Google udostępnił Gemini Omni Flash w wersji ogólnie dostępnej. Stabilny endpoint gemini-omni-1.1-flash generuje i edytuje krótkie filmy w dialogu, a za sekundę materiału 720p trzeba zapłacić około 0,10 USD. Najważniejszą zmianą nie jest jednak sama etykieta GA: model potrafi teraz przedłużać klipy, łączyć pierwszą i ostatnią klatkę oraz zwracać obraz do 4K. Trzeba tylko pamiętać, że 1080p i 4K powstają przez upscaling, a część funkcji edycji jest niedostępna w Europejskim Obszarze Gospodarczym.
Premiera z 27 sierpnia 2026 r. daje programistom stabilniejszy punkt integracji niż wcześniejszy gemini-omni-flash-preview. Jednocześnie nie ma jeszcze niezależnego rankingu, który pozwalałby uczciwie porównać jakość tego endpointu z Veo, Seedance czy innymi generatorami wideo. Na razie da się rzetelnie ocenić funkcje, limity, model rozliczeń i zakres dostępności.
Najważniejsze fakty o Gemini Omni Flash
- stabilny identyfikator modelu to
gemini-omni-1.1-flash; - model przyjmuje tekst, obraz i wideo, a zwraca filmy trwające od 3 do 10 sekund;
- generuje materiał w 24 klatkach na sekundę i formatach 16:9 lub 9:16;
- obsługuje 360p, 720p, 1080p i 4K, lecz dwie najwyższe rozdzielczości są skalowane w górę;
- edycja kolejnych wersji odbywa się w ramach rozmowy przez Interactions API;
- film 720p kosztuje efektywnie około 0,10 USD za sekundę samego wyjścia;
- endpoint preview ma zostać wyłączony 30 września 2026 r.
Co dokładnie weszło do GA
W oficjalnym changelogu Gemini API Google wymienia trzy najważniejsze rozszerzenia. Pierwsze to przedłużanie istniejącego filmu przez dopisywanie kontynuacji na końcu klipu. Drugie to interpolacja pomiędzy dwoma obrazami pełniącymi rolę pierwszej i ostatniej klatki. Trzecie to parametr rozdzielczości z wartościami 360p, 720p, 1080p i 4K.
Ta ostatnia funkcja wymaga doprecyzowania. Domyślnym formatem pozostaje 720p, a 1080p i 4K są generowane z użyciem upscalingu. Nie jest to więc natywna synteza wszystkich klatek od początku w 4K. To ważna różnica zarówno przy ocenie szczegółowości, jak i przy porównywaniu modelu z narzędziami reklamowanymi jako generatory 4K. Podobny problem interpretacji rozdzielczości opisywaliśmy przy okazji generowania wideo 4K w Google Flow.
Dotychczasowy endpoint preview pozostanie dostępny tylko przejściowo. Google zapowiedział jego wyłączenie na 30 września 2026 r., więc integracje produkcyjne powinny przejść na nowy identyfikator i przetestować różnice przed tą datą.
Na platformie Flow https://labs.google/fx/pl/tools/flow/ możesz za darmo wygenerować video – Google codziennie przyznaje 50 kredytów co pozwala na wygenerowanie około 3 filmików w niskiej rozdzielczości.
Jak działa dialogowa edycja wideo
Gemini Omni Flash korzysta z Interactions API. Program wysyła opis sceny albo materiał referencyjny, otrzymuje wideo, a potem może przekazać kolejne polecenie wraz z identyfikatorem poprzedniej interakcji. Model zachowuje kontekst i tworzy nową wersję filmu bez konieczności ponownego przesyłania poprzedniego wyniku.
To podejście przypomina pracę z edytorem sterowanym poleceniami: „zmień światło”, „usuń telefon” albo „dodaj kapelusz i pozostaw resztę bez zmian”. Każda tura generuje jednak nowy plik, więc nie jest to niedestrukcyjny montaż z warstwami i historią zmian znany z klasycznych programów. Dla powtarzalnych kampanii może skrócić drogę od szkicu do wariantu, ale wymaga testowania spójności postaci, rekwizytów i dźwięku między iteracjami.
Model obsługuje kilka trybów pracy: tekst do wideo, obraz do wideo, użycie obrazów i krótkich filmów jako referencji, edycję oraz przedłużanie. Potrafi również wygenerować ścieżkę audio razem z filmem. Dokumentacja zaznacza jednak, że nie można przesyłać osobnych referencji audio, dźwięk z referencyjnego filmu jest ignorowany, a edycja głosu nie jest obsługiwana.
Specyfikacja i ograniczenia techniczne
| Cecha | Wartość |
|---|---|
| Model | gemini-omni-1.1-flash |
| Wejście na karcie modelu | tekst, obraz, wideo |
| Wyjście | wideo z dźwiękiem |
| Długość pojedynczego wyniku | 3–10 sekund |
| Liczba klatek | 24 FPS |
| Format obrazu | 16:9 lub 9:16 |
| Rozdzielczość | 360p, 720p, 1080p i 4K; 1080p/4K przez upscaling |
| Okno kontekstowe | 1 048 576 tokenów |
| Długość przesłanego filmu do edycji | do 10 sekund, z wyjątkami dla pracy wieloturowej |
| Pochodzenie materiału | niewidoczny znak SynthID w każdym wygenerowanym filmie |
Przedłużenie może dodać od 3 do 10 sekund wyłącznie na końcu filmu. Nie da się dopisać fragmentu przed początkiem ani w środku klipu. Przewodnik Google mówi o możliwości wydłużania materiału do 40 sekund w kolejnych turach, przy czym model używa ostatnich 10 sekund jako kontekstu i może zmienić końcowe klatki wejścia, by wygładzić przejście.
Lista ograniczeń jest dłuższa. Model nie obsługuje obecnie provisioned throughput, instrukcji systemowych, parametrów temperature i top_p, sekwencji stop ani osobnego pola na negative prompt. Google deklaruje pełne wsparcie dla języka angielskiego; inne języki nie zostały ocenione i mogą działać mniej przewidywalnie.
Ile kosztuje generowanie wideo
Według cennika Gemini Developer API obowiązującego 28 sierpnia 2026 r. Gemini Omni Flash jest dostępny tylko w płatnym planie. Tokeny wejściowe kosztują 1,50 USD za milion, tekstowe wyjście 9 USD za milion, a wyjście wideo 17,50 USD za milion tokenów.
Dla materiału 720p Google podaje zużycie 5792 tokenów wyjściowych na sekundę. Daje to dokładnie 0,10136 USD za sekundę, co producent zaokrągla do około 0,10 USD. Poniższe wartości obejmują wyłącznie wideo wyjściowe i nie doliczają wejścia ani kolejnych prób.
| Długość klipu 720p | Tokeny wyjściowe | Koszt wyjścia |
|---|---|---|
| 3 sekundy | 17 376 | około 0,30 USD |
| 5 sekund | 28 960 | około 0,51 USD |
| 10 sekund | 57 920 | około 1,01 USD |
Realny budżet projektu będzie wyższy, bo dobry klip rzadko powstaje za pierwszym podejściem. Pięć wariantów po 10 sekund to już około 5,07 USD samego wyjścia 720p. Cennik nie podaje osobnego przelicznika tokenów na sekundę dla 360p, 1080p i 4K, dlatego nie należy automatycznie przenosić stawki 720p na wyższe rozdzielczości.
Ważne ograniczenie w Polsce i całym EOG
General availability nie oznacza identycznego zestawu funkcji w każdym regionie. Użytkownicy z Europejskiego Obszaru Gospodarczego, Szwajcarii i Wielkiej Brytanii nie mogą obecnie edytować ani przedłużać własnych filmów przesłanych do usługi. Mogą natomiast edytować i rozszerzać klipy wygenerowane wcześniej przez Gemini Omni Flash.
Dodatkowo w tych regionach nie jest obsługiwana edycja przesłanych obrazów zawierających osoby niepełnoletnie, a globalnie istnieją ograniczenia dotyczące niektórych rozpoznawalnych osób. Zespoły planujące produkt dla europejskich klientów powinny potraktować to jako wymóg architektoniczny, a nie drobny zapis regulaminu: obiecana funkcja „edytuj własne wideo” może po prostu nie zadziałać dla użytkownika w Polsce.
Czy Omni Flash jest alternatywą dla Veo
Google pozycjonuje Omni Flash jako szybki model do dialogowej generacji i edycji, a nie jako bezpośrednie zastępstwo wszystkich wariantów Veo. Jego przewagą produktową może być iteracyjna praca w jednej historii Interactions API i łatwe tworzenie krótkich wariantów. Veo pozostaje osobną rodziną, której rozwój opisywaliśmy m.in. przy premierze Veo 3.1 i Flow.
Nie da się jednak uczciwie stwierdzić, że Omni Flash jest lepszy jakościowo. Google nie opublikował porównywalnych wyników niezależnych testów stabilnego endpointu, a bieżący ranking generatorów wideo AI nie daje podstaw do przypisania nowemu modelowi konkretnej pozycji. Równie ważny jest brak informacji o architekturze, liczbie parametrów, danych treningowych, post-trainingu, infrastrukturze i kosztach szkolenia.
Gemini Omni Flash nie jest również modelem open source ani open weights. Google udostępnia go jako zamkniętą usługę API; nie opublikował wag ani licencji pozwalającej uruchomić model na własnej infrastrukturze.
Co ta premiera zmienia w praktyce
Dla zespołów budujących narzędzia do reklam, storyboardów, krótkich form społecznościowych i prototypowania scen najważniejsze są trzy rzeczy: stabilny identyfikator API, przewidywalny koszt około dolara za 10 sekund 720p oraz możliwość poprawiania filmu kolejnymi poleceniami. Interpolacja pierwszej i ostatniej klatki może ułatwić kontrolowanie początku i końca ujęcia, a przedłużanie pozwala budować dłuższą sekwencję etapami.
Największe znaki zapytania dotyczą jakości po kilku iteracjach, spójności postaci, opóźnień przy wyższych rozdzielczościach i kosztu licznych prób. Do tego dochodzą regionalne ograniczenia edycji własnych materiałów. GA zmniejsza ryzyko związane z używaniem tymczasowego endpointu, ale nie usuwa ryzyka kreatywnego ani prawnego.
Gemini Omni Flash wygląda więc przede wszystkim jak praktyczny komponent dla aplikacji, które potrzebują wielu krótkich wariantów i dialogowego sterowania. Dopiero niezależne testy pokażą, czy jego szybkość i cena idą w parze z jakością wystarczającą do produkcji, a nie tylko do prototypowania.
Częste pytania
Jakie są główne funkcje Gemini Omni Flash?
Gemini Omni Flash potrafi generować i edytować krótkie filmy w dialogu, przedłużać klipy oraz łączyć pierwszą i ostatnią klatkę. Obsługuje różne rozdzielczości, w tym 720p, 1080p i 4K, chociaż 1080p i 4K są skalowane w górę.
Ile kosztuje generowanie wideo w Gemini Omni Flash?
Koszt generowania wideo w rozdzielczości 720p wynosi około 0,10 USD za sekundę. Cennik wskazuje, że dla 10-sekundowego klipu 720p koszt wynosi około 1,01 USD.
Czy użytkownicy w Europejskim Obszarze Gospodarczym mogą edytować swoje filmy?
Użytkownicy z Europejskiego Obszaru Gospodarczego nie mogą aktualnie edytować ani przedłużać własnych filmów przesłanych do usługi. Mogą jednak edytować i rozszerzać klipy wygenerowane wcześniej przez Gemini Omni Flash.
Jak działa dialogowa edycja wideo w Gemini Omni Flash?
Dialogowa edycja wideo w Gemini Omni Flash odbywa się za pomocą Interactions API, które pozwala na przesyłanie opisów scen i wykonywanie poleceń edycyjnych. Model zachowuje kontekst, co umożliwia tworzenie nowych wersji filmu bez konieczności ponownego przesyłania poprzednich wyników.
Kiedy zostanie wyłączony dotychczasowy endpoint preview Gemini?
Dotychczasowy endpoint preview Gemini ma zostać wyłączony 30 września 2026 roku. Programiści powinni przejść na nowy identyfikator i przetestować różnice przed tą datą.







