Gemini nie musi już oglądać całego nagrania w jednakowy sposób. Nowy tryb agentowej analizy wideo pozwala modelowi samodzielnie wybierać fragmenty, transkrypcję, dźwięk i klatki potrzebne do odpowiedzi. Google deklaruje dzięki temu do 88% mniej tokenów, do 66% niższy koszt i do 7% lepszą jakość. Te liczby brzmią mocno, ale na razie pochodzą wyłącznie z testów producenta.
- Funkcja działa w Gemini 3.7 Flash, 3.6 Flash i 3.5 Flash-Lite.
- Jest dostępna dla przesłanych filmów i materiałów z YouTube przez Gemini API.
- Tryb agentowy jest przeznaczony przede wszystkim do długich nagrań i pytań o konkretne momenty.
- Nie ma osobnej opłaty za funkcję, ale zużycie tokenów staje się zmienne.
- Brakuje niezależnej replikacji deklarowanych oszczędności i wzrostu jakości.
Co właściwie zmienił Google
W standardowym trybie analizy wideo model pobiera klatki w stałym tempie — domyślnie jedną na sekundę — i umieszcza je w kontekście wraz z dźwiękiem. To podejście jest przewidywalne, ale przy godzinnych nagraniach oznacza przetwarzanie dużej ilości materiału, nawet gdy pytanie dotyczy kilkunastu sekund.
W ogłoszonym 1 września trybie agentowym Gemini dostaje wewnętrzne narzędzie do nawigowania po filmie. Model może zacząć od transkrypcji, odnaleźć podejrzany przedział czasu, załadować wybrane klatki, a następnie wrócić do fragmentu z większą liczbą klatek na sekundę lub inną rozdzielczością. Zamiast jednego dużego przebiegu powstaje pętla: hipoteza, wyszukanie fragmentu, inspekcja i ewentualne ponowne sprawdzenie.
To rozszerzenie dotyczy tych samych modeli, które już przyjmowały wideo. Najmocniejszym wariantem jest Gemini 3.7 Flash, opisany wcześniej na AIOAI.pl. Nie należy też mylić analizy nagrań z ich generowaniem: Gemini Omni Flash tworzy i edytuje wideo, podczas gdy nowa funkcja służy do rozumienia materiału wejściowego.
| Cecha | Tryb statyczny | Tryb agentowy |
|---|---|---|
| Wybór klatek | Stałe próbkowanie, domyślnie 1 FPS | Dynamiczne fragmenty i częstotliwość klatek |
| Dane ładowane do analizy | Cały przebieg według ustawień | Tylko wybrane klatki, dźwięk lub transkrypcja |
| Najlepsze zastosowanie | Krótkie klipy, niskie opóźnienie, kontrola całego materiału | Długie filmy, wyszukiwanie momentów, anomalie i liczenie zdarzeń |
| Zużycie tokenów | Przewidywalne, rośnie z długością filmu | Zmienne, zależne od pytania i strategii modelu |
Do 88% mniej tokenów, ale pod określonymi warunkami
Google podaje trzy maksymalne korzyści uzyskane w standardowych benchmarkach analizy wideo. Słowo „do” ma tu kluczowe znaczenie. Wynik zależy od modelu, długości materiału, pytania, wybranej rozdzielczości i tego, ile razy agent wróci do nagrania.
| Miara | Deklarowana zmiana | Status dowodu |
|---|---|---|
| Zużycie tokenów | do 88% mniej | testy Google |
| Koszt analizy | do 66% mniej | testy Google |
| Jakość odpowiedzi | do 7% lepiej | testy Google |
W materiale pojawia się LongVideoBench. To rzeczywisty, niezależnie opracowany benchmark długich nagrań z 6678 pytaniami wielokrotnego wyboru w 17 kategoriach. Jednak niezależne pochodzenie zestawu testowego nie oznacza niezależnej weryfikacji konkretnego wyniku Gemini. Pomiar trybu agentowego przeprowadził i opublikował Google.
Producent pokazuje także zastosowania, w których statyczne 1 FPS jest naturalnym ograniczeniem: wykrywanie krótkiej zmiany stanu, liczenie szybkich ruchów, odnajdywanie pojedynczego zdarzenia w wielogodzinnym nagraniu i analiza anomalii. W takich zadaniach możliwość ponownego obejrzenia wybranego fragmentu z wyższą częstotliwością może poprawić zarówno trafność, jak i ekonomię pracy.
Ile może kosztować analiza filmu
Dokumentacja Gemini API szacuje statyczne przetwarzanie na około 100 tokenów na sekundę przy niskiej rozdzielczości mediów albo około 300 tokenów na sekundę przy wysokiej. Dla godzinnego filmu daje to orientacyjnie 360 tys. lub 1,08 mln tokenów wejściowych, zanim doliczymy wynik i inne elementy żądania.
Według cennika z 2 września 2026 r. Gemini 3.7 Flash i 3.6 Flash mają promocyjną cenę 0,75 USD za 1 mln tokenów wejścia i 3,75 USD za 1 mln tokenów wyjścia do końca 2026 r. Gemini 3.5 Flash-Lite kosztuje 0,30 USD za wejście i 2,50 USD za wyjście. Agentowa analiza nie ma dodatkowej opłaty funkcjonalnej.
Nie da się jednak wiarygodnie policzyć rachunku z samej długości filmu. W trybie agentowym osobno rozliczane są tokeny rozumowania nawigacyjnego oraz materiał pobrany przez narzędzie. Proste pytanie o jeden rozdział może wymagać niewielu fragmentów, a szczegółowy audyt całego nagrania może uruchomić wiele powrotów. Dlatego deklaracja „do 66% taniej” nie jest gwarantowanym rabatem i powinna zostać sprawdzona na własnym zestawie filmów.
Jak włączyć agentową analizę wideo
W Interactions API wystarczy ustawić pole processing na agentic dla elementu wideo. Funkcja obsługuje zarówno pliki przesłane przez API, jak i publiczne adresy YouTube. Minimalny fragment konfiguracji wygląda tak:
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
}W odpowiedzi warto sprawdzić tablicę kroków. Obecność processing_call i processing_result potwierdza, że model rzeczywiście nawigował po materiale. W rozmowie wieloturowej trzeba też zachować kontekst wideo: tryb stanowy robi to przez identyfikator poprzedniej interakcji, a w trybie bezstanowym aplikacja musi przesłać dalej komplet kroków związanych z przetwarzaniem.
Google udostępnia funkcję w Gemini API przez Google AI Studio i Gemini Enterprise Agent Platform. Firma zapowiada również wdrożenie w aplikacji Gemini dla modeli Flash i Flash-Lite oraz wykorzystanie w funkcji Ask YouTube, ale 2 września opisuje te wdrożenia jako nadchodzące, a nie zakończone.
Kiedy tryb statyczny nadal ma sens
Agentowe przetwarzanie nie jest automatycznie najlepsze dla każdego filmu. Dokumentacja wskazuje, że przy krótkich klipach poniżej około pięciu minut dodatkowe rozumowanie i wywołania narzędzia mogą wydłużyć czas do pierwszego tokenu. Jeśli aplikacja musi odpowiedzieć natychmiast albo systematycznie sprawdzić każdą klatkę, stałe próbkowanie pozostaje łatwiejsze do przewidzenia.
Drugi problem to kontrola kosztów. Statyczny tryb pozwala oszacować liczbę tokenów z długości nagrania i rozdzielczości. Agent działa adaptacyjnie, więc dwa pytania do tego samego filmu mogą wygenerować zupełnie różne zużycie. Zespół wdrażający funkcję powinien zapisywać pola użycia, czas do pierwszej odpowiedzi i jakość na własnych zadaniach, zamiast opierać budżet na maksymalnych procentach z komunikatu.
Trzecie ograniczenie jest metodologiczne. Google nie podał pełnego zestawu surowych wyników, przedziałów niepewności ani warunków dla każdego z trzech modeli. Nie ma też niezależnych testów agentowej funkcji. To wystarczający materiał, by uznać premierę za istotną zmianę techniczną, ale jeszcze nie, by nazwać ją bezspornym przełomem jakościowym.
Jak sprawdzić oszczędności we własnej aplikacji
Najuczciwszy test powinien porównać oba tryby na tych samych filmach, pytaniach i wersji modelu. Warto rozdzielić krótkie klipy, materiały około godziny oraz nagrania wielogodzinne, bo mechanizm został zaprojektowany głównie z myślą o długim wideo. Zestaw pytań powinien obejmować zarówno wyszukiwanie pojedynczego momentu, jak i podsumowanie całej treści, liczenie zdarzeń oraz analizę szybkiej akcji.
Dla każdego zapytania należy zapisać łączne tokeny wejścia, rozumowania, użycia narzędzia i wyjścia, a także koszt, czas do pierwszego tokenu i czas pełnej odpowiedzi. Sama liczba tokenów wejściowych nie wystarczy, jeśli agent wykonuje dłuższą pętlę nawigacyjną. Jakość najlepiej oceniać na przygotowanym wcześniej kluczu odpowiedzi, a nie przez wrażenie po kilku demonstracjach.
Praktyczna zasada wdrożeniowa może być prosta: dla krótkich nagrań pozostawić tryb statyczny, a dla długich uruchamiać agentowy, o ile testy pokażą niższy koszt bez pogorszenia trafności. W produkcji warto dodać limity budżetu i telemetrię, ponieważ adaptacyjne przeszukiwanie nie daje stałego zużycia dla każdej prośby.
Co ta premiera realnie zmienia
Najważniejsza zmiana nie polega na zwiększeniu okna kontekstowego, lecz na innym sposobie korzystania z niego. Gemini może potraktować długi film jak przestrzeń do przeszukania, a nie blok danych, który zawsze trzeba załadować w całości. To podejście pasuje do szerszego kierunku rozwoju rodziny Gemini 3 i narzędzi agentowych: model nie tylko odpowiada, ale decyduje, jakie dane pozyskać przed odpowiedzią.
Dla firm analizujących szkolenia, monitoring, rozmowy, transmisje czy materiały redakcyjne potencjał jest konkretny. Najpierw trzeba jednak zmierzyć trzy rzeczy na własnych danych: trafność odnajdywania momentów, rozrzut kosztu między zapytaniami oraz opóźnienie. Jeśli deklarowane oszczędności utrzymają się poza demonstracjami Google, agentowe oglądanie może okazać się ważniejsze niż kolejna kosmetyczna poprawa samego modelu.
Częste pytania
Jakie korzyści przynosi tryb agentowej analizy wideo w Gemini?
Tryb agentowej analizy wideo w Gemini pozwala na dynamiczny wybór fragmentów materiału, co może prowadzić do oszczędności do 88% tokenów oraz do 66% niższych kosztów analizy. Dodatkowo, jakość odpowiedzi może być lepsza o 7% w porównaniu do standardowego trybu.
Kiedy warto używać trybu statycznego zamiast agentowego w Gemini?
Tryb statyczny jest bardziej odpowiedni dla krótkich klipów poniżej pięciu minut, gdzie przewidywalność i szybkość odpowiedzi są kluczowe. W takich przypadkach dodatkowe przetwarzanie w trybie agentowym może wydłużyć czas do pierwszego tokenu.
Czy agentowa analiza wideo ma dodatkowe opłaty?
Agentowa analiza wideo w Gemini nie ma osobnej opłaty funkcjonalnej, jednak zużycie tokenów jest zmienne i zależy od długości materiału oraz zadawanych pytań.
Jak włączyć agentową analizę wideo w Gemini API?
Aby włączyć agentową analizę wideo, należy ustawić pole processing na 'agentic' w konfiguracji elementu wideo w Interactions API. Funkcja obsługuje zarówno przesłane pliki, jak i publiczne adresy YouTube.
Jak sprawdzić oszczędności przy użyciu agentowej analizy wideo?
Aby sprawdzić oszczędności, należy porównać oba tryby analizy na tych samych filmach i pytaniach, zapisując łączne tokeny oraz koszty. Ważne jest także, aby ocenić jakość odpowiedzi na podstawie przygotowanego klucza odpowiedzi.







