AI w IT Artykuły

Gemini 3.8 Flash w GA. Więcej rozumowania, ten sam cennik

Programista analizujący złożony workflow i napis Gemini 3.8 Flash

Google udostępnił Gemini 3.8 Flash jako stabilny model do zastosowań produkcyjnych. Najważniejszą zmianą nie jest większe okno kontekstowe ani niższa cena za token. Firma próbuje poprawić długie zadania programistyczne i agentowe, pozwalając modelowi wykonywać więcej kroków rozumowania, wywołań narzędzi i kontroli własnej pracy. Niezależny pomiar Artificial Analysis daje wariantowi high 59 punktów w Intelligence Index i 21. miejsce wśród 202 porównywanych modeli, ale pokazuje też koszt tego podejścia: bardzo duże zużycie tokenów rozumowania.

Gemini 3.8 Flash jest dostępny od 2 września 2026 roku pod identyfikatorem gemini-3.8-flash. Do 31 grudnia kosztuje w trybie Standard 0,75 USD za milion tokenów wejścia i 3,75 USD za milion tokenów wyjścia. To dokładnie ten sam promocyjny cennik co w poprzednim Gemini 3.7 Flash. W praktyce rachunek może jednak być wyższy, jeśli model potrzebuje więcej tokenów, by zakończyć zadanie.

Najważniejsze fakty:

  • Gemini 3.8 Flash ma status GA i jest przeznaczony do zastosowań produkcyjnych.
  • Obsługuje wejście tekstowe, obrazy, audio, wideo i PDF, a zwraca tekst.
  • Limit wejścia wynosi 1 048 576 tokenów, a maksymalne wyjście 65 536 tokenów.
  • Do wyboru są poziomy rozumowania low, medium i high; domyślny jest medium.
  • Google nie ujawnił liczby parametrów, pełnej architektury, kosztu treningu ani szczegółów danych szkoleniowych.

Co Google zmienił w Gemini 3.8 Flash

W przewodniku po nowym modelu Google opisuje 3.8 Flash jako swoją najinteligentniejszą wersję Flash, zaprojektowaną do długotrwałej inżynierii oprogramowania, autonomicznych agentów i złożonych procesów w firmach. Jednocześnie dokumentacja otwarcie ostrzega, że model może zużywać więcej tokenów w długich i trudnych zadaniach, bo wykonuje mniejsze kroki rozumowania, iteracyjnie używa narzędzi i weryfikuje wynik.

Takie pozycjonowanie rozwija kierunek zapoczątkowany przez Gemini 3 Flash. Model ma nie tylko szybko odpowiadać, lecz również utrzymać cel przez serię operacji. Wbudowane możliwości obejmują m.in. function calling, wykonanie kodu, wyszukiwanie, File Search, structured outputs i Computer Use w wersji preview. Nie obsługuje natomiast Live API ani generowania obrazu i audio.

Specyfikacja: duży kontekst, ale bez nowych modalności wyjściowych

ElementGemini 3.8 Flash
Identyfikator APIgemini-3.8-flash
StatusGA, model stabilny
Wejścietekst, obraz, wideo, audio, PDF
Wyjścietekst
Limit wejścia1 048 576 tokenów
Maksymalne wyjście65 536 tokenów
Poziomy rozumowanialow, medium, high
Domyślny poziommedium
Waginieopublikowane, model własnościowy
Specyfikacja według dokumentacji Gemini API; stan na 4 września 2026 r.

Milion tokenów kontekstu brzmi efektownie, lecz sam limit nie gwarantuje poprawnej pracy na bardzo długim materiale. Jakość zależy od tego, czy model odnajduje istotne fragmenty, zachowuje zależności między krokami i poprawnie reaguje na wyniki narzędzi. Dlatego w systemie produkcyjnym warto osobno mierzyć skuteczność na krótkich promptach, dużych repozytoriach i wieloetapowych sesjach.

Niezależny test pokazuje cenę wyższego poziomu rozumowania

Najbardziej aktualnym niezależnym punktem odniesienia jest Artificial Analysis. W odczycie z 4 września wariant high zdobył 59 punktów w Intelligence Index i zajmował 21. miejsce na 202 modele. Osiągał około 327 tokenów wyjścia na sekundę, ale czas do pierwszego tokenu wynosił około 10,8 sekundy.

PoziomIntelligence IndexPrędkość wyjściaTTFTTokeny wyjścia w całym teście
low52ok. 314 tokenów/s0,70 s19 mln
medium57ok. 313 tokenów/sok. 6,0 s53 mln
high59ok. 327 tokenów/sok. 10,8 s120 mln
Źródło: Artificial Analysis; niezależne pomiary wariantów Gemini 3.8 Flash, odczyt 4 września 2026 r. Dane są dynamiczne.

Wniosek jest ważniejszy niż sama pozycja. Przejście z medium na high zwiększyło indeks o 2 punkty, lecz w całym zestawie testów liczba tokenów wyjścia wzrosła z 53 do 120 mln. Artificial Analysis wyliczył dla high około 0,58 USD ważonego kosztu jednego zadania indeksu. To nie jest cena typowego promptu klienta, tylko metryka porównawcza, ale dobrze pokazuje, że tańszy model nie musi oznaczać tańszego procesu.

Dlatego poziom low może być rozsądniejszy dla czatu, szybkiej klasyfikacji i prostych automatyzacji, a high dla trudnego debugowania lub zadania, którego ponowienie kosztuje więcej niż dodatkowe tokeny. Domyślny medium jest kompromisem, nie uniwersalnym optimum.

Benchmarki Google: mocny DeepSWE, słaby sygnał z nowszego Terminal-Bench

Karta modelu Google DeepMind pokazuje duży postęp względem 3.7 Flash w kilku zadaniach agentowych. Trzeba jednak czytać ją razem z metodologią. Wynik DeepSWE dla Gemini 3.8 Flash został obliczony przez Google, podczas gdy część wyników konkurencji pochodzi z publicznej tablicy. W Terminal-Bench 2.1 wyniki modeli Gemini również są obliczone przez producenta. To nie jest jeden w pełni niezależny eksperyment prowadzony identycznie dla wszystkich modeli.

BenchmarkGemini 3.8 FlashGemini 3.7 FlashClaude Opus 5
DeepSWE v1.173,7%65,3%74,0%
Terminal-Bench 2.189,4%85,8%89,1%
Terminal-Bench 4.019,1%11,2%51,8%
Źródło: tabela ewaluacyjna Google DeepMind, wrzesień 2026 r.; wyniki producenta i wskazane w jego metodologii dane z publicznych tablic.

DeepSWE sugeruje, że 3.8 Flash zbliżył się do znacznie droższych modeli w długotrwałej pracy nad kodem. Terminal-Bench 2.1 też wygląda bardzo dobrze. Nowszy i trudniejszy Terminal-Bench 4.0 studzi jednak entuzjazm: 19,1% to poprawa wobec 3.7 Flash, ale daleko do 51,8% Opus 5. Nie wolno zatem przenosić dobrego wyniku z jednej wersji benchmarku na wszystkie zadania terminalowe.

Różnica pasuje do szerszego obrazu z rankingów agentów AI: lider zależy od metryki, środowiska, zestawu narzędzi i długości zadania. Dla zespołu programistycznego bardziej wartościowy będzie własny test na prawdziwych zgłoszeniach, z pomiarem odsetka ukończonych zadań, liczby ponowień i poprawek człowieka.

Cena Gemini 3.8 Flash

Oficjalny cennik Gemini API przewiduje promocyjne stawki do końca 2026 roku. Od 1 stycznia 2027 roku ceny mają wzrosnąć dwukrotnie. Tokeny rozumowania są rozliczane po stawce wyjściowej.

TrybWejście do 31.12.2026Wyjście do 31.12.2026Wejście od 1.01.2027Wyjście od 1.01.2027
Standard0,75 USD3,75 USD1,50 USD7,50 USD
Batch / Flex0,375 USD1,875 USD0,75 USD3,75 USD
Priority1,35 USD6,75 USD2,70 USD13,50 USD
Ceny w USD za 1 mln tokenów według Google; stan na 4 września 2026 r. Stawka wyjściowa obejmuje tokeny rozumowania.

Cache kosztuje obecnie 0,075 USD za milion tokenów w trybie Standard, a jego przechowywanie 0,50 USD za milion tokenów na godzinę. Batch i Flex obniżają stawki tokenowe o połowę, gdy zadanie nie wymaga gwarantowanego niskiego opóźnienia. W aplikacji agentowej trzeba liczyć koszt całej pętli: promptu, kontekstu, rozumowania, wyników narzędzi i ponowień.

Dostępność, migracja i licencja

Gemini 3.8 Flash jest dostępny w aplikacji Gemini, Google AI Studio, Gemini API, Gemini Enterprise Agent Platform, AI Mode i Antigravity. W Antigravity stał się modelem domyślnym. Jest to usługa własnościowa podlegająca warunkom Google; wagi nie zostały udostępnione, więc nie można mówić o modelu open weights.

Migracja z wcześniejszych modeli Gemini 3 wymaga kontroli konfiguracji. Google zaleca usunięcie parametrów temperature, top_p i top_k, zastąpienie thinking_budget ustawieniem thinking_level i rezygnację z candidate_count. Poziom minimal nie jest obsługiwany. W rozmowach wieloturowych producent preferuje serwerowy identyfikator previous_interaction_id.

Jeśli model steruje narzędziami, sama jakość odpowiedzi nie wystarczy. Potrzebne są limity uprawnień, rejestrowanie operacji, budżet kosztu, mechanizm przerwania pętli i walidacja efektu. Warto też precyzyjnie odróżniać agentów AI od samego modelu językowego: model jest silnikiem, ale bezpieczeństwo i niezawodność zależą od całego systemu.

Czego Google nie ujawnił i co nadal trzeba sprawdzić

Google nie podał liczby parametrów całkowitych ani aktywnych, szczegółowej architektury, składu danych treningowych, etapów post-treningu, użytej infrastruktury ani kosztu szkolenia. Karta modelu mówi jedynie, że 3.8 Flash bazuje na 3.7 Flash, i odsyła do poprzedniej dokumentacji. Nie da się więc niezależnie ustalić, czy poprawa pochodzi z nowego treningu, zmian w inferencji, dłuższego rozumowania czy kombinacji tych elementów.

Producent wymienia typowe ograniczenia: halucynacje, sporadyczne spowolnienia i timeouty. Granica wiedzy została określona na marzec 2026 roku, choć w części dziedzin model może mieć wiedzę ograniczoną do stycznia 2025 roku. Google odnotował też lekkie pogorszenie automatycznego wyniku bezpieczeństwa wielojęzycznego względem 3.7 Flash. To dodatkowy powód, by testować model po polsku, a nie zakładać, że anglojęzyczne benchmarki przeniosą się bez strat.

Czy warto przejść na Gemini 3.8 Flash

Dla użytkowników 3.7 Flash test migracyjny jest uzasadniony: cena katalogowa pozostaje taka sama, specyfikacja wejścia i kontekstu jest znajoma, a wyniki wskazują na poprawę w części długich zadań programistycznych. Nie ma jednak podstaw do automatycznej wymiany modelu we wszystkich procesach. Wysoki poziom rozumowania może zwiększyć koszt i czas odpowiedzi bardziej, niż sugeruje niewielka różnica w zbiorczym indeksie.

Gemini 3.8 Flash jest więc przede wszystkim bardziej ambitnym modelem roboczym w klasie Flash, a nie tanią kopią największych modeli bez kompromisów. Najrozsądniejszy plan to porównać low, medium i high na własnym zestawie zadań oraz mierzyć koszt poprawnie zakończonego procesu. Dopiero ta metryka pokaże, czy dodatkowe rozumowanie rzeczywiście oszczędza pracę zespołu.

Częste pytania

Jakie są główne zmiany w Gemini 3.8 Flash w porównaniu do poprzednich wersji?

Gemini 3.8 Flash koncentruje się na poprawie długich zadań programistycznych i agentowych poprzez umożliwienie modelowi wykonywania więcej kroków rozumowania oraz iteracyjnego używania narzędzi. Model ma również wyższy wynik w Intelligence Index, ale może generować większe zużycie tokenów.

Kiedy Gemini 3.8 Flash będzie dostępny i jakie są jego ceny?

Gemini 3.8 Flash jest dostępny od 2 września 2026 roku. Do 31 grudnia 2026 roku ceny wynoszą 0,75 USD za milion tokenów wejścia i 3,75 USD za milion tokenów wyjścia.

Jakie są limity tokenów w Gemini 3.8 Flash?

Gemini 3.8 Flash ma limit wejścia wynoszący 1 048 576 tokenów oraz maksymalne wyjście wynoszące 65 536 tokenów. To oznacza, że model może przetwarzać duże ilości danych, ale jakość wyników zależy od kontekstu.

Jakie są poziomy rozumowania dostępne w Gemini 3.8 Flash?

W Gemini 3.8 Flash dostępne są trzy poziomy rozumowania: low, medium i high, przy czym domyślnym poziomem jest medium. Wybór poziomu wpływa na jakość wyników oraz zużycie tokenów.

Jak migracja z wcześniejszych modeli Gemini do 3.8 Flash powinna wyglądać?

Migracja z wcześniejszych modeli Gemini 3 wymaga usunięcia parametrów temperature, top_p i top_k oraz zastąpienia ich nowymi ustawieniami. Google zaleca również użycie identyfikatora previous_interaction_id w rozmowach wieloturowych.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *