Google udostępnił Gemini 3.8 Flash jako stabilny model do zastosowań produkcyjnych. Najważniejszą zmianą nie jest większe okno kontekstowe ani niższa cena za token. Firma próbuje poprawić długie zadania programistyczne i agentowe, pozwalając modelowi wykonywać więcej kroków rozumowania, wywołań narzędzi i kontroli własnej pracy. Niezależny pomiar Artificial Analysis daje wariantowi high 59 punktów w Intelligence Index i 21. miejsce wśród 202 porównywanych modeli, ale pokazuje też koszt tego podejścia: bardzo duże zużycie tokenów rozumowania.
Gemini 3.8 Flash jest dostępny od 2 września 2026 roku pod identyfikatorem gemini-3.8-flash. Do 31 grudnia kosztuje w trybie Standard 0,75 USD za milion tokenów wejścia i 3,75 USD za milion tokenów wyjścia. To dokładnie ten sam promocyjny cennik co w poprzednim Gemini 3.7 Flash. W praktyce rachunek może jednak być wyższy, jeśli model potrzebuje więcej tokenów, by zakończyć zadanie.
Najważniejsze fakty:
- Gemini 3.8 Flash ma status GA i jest przeznaczony do zastosowań produkcyjnych.
- Obsługuje wejście tekstowe, obrazy, audio, wideo i PDF, a zwraca tekst.
- Limit wejścia wynosi 1 048 576 tokenów, a maksymalne wyjście 65 536 tokenów.
- Do wyboru są poziomy rozumowania
low,mediumihigh; domyślny jestmedium. - Google nie ujawnił liczby parametrów, pełnej architektury, kosztu treningu ani szczegółów danych szkoleniowych.
Co Google zmienił w Gemini 3.8 Flash
W przewodniku po nowym modelu Google opisuje 3.8 Flash jako swoją najinteligentniejszą wersję Flash, zaprojektowaną do długotrwałej inżynierii oprogramowania, autonomicznych agentów i złożonych procesów w firmach. Jednocześnie dokumentacja otwarcie ostrzega, że model może zużywać więcej tokenów w długich i trudnych zadaniach, bo wykonuje mniejsze kroki rozumowania, iteracyjnie używa narzędzi i weryfikuje wynik.
Takie pozycjonowanie rozwija kierunek zapoczątkowany przez Gemini 3 Flash. Model ma nie tylko szybko odpowiadać, lecz również utrzymać cel przez serię operacji. Wbudowane możliwości obejmują m.in. function calling, wykonanie kodu, wyszukiwanie, File Search, structured outputs i Computer Use w wersji preview. Nie obsługuje natomiast Live API ani generowania obrazu i audio.
Specyfikacja: duży kontekst, ale bez nowych modalności wyjściowych
| Element | Gemini 3.8 Flash |
|---|---|
| Identyfikator API | gemini-3.8-flash |
| Status | GA, model stabilny |
| Wejście | tekst, obraz, wideo, audio, PDF |
| Wyjście | tekst |
| Limit wejścia | 1 048 576 tokenów |
| Maksymalne wyjście | 65 536 tokenów |
| Poziomy rozumowania | low, medium, high |
| Domyślny poziom | medium |
| Wagi | nieopublikowane, model własnościowy |
Milion tokenów kontekstu brzmi efektownie, lecz sam limit nie gwarantuje poprawnej pracy na bardzo długim materiale. Jakość zależy od tego, czy model odnajduje istotne fragmenty, zachowuje zależności między krokami i poprawnie reaguje na wyniki narzędzi. Dlatego w systemie produkcyjnym warto osobno mierzyć skuteczność na krótkich promptach, dużych repozytoriach i wieloetapowych sesjach.
Niezależny test pokazuje cenę wyższego poziomu rozumowania
Najbardziej aktualnym niezależnym punktem odniesienia jest Artificial Analysis. W odczycie z 4 września wariant high zdobył 59 punktów w Intelligence Index i zajmował 21. miejsce na 202 modele. Osiągał około 327 tokenów wyjścia na sekundę, ale czas do pierwszego tokenu wynosił około 10,8 sekundy.
| Poziom | Intelligence Index | Prędkość wyjścia | TTFT | Tokeny wyjścia w całym teście |
|---|---|---|---|---|
low | 52 | ok. 314 tokenów/s | 0,70 s | 19 mln |
medium | 57 | ok. 313 tokenów/s | ok. 6,0 s | 53 mln |
high | 59 | ok. 327 tokenów/s | ok. 10,8 s | 120 mln |
Wniosek jest ważniejszy niż sama pozycja. Przejście z medium na high zwiększyło indeks o 2 punkty, lecz w całym zestawie testów liczba tokenów wyjścia wzrosła z 53 do 120 mln. Artificial Analysis wyliczył dla high około 0,58 USD ważonego kosztu jednego zadania indeksu. To nie jest cena typowego promptu klienta, tylko metryka porównawcza, ale dobrze pokazuje, że tańszy model nie musi oznaczać tańszego procesu.
Dlatego poziom low może być rozsądniejszy dla czatu, szybkiej klasyfikacji i prostych automatyzacji, a high dla trudnego debugowania lub zadania, którego ponowienie kosztuje więcej niż dodatkowe tokeny. Domyślny medium jest kompromisem, nie uniwersalnym optimum.
Benchmarki Google: mocny DeepSWE, słaby sygnał z nowszego Terminal-Bench
Karta modelu Google DeepMind pokazuje duży postęp względem 3.7 Flash w kilku zadaniach agentowych. Trzeba jednak czytać ją razem z metodologią. Wynik DeepSWE dla Gemini 3.8 Flash został obliczony przez Google, podczas gdy część wyników konkurencji pochodzi z publicznej tablicy. W Terminal-Bench 2.1 wyniki modeli Gemini również są obliczone przez producenta. To nie jest jeden w pełni niezależny eksperyment prowadzony identycznie dla wszystkich modeli.
| Benchmark | Gemini 3.8 Flash | Gemini 3.7 Flash | Claude Opus 5 |
|---|---|---|---|
| DeepSWE v1.1 | 73,7% | 65,3% | 74,0% |
| Terminal-Bench 2.1 | 89,4% | 85,8% | 89,1% |
| Terminal-Bench 4.0 | 19,1% | 11,2% | 51,8% |
DeepSWE sugeruje, że 3.8 Flash zbliżył się do znacznie droższych modeli w długotrwałej pracy nad kodem. Terminal-Bench 2.1 też wygląda bardzo dobrze. Nowszy i trudniejszy Terminal-Bench 4.0 studzi jednak entuzjazm: 19,1% to poprawa wobec 3.7 Flash, ale daleko do 51,8% Opus 5. Nie wolno zatem przenosić dobrego wyniku z jednej wersji benchmarku na wszystkie zadania terminalowe.
Różnica pasuje do szerszego obrazu z rankingów agentów AI: lider zależy od metryki, środowiska, zestawu narzędzi i długości zadania. Dla zespołu programistycznego bardziej wartościowy będzie własny test na prawdziwych zgłoszeniach, z pomiarem odsetka ukończonych zadań, liczby ponowień i poprawek człowieka.
Cena Gemini 3.8 Flash
Oficjalny cennik Gemini API przewiduje promocyjne stawki do końca 2026 roku. Od 1 stycznia 2027 roku ceny mają wzrosnąć dwukrotnie. Tokeny rozumowania są rozliczane po stawce wyjściowej.
| Tryb | Wejście do 31.12.2026 | Wyjście do 31.12.2026 | Wejście od 1.01.2027 | Wyjście od 1.01.2027 |
|---|---|---|---|---|
| Standard | 0,75 USD | 3,75 USD | 1,50 USD | 7,50 USD |
| Batch / Flex | 0,375 USD | 1,875 USD | 0,75 USD | 3,75 USD |
| Priority | 1,35 USD | 6,75 USD | 2,70 USD | 13,50 USD |
Cache kosztuje obecnie 0,075 USD za milion tokenów w trybie Standard, a jego przechowywanie 0,50 USD za milion tokenów na godzinę. Batch i Flex obniżają stawki tokenowe o połowę, gdy zadanie nie wymaga gwarantowanego niskiego opóźnienia. W aplikacji agentowej trzeba liczyć koszt całej pętli: promptu, kontekstu, rozumowania, wyników narzędzi i ponowień.
Dostępność, migracja i licencja
Gemini 3.8 Flash jest dostępny w aplikacji Gemini, Google AI Studio, Gemini API, Gemini Enterprise Agent Platform, AI Mode i Antigravity. W Antigravity stał się modelem domyślnym. Jest to usługa własnościowa podlegająca warunkom Google; wagi nie zostały udostępnione, więc nie można mówić o modelu open weights.
Migracja z wcześniejszych modeli Gemini 3 wymaga kontroli konfiguracji. Google zaleca usunięcie parametrów temperature, top_p i top_k, zastąpienie thinking_budget ustawieniem thinking_level i rezygnację z candidate_count. Poziom minimal nie jest obsługiwany. W rozmowach wieloturowych producent preferuje serwerowy identyfikator previous_interaction_id.
Jeśli model steruje narzędziami, sama jakość odpowiedzi nie wystarczy. Potrzebne są limity uprawnień, rejestrowanie operacji, budżet kosztu, mechanizm przerwania pętli i walidacja efektu. Warto też precyzyjnie odróżniać agentów AI od samego modelu językowego: model jest silnikiem, ale bezpieczeństwo i niezawodność zależą od całego systemu.
Czego Google nie ujawnił i co nadal trzeba sprawdzić
Google nie podał liczby parametrów całkowitych ani aktywnych, szczegółowej architektury, składu danych treningowych, etapów post-treningu, użytej infrastruktury ani kosztu szkolenia. Karta modelu mówi jedynie, że 3.8 Flash bazuje na 3.7 Flash, i odsyła do poprzedniej dokumentacji. Nie da się więc niezależnie ustalić, czy poprawa pochodzi z nowego treningu, zmian w inferencji, dłuższego rozumowania czy kombinacji tych elementów.
Producent wymienia typowe ograniczenia: halucynacje, sporadyczne spowolnienia i timeouty. Granica wiedzy została określona na marzec 2026 roku, choć w części dziedzin model może mieć wiedzę ograniczoną do stycznia 2025 roku. Google odnotował też lekkie pogorszenie automatycznego wyniku bezpieczeństwa wielojęzycznego względem 3.7 Flash. To dodatkowy powód, by testować model po polsku, a nie zakładać, że anglojęzyczne benchmarki przeniosą się bez strat.
Czy warto przejść na Gemini 3.8 Flash
Dla użytkowników 3.7 Flash test migracyjny jest uzasadniony: cena katalogowa pozostaje taka sama, specyfikacja wejścia i kontekstu jest znajoma, a wyniki wskazują na poprawę w części długich zadań programistycznych. Nie ma jednak podstaw do automatycznej wymiany modelu we wszystkich procesach. Wysoki poziom rozumowania może zwiększyć koszt i czas odpowiedzi bardziej, niż sugeruje niewielka różnica w zbiorczym indeksie.
Gemini 3.8 Flash jest więc przede wszystkim bardziej ambitnym modelem roboczym w klasie Flash, a nie tanią kopią największych modeli bez kompromisów. Najrozsądniejszy plan to porównać low, medium i high na własnym zestawie zadań oraz mierzyć koszt poprawnie zakończonego procesu. Dopiero ta metryka pokaże, czy dodatkowe rozumowanie rzeczywiście oszczędza pracę zespołu.
Częste pytania
Jakie są główne zmiany w Gemini 3.8 Flash w porównaniu do poprzednich wersji?
Gemini 3.8 Flash koncentruje się na poprawie długich zadań programistycznych i agentowych poprzez umożliwienie modelowi wykonywania więcej kroków rozumowania oraz iteracyjnego używania narzędzi. Model ma również wyższy wynik w Intelligence Index, ale może generować większe zużycie tokenów.
Kiedy Gemini 3.8 Flash będzie dostępny i jakie są jego ceny?
Gemini 3.8 Flash jest dostępny od 2 września 2026 roku. Do 31 grudnia 2026 roku ceny wynoszą 0,75 USD za milion tokenów wejścia i 3,75 USD za milion tokenów wyjścia.
Jakie są limity tokenów w Gemini 3.8 Flash?
Gemini 3.8 Flash ma limit wejścia wynoszący 1 048 576 tokenów oraz maksymalne wyjście wynoszące 65 536 tokenów. To oznacza, że model może przetwarzać duże ilości danych, ale jakość wyników zależy od kontekstu.
Jakie są poziomy rozumowania dostępne w Gemini 3.8 Flash?
W Gemini 3.8 Flash dostępne są trzy poziomy rozumowania: low, medium i high, przy czym domyślnym poziomem jest medium. Wybór poziomu wpływa na jakość wyników oraz zużycie tokenów.
Jak migracja z wcześniejszych modeli Gemini do 3.8 Flash powinna wyglądać?
Migracja z wcześniejszych modeli Gemini 3 wymaga usunięcia parametrów temperature, top_p i top_k oraz zastąpienia ich nowymi ustawieniami. Google zaleca również użycie identyfikatora previous_interaction_id w rozmowach wieloturowych.







