Gemini 4 Argon osiągnął 53 punkty w niezależnym Intelligence Index firmy Artificial Analysis — tyle samo co GPT-6 Astra w ustawieniu max. Google ogłosiło model 30 września 2026 r., ale na razie udostępnia go tylko wybranym, zaufanym partnerom zajmującym się cyberobroną. To premiera z mocnymi wynikami, ale jeszcze nie narzędzie dostępne dla każdego.
Istotna jest także cena. Zapowiedziana promocja obniża stawki za tokeny o połowę, jednak długie rozumowanie nadal kosztuje. Oceniając Argona, trzeba rozdzielić trzy rzeczy: możliwości konkretnego wariantu High, warunki dostępu oraz koszt wykonania zadania. Poniżej zestawiamy niezależne pomiary i dane producenta.
Nowy model Gemini 4 Argon
Komunikat Google opisuje Argona jako model do długich zadań programistycznych i profesjonalnych. Firma zapowiada, że będzie go stopniowo udostępniać deweloperom, przedsiębiorstwom i konsumentom, zaczynając od płatnych klientów API oraz subskrybentów Google AI Ultra. Daty w komunikacie nie podaje.
Obecnie droga do modelu prowadzi przez Fairwind Program. Dostęp otrzymuje w nim wybrana grupa zatwierdzonych partnerów, a pierwszeństwo mają rządy i krajowe organy ds. cyberbezpieczeństwa, operatorzy infrastruktury krytycznej oraz kluczowe platformy technologiczne. Google nie pozwala partnerom udostępniać, redystrybuować ani sprzedawać dostępu do modelu.
Partnerzy muszą stosować uwierzytelnianie na poziomie użytkownika, MFA odporne na phishing i odpowiednią kontrolę dostępu, a także rejestrować, kto z pracowników ma dostęp do modelu i jak z niego korzysta. Uprawnienia mają trafiać do wewnętrznych zespołów bezpieczeństwa, reagowania na incydenty lub testów penetracyjnych. Sam udział organizacji w Fairwind nie oznacza więc, że Argon trafi do wszystkich jej pracowników.
Google dopuszcza korzystanie z Argona samodzielnie lub w połączeniu z CodeMender. Organizacjom spoza programu wskazuje CodeMender z publicznie dostępnymi modelami. To istotne rozróżnienie: dostęp do agenta naprawiającego kod nie oznacza dostępu do samego Argona. Nie udało nam się potwierdzić ogólnej dostępności modelu w Polsce ani znaleźć publicznej listy regionów jego API.
Specyfikacja: dwa różne limity miliona tokenów
| Właściwość | Potwierdzone informacje i zakres |
|---|---|
| Wariant w pomiarach niezależnych | Gemini 4 Argon (High) |
| Kontekst | 1 mln tokenów według karty Artificial Analysis |
| Limit wyjścia | Do 1 mln tokenów według zapowiedzi Google |
| Wejście / wyjście na karcie AA | Tekst i obraz / tekst |
| Wagi i licencja | Model własnościowy; wagi nie są publicznie dostępne |
| Parametry i architektura | Liczby parametrów i szczegółów architektury nie ujawniono w sprawdzonych źródłach |
Źródła: karta modelu w AA i komunikat Google. Kontekst określa, ile informacji model może mieć jednocześnie do dyspozycji, a limit wyjścia — ile może wygenerować. To dwie różne właściwości, a bez pełnej specyfikacji API nie wiadomo, czy oba limity da się wykorzystać w całości jednocześnie.
Analiza premierowa AA opisuje mechanizm Long Decode Continuation: długa odpowiedź jest zatrzymywana i wznawiana w kolejnych wywołaniach. Pozwoliło to badaczom prowadzić rozumowanie sięgające miliona tokenów bez przekraczania limitu czasu pojedynczego żądania. To sposób na kontynuację, a nie gwarancja szybkiej odpowiedzi tej długości.
Co do modalności źródła AA nie są w pełni spójne: analiza premierowa wymienia także wideo i mowę, natomiast karta modelu wskazuje tekst i obraz. Google pokazuje zadania z wideo, ale nie znaleźliśmy kompletnej publicznej specyfikacji interfejsu Argona. Dlatego w tabeli podajemy węższy zakres z karty modelu i nie zakładamy, że obsługa dźwięku jest już dostępna w aplikacji.
Niezależne wyniki: mocne strony i słabsze zadania
Poniższe wyniki pochodzą z Artificial Analysis i dotyczą wariantu High; nie powtarzaliśmy tych pomiarów samodzielnie. Indeks ma na karcie modelu wersję v4.3.2 i łączy dziesięć ewaluacji. Podawany przy nim koszt zadania to średnia ważona kosztów tych testów, a nie cennik dowolnej pracy użytkownika.
| Pomiar AA | Argon High | Punkt odniesienia |
|---|---|---|
| Intelligence Index | 53 pkt | GPT-6 Astra max: 53; GPT-6.1 Sol max: 52 |
| AutomationBench-AA | 78% | Claude Sonnet 5.5 max: 71% |
| Terminal-Bench 4 | 57% | Sonnet 5.5 max: 64%; Opus 5.5 max: 60%; Astra: 59% |
Źródło: analiza AA z 30 września. Argon wypada mocno w automatyzacji pracy, lecz w zadaniach terminalowych ustępuje wymienionym konkurentom. Jednopunktowa różnica w zaokrąglonym indeksie nie musi być statystycznie istotna, a wysoki wynik zbiorczy nie rozstrzyga, który model najlepiej sprawdzi się w konkretnym projekcie.
Wyniki te warto zestawić z wcześniejszym Gemini 3.8 Flash, pamiętając, że jego dostępność i warunki nie przekładają się na Argona: inny wariant to inne parametry, sposób wdrożenia i koszt. Podobnie w porównaniu z GPT-6.1 Sol liczy się ustawienie rozumowania, a nie tylko nazwa rodziny.
Arena: pierwsze miejsce, ale wynik wstępny
W rankingu Text Arena Overall z 2 października gemini-4-argon-high zajmuje pierwsze miejsce. Ma wynik 1525±9 przy 4932 głosach, z oznaczeniem Preliminary. Dwa kolejne modele mają wyniki 1505±3 i 1504±4. Rozrzut miejsc (Rank Spread) wynosi dla Argona 1–1, czyli w zestawieniu ogólnym żaden inny model nie mieści się statystycznie na pierwszej pozycji. Argon jest pierwszy nie tylko w zestawieniu ogólnym, ale też w kategorii Creative Writing: ma tam 1519±19 przy 1097 głosach, również z oznaczeniem Preliminary. Wyprzedza jednak Claude Opus 5.5 (1516±20) tylko o 3 punkty, więc w pisaniu kreatywnym to w praktyce remis: rozrzut miejsc obu modeli wynosi tam 1–5.
To ranking preferencji użytkowników porównujących odpowiedzi, a nie odsetek poprawnie wykonanych zadań. Wynik jest wstępny i obarczony większą niepewnością niż u kolejnych modeli, więc za wcześnie na trwały tytuł „najlepszego modelu”. Warto obserwować, czy przewaga utrzyma się przy większej liczbie głosów i w innych kategoriach.
Cena tokenów i koszt zadania
Oficjalne stawki z komunikatu Google wyglądają następująco. Wszystkie wartości dotyczą 1 mln tokenów.
| Rodzaj | Cena promocyjna | Po promocji |
|---|---|---|
| Wejście | 2 USD | 4 USD |
| Wyjście | 10 USD | 20 USD |
| Wejście z cache | 0,10 USD | 0,20 USD przy zachowaniu rabatu 95% |
Źródło: komunikat Google. Cenę wejścia z cache wyliczyliśmy z podanego rabatu 95% względem zwykłego wejścia; tabela nie obejmuje opłat za zapis ani przechowywanie cache. Komunikat nie podaje daty końca promocji ani progów cenowych zależnych od długości kontekstu.
AA podaje dla Argona High 1,99 USD za zadanie w Intelligence Index przy stawkach promocyjnych oraz 3,98 USD przy standardowych. Dla Astry max było to w tym samym porównaniu 3,26 USD. Argon generował średnio około 62 tys. tokenów wyjściowych na zadanie, a Astra — około 27 tys. Przewaga kosztowa w promocji wynika więc z cen, a nie z krótszego rozumowania.
Dla planujących wdrożenie to ważna zależność. Niższą stawkę jednostkową może zniwelować większa liczba tokenów, dodatkowe próby i wywołania narzędzi. Budżet powinien uwzględniać także ceny po zakończeniu promocji. Z kolei maksymalna długość odpowiedzi pokazuje jedynie, ile model może wygenerować, a nie jakie ustawienie opłaca się w danym zadaniu.
Co pokazuje Google i jak czytać te pomiary
Na stronie modelu Google publikuje szerszą tabelę. Poniżej wybrane wyniki z zestawienia producenta — zarówno z obszaru, w którym Argon prowadzi, jak i z tych, w których wypada słabiej.
| Benchmark | Argon | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| DeepSWE v1.1 | 77,9% | 74,1% | 74,2% |
| FrontierSWE v2 | 55,0% | 65,5% | 62,3% |
| Terminal-Bench Science 0.1 | 57,6% | 68,1% | 63,3% |
Dokument metodologiczny Google odróżnia pomiary własne od wyników pobranych z tablic autorów benchmarków i kart modeli konkurencji. Zwykle stosowano pass@1 i najwyższy poziom myślenia, z opisanymi wyjątkami. Wynik DeepSWE dla Argona uzyskano z agentem mini-swe, a FrontierSWE pochodzi z oficjalnej tablicy Proximal. W Terminal-Bench Science dla Argona użyto sześciokrotnie dłuższego limitu czasu weryfikatora.
Wyniki producenta i AA nie zawsze dotyczą tej samej konfiguracji. Przykładem są AutomationBench i AutomationBench-AA: ich wartości nie należy bezpośrednio zestawiać, a różnica między nimi nie oznacza sprzeczności. Znaczenie mają zbiór zadań, agent, narzędzia, budżet i sposób oceniania. Dlatego podajemy te dane w osobnych tabelach, a nie na wspólnym wykresie, który sugerowałby jednolite warunki.
Trening i ograniczenia: czego nie ujawniono
Google opisuje rozwijanie zdolności cyberobrony, testy bezpieczeństwa oraz nadzór nad działaniami modelu. W sprawdzonych materiałach nie ujawniono jednak szczegółów architektury, łącznej i aktywnej liczby parametrów, składu danych, pełnego przebiegu pretrainingu i post-trainingu, skali uczenia przez wzmacnianie (RL), destylacji ani kosztu treningu. Argon nie jest modelem o otwartych wagach; nie ma też podstaw, by nazywać go open source.
Dokument ewaluacyjny pomaga zrozumieć wyniki, ale nie zastępuje raportu o treningu. Zestawienie benchmarków pokazuje kierunek zmian, lecz nie pozwala oszacować niezawodności w każdym zastosowaniu. Przykładowo nasz test OCR syntetycznych faktur dotyczył innych, już dostępnych modeli i nie mówi nic o zachowaniu Argona.
Gemini 4 Argon to mocny sygnał, że Google wraca do rywalizacji w długich zadaniach wymagających rozumowania. Czy jest to praktyczny przełom, okaże się po szerszym udostępnieniu — gdy znane będą konkretne limity API i pełne koszty, a model da się sprawdzić na rzeczywistych zadaniach. Dziś wiadomo, że wariant High osiąga wysokie wyniki; nie wiadomo jeszcze, kiedy każdy zainteresowany będzie mógł to samodzielnie zweryfikować.
Częste pytania
Jakie są główne cechy modelu Gemini 4 Argon?
Gemini 4 Argon jest zaprojektowany do długich zadań programistycznych i profesjonalnych, osiągając 53 punkty w Intelligence Index. Model ten jest dostępny tylko dla wybranych partnerów, co ogranicza jego dostępność.
Kto ma dostęp do modelu Gemini 4 Argon?
Dostęp do Gemini 4 Argon mają wybrani partnerzy w ramach Fairwind Program, w tym rządy i organy ds. cyberbezpieczeństwa. Google nie pozwala na redystrybucję ani sprzedaż dostępu do modelu przez partnerów.
Jakie są ceny korzystania z Gemini 4 Argon?
Ceny za korzystanie z Gemini 4 Argon w promocji wynoszą 2 USD za wejście i 10 USD za wyjście na 1 mln tokenów. Po zakończeniu promocji stawki wzrosną do 4 USD za wejście i 20 USD za wyjście.
Jakie są mocne i słabe strony Gemini 4 Argon w porównaniu do konkurencji?
Gemini 4 Argon wyróżnia się wysoką wydajnością w automatyzacji pracy, osiągając 78% w pomiarach. Jednak w zadaniach terminalowych wypada słabiej w porównaniu do niektórych konkurentów.
Czy dostęp do Gemini 4 Argon oznacza dostęp do CodeMender?
Nie, dostęp do CodeMender nie oznacza automatycznie dostępu do Gemini 4 Argon. Organizacje spoza programu mogą korzystać z CodeMender z publicznie dostępnymi modelami.







