Aktualności Tekstowe

Gemini 4 Argon: mocne wyniki, cena i ograniczony dostęp

Zamknięty bordowy futerał i srebrny klucz — metafora ograniczonego dostępu do modelu Gemini 4 Argon.

Gemini 4 Argon osiągnął 53 punkty w niezależnym Intelligence Index firmy Artificial Analysis — tyle samo co GPT-6 Astra w ustawieniu max. Google ogłosiło model 30 września 2026 r., ale na razie udostępnia go tylko wybranym, zaufanym partnerom zajmującym się cyberobroną. To premiera z mocnymi wynikami, ale jeszcze nie narzędzie dostępne dla każdego.

Istotna jest także cena. Zapowiedziana promocja obniża stawki za tokeny o połowę, jednak długie rozumowanie nadal kosztuje. Oceniając Argona, trzeba rozdzielić trzy rzeczy: możliwości konkretnego wariantu High, warunki dostępu oraz koszt wykonania zadania. Poniżej zestawiamy niezależne pomiary i dane producenta.

Nowy model Gemini 4 Argon

Komunikat Google opisuje Argona jako model do długich zadań programistycznych i profesjonalnych. Firma zapowiada, że będzie go stopniowo udostępniać deweloperom, przedsiębiorstwom i konsumentom, zaczynając od płatnych klientów API oraz subskrybentów Google AI Ultra. Daty w komunikacie nie podaje.

Obecnie droga do modelu prowadzi przez Fairwind Program. Dostęp otrzymuje w nim wybrana grupa zatwierdzonych partnerów, a pierwszeństwo mają rządy i krajowe organy ds. cyberbezpieczeństwa, operatorzy infrastruktury krytycznej oraz kluczowe platformy technologiczne. Google nie pozwala partnerom udostępniać, redystrybuować ani sprzedawać dostępu do modelu.

Partnerzy muszą stosować uwierzytelnianie na poziomie użytkownika, MFA odporne na phishing i odpowiednią kontrolę dostępu, a także rejestrować, kto z pracowników ma dostęp do modelu i jak z niego korzysta. Uprawnienia mają trafiać do wewnętrznych zespołów bezpieczeństwa, reagowania na incydenty lub testów penetracyjnych. Sam udział organizacji w Fairwind nie oznacza więc, że Argon trafi do wszystkich jej pracowników.

Google dopuszcza korzystanie z Argona samodzielnie lub w połączeniu z CodeMender. Organizacjom spoza programu wskazuje CodeMender z publicznie dostępnymi modelami. To istotne rozróżnienie: dostęp do agenta naprawiającego kod nie oznacza dostępu do samego Argona. Nie udało nam się potwierdzić ogólnej dostępności modelu w Polsce ani znaleźć publicznej listy regionów jego API.

Specyfikacja: dwa różne limity miliona tokenów

WłaściwośćPotwierdzone informacje i zakres
Wariant w pomiarach niezależnychGemini 4 Argon (High)
Kontekst1 mln tokenów według karty Artificial Analysis
Limit wyjściaDo 1 mln tokenów według zapowiedzi Google
Wejście / wyjście na karcie AATekst i obraz / tekst
Wagi i licencjaModel własnościowy; wagi nie są publicznie dostępne
Parametry i architekturaLiczby parametrów i szczegółów architektury nie ujawniono w sprawdzonych źródłach

Źródła: karta modelu w AA i komunikat Google. Kontekst określa, ile informacji model może mieć jednocześnie do dyspozycji, a limit wyjścia — ile może wygenerować. To dwie różne właściwości, a bez pełnej specyfikacji API nie wiadomo, czy oba limity da się wykorzystać w całości jednocześnie.

Analiza premierowa AA opisuje mechanizm Long Decode Continuation: długa odpowiedź jest zatrzymywana i wznawiana w kolejnych wywołaniach. Pozwoliło to badaczom prowadzić rozumowanie sięgające miliona tokenów bez przekraczania limitu czasu pojedynczego żądania. To sposób na kontynuację, a nie gwarancja szybkiej odpowiedzi tej długości.

Co do modalności źródła AA nie są w pełni spójne: analiza premierowa wymienia także wideo i mowę, natomiast karta modelu wskazuje tekst i obraz. Google pokazuje zadania z wideo, ale nie znaleźliśmy kompletnej publicznej specyfikacji interfejsu Argona. Dlatego w tabeli podajemy węższy zakres z karty modelu i nie zakładamy, że obsługa dźwięku jest już dostępna w aplikacji.

Niezależne wyniki: mocne strony i słabsze zadania

Poniższe wyniki pochodzą z Artificial Analysis i dotyczą wariantu High; nie powtarzaliśmy tych pomiarów samodzielnie. Indeks ma na karcie modelu wersję v4.3.2 i łączy dziesięć ewaluacji. Podawany przy nim koszt zadania to średnia ważona kosztów tych testów, a nie cennik dowolnej pracy użytkownika.

Pomiar AAArgon HighPunkt odniesienia
Intelligence Index53 pktGPT-6 Astra max: 53; GPT-6.1 Sol max: 52
AutomationBench-AA78%Claude Sonnet 5.5 max: 71%
Terminal-Bench 457%Sonnet 5.5 max: 64%; Opus 5.5 max: 60%; Astra: 59%

Źródło: analiza AA z 30 września. Argon wypada mocno w automatyzacji pracy, lecz w zadaniach terminalowych ustępuje wymienionym konkurentom. Jednopunktowa różnica w zaokrąglonym indeksie nie musi być statystycznie istotna, a wysoki wynik zbiorczy nie rozstrzyga, który model najlepiej sprawdzi się w konkretnym projekcie.

Wyniki te warto zestawić z wcześniejszym Gemini 3.8 Flash, pamiętając, że jego dostępność i warunki nie przekładają się na Argona: inny wariant to inne parametry, sposób wdrożenia i koszt. Podobnie w porównaniu z GPT-6.1 Sol liczy się ustawienie rozumowania, a nie tylko nazwa rodziny.

Arena: pierwsze miejsce, ale wynik wstępny

W rankingu Text Arena Overall z 2 października gemini-4-argon-high zajmuje pierwsze miejsce. Ma wynik 1525±9 przy 4932 głosach, z oznaczeniem Preliminary. Dwa kolejne modele mają wyniki 1505±3 i 1504±4. Rozrzut miejsc (Rank Spread) wynosi dla Argona 1–1, czyli w zestawieniu ogólnym żaden inny model nie mieści się statystycznie na pierwszej pozycji. Argon jest pierwszy nie tylko w zestawieniu ogólnym, ale też w kategorii Creative Writing: ma tam 1519±19 przy 1097 głosach, również z oznaczeniem Preliminary. Wyprzedza jednak Claude Opus 5.5 (1516±20) tylko o 3 punkty, więc w pisaniu kreatywnym to w praktyce remis: rozrzut miejsc obu modeli wynosi tam 1–5.

To ranking preferencji użytkowników porównujących odpowiedzi, a nie odsetek poprawnie wykonanych zadań. Wynik jest wstępny i obarczony większą niepewnością niż u kolejnych modeli, więc za wcześnie na trwały tytuł „najlepszego modelu”. Warto obserwować, czy przewaga utrzyma się przy większej liczbie głosów i w innych kategoriach.

Cena tokenów i koszt zadania

Oficjalne stawki z komunikatu Google wyglądają następująco. Wszystkie wartości dotyczą 1 mln tokenów.

RodzajCena promocyjnaPo promocji
Wejście2 USD4 USD
Wyjście10 USD20 USD
Wejście z cache0,10 USD0,20 USD przy zachowaniu rabatu 95%

Źródło: komunikat Google. Cenę wejścia z cache wyliczyliśmy z podanego rabatu 95% względem zwykłego wejścia; tabela nie obejmuje opłat za zapis ani przechowywanie cache. Komunikat nie podaje daty końca promocji ani progów cenowych zależnych od długości kontekstu.

AA podaje dla Argona High 1,99 USD za zadanie w Intelligence Index przy stawkach promocyjnych oraz 3,98 USD przy standardowych. Dla Astry max było to w tym samym porównaniu 3,26 USD. Argon generował średnio około 62 tys. tokenów wyjściowych na zadanie, a Astra — około 27 tys. Przewaga kosztowa w promocji wynika więc z cen, a nie z krótszego rozumowania.

Dla planujących wdrożenie to ważna zależność. Niższą stawkę jednostkową może zniwelować większa liczba tokenów, dodatkowe próby i wywołania narzędzi. Budżet powinien uwzględniać także ceny po zakończeniu promocji. Z kolei maksymalna długość odpowiedzi pokazuje jedynie, ile model może wygenerować, a nie jakie ustawienie opłaca się w danym zadaniu.

Co pokazuje Google i jak czytać te pomiary

Na stronie modelu Google publikuje szerszą tabelę. Poniżej wybrane wyniki z zestawienia producenta — zarówno z obszaru, w którym Argon prowadzi, jak i z tych, w których wypada słabiej.

BenchmarkArgonGPT-6 AstraClaude Opus 5.5
DeepSWE v1.177,9%74,1%74,2%
FrontierSWE v255,0%65,5%62,3%
Terminal-Bench Science 0.157,6%68,1%63,3%

Dokument metodologiczny Google odróżnia pomiary własne od wyników pobranych z tablic autorów benchmarków i kart modeli konkurencji. Zwykle stosowano pass@1 i najwyższy poziom myślenia, z opisanymi wyjątkami. Wynik DeepSWE dla Argona uzyskano z agentem mini-swe, a FrontierSWE pochodzi z oficjalnej tablicy Proximal. W Terminal-Bench Science dla Argona użyto sześciokrotnie dłuższego limitu czasu weryfikatora.

Wyniki producenta i AA nie zawsze dotyczą tej samej konfiguracji. Przykładem są AutomationBench i AutomationBench-AA: ich wartości nie należy bezpośrednio zestawiać, a różnica między nimi nie oznacza sprzeczności. Znaczenie mają zbiór zadań, agent, narzędzia, budżet i sposób oceniania. Dlatego podajemy te dane w osobnych tabelach, a nie na wspólnym wykresie, który sugerowałby jednolite warunki.

Trening i ograniczenia: czego nie ujawniono

Google opisuje rozwijanie zdolności cyberobrony, testy bezpieczeństwa oraz nadzór nad działaniami modelu. W sprawdzonych materiałach nie ujawniono jednak szczegółów architektury, łącznej i aktywnej liczby parametrów, składu danych, pełnego przebiegu pretrainingu i post-trainingu, skali uczenia przez wzmacnianie (RL), destylacji ani kosztu treningu. Argon nie jest modelem o otwartych wagach; nie ma też podstaw, by nazywać go open source.

Dokument ewaluacyjny pomaga zrozumieć wyniki, ale nie zastępuje raportu o treningu. Zestawienie benchmarków pokazuje kierunek zmian, lecz nie pozwala oszacować niezawodności w każdym zastosowaniu. Przykładowo nasz test OCR syntetycznych faktur dotyczył innych, już dostępnych modeli i nie mówi nic o zachowaniu Argona.

Gemini 4 Argon to mocny sygnał, że Google wraca do rywalizacji w długich zadaniach wymagających rozumowania. Czy jest to praktyczny przełom, okaże się po szerszym udostępnieniu — gdy znane będą konkretne limity API i pełne koszty, a model da się sprawdzić na rzeczywistych zadaniach. Dziś wiadomo, że wariant High osiąga wysokie wyniki; nie wiadomo jeszcze, kiedy każdy zainteresowany będzie mógł to samodzielnie zweryfikować.

Częste pytania

Jakie są główne cechy modelu Gemini 4 Argon?

Gemini 4 Argon jest zaprojektowany do długich zadań programistycznych i profesjonalnych, osiągając 53 punkty w Intelligence Index. Model ten jest dostępny tylko dla wybranych partnerów, co ogranicza jego dostępność.

Kto ma dostęp do modelu Gemini 4 Argon?

Dostęp do Gemini 4 Argon mają wybrani partnerzy w ramach Fairwind Program, w tym rządy i organy ds. cyberbezpieczeństwa. Google nie pozwala na redystrybucję ani sprzedaż dostępu do modelu przez partnerów.

Jakie są ceny korzystania z Gemini 4 Argon?

Ceny za korzystanie z Gemini 4 Argon w promocji wynoszą 2 USD za wejście i 10 USD za wyjście na 1 mln tokenów. Po zakończeniu promocji stawki wzrosną do 4 USD za wejście i 20 USD za wyjście.

Jakie są mocne i słabe strony Gemini 4 Argon w porównaniu do konkurencji?

Gemini 4 Argon wyróżnia się wysoką wydajnością w automatyzacji pracy, osiągając 78% w pomiarach. Jednak w zadaniach terminalowych wypada słabiej w porównaniu do niektórych konkurentów.

Czy dostęp do Gemini 4 Argon oznacza dostęp do CodeMender?

Nie, dostęp do CodeMender nie oznacza automatycznie dostępu do Gemini 4 Argon. Organizacje spoza programu mogą korzystać z CodeMender z publicznie dostępnymi modelami.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *