Aktualności

Grok 4.7 poprawia kodowanie, ale xhigh zużywa dużo tokenów

Mechaniczny system długiej pracy agentowej z wieloma krokami, symbolizujący Grok 4.7 i koszt trybu xhigh

Grok 4.7 wyraźnie poprawia wyniki xAI w długich zadaniach programistycznych i agentowych, ale nie robi tego za darmo: najwyższy tryb rozumowania zużywa dużo tokenów i wykonuje więcej kroków. Według Artificial Analysis model z Grok Build zajął 4. miejsce w Coding Agent Index wśród systemów uruchomionych w ich natywnych środowiskach. Z kolei w bieżącej tabeli CursorBench 4.0 wariant Extra High był 10., a High 14. To mocny debiut, lecz daleki od prostego hasła „najlepszy model do kodowania”.

SpaceXAI ogłosiło Grok 4.7 21 września 2026 r. Model jest już dostępny w API, Cursor, Grok Build oraz u wybranych routerów. Cena publicznego API zaczyna się od 2 USD za milion tokenów wejściowych i 6 USD za milion wyjściowych. Przy długim kontekście stawki rosną dwukrotnie, a szybki wariant kosztuje dwa razy więcej i nie trafił do publicznego API.

  • Okno kontekstowe: 500 tys. tokenów.
  • Wejście: tekst i obraz; wyjście: tekst.
  • Poziomy rozumowania: low, medium, high i xhigh; domyślnie high.
  • Artificial Analysis Coding Agent Index: 56 punktów i 4. miejsce w grupie modeli z natywnymi środowiskami.
  • CursorBench 4.0: 46,3% dla Extra High i 43,9% dla High według stanu z 23 września 2026 r.

Co zmieniło się względem Grok 4.6

Producent opisuje Grok 4.7 jako nowy, większy model bazowy, trenowany dłużej metodą reinforcement learning na trudniejszej mieszance zadań. Większy nacisk położono na problemy trwające wiele godzin, kontrolowanie własnych rezultatów i zarządzanie długim kontekstem. Model ma również natywnie rozumieć środowisko Grok Bot.

To rozwinięcie kierunku widocznego już przy Grok 4.5, którego analizowaliśmy pod kątem kodowania i agentów. Nowa wersja nie jest jednak tylko zmianą nazwy lub dodatkowym poziomem effort. xAI mówi o większej bazie i dłuższym post-treningu, choć nie podaje liczby parametrów, zbioru danych, użytej infrastruktury ani kosztu szkolenia. Nie wiemy więc, jak duża jest zmiana architektury i które usprawnienia odpowiadają za wzrost wyników.

Ważny jest także kontekst produktu. Grok Bot ma działać jako trwały agent w procesach firmowych, więc lepsza kontrola wieloetapowej pracy ma dla xAI znaczenie większe niż wynik pojedynczego krótkiego promptu.

Specyfikacja i dostępność Grok 4.7

CechaGrok 4.7
Identyfikator APIgrok-4.7
Okno kontekstowe500 000 tokenów
Modalnościtekst i obraz na wejściu, tekst na wyjściu
Reasoning effortlow, medium, high (domyślny), xhigh
APIResponses API i Chat Completions
Narzędziafunction calling, web search, X search, code execution
DostępxAI API, Grok Build, Cursor, routery i platformy chmurowe
Nieujawnioneliczba parametrów, dane i koszt treningu, pełna architektura

Dokumentacja xAI podaje 500 tys. tokenów kontekstu. W Cursor standardowy kontekst ma 256 tys. tokenów, a tryb długiego kontekstu 500 tys. Na niższym planie Start model działa w medium i bez Fast; wyższe plany pozwalają wybierać effort. To kolejny powód, by przy porównywaniu wyników zapisywać nie tylko nazwę modelu, ale także środowisko, plan i ustawienia.

Cena: tanie tokeny, ale długie zadanie może kosztować więcej

Według release notes xAI ceny publicznego API zależą od długości promptu. Stan na 23 września 2026 r.:

Zakres promptuWejście / 1 mlnCache / 1 mlnWyjście / 1 mln
Do 200 tys. tokenów2 USD0,50 USD6 USD
Powyżej 200 tys. tokenów4 USD1 USD12 USD

Grok 4.7 Fast ma dwa razy większą szybkość generowania i dwa razy wyższe stawki. W dniu sprawdzenia wariant działał w Cursor i Grok Build, ale nie był dostępny przez publiczne API xAI. Podstawowa cena za milion tokenów jest konkurencyjna, lecz koszt kompletnego zadania zależy od liczby wygenerowanych tokenów i kroków. To szczególnie ważne w agentach, które wielokrotnie czytają repozytorium, wywołują narzędzia i poprawiają własne rozwiązania.

Niezależne pomiary: postęp jest realny, pozycja zależy od ustawień

CursorBench 4.0 testuje niejednoznaczne zadania wieloplikowe pochodzące z rzeczywistych sesji Cursor. 23 września Grok 4.7 Extra High zajmował 10. miejsce z wynikiem 46,3%, średnim kosztem 6,01 USD, 70 141 tokenami i 88 krokami. Wariant High był 14. z wynikiem 43,9%, kosztem 4,69 USD, 56 382 tokenami i 71 krokami.

Wariant w CursorBench 4.0MiejsceWynikKosztTokenyKroki
Grok 4.7 Extra High10.46,3%6,01 USD70 14188
Grok 4.7 High14.43,9%4,69 USD56 38271
Grok 4.7 Medium18.41,6%3,49 USD36 68360
Grok 4.7 Low35.33,1%1,58 USD15 67740

Tabela dobrze pokazuje cenę dodatkowego „myślenia”. Przejście z Low do Extra High podnosi wynik o 13,2 punktu procentowego, ale średni koszt rośnie prawie czterokrotnie, liczba tokenów ponad czterokrotnie, a kroków ponad dwukrotnie. Sama nazwa Grok 4.7 nie opisuje więc rzeczywistych warunków pracy.

Artificial Analysis potwierdza mocniejszą pracę agentową. Grok 4.7 xhigh z Grok Build zdobył 56 punktów w Coding Agent Index, o 9 więcej niż Grok 4.6 xhigh, i zajął 4. miejsce wśród modeli korzystających z natywnych środowisk. W AA-Briefcase uzyskał 1657 Elo, o 111 więcej od Grok 4.6 high.

Ten sam pomiar ujawnia koszt postępu: w Intelligence Index Grok 4.7 xhigh zużywał około 81 tys. tokenów wyjściowych na zadanie, wobec 38 tys. dla Grok 4.6 xhigh i 27 tys. dla GPT-6 Astra max. Wynik 46 punktów plasuje laboratorium w ścisłej czołówce, ale efektywność tokenowa nie jest jego największą przewagą.

Co pokazuje tabela producenta

W komunikacie premierowym xAI Grok 4.7 uzyskuje 46,3% w CursorBench 4.0, 71,0% w DeepSWE v1.1, 37,6% w Terminal-Bench 4.0, 1657 punktów w AA-Briefcase v1.1 i 64,0% w EEBench. To wartości interesujące, ale nie tworzą jednego, w pełni porównywalnego rankingu.

Grok 4.7 jest pokazany przy xhigh, lecz wynik DeepSWE oznaczono jako high. Konkurenci występują w innych konfiguracjach, między innymi max. Część testów pochodzi od niezależnych autorów, lecz układ tabeli, dobór wariantów i interpretacja należą do producenta. Najuczciwszy wniosek brzmi: 4.7 poprawia się względem 4.6 w większości zaprezentowanych zadań, ale nie wygrywa każdego testu i nie zawsze używa porównywalnego budżetu obliczeniowego.

Gdzie Grok 4.7 może mieć sens

Model wygląda najciekawiej tam, gdzie zadanie jest długie, wieloetapowe i warte dodatkowych tokenów: modernizacja dużego repozytorium, analiza wielu plików, tworzenie dokumentów z kontrolą wymagań czy agent wykonujący serię operacji. W prostym uzupełnianiu kodu albo krótkiej rozmowie wysoki effort może być niepotrzebnym kosztem.

To zgodne z szerszym trendem agentów ocenianych za dokończenie pracy, nie za jedną odpowiedź. Przy wcześniejszym Apodex 1.1 zwracaliśmy uwagę, że deklarowana długość działania musi iść w parze z kontrolą rezultatów. Grok 4.7 stawia na podobny kierunek: więcej kroków, dłuższe rozumowanie i silniejsza samoweryfikacja.

Ograniczenia i pytania bez odpowiedzi

xAI nie opublikowało liczby parametrów, składu danych treningowych, infrastruktury ani kosztu szkolenia. Nie da się więc ocenić, czy wzrost jakości wynika głównie ze skali modelu, dłuższego RL, integracji z Grok Build czy większego budżetu podczas inferencji. Deklaracje o nowym systemie zabezpieczeń i lepszej odporności na jailbreak także wymagają szerszej niezależnej weryfikacji.

Rankingi będą się zmieniać, a wyniki zależą od wersji harnessu, poziomu effort i limitów. Szczególnie przy zadaniach agentowych koszt w dolarach za jedno ukończone zadanie bywa ważniejszy niż cena miliona tokenów. Zespół wdrażający model powinien więc mierzyć równocześnie skuteczność, czas, liczbę kroków, tokeny oraz odsetek prac wymagających ręcznej poprawki.

Grok 4.7 to duży krok dla xAI, nie uniwersalny zwycięzca

Grok 4.7 przesuwa xAI bliżej czołówki narzędzi do kodowania i długiej pracy agentowej. Potwierdzają to zarówno CursorBench, jak i Artificial Analysis. Jednocześnie dane pokazują, że najwyższy wynik kupuje się większą liczbą tokenów i kroków, a warianty effort potrafią zmienić rezultat bardziej niż sama etykieta modelu.

Dla użytkownika najważniejsze są trzy rzeczy: zapisać dokładny poziom effort, uwzględnić próg długiego kontekstu w budżecie i testować model na własnych zadaniach. Grok 4.7 może być opłacalny przy trudnej pracy wieloetapowej. Nie ma jednak podstaw, by z jednej tabeli producenta wyciągać wniosek, że jest najlepszy we wszystkim.

Częste pytania

Jakie są główne ulepszenia w Grok 4.7 w porównaniu do Grok 4.6?

Grok 4.7 wprowadza nowy, większy model bazowy, który był trenowany dłużej metodą reinforcement learning na trudniejszych zadaniach. Zwiększono nacisk na długie problemy oraz kontrolowanie własnych wyników, co przyczynia się do lepszej wydajności w agentach.

Czy Grok 4.7 jest dostępny w publicznym API?

Tak, Grok 4.7 jest dostępny w API, Cursor, Grok Build oraz u wybranych routerów. Cena publicznego API zaczyna się od 2 USD za milion tokenów wejściowych i 6 USD za milion wyjściowych.

Jakie są koszty używania Grok 4.7 w długich zadaniach?

Koszty używania Grok 4.7 w długich zadaniach mogą być znacznie wyższe, ponieważ ceny za milion tokenów rosną w zależności od długości promptu. W przypadku długiego kontekstu stawki rosną dwukrotnie, co może wpłynąć na całkowity koszt zadania.

Jak Grok 4.7 wypada w testach porównawczych?

W testach CursorBench 4.0 Grok 4.7 Extra High zajmował 10. miejsce z wynikiem 46,3%, a wariant High był 14. z wynikiem 43,9%. Wskazuje to na znaczący postęp, ale nie oznacza, że model jest najlepszy we wszystkich kategoriach.

Gdzie najlepiej wykorzystać Grok 4.7?

Grok 4.7 sprawdzi się najlepiej w długich, wieloetapowych zadaniach, takich jak modernizacja dużych repozytoriów czy analiza wielu plików. W prostych zadaniach, jak krótkie uzupełnianie kodu, wysoki poziom effort może być nieopłacalny.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *