AI w IT Aktualności

Claude Sonnet 5.5: cena tokena to nie koszt wykonania zadania

Niebieskie ceramiczne koraliki tworzą ścieżkę i stertę, ilustrując różnicę między ceną tokena a kosztem zadania Claude Sonnet 5.5.

Claude Sonnet 5.5 ma zbliżyć tańszą linię Anthropic do możliwości Opusa w pracy agentowej. Premiera z 28 września przynosi poprawę wyników, ale nie prostą obietnicę niższego rachunku. Producent deklaruje do 30% mniejszy koszt zadania niż w Sonnet 5, podczas gdy Artificial Analysis przy maksymalnym rozumowaniu zmierzyło koszt wyższy. Oba stwierdzenia dotyczą różnych prób i konfiguracji.

Najważniejsza decyzja dla użytkownika dotyczy więc poziomu rozumowania. W niezależnych pomiarach Sonnet 5.5 przy medium kosztuje znacznie mniej niż przy max, lecz osiąga też niższy wynik. Dla programistów dochodzi drugi temat: migracja z Sonnet 5 wymaga sprawdzenia parametrów żądania i obsługi bloków thinking.

Co wprowadzono?

Według oficjalnego komunikatu Sonnet 5.5 jest drugim modelem rodziny 5.5, po opisanym wcześniej Opusie 5.5. Firma deklaruje generowanie o ponad 30% szybsze niż w Sonnet 5 przy niezmienionej cenie tokenów.

Model jest dostępny w Claude, Claude Code i API oraz u partnerów chmurowych. Poszczególne produkty mają własne limity i warunki dostępu. W Claude i Claude Code domyślnym effort jest medium a na Claude Platform high. Wynik benchmarku ustawionego na max nie opisuje zatem automatycznie zachowania modelu w zwykłej rozmowie.

Specyfikacja: duży kontekst, tekst i obrazy

Oficjalna karta modelu podaje następujące parametry, sprawdzone 30 września 2026 r.

ParametrClaude Sonnet 5.5
Identyfikator Claude APIclaude-sonnet-5-5
Okno kontekstowe1 mln tokenów
Maksymalne wyjście standardowe128 tys. tokenów
Wejście i wyjścieTekst i obrazy → tekst
RozumowanieAdaptive; effort: low, medium, high, xhigh, max
Granica wiedzy deklarowana przez producentaCzerwiec 2026

Duży kontekst pozwala przekazać obszerny materiał, ale nie dowodzi poprawnego wykorzystania każdego fragmentu. Przy analizie dokumentów nadal potrzebna jest kontrola odwołań i pominięć.

Sonnet 5.5 jest modelem zamkniętym: Anthropic udostępnia usługę na swoich warunkach, bez publicznych wag i licencji otwartych wag. Dostępność przez kilku dostawców chmurowych nie zmienia tego statusu.

Niezależne pomiary: mocny wynik, konkretne słabości

Na aktualnej karcie Artificial Analysis wariant Adaptive Reasoning, Max Effort, Default Fallback ma 56 punktów Intelligence Index v4.3.2. Według odczytu z 30 września zajmuje trzecie miejsce w pokazanej klasie 222 modeli. To nowszy stan niż drugie miejsce opisane w analizie premierowej. Indeks łączy dziesięć ewaluacji; nie jest miarą wszystkich możliwych zastosowań.

Analiza AA z premiery wskazuje na silną pracę terminalową: 64% w Terminal-Bench 4.0. W zadaniach biznesowych Sonnet 5.5 uzyskał 1811 Elo w AA-Briefcase i 1844 Elo w GDPval-AA, wobec 1822 i 1846 dla Opusa 5.5. Niewielka różnica liczbowa bez przedziałów nie uzasadnia stwierdzenia, że modele są równie dobre we wszystkich zadaniach.

Słabszą stroną w tym zestawie była faktografia: wskaźnik dokładności wyniósł 54%, wobec 66% dla Opusa. Te wartości dotyczą określonej ewaluacji, a nie odsetka poprawnych odpowiedzi w codziennym użyciu. Wysoki wynik pracy agentowej nie zwalnia z weryfikowania informacji.

AA testowało wersję z domyślnym fallbackiem do Sonnet 5, użytym w około 0,1% zadań. Opisuje też błąd structured outputs we wcześniejszym wdrożeniu, poprawiony przed publiczną premierą, i zapowiada powtórzenie odpowiednich prób. Podczas weryfikacji 30 września nie znaleźliśmy w tym materiale potwierdzenia ukończenia powtórki. Wyniki trzeba czytać z tym zastrzeżeniem.

Benchmarki producenta nie tworzą jednej tabeli z AA

Anthropic podaje 70,6% w Terminal-Bench 4.0. Różnica względem 64% AA nie jest dowodem błędu jednej strony: konfiguracja agenta i sposób wykonania testu wpływają na rezultat. W FrontierCode 1.1 firma raportuje 46,2% przy max oraz 52,1% przy xhigh. Opisuje przypadki, w których dodatkowe działania przy max prowadziły do przekroczenia czasu albo wyjścia poza zakres zadania.

To praktyczna wskazówka: większy budżet rozumowania może zwiększać liczbę działań, ale nie musi poprawiać końcowego rozwiązania. Agent wykonujący kod ma także ograniczenia czasu, narzędzi i zakresu zmian. Sam wybór najwyższego effort nie usuwa tych ograniczeń.

Cena tokenów i koszt zadania to dwie różne liczby

Oficjalne stawki Claude API, sprawdzone 30 września, wynoszą poniżej tyle samo co dla Sonnet 5. Jednostką jest milion tokenów, a walutą USD.

Rodzaj rozliczeniaCena za 1 mln tokenów
Nowe wejście2,00 USD
Wyjście10,00 USD
Zapis cache na 5 minut2,50 USD
Zapis cache na godzinę4,00 USD
Odczyt cache0,20 USD

Batch API ma rabat 50% na wejście i wyjście. Warunki innych platform trzeba sprawdzić osobno. Cena tokena pozostaje stała w tym cenniku, ale effort wpływa na jego zużycie i liczbę kolejnych wywołań.

Tabela wariantów AA pokazuje następujący kompromis. Są to niezależne pomiary z domyślnym fallbackiem, według stanu odczytanego 30 września.

EffortIntelligence IndexKoszt zadania indeksu
Medium410,59 USD
High471,08 USD
Xhigh522,74 USD
Max567,60 USD

„Koszt zadania” AA jest średnią ważoną kosztów ewaluacji: obejmuje wejście, cache, rozumowanie i odpowiedź. Nie jest ceną jednej typowej rozmowy ani gwarantowanym rachunkiem za zadanie czytelnika. Przejście z xhigh do max daje tu cztery punkty indeksu, a koszt rośnie około 2,8 raza. Ten iloraz jest naszym obliczeniem z tabeli.

W analizie premierowej AA koszt max był około 50% wyższy niż dla Sonnet 5. Deklaracja Anthropic „do 30% taniej” odnosi się do zadań i warunków wybranych przez producenta. Nie ma sprzeczności, którą można rozstrzygnąć samym cennikiem. Własny proces trzeba porównać przy tej samej jakości akceptowanego wyniku, z uwzględnieniem poprawek.

Migracja API: sama podmiana nazwy może nie wystarczyć

Przewodnik migracji wymienia zmiany, które mogą przerwać działanie integracji:

  • thinking: disabled należy zastąpić ustawieniem between_tools. Działa ono przy high lub niższym effort; nie oznacza całkowitego wyłączenia rozumowania między narzędziami.
  • tool_choice: any i wymuszenie konkretnego narzędzia zwracają błąd 400. Trzeba dostosować wybór narzędzi oraz wymagania dotyczące schematu odpowiedzi.
  • Bloki thinking są związane z modelem i rozmową. Nie można swobodnie przenosić ich między historiami lub kontami; aplikacja musi zachować właściwą historię wywołań.
  • Claude API i Google Cloud odrzucają starsze narzędzie computer_20251124. Integracje korzystające z computer use wymagają osobnej kontroli wersji narzędzia.

Zmienił się też kształt odpowiedzi między wywołaniami narzędzi: tekst może trafiać do bloków thinking. Interfejs pokazujący tylko zwykłe bloki tekstowe może przestać wyświetlać postęp, choć żądanie działa. Przed migracją warto sprawdzić pełny cykl: odpowiedź, wywołanie narzędzia, jego wynik i dalszą odpowiedź. Kontekst integracji opisaliśmy przy Agent Skills w Claude API.

Co wiadomo o treningu i zabezpieczeniach?

Karta systemowa, w sekcji 1.1, opisuje mieszankę danych internetowych, publicznych i prywatnych zbiorów oraz danych syntetycznych innych modeli. Wspomina deduplikację, klasyfikację i post-training po pretrainingu, ukierunkowany na zachowanie zgodne z konstytucją Claude. Dane użytkowników mogą być uwzględniane na opisanych tam zasadach, np. po wyraźnej zgodzie.

Dokument nie ujawnia liczby parametrów całkowitych i aktywnych, szczegółowej architektury ani kosztu treningu. Nie podaje też receptury RL, proporcji zbiorów czy informacji pozwalających stwierdzić, że Sonnet 5.5 jest destylacją Opusa. Podobieństwo wyników nie dowodzi podobieństwa procesu szkolenia.

W wybranych zadaniach cyber model może przełączać się na Sonnet 5. Anthropic opisuje też zabezpieczenia biologiczne i chemiczne. To mechanizmy producenta, a nie niezależny certyfikat. O szerszych warunkach dostępu do pracy w naukach o życiu pisaliśmy przy Life Sciences Verification Program.

Co zmienia Sonnet 5.5?

Premiera daje mocniejszy model do kodowania i pracy z narzędziami przy dotychczasowych stawkach tokenów. Niezależne wyniki potwierdzają poprawę, ale pokazują także koszt intensywnego rozumowania oraz słabszą faktografię względem Opusa. Wybór Sonnet 5.5 ma sens wtedy, gdy jego ustawienie daje potrzebną jakość przy akceptowalnym koszcie całego procesu.

Najważniejsze kolejne dane to powtórzone ewaluacje po poprawce structured outputs i porównania na konkretnych zadaniach użytkownika. Dla istniejących integracji pierwszym krokiem jest kontrola migracji API. Dla nowego zastosowania — porównanie medium, high i xhigh przed przyjęciem max jako ustawienia domyślnego.

Częste pytania

Jakie są główne różnice między Sonnet 5 a Sonnet 5.5?

Sonnet 5.5 oferuje do 30% szybsze generowanie wyników w porównaniu do Sonnet 5, przy zachowaniu tej samej ceny tokenów. Jednakże, w niezależnych pomiarach, koszt zadania może być wyższy, co wskazuje na różnice w konfiguracji i próbach.

Czy migracja z Sonnet 5 do Sonnet 5.5 jest prosta?

Migracja z Sonnet 5 do Sonnet 5.5 wymaga sprawdzenia parametrów żądania oraz dostosowania bloków thinking. Prosta podmiana nazwy może nie wystarczyć, ponieważ zmieniły się również wymagania dotyczące wyboru narzędzi.

Jakie są koszty tokenów w Sonnet 5.5?

Koszty tokenów w Sonnet 5.5 są takie same jak w Sonnet 5, wynoszą 2,00 USD za milion tokenów wejściowych i 10,00 USD za milion tokenów wyjściowych. Warto jednak zauważyć, że różne poziomy effort wpływają na zużycie tokenów.

Jakie są wyniki benchmarków Sonnet 5.5 w porównaniu do Opusa 5.5?

Sonnet 5.5 uzyskał 56 punktów w Intelligence Index, co plasuje go na trzecim miejscu wśród 222 modeli. W zadaniach biznesowych osiągnął wyniki zbliżone do Opusa 5.5, ale z niższą dokładnością w faktografii.

Jakie zabezpieczenia są wprowadzone w Sonnet 5.5?

Sonnet 5.5 wykorzystuje mieszankę danych internetowych, publicznych i prywatnych zbiorów, a także mechanizmy zabezpieczeń biologicznych i chemicznych. Producent nie ujawnia szczegółowych informacji o architekturze czy liczbie parametrów, co utrudnia pełną ocenę modelu.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *