Aktualności

Claude Opus 5.5 debiutuje. Niższe ceny i mocne benchmarki

Dźwig z przeciwwagą unosi złożoną drewnianą konstrukcję jako metafora wydajniejszej pracy Claude Opus 5.5.

Anthropic udostępnił Claude Opus 5.5 — pierwszy model rodziny Claude 5.5. Nowość ma łączyć możliwości zbliżone do Fable 5.1 z niższym kosztem pracy: firma deklaruje oszczędność 40% względem Opus 5 przy domyślnych ustawieniach. Są też pierwsze niezależne wyniki. W dniu premiery, 22 września 2026 r., wariant max z mechanizmem fallback zajmuje pierwsze miejsce w Artificial Analysis Intelligence Index.

Najważniejsze pytanie brzmi, ile tej przewagi da się przenieść do codziennego programowania i pracy z dokumentami. Dane wyglądają obiecująco, ale trzeba rozdzielić cenę tokena, koszt wykonania zadania oraz wynik modelu uruchomionego z maksymalnym budżetem rozumowania. To trzy różne rzeczy.

Co przynosi Claude Opus 5.5

Premiera została ogłoszona w oficjalnym komunikacie Anthropic i wątku konta Claude na X. Producent akcentuje programowanie agentowe, obsługę komputera, pracę analityczną i bardziej czytelną komunikację. Deklaruje też generowanie odpowiedzi o ponad 30% szybsze niż w Opus 5. Nie jest to jednak obietnica skrócenia każdego zadania o taki sam procent.

  • Niższe ceny API: 4 USD za milion tokenów wejściowych i 20 USD za milion wyjściowych.
  • Duży kontekst: milion tokenów, ze standardowym limitem odpowiedzi 128 tys. tokenów.
  • Rozumowanie zawsze aktywne: domyślny poziom wysiłku to medium.
  • Więcej miejsca w abonamentach: Anthropic zapowiedział zwiększenie limitów pięciogodzinnych Pro, Max i Team oraz reset limitu, który abonent może zachować na później.

To następca opisywanego przez nas Claude Opus 5, ale naturalnym punktem odniesienia jest także droższy Claude Fable 5.1. W aktualnej dokumentacji Anthropic wskazuje Opus 5.5 jako punkt startowy dla większości zadań, pozostawiając Fable 5.1 dla szczególnie wymagającego rozumowania i długich procesów agentowych.

Niezależny ranking: 58 punktów przy maksymalnym wysiłku

W tabeli Artificial Analysis, sprawdzonej 22 września 2026 r., Opus 5.5 uzyskuje 58 punktów w wariancie max with fallback, 56 przy xhigh, 54 przy high i 51 przy medium. Fable 5.1 max with fallback oraz GPT-6 Astra max mają po 53 punkty, a Opus 5 max — 51. To pierwsze miejsce konkretnej konfiguracji w konkretnym indeksie, a nie dowód wyższości w każdym zastosowaniu.

Wyniki Artificial Analysis: Opus 5.5 max z fallbackiem 58 punktów, Fable 5.1 max i GPT-6 Astra max po 53 punkty.
Opracowanie AIOAI.pl. Źródło: niezależne pomiary Artificial Analysis; stan na: 22.09.2026. Kliknij wykres, aby otworzyć pełny rozmiar.

Karta modelu w Artificial Analysis identyfikuje indeks jako wersję 4.3.2, obejmującą dziesięć ewaluacji. Oznaczenie „with fallback” jest istotne: w określonych przypadkach zabezpieczenia mogą skierować zadanie do innego modelu. Przy odczycie brakowało jeszcze kompletnych pomiarów kosztu i szybkości Opus 5.5. Nie używamy więc tej tablicy do potwierdzania deklaracji o 40% oszczędności.

Benchmarki: mocne kodowanie, ale nie wygrana we wszystkim

Poniższe wyniki pochodzą z zestawienia w komunikacie Anthropic. To porównanie producenta, zawierające również pomiary innych organizacji. Zachowujemy nazwy testów, jednostki i brakujące wartości — kreska nie oznacza wyniku zerowego.

Wyniki opublikowane przy premierze 22.09.2026; wyżej oznacza lepiej
TestOpus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.066,4%55,8%52,3%57,9%37,3%
FrontierCode v1.1 (Main)54,4%50,3%48,0%53,3%47,5%
CursorBench 4.057,8%51,8%46,6%41,7%
GDPval-AA v2.1 (Elo)18461735170815421588
AutomationBench40,0%31,4%26,9%41,4%28,8%
Humanity’s Last Exam, z narzędziami67,7%65,6%63,6%57,2%
Terminal-Bench-Science 0.158,7%52,6%29,0%64,6%22,4%
OSWorld 2.0, partial81,8%80,7%74,0%
Chartography, z narzędziami89,0%88,4%83,4%
Źródło: Anthropic, tabela premierowa. AutomationBench: pomiary Zapier przytoczone przez Anthropic. „Partial” zachowuje oznaczenie sposobu punktowania OSWorld w źródle; nie oznacza odsetka zadań wykonanych w całości.

Opus 5.5 wyprzedza Astrę w Terminal-Bench 4.0 o 8,5 pkt proc., ale ustępuje jej o 1,4 pkt proc. w AutomationBench i o 5,9 pkt proc. w Terminal-Bench-Science. Takie różnice mają znaczenie przy wyborze modelu do konkretnego rodzaju pracy. Podobną ostrożność opisywaliśmy przy porównywaniu liderów różnych metryk Agent Arena.

Porównanie Opus 5.5, Fable 5.1, Opus 5 i GPT-6 Astra w kodowaniu, automatyzacji i zadaniach naukowych.
Opracowanie AIOAI.pl. Źródło: zestawienie premierowe Anthropic; AutomationBench: pomiary Zapier przytoczone przez Anthropic; stan na: 22.09.2026. Kliknij wykres, aby otworzyć pełny rozmiar.

Warunki testów nie są identyczne. Anthropic podaje dla Opus 5.5 przeważnie adaptive thinking z wysiłkiem max; w Terminal-Bench 4.0 użyto xhigh, a dla Astry przytoczono wynik OpenAI na high. Błąd standardowy wyniku Opus 5.5 w tym teście wynosi ±2,6 pkt proc. W Terminal-Bench-Science błędy standardowe wynoszą ±3,5–5 pkt proc. na model, dlatego niewielkie różnice nie uzasadniają kategorycznego rozstrzygnięcia.

Testy Claude’a wykonywano z aktywnymi zabezpieczeniami produkcyjnymi i modelami zastępczymi dla części zadań. Wyjątkiem jest AutomationBench: Zapier liczył interwencje zabezpieczeń jako niepowodzenia, bez fallbacku. Nie należy mieszać tych liczb z wynikami uzyskanymi w innym środowisku albo z wyłączonymi zabezpieczeniami.

Ile kosztuje Opus 5.5? Tokeny tańsze o 20%, odczyt cache o 60%

Oficjalny cennik API z 22 września 2026 r. pokazuje konkretne stawki. Wszystkie kwoty poniżej dotyczą miliona tokenów w standardowym trybie, w USD, bez dodatkowych opłat za narzędzia i dopłat regionalnych.

Standardowe ceny API: USD za 1 mln tokenów
Rodzaj tokenówOpus 5.5Opus 5ZmianaFable 5.1
Wejście4,005,00−20%10,00
Wyjście20,0025,00−20%50,00
Odczyt cache0,200,50−60%0,25
Zapis cache na 5 minut5,006,25−20%12,50
Zapis cache na 1 godzinę8,0010,00−20%20,00
Źródło: cennik Anthropic, sprawdzony 22.09.2026. Zmiana względem Opus 5; obliczenia AIOAI.pl.

Deklarowane 40% niższego kosztu zadania wynika według Anthropic z połączenia nowych cen i mniejszego zużycia tokenów przy ustawieniach domyślnych. To wynik testów firmy, a nie osobna stawka w cenniku. W aplikacji wielokrotnie przekazującej ten sam kontekst większą rolę odegra cache; przy generowaniu długich odpowiedzi ważniejsza będzie cena wyjścia.

Prosty przykład rachunkowy: milion tokenów wejścia bez cache i milion tokenów wyjścia kosztują łącznie 24 USD zamiast 30 USD. Oszczędność wynosi tu dokładnie 20%, ponieważ liczba tokenów pozostaje taka sama. Większa oszczędność wymaga innego zużycia lub innej struktury ruchu. Ten przykład nie jest testem wydajności modelu.

Osobno wyceniono Fast mode: 8 USD za wejście i 40 USD za wyjście. Batch API kosztuje odpowiednio 2 i 10 USD. Standardowe stawki obowiązują w całym oknie miliona tokenów, bez podwyżki po przekroczeniu progu długości kontekstu. Dobór trybu może więc zmienić rachunek bardziej niż sama zamiana numeru modelu.

Specyfikacja i dostępność

CechaClaude Opus 5.5
Identyfikator Claude APIclaude-opus-5-5
Okno kontekstowe1 mln tokenów
Maksymalne standardowe wyjście128 tys. tokenów
ModalnościTekst i obrazy na wejściu; tekst na wyjściu
RozumowanieAdaptacyjne, zawsze włączone; domyślnie medium
Granica wiedzy i danych treningowychCzerwiec 2026
Kanały dostępu dla programistówClaude API, Amazon Bedrock, Google Cloud, Microsoft Foundry i Claude Platform on AWS
Źródło: dokumentacja modelu, 22.09.2026. W Batch API dostępny jest także odrębny limit wyjścia 300 tys. tokenów w wersji beta.

Model jest oferowany jako usługa zamknięta; premiera nie obejmuje udostępnienia wag do pobrania. Dostępność na platformie chmurowej nie oznacza automatycznie dostępności każdego wariantu w każdym regionie. Dla wdrożenia należy sprawdzić katalog wybranego dostawcy i ustawienia konta.

Co ujawniono o treningu i zabezpieczeniach

W karcie systemowej Opus 5.5, w sekcji 1.1, Anthropic wymienia dane z publicznego internetu, zbiory publiczne i prywatne, dane z informacji zwrotnych i zgłoszeń błędów lub udostępnione za zgodą użytkowników oraz materiały syntetyczne tworzone przez inne modele. Opisuje deduplikację i filtrowanie, a następnie post-training oraz dostrajanie zgodne z konstytucją Claude’a.

Opis ten nie pozwala odtworzyć treningu. W sprawdzonych materiałach nie podano liczby parametrów całkowitych i aktywnych, szczegółów architektury, pełnego składu zbiorów, liczby akceleratorów ani kosztu szkolenia. Wykorzystanie danych syntetycznych samo w sobie nie potwierdza destylacji konkretnego modelu.

Karta systemowa opisuje również zabezpieczenia w biologii, cyberbezpieczeństwie i wybranych zadaniach rozwoju najbardziej zaawansowanych modeli. Po ich zadziałaniu zadanie może trafić do Opus 5 lub Opus 4.8. Zachowanie zależy od produktu; w API wymaga odpowiedniej konfiguracji. To realne ograniczenie interpretacji benchmarków, a nie jedynie szczegół nazewnictwa.

Migracja z Opus 5 wymaga sprawdzenia integracji

Dokumentacja zmian wymienia kilka niezgodności. Nie można wyłączyć rozumowania ani wymusić użycia narzędzia przez dotychczasowe ustawienia tool_choice typu any lub tool. Starsza definicja narzędzia computer use nie jest przyjmowana w Claude API i Google Cloud. Zmienia się również sposób przekazywania komunikatów postępu między wywołaniami narzędzi.

Domyślny wysiłek spada z high w Opus 5 do medium w Opus 5.5. Zachowanie tej samej ręcznie ustawionej wartości nie gwarantuje takiego samego zużycia: dokumentacja ostrzega, że nowy model może rozumować więcej na pojedynczy krok, szczególnie przy xhigh i max. Dlatego porównanie rachunków powinno obejmować to samo zadanie, podobną jakość rezultatu i jawnie zapisane ustawienia.

Co ta premiera zmienia w praktyce

Opus 5.5 daje konkretny powód do ponownego porównania modeli: niższe ceny jednostkowe oraz mocne wyniki zarówno w niezależnym indeksie, jak i w zestawieniu premierowym. Dla zespołów budujących agentów najciekawsza może być opłacalność długich procesów, nie sam najwyższy słupek na wykresie.

Przed zmianą modelu produkcyjnego warto zmierzyć koszt poprawnie ukończonego zadania, liczbę poprawek i częstotliwość uruchamiania fallbacku. Dopiero taki pomiar pokaże, czy deklarowana oszczędność występuje także we własnym zastosowaniu. Przedstawione tutaj wyniki pochodzą z opisanych źródeł; AIOAI.pl nie wykonywało własnego testu Opus 5.5.

Częste pytania

Jakie są oszczędności kosztów przy korzystaniu z Claude Opus 5.5?

Claude Opus 5.5 oferuje oszczędność 40% w porównaniu do Opus 5 przy domyślnych ustawieniach. Nowe ceny tokenów oraz mniejsze zużycie przyczyniają się do tej redukcji kosztów.

Kiedy zadebiutował Claude Opus 5.5?

Claude Opus 5.5 zadebiutował 22 września 2026 roku. Premiera została ogłoszona w oficjalnym komunikacie Anthropic oraz na koncie Claude na X.

Jakie są główne zalety Claude Opus 5.5 w porównaniu do wcześniejszych modeli?

Claude Opus 5.5 łączy możliwości zbliżone do Fable 5.1 z niższym kosztem pracy oraz generuje odpowiedzi o ponad 30% szybciej niż Opus 5. Model akcentuje programowanie agentowe i bardziej czytelną komunikację.

Jakie są ceny API dla Claude Opus 5.5?

Ceny API dla Claude Opus 5.5 wynoszą 4 USD za milion tokenów wejściowych i 20 USD za milion wyjściowych. Dodatkowo, odczyt cache kosztuje 0,20 USD za milion tokenów.

Jakie wyniki uzyskał Claude Opus 5.5 w niezależnych testach?

Claude Opus 5.5 uzyskał 58 punktów w wariancie max with fallback w tabeli Artificial Analysis, co zapewniło mu pierwsze miejsce w tym indeksie. Wyniki te pokazują przewagę nad innymi modelami w określonych testach.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *