AI w IT Artykuły

Qwen3.8-Max ma 2,4 biliona parametrów. Jest drugi w kodowaniu stron

Autorska wizualizacja Qwen3.8-Max jako ogromnej sieci ekspertów pracującej nad kodem i dokumentami

Alibaba zaprezentowała Qwen3.8-Max – największy i według producenta, najmocniejszy model w historii rodziny Qwen. Ma 2,4 biliona parametrów, ale podczas generowania odpowiedzi aktywuje 95 miliardów. W świeżym zestawieniu Image-to-WebDev Arena.ai zajął drugie miejsce, ustępując tylko Claude Opus 5 w wariancie Max.

Qwen3.8-Max został zaprojektowany jako model do kodowania, pracy z narzędziami i wielodniowych zadań agentowych. Alibaba pokazała przykłady, w których system samodzielnie rozwijał projekt przez ponad dwa tygodnie, odtwarzał i poprawiał badanie naukowe oraz optymalizował układ scalony przez około 500 tur. Do tego dochodzi agresywna cena API: 2 dolary za milion tokenów wejściowych i 6 dolarów za milion wyjściowych.

Qwen3.8-Max w skrócie:

  • 2,4 bln parametrów łącznie i 95 mld aktywnych;
  • okno kontekstowe do 1 mln tokenów;
  • obsługa tekstu i obrazów oraz praca z narzędziami;
  • cena API: 2 USD za 1 mln tokenów wejścia, 6 USD za wyjście i 0,25 USD za wejście z cache;
  • wagi modelu mają zostać udostępnione w tygodniu następującym po premierze z 3 sierpnia 2026 r.

Oficjalna premiera Qwen3.8-Max

Oficjalny komunikat Qwen Team ukazał się 3 sierpnia 2026 r. Alibaba określa w nim Qwen3.8-Max jako swój najpotężniejszy dotąd model oraz pierwszy model klasy Max, którego wagi mają zostać otwarte.

To ostatnie sformułowanie wymaga precyzji. W dniu przygotowania tego tekstu, 5 sierpnia, pliki z wagami nie były jeszcze publicznie dostępne. Producent zapowiedział publikację „w przyszłym tygodniu” na Hugging Face i ModelScope. Nie znamy też jeszcze licencji. Dlatego na razie mamy zapowiedź modelu otwarto-wagowego, a nie gotowy do pobrania checkpoint z ustalonymi zasadami użycia.

Jeżeli Alibaba dotrzyma terminu, będzie to istotne wydarzenie. Udostępnienie wag 2,4-bilionowego modelu pozwoli niezależnym zespołom analizować jego działanie, uruchamiać go na własnej infrastrukturze i budować wersje dostrojone do konkretnych zadań. Barierą pozostanie oczywiście skala sprzętu. Podobny kierunek opisywaliśmy przy okazji publikacji pełnych wag Kimi K3 oraz w materiale o znaczeniu otwartych modeli AI.

2,4 biliona parametrów nie pracuje jednocześnie

Najważniejsza liczba techniczna brzmi nie 2,4 bln, lecz 95 mld parametrów aktywnych. Oznacza to, że przy przetwarzaniu pojedynczego tokenu model korzysta tylko z wybranej części całej sieci. Taka konstrukcja jest charakterystyczna dla architektury Mixture-of-Experts: router kieruje dane do niewielkiej grupy wyspecjalizowanych „ekspertów”, zamiast uruchamiać cały model naraz.

Qwen informuje, że 3.8-Max zbudowano na fundamencie architektonicznym Qwen3.5. Qwen3.5 łączy liniowy mechanizm uwagi Gated Delta Networks z rzadką siecią ekspertów. Nie należy jednak automatycznie zakładać, że w Qwen3.8 zachowano każdy szczegół tej konfiguracji. Producent nie opublikował jeszcze liczby ekspertów, reguł routingu ani pełnego raportu technicznego dla nowego modelu.

W praktyce taki projekt ma połączyć dwie sprzeczne potrzeby: ogromną pojemność modelu i rozsądny koszt pojedynczej odpowiedzi. Nadal jest to jednak system bardzo wymagający sprzętowo. „95 mld aktywnych” nie oznacza, że do pamięci można wczytać wyłącznie tę część – komplet wag musi być dostępny dla routera, chyba że zastosuje się rozproszone ładowanie i specjalistyczną infrastrukturę.

Jak szkolono Qwen3.8-Max?

Alibaba nie ujawniła dotąd liczby tokenów pretreningu, składu zbioru danych, daty odcięcia wiedzy ani całkowitego kosztu obliczeniowego. Oficjalny artykuł zawiera za to wyjątkowo konkretny opis post-treningu przez reinforcement learning, nastawionego na rzeczywistą pracę agentową.

Według Qwen Team skalowano równocześnie moc obliczeniową RL i środowiska treningowe w trzech wymiarach:

  • zadania – od pojedynczej czynności, przez zestaw zależnych kroków, aż po projekty trwające wiele dni;
  • przestrzeń robocza – od kilku plików po złożone, hierarchiczne repozytoria zawierające różne typy danych;
  • harnessy – model trenowano do działania w wielu środowiskach agentowych, m.in. QwenWork, Claude Code, Codex, OpenClaw i Hermes.

Drugim elementem był uniwersalny system nagrody. Łączył on automatyczne sprawdzanie wykonania kodu, ocenę odpowiedzi tekstowych, analizę wyrenderowanych rezultatów wizualnych oraz inspekcję wykonywaną przez agenta. Trzecim składnikiem był internetowy balanser danych, który pilnował proporcji zadań, poziomów trudności, przestrzeni roboczych i harnessów w kolejnych partiach treningowych. Celem było ograniczenie wahań gradientu i stabilne zwiększanie budżetu RL.

To ważna zmiana akcentów. Model nie był uczony wyłącznie udzielania poprawnej odpowiedzi, lecz utrzymywania celu przez setki tur, korzystania z informacji zwrotnej i weryfikowania własnych rezultatów. W przypadku zadań multimodalnych obraz ma być częścią ciągłej pętli: plan – wykonanie – obserwacja – korekta.

Drugie miejsce w Image-to-WebDev Arena

Najświeższy sygnał z niezależnego rankingu pochodzi z Image-to-WebDev Arena. Model otrzymuje tam zrzut lub projekt interfejsu i ma odtworzyć działającą stronę. W komunikacie z 5 sierpnia Qwen3.8-Max uzyskał 1631 punktów i zajął drugie miejsce – za Claude Opus 5 Max z wynikiem 1670, ale przed Claude Fable 5 High z 1626 punktami.

Qwen3.8-Max na drugim miejscu w rankingu Arena.ai Image-to-WebDev
Qwen3.8-Max zajmuje drugie miejsce w Image-to-WebDev. Źródło danych: Arena.ai, stan z komunikatu z 5 sierpnia 2026 r.

Ranking społecznościowy ma inną wartość niż test producenta, bo oceny pochodzą od użytkowników porównujących rezultaty modeli. Jednocześnie nie jest to wynik wykuty w kamieniu: pozycje i przedziały niepewności zmieniają się wraz z napływem kolejnych głosów. Drugie miejsce należy więc czytać jako mocny wczesny sygnał, a nie ostateczny werdykt.

Benchmarki: są zwycięstwa, ale są też wyraźne porażki

Pełna tabela opublikowana przez Qwen pokazuje model bardzo mocny, lecz nie dominujący we wszystkich kategoriach. W Terminal Bench 2.1 osiąga 86,6 punktu wobec 84,6 dla Claude Fable 5. W PaperBench zdobywa 93,0, wyprzedzając Fable 5 z wynikiem 88,8. Z drugiej strony w SWE-bench Pro Qwen3.8-Max uzyskuje 67,7, podczas gdy Fable 5 osiąga 80,0.

Porównanie wyników Qwen3.8-Max i Claude Fable 5 w trzech benchmarkach kodowania
Wybrane wyniki z oficjalnej tabeli Qwen. Źródło: Qwen Team. Część rezultatów konkurencyjnych modeli pochodzi z ich raportów, a część została zmierzona wewnętrznie przez Alibaba.

Podobnie jest w testach multimodalnych. Qwen3.8-Max wypada bardzo dobrze m.in. w LogicVista, BabyVision i zadaniach dotyczących dokumentów, ale sposób raportowania nie zawsze jest identyczny dla wszystkich modeli. Dlatego nie warto sprowadzać całej premiery do jednego zdania o „pokonaniu Claude’a” czy „najlepszym modelu świata”. Uczciwszy wniosek brzmi: Qwen wszedł do ścisłej czołówki, szczególnie w zadaniach łączących kod, narzędzia i obraz.

Najciekawsze są długie zadania, nie pojedyncze odpowiedzi

Qwen pokazał trzy demonstracje, które dobrze wyjaśniają, do czego ten model ma służyć.

Autonomiczny rozwój oprogramowania. Qwen3.8-Max budował od zera projekt oh-my-cli. Według stanu na 30 lipca, po około 16 dniach ciągłego działania, repozytorium miało 265 commitów, 127 pull requestów i 151 zgłoszeń. System sam przyjmował wymagania, zamieniał je w zadania, modyfikował kod, uruchamiał testy i wracał do błędów.

Odtworzenie i poprawienie pracy naukowej. Model dostał artykuł dotyczący selekcji danych do trenowania modeli rozumujących, bez gotowego kodu. Przez około 125 godzin napisał 7600 linii kodu, wykonał ponad 1100 akcji i przeprowadził 33 eksperymenty treningowe na GPU. Najpierw odtworzył główne wyniki pracy, a następnie sprawdził 18 własnych pomysłów i poprawił bazowy rezultat na AIME24 o 2,71 punktu.

Optymalizacja układu scalonego. W środowisku z Iverilog, Yosys i OpenROAD model wykonał około 500 tur oraz 71 ewaluacji. Zredukował projekt akceleratora kryptograficznego z 8298 do 678 bramek. Następnie przeszedł przez fizyczne rozmieszczenie i trasowanie: powierzchnia układu spadła o 81 proc., długość połączeń z 33 369 do 4187 mikrometrów, a projekt osiągnął domknięcie czasowe przy 500 MHz.

To nadal demonstracje przygotowane i opisane przez producenta. Nie mówią, ile nieudanych prób poprzedzało pokazane przebiegi ani jak rezultat zależy od całego scaffoldu otaczającego model. Pokazują jednak kierunek rozwoju: laboratoria coraz rzadziej konkurują wyłącznie jakością pojedynczej odpowiedzi, a coraz częściej zdolnością modelu do podtrzymywania procesu pracy przez wiele godzin lub dni.

Cena może być równie ważna jak wynik

W oficjalnym komunikacie Qwen cena wynosi 2 USD za milion tokenów wejściowych i 6 USD za milion wyjściowych. Wejście obsłużone przez implicit cache kosztuje 0,25 USD za milion tokenów. Dla porównania, przetworzenie 1 mln tokenów wejścia i wygenerowanie 1 mln tokenów wyjścia kosztuje łącznie 8 dolarów w Qwen3.8-Max, wobec 30 dolarów w Claude Opus 4.7 i 60 dolarów w Claude Fable 5 według tabeli cen Arena.ai.

Porównanie ceny API Qwen3.8-Max z modelami Kimi, Gemini i Claude
Koszt 1 mln tokenów wejścia i 1 mln tokenów wyjścia. Źródła: Qwen oraz Arena.ai. Ceny katalogowe, stan na 5 sierpnia 2026 r.

Qwen nie jest przy tym najtańszym modelem w zestawieniu – Kimi K2.6 kosztuje jeszcze mniej. Alibaba celuje jednak w atrakcyjniejszy punkt jakościowo-cenowy: możliwości zbliżone do najdroższych systemów przy koszcie wielokrotnie niższym. To może mieć większe znaczenie dla agentów wykonujących setki wywołań niż różnica kilku punktów w pojedynczym benchmarku.

Czy Qwen3.8-Max zmieni rynek?

Na dziś odpowiedź brzmi: ma na to realną szansę, ale dwa elementy wciąż wymagają weryfikacji. Pierwszym jest powtarzalność długich demonstracji poza środowiskiem producenta. Drugim – faktyczna publikacja wag wraz z licencją, dokumentacją i wymaganiami sprzętowymi.

Jeżeli obietnica zostanie spełniona, Qwen3.8-Max stanie się jednym z najmocniejszych dostępnych modeli otwarto-wagowych i rzadkim przypadkiem, w którym laboratorium udostępnia swój wariant klasy Max. Już teraz widać natomiast, że model nie jest wyłącznie pokazem skali. Drugie miejsce w Image-to-WebDev, konkurencyjne wyniki agentowe i cena 2/6 USD tworzą ofertę, której nie da się zignorować.

Stan informacji: 5 sierpnia 2026 r. Rankingi, ceny i dostępność wag mogą ulec zmianie.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *