Qwen udostępnił wagi Qwen3.8-Flash-Next, eksperymentalnego modelu, który ma pokazywać kierunek architektury Qwen4. Konstrukcja łączy 125 mld parametrów modelu językowego z 51 mld parametrów embeddingów n-gramowych i 4 mld parametrów modułu MTP. W pojedynczym kroku inferencji aktywowanych jest jednak tylko 6 mld parametrów. To ambitna próba przeniesienia części pojemności modelu poza kosztowną ścieżkę obliczeń.
Premiera z 26 sierpnia 2026 roku jest czymś więcej niż publikacją kolejnego checkpointu. Qwen pokazuje cztery pomysły projektowe rozwijane z myślą o Qwen4: hybrydę Gated DeltaNet i rzadkiej uwagi, czterogałęziowy strumień resztkowy, ogromne tablice n-gramów oraz nową recepturę optymalizacji. Pierwszy niezależny pomiar też wygląda mocno: według stanu na 28 sierpnia model uzyskał 56 punktów i 4. miejsce na 110 modeli w Artificial Analysis Intelligence Index.
Najważniejsze fakty w skrócie
- Qwen3.8-Flash-Next jest eksperymentalnym modelem multimodalnym i podglądem architektury zapowiadanej dla Qwen4.
- Ma 125 mld parametrów modelu językowego, 51 mld parametrów embeddingów n-gramowych i 4 mld parametrów MTP; aktywnych jest 6 mld na token.
- Natywne okno kontekstowe wynosi 262 144 tokeny i może być rozszerzone do 1 mln.
- Wagi zajmują około 360 GB na Hugging Face i są dostępne w 131 plikach Safetensors.
- Licencja Qwen Community License 1.0 pozwala na wiele zastosowań komercyjnych, ale wprowadza ważne ograniczenia dla usług model-as-a-service i asystentów do kodowania lub pracy biurowej.
- Model ma już niezależne wyniki Artificial Analysis i AutoEval Arena.ai, choć benchmarki szczegółowe w model cardzie pochodzą od producenta.
Co właściwie opublikował Qwen
Repozytorium Qwen3.8-Flash-Next na Hugging Face zawiera wagi i konfigurację post-trenowanego modelu w formacie Transformers. Model przyjmuje tekst, obrazy i wideo, a generuje tekst. Qwen podaje zgodność między innymi z Transformers, vLLM, SGLang i TokenSpeed.
W nazwie najważniejszy jest człon „Next”. To nie tylko szybsza odmiana opisanego wcześniej Qwen3.8-Max, lecz eksperymentalny model służący do sprawdzenia rozwiązań projektowanych dla Qwen4. Producent udostępnia też osobny Qwen3.8-Flash jako wersję produkcyjną opartą na Flash-Next. Ma ona domyślny kontekst 1 mln tokenów i wbudowane narzędzia, których nie należy automatycznie przypisywać surowym wagom Flash-Next.
| Cecha | Qwen3.8-Flash-Next |
|---|---|
| Typ | Model przyczynowy z enkoderem obrazu, Mixture of Experts |
| Parametry modelu językowego | 125 mld, w tym 6 mld aktywnych na token |
| Dodatkowe parametry | 51 mld embeddingów n-gramowych i 4 mld MTP |
| Liczba ekspertów | 512; aktywnych 10 trasowanych i 1 współdzielony |
| Warstwy | 48 |
| Kontekst | 262 144 tokeny natywnie, do 1 mln po rozszerzeniu |
| Modalności | Wejście: tekst, obraz i wideo; wyjście: tekst |
| Rozmiar repozytorium | Około 360 GB |
| Licencja | Qwen Community License 1.0 |
Określenie „180 mld parametrów” jest matematycznie poprawne po zsumowaniu 125, 51 i 4 mld, ale zaciera strukturę modelu. Podczas generowania nie pracuje 180 mld parametrów naraz. Z drugiej strony 6 mld aktywnych parametrów nie oznacza, że model zajmie tyle pamięci co gęsty model 6B. Trzeba nadal przechowywać wagi ekspertów i dodatkowe tablice, chyba że część danych zostanie skwantyzowana lub przeniesiona do pamięci hosta.
Jak działa architektura zapowiadana dla Qwen4
Raport techniczny Qwen opisuje układ, w którym trzy warstwy Gated DeltaNet są przeplatane jedną warstwą Qwen Sparse Attention. Gated DeltaNet utrzymuje stan o stałym rozmiarze i ma ograniczać koszt przetwarzania długiego kontekstu. Warstwa QSA zachowuje dostęp do odległych fragmentów, ale zamiast oceniać każdy token osobno wybiera istotne mikrobloki kontekstu.
Producent twierdzi, że przy kontekście 1 mln tokenów kernel QSA jest 7,6 raza szybszy od gęstej uwagi podczas prefilla i 4,9 raza szybszy w dekodowaniu. To pomiar konkretnego kernela, a nie gwarancja takiego samego przyspieszenia całej aplikacji. Na czas odpowiedzi wpływają także ładowanie wag, komunikacja między urządzeniami, router MoE, przygotowanie wejścia i silnik serwujący.
Drugim elementem jest Gated Residual. Zamiast jednego strumienia resztkowego model utrzymuje cztery gałęzie, a bramki decydują, które informacje odczytać i gdzie je zapisać. Według Qwen rozwiązanie poprawia stabilność treningu oraz pozwala przechowywać stan resztkowy w FP8 przy niewielkiej stracie jakości.
Najbardziej nietypowe są embeddingi n-gramowe. Krótkie sekwencje tokenów służą jako klucze do dużych tablic, które mogą pozostawać w pamięci hosta i być pobierane z wyprzedzeniem. To sposób na zwiększenie pojemności pamięci modelu bez proporcjonalnego wzrostu liczby operacji na każdy token. Ceną jest jednak duży rozmiar wag i zależność od sprawnego transferu danych między pamięcią hosta a akceleratorem.
Co ujawniono o treningu, a czego nadal nie wiemy
Qwen użył dwóch optymalizatorów. Muon obsługiwał dwuwymiarowe macierze pełniące funkcję przekształceń liniowych, a AdamW pozostał między innymi przy embeddingach, głowicy wyjściowej, routerze MoE i niskorangowych projekcjach Gated Residual. Zespół ponownie dopasował prawa skalowania, zwiększył docelowy batch i learning rate oraz zrezygnował z rozgrzewania rozmiaru batcha, które w eksperymentach zwiększało liczbę kroków optymalizatora o 18,8% bez poprawy wyniku.
Raport podaje, że model bazowy trenowano na około jednej trzeciej liczby tokenów użytych dla Qwen3.7-Plus-Base i przy około jednej dziewiątej FLOPs. Nie ujawnia jednak bezwzględnej liczby tokenów pełnego treningu Flash-Next, składu danych, liczby akceleratorów ani kosztu w pieniądzu. Widoczne w raporcie wartości 400 mld i 80 mld tokenów dotyczą mniejszego modelu użytego w ablacjach architektury, a nie finalnego checkpointu. Nie należy ich przepisywać jako rozmiaru treningu Qwen3.8-Flash-Next.
Niezależne wyniki: mocny indeks, ale wciąż mało danych
Artificial Analysis zdążyło już przetestować model. Według stanu na 28 sierpnia Qwen3.8-Flash-Next uzyskał 56 punktów w Intelligence Index i zajmował 4. miejsce na 110 modeli. Serwis zmierzył też 73,4 tokenu wyjściowego na sekundę oraz 2,99 s czasu do pierwszego tokenu, korzystając z API Alibaba. To niezależniejszy punkt odniesienia niż tabela producenta, ale pozycja może się zmieniać wraz z dodawaniem modeli i aktualizacją metodologii.
Arena.ai w tablicy WebDev pokazuje wynik AutoEval 1617 z przedziałem +15/-15. Model nie ma jeszcze głosów użytkowników ani pełnej pozycji opartej na głosowaniu, dlatego nie można na tej podstawie ogłosić go wiceliderem rankingu. To wczesny automatyczny pomiar.
Model card Qwen zawiera znacznie więcej wyników, ale wszystkie pochodzą z ewaluacji producenta. W SWE-bench Pro model uzyskał 62,5, w GPQA Diamond 91,7, a w LiveCodeBench v6 91,9. Obraz nie jest jednostronny: w HLE zdobył 35,9 wobec 40,0 dla Claude Opus 4.6 Max, a w NL2Repo-Bench 48,1 wobec 54,2 dla DeepSeek-V4-Flash-0731. Część testów używała własnych harnessów Qwen, poprawionych zadań lub benchmarków wewnętrznych, więc wyniki nie są prostym odpowiednikiem niezależnej tablicy.
Cena API i różnica między Flash-Next a Qwen3.8-Flash
Artificial Analysis podaje dla Flash-Next 0,15 USD za 1 mln tokenów wejściowych i 0,47 USD za 1 mln tokenów wyjściowych w API Alibaba. Oficjalna strona produkcyjnego Qwen3.8-Flash w QwenCloud pokazuje bardzo podobne 0,16 i 0,47 USD oraz 0,016 USD za wejście z implicit cache. Ceny sprawdzono 28 sierpnia 2026 roku.
Nie są to jednak koszty samodzielnego hostingu opublikowanych wag. Własne wdrożenie wymaga pamięci na checkpoint, akceleratorów, pamięci hosta, szybkiego transferu i obsługi silnika inferencyjnego. Repozytorium ma około 360 GB, ale ta liczba nie jest równoznaczna z minimalnym VRAM. Wymagania zależą od precyzji wag, kwantyzacji, rozłożenia modelu na urządzenia i sposobu offloadingu.
Dla osób zaczynających od mniejszych modeli przydatny będzie nasz poradnik jak uruchomić lokalny model AI. Flash-Next jest jednak projektem dla znacznie mocniejszej infrastruktury niż typowy komputer z jedną kartą konsumencką.
Otwarte wagi nie oznaczają pełnego open source
Wagi są publicznie dostępne, lecz licencja nie jest Apache 2.0 ani inną standardową licencją open source. Qwen Community License 1.0 pozwala używać, modyfikować, dystrybuować, hostować i dostrajać model, ale wprowadza szczególne warunki komercyjne.
Firma świadcząca Model as a Service albo sprzedająca niezależnego asystenta AI do kodowania lub pracy biurowej musi uzyskać od Qwen osobną licencję na użycie komercyjne. Duże produkty przekraczające 100 mln aktywnych użytkowników miesięcznie albo 20 mln USD miesięcznego przychodu muszą wyraźnie pokazywać nazwę modelu w interfejsie.
To ważny przykład różnicy opisanej szerzej w naszym materiale o otwartych wagach modeli AI. Możliwość pobrania checkpointu daje kontrolę techniczną i ułatwia badania, ale nie gwarantuje pełnej swobody biznesowej ani dostępu do danych treningowych.
Dla kogo ma sens Qwen3.8-Flash-Next
Model jest interesujący przede wszystkim dla zespołów badających architekturę LLM, operatorów własnej infrastruktury oraz twórców silników inferencyjnych. Obsługa tekstu, obrazu i wideo otwiera drogę do agentów analizujących interfejsy, dokumenty i nagrania, a 6 mld aktywnych parametrów obiecuje korzystniejszy koszt obliczeń niż sugeruje rozmiar całego checkpointu.
Nie jest natomiast oczywistym wyborem dla małej firmy, która chce po prostu wywołać gotowy model. Produkcyjny Qwen3.8-Flash oferuje łatwiejsze API, domyślny kontekst 1 mln tokenów i wbudowane narzędzia. Własny Flash-Next daje większą kontrolę, ale przerzuca na użytkownika odpowiedzialność za infrastrukturę, zgodność licencyjną, monitoring oraz optymalizację.
Co ta premiera mówi o Qwen4
Najważniejszym sygnałem nie jest pojedynczy benchmark, lecz kierunek projektu. Qwen próbuje rozdzielić pojemność modelu od kosztu każdego tokenu: rzadki MoE ogranicza liczbę aktywnych parametrów, Gated DeltaNet kompresuje historię, QSA wybiera fragmenty długiego kontekstu, a tablice n-gramów pozostają poza główną ścieżką akceleratora.
Flash-Next nie dowodzi jeszcze, że Qwen4 będzie najlepszym modelem ani że cała architektura zachowa przewagę w innych skalach. Pokazuje jednak, że Qwen szuka efektywności nie tylko przez kwantyzację i tańsze API, lecz na poziomie konstrukcji oraz treningu. Warto obserwować, czy niezależne rankingi potwierdzą wczesny wynik 56 punktów i czy produkcyjne wdrożenia utrzymają deklarowane korzyści przy kontekście zbliżonym do 1 mln tokenów. Aktualną sytuację na rynku można śledzić także w naszym rankingu modeli LLM.
Częste pytania
Jakie są główne różnice między Qwen3.8-Flash-Next a Qwen3.8-Max?
Qwen3.8-Flash-Next to eksperymentalny model, który jest szybszą odmianą Qwen3.8-Max, a jego celem jest sprawdzenie rozwiązań projektowanych dla Qwen4. W przeciwieństwie do Qwen3.8-Max, Flash-Next łączy różne innowacyjne elementy architektury, takie jak Gated DeltaNet i rzadką uwagę.
Kiedy planowana jest premiera modelu Qwen4?
Premiera Qwen4 jest zaplanowana na 26 sierpnia 2026 roku. To wydarzenie ma na celu wprowadzenie nowej architektury oraz innowacji w modelach językowych.
Jakie są parametry modelu Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next ma 125 mld parametrów modelu językowego, 51 mld parametrów embeddingów n-gramowych oraz 4 mld parametrów modułu MTP. W aktywacji podczas jednego kroku inferencji używanych jest 6 mld parametrów.
Jakie możliwości oferuje licencja Qwen Community License 1.0?
Licencja Qwen Community License 1.0 pozwala na wiele zastosowań komercyjnych, ale wprowadza istotne ograniczenia dla usług model-as-a-service oraz asystentów do kodowania lub pracy biurowej.
Jakie wyniki uzyskał model Qwen3.8-Flash-Next w testach niezależnych?
Według stanu na 28 sierpnia, model Qwen3.8-Flash-Next uzyskał 56 punktów w Artificial Analysis Intelligence Index, zajmując 4. miejsce na 110 modeli. Dodatkowo, zmierzono 73,4 tokenu wyjściowego na sekundę oraz 2,99 s czasu do pierwszego tokenu.







