DeepSeek nie zbudował większego modelu. Wziął V4 Flash, zachował tę samą architekturę i liczbę parametrów, a następnie ponownie przeprowadził post-training. Efekt jest zaskakująco duży: wersja DeepSeek-V4-Flash-0731 wskoczyła na 7. miejsce Frontend Code Arena, a w Artificial Analysis Intelligence Index poprawiła wynik poprzednika z 40 do 50 punktów.
To nadal nie jest najlepszy model ogólnego przeznaczenia na świecie. W zadaniach programistycznych i agentowych stał się jednak graczem, którego trudno ignorować — szczególnie przy cenie 0,14 dolara za milion tokenów wejściowych i 0,28 dolara za milion tokenów wyjściowych.
Co właściwie wydarzyło się 31 lipca?
31 lipca 2026 roku DeepSeek udostępnił w publicznej becie oficjalną wersję API DeepSeek-V4-Flash. Aktualny checkpoint nosi nazwę DeepSeek-V4-Flash-0731, ale sposób wywoływania API się nie zmienił: nadal używa się identyfikatora deepseek-v4-flash.
Według oficjalnego changelogu DeepSeek nie jest to nowa architektura ani większy model. Wersja 0731 ma — tak jak kwietniowy V4 Flash Preview — 284 miliardy parametrów, z których podczas generowania aktywowanych jest 13 miliardów. Skok jakości uzyskano wyłącznie przez ponowny post-training, czyli etap dostrajania modelu po jego zasadniczym treningu.
Aktualizacja dotyczy obecnie API V4 Flash. Model V4 Pro oraz wersje działające w aplikacji i serwisie internetowym DeepSeek pozostały bez zmian.
7. miejsce w Frontend Code Arena
Najbardziej widowiskowy wynik przyszedł z Frontend Code Arena — rankingu opartego na ocenach użytkowników porównujących interfejsy wygenerowane przez różne modele. W zestawieniu opublikowanym przez Arena.ai model DeepSeek-V4-Flash (High) zdobył 1586 punktów i zajął 7. miejsce w klasyfikacji ogólnej.
Do zajmującego szóstą pozycję GLM-5.2 (Max) zabrakł mu tylko jeden punkt. Przed DeepSeekiem znalazły się również Claude Opus 5 Max, Kimi K3 Max, Claude Opus 5 High, Claude Fable 5 i GPT-5.6 Sol xHigh.
| Zestawienie Frontend Code Arena | Pozycja |
|---|---|
| Klasyfikacja ogólna | 7. |
| Modele otwarte | 3. |
| Consumer Product | 4. |
| Reference-based Design | 6. |
| Data & Analytics | 6. |
| Gaming | 6. |
| Brand & Marketing | 7. |
To ważny wynik, ale trzeba czytać go prawidłowo. Arena mierzy preferencje ludzi oceniających gotowe rezultaty, a nie matematycznie zdefiniowaną poprawność kodu. Ranking jest też dynamiczny: kolejne głosy mogą zmieniać zarówno wynik, jak i miejsce modelu. Liczby są więc snapshotem z początku sierpnia 2026 roku, a nie stałym certyfikatem jakości.
Warto zestawić ten rezultat z wcześniejszym sukcesem GLM-5.2 w kodowaniu frontendowym. Chińskie modele coraz częściej nie tylko doganiają rozwiązania amerykańskie, ale zajmują kilka miejsc w ścisłej czołówce tego samego rankingu.
50 punktów w Artificial Analysis. Skok o 10 punktów
Jeszcze mocniejszym potwierdzeniem postępu jest niezależna ocena Artificial Analysis. DeepSeek V4 Flash 0731 zdobył 50 punktów w Intelligence Index, podczas gdy kwietniowy V4 Flash uzyskiwał 40 punktów.
Według analizy opublikowanej 31 lipca nowy checkpoint:
- jest o 6 punktów lepszy od DeepSeek V4 Pro Preview,
- traci tylko jeden punkt do GPT-5.6 Luna Max i GLM-5.2 Max,
- osiąga wynik równy Gemini 3.6 Flash,
- pozostaje 7 punktów za liderem modeli z otwartymi wagami, Kimi K3 Max.
Ten ostatni punkt daje dobry kontekst. Kimi K3 po publikacji pełnych wag nadal wyznacza otwarty front z wynikiem 57. DeepSeek nie przejął prowadzenia, lecz znacząco zmniejszył dystans, korzystając z modelu o dużo mniejszej liczbie aktywnych parametrów.
Największa zmiana dotyczy agentów
Artificial Analysis odnotowało największy skok w GDPval-AA v2, teście obejmującym agentowe zadania przypominające realną pracę. Wynik Elo wzrósł z 1189 do 1559. Terminal-Bench 2.1 poprawił się o 17 punktów procentowych, do 79 proc., a wynik w τ³-Bench Banking wzrósł o 8 punktów, do 31 proc.
Model poprawił się w każdym składniku Intelligence Index. Wśród pozostałych zmian znalazły się:
- SciCode: wzrost o 5 punktów, do 50 proc.,
- Humanity’s Last Exam: wzrost o 5 punktów, do 37 proc.,
- AA-LCR: wzrost o 3 punkty, do 66 proc.,
- GPQA Diamond: wzrost o 1 punkt, do 91 proc.,
- zużycie tokenów wyjściowych podczas całego testu: spadek o 12 proc., z około 234 do 206 milionów.
DeepSeek podaje własny wynik 82,7 proc. w Terminal-Bench 2.1. Nie jest to sprzeczność z wynikiem 79 proc. Artificial Analysis — testy wykorzystują inne konfiguracje i środowiska. Producent uruchamiał zadania z maksymalnym poziomem wysiłku w przygotowywanym narzędziu DeepSeek Harness Minimal. Dwa inne zestawy przytoczone przez firmę, DSBench-FullStack i DSBench-Hard, są testami wewnętrznymi, dlatego powinny być traktowane ostrożniej niż niezależne pomiary.

Dlaczego sam post-training dał tak dużo?
Model bazowy przechowuje wiedzę i wyuczone zależności, ale dopiero post-training uczy go skutecznie korzystać z tych możliwości: wykonywać polecenia, planować kolejne kroki, używać narzędzi, poprawiać błędy i wiedzieć, kiedy zakończyć zadanie.
W przypadku agentów różnica między „zna rozwiązanie” a „potrafi doprowadzić pracę do końca” jest ogromna. Model może być dobry w pojedynczych pytaniach programistycznych, a jednocześnie przegrywać, gdy musi przez kilkadziesiąt kroków poruszać się po repozytorium, uruchamiać testy i reagować na komunikaty terminala. Wyniki wersji 0731 sugerują, że DeepSeek poprawił właśnie tę warstwę zachowania.
Oficjalna wersja obsługuje format Responses API i została przygotowana do pracy w środowiskach agentowych zgodnych z narzędziami typu Codex. To może ułatwić podłączanie modelu do istniejących systemów, które potrafią wykonywać polecenia, uruchamiać kod i korzystać z funkcji.
Milion tokenów kontekstu i bardzo agresywna cena
DeepSeek V4 Flash 0731 obsługuje okno kontekstowe o długości miliona tokenów, wywołania narzędzi oraz tryb reasoning i non-reasoning. Maksymalna długość odpowiedzi w API wynosi 384 tysiące tokenów. Model przyjmuje i zwraca wyłącznie tekst — nie obsługuje wejścia obrazowego.
Oficjalny cennik DeepSeek wynosi obecnie:
| Pozycja | Cena za 1 mln tokenów |
|---|---|
| Wejście bez trafienia w cache | 0,14 USD |
| Wejście z trafieniem w cache | 0,0028 USD |
| Wyjście | 0,28 USD |
Cena tokenów pobranych z pamięci podręcznej oznacza rabat sięgający 98 proc. Artificial Analysis ocenia, że mimo obniżki cen GPT-5.6 Luna koszt wykonania porównywalnych zadań przez DeepSeek pozostaje około 60 proc. niższy. To właśnie połączenie jakości, długiego kontekstu i niskiej ceny może być największym atutem wersji Flash.
Czy to już model w pełni otwarty?
Tu potrzebne jest doprecyzowanie. Wagi kwietniowego DeepSeek V4 Flash zostały udostępnione na licencji MIT, dlatego rodzina jest klasyfikowana jako open-weight. Według Artificial Analysis pełne wagi zaktualizowanego checkpointu 0731 mają zostać opublikowane w kolejnych tygodniach.
Na 2 sierpnia 2026 roku najnowsza wersja jest dostępna przede wszystkim przez API DeepSeek. Nie należy więc automatycznie zakładać, że pobierając wcześniejsze wagi V4 Flash, uruchomimy lokalnie dokładnie ten sam model, który osiągnął nowe wyniki w rankingach.
Największy znak ostrzegawczy: halucynacje
Artificial Analysis zauważyło, że poprawa w teście AA-Omniscience wynika z rzadszego udzielania błędnych odpowiedzi, a nie ze wzrostu odsetka odpowiedzi poprawnych. Trafność pozostała na poziomie 37 proc., natomiast wskaźnik halucynacji spadł z 96 do 84 proc.
To poprawa, ale 84 proc. nadal jest bardzo wysokim wynikiem. W zastosowaniach wymagających faktów model powinien pracować z wyszukiwaniem, cytowaniem źródeł i dodatkową weryfikacją. Świetny wynik w kodowaniu frontendowym nie oznacza automatycznie równie wysokiej wiarygodności w analizie prawa, medycyny czy bieżących wydarzeń.
DeepSeek V4 Flash 0731 naprawdę robi robotę — ale w konkretnych zadaniach
Najuczciwszy wniosek jest prosty: DeepSeek V4 Flash 0731 nie został nowym bezdyskusyjnym liderem wszystkich rankingów. W ciągu jednej aktualizacji przesunął się jednak z poziomu interesującego, taniego modelu do ścisłej czołówki zadań frontendowych i agentowych.
Szczególnie interesujący jest sposób osiągnięcia tego wyniku. Architektura, liczba parametrów i cena pozostały praktycznie takie same. Zmieniło się zachowanie wyuczone w post-trainingu. To kolejny dowód, że w obecnym wyścigu AI nie zawsze wygrywa laboratorium, które buduje największy model. Czasem wygrywa to, które nauczy istniejący model skuteczniej kończyć rozpoczętą pracę.
Najczęstsze pytania
Które miejsce zajmuje DeepSeek V4 Flash 0731 w rankingu kodowania?
W snapshotcie Frontend Code Arena z początku sierpnia 2026 roku wariant High zajmował 7. miejsce ogółem z wynikiem 1586 oraz 3. miejsce wśród modeli otwartych.
Czy DeepSeek V4 Flash 0731 ma opublikowane wagi?
Wagi wcześniejszej wersji V4 Flash są dostępne na licencji MIT. Pełne wagi zaktualizowanego checkpointu 0731 nie były jeszcze opublikowane 2 sierpnia 2026 roku; Artificial Analysis informowało, że mają pojawić się w kolejnych tygodniach.
Ile kosztuje API DeepSeek V4 Flash?
Oficjalna cena wynosi 0,14 USD za milion tokenów wejściowych bez trafienia w cache i 0,28 USD za milion tokenów wyjściowych. Tokeny wejściowe odczytane z cache kosztują 0,0028 USD za milion.
Częste pytania
Jakie zmiany wprowadził DeepSeek w wersji V4 Flash 0731?
DeepSeek w wersji V4 Flash 0731 przeprowadził post-training na modelu, co pozwoliło mu poprawić wyniki w rankingach, osiągając 7. miejsce w Frontend Code Arena oraz 50 punktów w Artificial Analysis Intelligence Index.
Dlaczego model DeepSeek V4 Flash 0731 jest tak konkurencyjny w zadaniach programistycznych?
Model DeepSeek V4 Flash 0731 osiągnął wysoką jakość dzięki skutecznemu post-trainingowi, który pozwolił mu lepiej wykorzystywać swoje możliwości w realizacji złożonych zadań programistycznych.
Kiedy została udostępniona wersja API DeepSeek-V4-Flash?
Wersja API DeepSeek-V4-Flash została udostępniona w publicznej becie 31 lipca 2026 roku, a sposób wywoływania API pozostał niezmieniony.
Jakie są koszty korzystania z modelu DeepSeek V4 Flash 0731?
Koszt korzystania z modelu DeepSeek V4 Flash 0731 wynosi 0,14 dolara za milion tokenów wejściowych oraz 0,28 dolara za milion tokenów wyjściowych, co czyni go konkurencyjnym na rynku.
Czy model DeepSeek V4 Flash 0731 jest już w pełni otwarty?
Model DeepSeek V4 Flash 0731 nie jest jeszcze w pełni otwarty, ponieważ pełne wagi zaktualizowanego checkpointu mają zostać opublikowane w kolejnych tygodniach.







