Apodex 1.1 ma nie tylko odpowiadać, lecz także przez długi czas pracować na plikach, uruchamiać kod, korygować plan i koordynować równoległe zadania. W raporcie z 24 sierpnia 2026 roku producent pokazuje, że największy skok nie wynika z jednego modelu językowego. To połączenie modelu, środowiska wykonawczego AgentOS oraz systemu Agent Team. Lokalny wariant Mini ma 35 mld parametrów i otwarte wagi na licencji Apache 2.0.
Wyniki wyglądają mocno: pełny Apodex 1.1 z Agent Team uzyskał według autorów 38,5 punktu w APEX-Agents i 78,8 proc. wygranych w GDPVal. Nie są to jednak niezależne pomiary. Część rezultatów konkurencyjnych modeli odtworzył sam Apodex we własnym harnessie (warstwie porządkującej działanie), a cała publikacja nie doczekała się jeszcze zewnętrznej replikacji.
Najważniejsze fakty:
- Apodex rozwija dwa kierunki: trening w bogatszych środowiskach narzędziowych oraz koordynację wielu agentów.
- AgentOS przechowuje stan zadania, pliki, postęp i pochodzenie działań poza samym kontekstem modelu.
- Agent Team rozdziela pracę na asynchroniczne podzadania, ale oznacza też większy koszt obliczeniowy niż pojedynczy agent ReAct.
- Apodex 1.1 Mini można uruchomić lokalnie; zalecane okno kontekstowe wynosi 262 144 tokeny.
- Producent nie podał pełnego składu danych, liczby tokenów, infrastruktury ani kosztu treningu.
Apodex 1.1 to model i warstwa wykonawcza
W typowym chatbotcie historia rozmowy jest głównym nośnikiem stanu. W długim zadaniu to za mało. Kontekst puchnie od wyników narzędzi, część informacji trzeba kompresować, a jeden przerwany etap może unieważnić dalszy plan. Apodex próbuje rozdzielić te problemy pomiędzy model i runtime.
Oficjalny komunikat Apodex nazywa pierwszy kierunek Environment Scaling. Model ma uczyć się działania w środowiskach plików, wyszukiwarki, kodu i innych narzędzi, a nie tylko otrzymywać ich opis w promptach. Drugi kierunek, Agentic Coordination Scaling, obejmuje dzielenie pracy, delegowanie jej podagentom, scalanie częściowych wyników i zmianę planu w trakcie wykonania.
To istotne rozróżnienie. Dobry wynik systemu agentowego nie dowodzi automatycznie, że sam model bazowy jest równie dobry. Harness może dostarczać pamięć, ponawianie nieudanych kroków, izolację plików, narzędzia i dodatkową weryfikację. Dlatego porównując agentów, trzeba patrzeć nie tylko na nazwę modelu, ale także na środowisko testowe — podobny problem widać w naszym przeglądzie rankingu Agent Arena.
AgentOS ma pilnować stanu, a nie „myśleć” za model
Raport techniczny Apodex 1.1 opisuje AgentOS jako podłoże wykonawcze. Utrzymuje ono przestrzeń roboczą, wywołania narzędzi, tablicę zadań, cykl życia podagentów i ślady potrzebne do weryfikacji. Gdy kontekst zaczyna się zapełniać, starsze wyniki narzędzi mogą zostać usunięte z rozmowy, a ważny stan pozostaje w plikach i zewnętrznej tablicy.
System rozróżnia także miękki i twardy limit czasu. Przed wyczerpaniem budżetu agent ma skonsolidować ustalenia, zamiast nagle przerwać pracę i stracić częściowy rezultat. Użytkownik może w trakcie zadania dodać instrukcję, która trafi do koordynatora na bezpiecznej granicy kolejnego kroku.
Nie jest to pamięć bez ograniczeń. Model nadal musi odczytać właściwy fragment stanu, poprawnie ocenić jego aktualność i nie pomylić wyniku częściowego z finalnym. Zaletą jest jednak to, że stan nie musi w całości mieścić się w jednym nieprzerwanym łańcuchu wiadomości.
Agent Team zwiększa wynik ale też budżet
W trybie ReAct jeden agent wykonuje kolejne kroki sekwencyjnie. Agent Team dodaje koordynatora, tablicę zadań i podagentów pracujących równolegle. Raport podkreśla asynchroniczność: główny agent może wykorzystać dobry wynik jednej gałęzi, zanim zakończą się pozostałe, zmienić priorytety albo zatrzymać ślepą uliczkę.
W opublikowanym wariancie Mini ta warstwa poprawiała wszystkie trzy pokazane wyniki:
| Benchmark | Mini ReAct | Mini Agent Team | Zmiana |
|---|---|---|---|
| FrontierFinance | 40,0 | 50,2 | +10,2 |
| FrontierScience-Research | 45,0 | 51,7 | +6,7 |
| APEX-Agents | 24,2 | 27,7 | +3,5 |
Źródło: raport techniczny i model card Apodex 1.1; wyniki producenta, stan na 26 sierpnia 2026 roku. Nie są to niezależne testy.
Różnica nie jest darmową poprawą modelu. Agent Team wykonuje dodatkowe wywołania, utrzymuje więcej trajektorii i korzysta z większej ilości obliczeń w czasie testu. Raport nie publikuje przy tych tabelach jednolitego kosztu w tokenach i dolarach dla wszystkich systemów. Bez takiej miary nie da się stwierdzić, czy wzrost o 3,5 lub 10,2 punktu będzie opłacalny w konkretnej firmie.
Jak trenowano Apodex 1.1?
Post-training składał się z nadzorowanego dostrajania (SFT) oraz uczenia ze wzmocnieniem dla zadań agentowych. Mieszanka SFT obejmowała m.in. wyszukiwanie, pracę na plikach, kodowanie, matematykę, naukę, finanse, przygotowywanie profesjonalnych materiałów i koordynację wielu agentów. Autorzy filtrowali trajektorie z niepoprawnymi wywołaniami narzędzi, niespójnym stanem lub niedostarczonym rezultatem.
Najciekawszym elementem RL jest PIVOT-RL. Zamiast traktować długą trajektorię jako jednolitą całość, metoda ma lokalizować decyzję, po której agent zaczął stosować złą strategię, zignorował dowód albo źle użył narzędzia. Poprawny prefiks zostaje zachowany, a trening koncentruje się na kontynuacji od punktu zwrotnego. Krótka podpowiedź korekcyjna jest używana tylko podczas treningu, nie podczas inferencji.
Producent nie ujawnił jednak pełnego składu danych, liczby tokenów, kosztu ani infrastruktury treningowej. Nie można więc niezależnie ocenić efektywności całego procesu ani ryzyka pokrywania się danych treningowych z benchmarkami. Autorzy podają jedynie, że podczas testów blokowali dostęp do stron mogących zawierać odpowiedzi benchmarkowe.
Co naprawdę pokazują benchmarki
Dla pełnego Apodex 1.1 w konfiguracji Agent Team autorzy raportują 38,5 w APEX-Agents, 78,8 proc. wygranych w GDPVal, 54,3 w FrontierFinance, 63,3 w FrontierScience-Research, 35,3 w BioMysteryBench i 56,1 w Humanity’s Last Exam. Szerokość zestawu jest wartościowa, bo obejmuje zarówno gotowy rezultat, jak i pracę z plikami czy narzędziami.
Trzeba jednak zachować trzy zastrzeżenia. Po pierwsze, nie wszystkie wartości modeli zewnętrznych pochodzą z ich oficjalnych raportów; część to reprodukcje Apodex. Po drugie, tabele zawierają braki, więc „najlepszy wynik w tabeli” nie zawsze oznacza zwycięstwo nad pełnym rynkiem. Po trzecie, konfiguracje ReAct i Agent Team zużywają różne ilości obliczeń.
To również powód, dla którego mechanizmy zgłaszania i analizowania błędów agentów są ważniejsze od samego rankingu. Opisywaliśmy ten problem przy projekcie SAFE do raportowania incydentów agentów AI. Długie zadanie tworzy więcej punktów awarii: błędny plik, nieaktualny stan, nieudane narzędzie albo podagent, którego wynik został źle zinterpretowany.
Apodex 1.1 Mini: otwarte wagi, ale nie cały projekt
Apodex 1.1 Mini na Hugging Face ma bazę Qwen3.5-35B-A3B, format BF16 i licencję Apache 2.0. Model card zaleca okno 262 144 tokenów oraz do 32 768 tokenów generowanego wyjścia. Repozytorium można serwować przez SGLang lub vLLM, a FrontierAgent dostarcza otwarty runtime z trybami ReAct i Agent Team.
To wydanie open weights i zarazem permissive licencja dla udostępnionych elementów, ale nie pełna otwartość procesu. Nie opublikowano danych treningowych ani kodu całego pipeline’u uczenia, a wagi flagowego modelu 397B nie są dostępne w taki sam sposób. Hugging Face podaje około 36 mld parametrów dla plików modelu, podczas gdy Apodex używa nazwy skali 35B; tę różnicę warto traktować jako efekt sposobu raportowania, nie jako dwa oddzielne warianty.
Cena i dostępność
Pełny Apodex 1.1 działa w aplikacji webowej i przez platformę API. Mini można pobrać i uruchomić lokalnie. Cennik Apodex API pokazuje obecnie czasową zniżkę 20 proc.:
| Model | Wejście / 1 mln tokenów | Cache / 1 mln | Wyjście / 1 mln |
|---|---|---|---|
| Apodex 1.1 (397B) | 0,24 USD | 0,024 USD | 2,40 USD |
| Apodex 1.1 Mini (35B) | 0,08 USD | 0,008 USD | 0,80 USD |
Źródło: oficjalny cennik Apodex; ceny promocyjne oznaczone jako „limited-time -20%”, stan na 26 sierpnia 2026 roku. Usługi Deep Research, Deep Solve i Deep Discover mają oddzielne, wyższe stawki.
Cena surowego modelu nie jest ceną ukończenia złożonego zadania. Agent może wielokrotnie czytać te same materiały, generować kod, poprawiać błędy i uruchamiać podagentów. W praktyce trzeba mierzyć koszt całej pomyślnie zakończonej pracy, czas operatora oraz odsetek zadań wymagających ręcznej naprawy — dokładnie te pułapki omawiamy w poradniku o wdrażaniu agentów AI w firmie.
Co Apodex 1.1 zmienia i czego jeszcze nie dowodzi?
Najważniejsza teza premiery jest rozsądna: długiej pracy agentowej nie da się sprowadzić do większego okna kontekstowego. Potrzebne są trwały stan, kontrolowane środowisko, możliwość wznowienia, ślady działań i mechanizm dostarczania częściowego rezultatu przed wyczerpaniem budżetu.
Apodex 1.1 pokazuje spójny projekt takiego systemu i udostępnia praktyczny punkt wejścia w postaci Mini oraz FrontierAgent. Raport nie dowodzi jednak jeszcze, że rozwiązanie jest niezawodne w produkcji ani że przewaga utrzyma się przy równym koszcie. Najwięcej powiedzą niezależne reprodukcje APEX-Agents i FrontierFinance, jawne budżety tokenowe oraz testy wielogodzinnych zadań z przerwaniem, zmianą danych i kontrolowanymi awariami narzędzi.
Częste pytania
Jakie są główne kierunki rozwoju Apodex 1.1?
Apodex 1.1 rozwija dwa główne kierunki: trening w bogatszych środowiskach narzędziowych oraz koordynację wielu agentów. Te podejścia mają na celu poprawę wydajności i efektywności działania systemu.
Czy Apodex 1.1 Mini można uruchomić lokalnie?
Tak, Apodex 1.1 Mini można uruchomić lokalnie. Zalecane okno kontekstowe dla tego modelu wynosi 262 144 tokeny.
Jakie wyniki osiągnął pełny Apodex 1.1 w testach APEX-Agents?
Pełny Apodex 1.1 z Agent Team uzyskał 38,5 punktu w APEX-Agents oraz 78,8 proc. wygranych w GDPVal. Wyniki te jednak nie są niezależnymi pomiarami.
Jakie są różnice między trybem ReAct a Agent Team w Apodex 1.1?
W trybie ReAct jeden agent wykonuje zadania sekwencyjnie, podczas gdy Agent Team dodaje koordynatora i podagentów, którzy pracują równolegle. To zwiększa efektywność, ale także wymaga większych zasobów obliczeniowych.
Jakie informacje są dostępne na temat treningu Apodex 1.1?
Trening Apodex 1.1 obejmował nadzorowane dostrajanie oraz uczenie ze wzmocnieniem dla zadań agentowych. Producent jednak nie ujawnił pełnego składu danych ani kosztów treningu.







