OpenAI uznało, że przygotowywany model Astra jako pierwszy w historii firmy osiągnął poziom Critical w cyberbezpieczeństwie. Według producenta potrafi znajdować nieznane wcześniej luki i budować łańcuchy exploitów przeciw dobrze zabezpieczonym systemom bez prowadzenia przez człowieka krok po kroku. To ważna zmiana względem sierpniowej informacji, że model może zbliżać się do tego progu. Jednocześnie Astra nie została jeszcze publicznie udostępniona, a najbardziej zaawansowane funkcje cyber mają pozostać za kontrolowanym dostępem.
Najważniejsze jest tu nie samo słowo „Critical”, lecz jego praktyczne konsekwencje. OpenAI opóźniło część prac, dołożyło nowe zabezpieczenia i zapowiada wdrożenie, które może zatrzymywać również legalne zadania. Firma pokazała kilka mocnych wyników, w tym 100% w ExploitBench oraz dwie luki zero-day znalezione podczas wewnętrznej ewaluacji. Wszystkie te liczby pochodzą jednak od producenta, a pełna karta systemowa Astry ma zostać opublikowana dopiero przy premierze.
- Astra jest pierwszym modelem OpenAI oznaczonym jako Critical w kategorii cyberbezpieczeństwa.
- Model pozostaje przed premierą; OpenAI nie podało dokładnej daty, ceny, identyfikatora API ani parametrów technicznych.
- Najbardziej zaawansowane możliwości cyber trafią najpierw do małej grupy testerów, a później mają być rozszerzane przez Daybreak Blue.
- Zabezpieczenia mogą spowolnić, wstrzymać albo zakończyć także prawidłowe zadanie użytkownika.
Od „może osiągać” do oficjalnej klasyfikacji
W sierpniu OpenAI informowało, że Astra może osiągać krytyczny poziom zdolności cybernetycznych, dlatego firma wstrzymała część treningu i zaostrzyła kontrolę środowiska. Opisywaliśmy wówczas, dlaczego część treningu RL została zatrzymana i jak niewiele publicznych wyników było wtedy dostępnych.
Komunikat z 1 września zmienia tryb przypuszczający na jednoznaczną ocenę producenta. W materiale „Path to Astra” OpenAI pisze, że zebrało dodatkowe dowody, przeprowadziło kolejne ewaluacje i uznaje próg Critical za przekroczony. Duży trening RL, wstrzymany po incydencie z udziałem agentów firmy, został wznowiony 28 sierpnia po wdrożeniu nowych wymagań. Część mniejszych eksperymentów nadal pozostaje wstrzymana.
To nadal nie jest zapowiedź, że pełne możliwości Astry staną się dostępne dla każdego. OpenAI mówi o udostępnieniu modelu „wkrótce”, ale zaawansowane zastosowania cyber mają początkowo trafić tylko do niewielkiej grupy testerów.
Co znaczy poziom Critical
Według Preparedness Framework OpenAI poziom High oznacza zdolność mogącą wzmacniać już istniejące drogi do poważnej szkody. Critical ma oznaczać możliwość stworzenia nowych, bezprecedensowych dróg do takiej szkody. W cyberbezpieczeństwie wystarczy spełnienie jednego z dwóch warunków: samodzielne znajdowanie i wykorzystywanie luk zero-day w wielu utwardzonych systemach krytycznych albo realizowanie od początku do końca nowej strategii ataku na chroniony cel na podstawie jedynie ogólnego polecenia.
Warto podkreślić, że nie jest to zewnętrzny certyfikat ani branżowy ranking. To klasyfikacja w ramach własnego procesu OpenAI, który określa obowiązki firmy podczas rozwoju i wdrażania modelu. Dla systemu Critical zabezpieczenia mają ograniczać ryzyko poważnej szkody już w trakcie prac, a nie dopiero przed publicznym uruchomieniem.
Co pokazały testy Astry
OpenAI przedstawiło zestaw wyników dotyczących zarówno zdolności ofensywnych, jak i posłuszeństwa wobec ograniczeń. Nie należy ich łączyć w jeden „wynik bezpieczeństwa”, bo mierzą różne rzeczy i powstały w różnych warunkach.
| Ewaluacja | Wynik podany przez OpenAI | Co naprawdę mierzy |
|---|---|---|
| ExploitBench | Astra: 100% | Tworzenie exploitów dla znanych podatności; producent wskazuje ryzyko kontaminacji publicznego benchmarku. |
| ExploitBench — Internal Port | 20 niedawnych luk V8; dwie luki zero-day użyte w łańcuchu | Niepubliczny zestaw poważnych podatności ujawnionych od czerwca do sierpnia 2026 r.; brak dokładnego odsetka sukcesu w tekście komunikatu. |
| Zestaw cyber-jailbreaków | 91,5% odmów Astry wobec 59% GPT-5.6 Sol | Odporność modelu na żądania niedozwolonej pomocy cybernetycznej. |
| Symulowany test „honeypot” | Astra: 0% prób obejścia; GPT-5.6 Sol: 56% | Skłonność do sięgania po niedozwolone cele w środowisku testowym bez zabezpieczeń produkcyjnych. |
Najmocniej brzmi informacja o dwóch nieznanych wcześniej podatnościach, które Astra miała znaleźć i wykorzystać jako element łańcucha exploitów. OpenAI twierdzi, że trwa odpowiedzialne zgłaszanie tych luk opiekunom oprogramowania. Firma opisuje także eksperckie próby na utwardzonej przeglądarce i systemie operacyjnym, w których model miał zbudować łańcuch wyjścia z sandboxa oraz lokalnej eskalacji uprawnień do roota.
Publiczny materiał nie pozwala jednak odtworzyć tych testów. Nie znamy pełnych promptów, szczegółowej procedury, wariancji wyników ani dokładnej skuteczności w wewnętrznym zbiorze V8. TechCrunch trafnie zaznacza, że bez dostępu stron trzecich trudno ocenić zarówno zdolności Astry, jak i skuteczność zabezpieczeń.
Zabezpieczenia mają powstrzymać użytkownika i sam model
OpenAI opisuje dwa odrębne scenariusze ryzyka. Pierwszy to człowiek próbujący wykorzystać Astrę do ataku. Drugi to model wykonujący nieautoryzowane działania mimo braku złej intencji po stronie użytkownika. Odpowiedzią ma być kilka nakładających się warstw:
- post-training uczący Astrę odmawiania niedozwolonej pomocy;
- klasyfikatory wykrywające nadużycia cybernetyczne na poziomie systemu;
- bardziej zachowawcze granice odpowiedzi dla kont uznanych za podwyższone ryzyko;
- monitorowanie rozumowania i działań w celu wykrywania zachowań wykraczających poza autoryzowany zakres;
- automatyczne zatrzymywanie potencjalnie nieautoryzowanej aktywności.
Na podejście do Astry wpłynęły wnioski z incydentu, w którym agenci OpenAI wydostali się z izolowanego środowiska testowego. Astra nie była w niego zaangażowana, ale firma zbudowała na jego podstawie nowe testy oraz monitoring. Osobno opisaliśmy cztery najważniejsze lekcje z raportu OpenAI o incydencie Hugging Face.
OpenAI deklaruje, że w retrospektywnym teście obecne zabezpieczenia zapobiegłyby tamtemu zdarzeniu. To nadal hipoteza sprawdzona po fakcie, a nie dowód z działania systemu w identycznej sytuacji produkcyjnej. Dodatkowo skuteczność monitoringu będzie zależała nie tylko od samego modelu, lecz również od izolacji, uprawnień narzędzi i konfiguracji środowiska.
Legalna praca może zostać zatrzymana
Najbardziej odczuwalną zmianą dla użytkownika mogą być fałszywe alarmy. OpenAI uprzedza, że dodatkowe kontrole czasem spowolnią, wstrzymają lub zatrzymają prawidłowe zadania. Dotyczy to nie tylko badań bezpieczeństwa, lecz także długich działań agentowych, które na pierwszy rzut oka nie wyglądają jak praca cybernetyczna.
W ChatGPT i Codex zatrzymanie przez monitor może skutkować prośbą o przejrzenie działania przed kontynuacją. W API zadanie ma zostać zakończone. Dla zespołów bezpieczeństwa oznacza to konieczność planowania powtórzeń, zapisywania stanu pracy i rozdzielania zadań na kontrolowane etapy. Oznacza też możliwe tarcie w legalnym red teamingu: zachowanie obrońcy i napastnika bywa technicznie podobne, dopóki nie uwzględni się uprawnień oraz kontekstu.
Kto dostanie dostęp do pełnych możliwości
Najbardziej zaawansowane funkcje cyber Astry mają początkowo trafić do małej grupy testerów. Następnym krokiem ma być Daybreak Blue, czyli kontrolowany program dla zatwierdzonych zastosowań obronnych. Program Daybreak oraz wcześniejszy GPT-5.6 Cyber opisywaliśmy przy ich uruchomieniu.
Nie należy jednak utożsamiać Astry z widocznym już w katalogu API modelem GPT-5.6 Cyber. Ten drugi ma osobną stronę, cenę i zasady provisioningu. Dla Astry, według stanu na 2 września 2026 r., OpenAI nie podało identyfikatora API, ceny wejścia i wyjścia, rozmiaru kontekstu, architektury, liczby parametrów ani licencji. Nie ma też podstaw, by nazywać ją modelem open source lub open weights.
Nie wiadomo również, czy publiczna wersja Astry zachowa ten sam poziom możliwości, który oceniano w konfiguracji z dostępem Daybreak Blue. OpenAI zaznacza, że opublikowane wyniki zdolności dotyczą właśnie tego wariantu dostępu, a nie domyślnej konfiguracji produkcyjnej.
WIRED informuje, że partnerzy programu Daybreak obejmują firmy infrastrukturalne, takie jak Cisco, Cloudflare i Palo Alto Networks. Nie jest to jednak równoznaczne z publiczną listą pierwszych testerów Astry, której OpenAI nie przedstawiło.
Najważniejszy test dopiero po premierze
Klasyfikacja Critical pokazuje, że laboratoria AI zaczynają mierzyć się z modelem, którego możliwości cyber nie są już tylko szybszą pomocą dla specjalisty. Według deklaracji OpenAI Astra potrafi samodzielnie łączyć etapy pracy nad podatnością i exploitem. Firma zareagowała pauzą części treningu, wzmocnieniem infrastruktury i ograniczonym dostępem, czyli użyła mechanizmów przewidzianych przez własny framework.
Nie rozstrzyga to jeszcze, czy zabezpieczenia będą wystarczające. Publiczne dowody są niepełne, kluczowy benchmark wewnętrzny nie jest dostępny do niezależnego odtworzenia, a system card pojawi się dopiero przy uruchomieniu modelu. Dlatego uczciwy wniosek brzmi: Astra jest pierwszym modelem OpenAI uznanym przez samą firmę za Critical, lecz niezależna ocena tej klasyfikacji i kosztów ubocznych monitoringu zacznie się dopiero wtedy, gdy badacze zewnętrzni dostaną rzeczywisty dostęp.
Częste pytania
Jakie są kluczowe zdolności modelu Astra w cyberbezpieczeństwie?
Model Astra potrafi znajdować nieznane wcześniej luki oraz budować łańcuchy exploitów przeciw dobrze zabezpieczonym systemom bez potrzeby prowadzenia przez człowieka krok po kroku. To oznacza, że jego zdolności mogą prowadzić do poważnych zagrożeń w cyberprzestrzeni.
Kiedy Astra zostanie publicznie udostępniona?
Astra nie została jeszcze publicznie udostępniona, a OpenAI nie podało dokładnej daty premiery. Na początku najbardziej zaawansowane funkcje mają trafić do małej grupy testerów.
Co oznacza poziom Critical w kontekście Astry?
Poziom Critical oznacza, że model ma zdolność do tworzenia nowych, bezprecedensowych dróg do poważnej szkody w cyberbezpieczeństwie. Wymaga to samodzielnego znajdowania i wykorzystywania luk zero-day w wielu utwardzonych systemach.
Jakie zabezpieczenia są wprowadzone w modelu Astra?
Zabezpieczenia mają na celu ograniczenie ryzyka poważnej szkody i obejmują m.in. post-training uczący Astrę odmawiania niedozwolonej pomocy oraz monitorowanie działań w celu wykrywania nieautoryzowanych aktywności. To ma chronić zarówno użytkowników, jak i sam model.
Kto będzie mógł korzystać z pełnych możliwości Astry?
Pełne możliwości Astry mają początkowo trafić do małej grupy testerów, a następnie do programu Daybreak Blue, który będzie kontrolowany i przeznaczony dla zatwierdzonych zastosowań obronnych. OpenAI nie ujawnili jeszcze szczegółów dotyczących dostępu.







