OpenAI uznało Astrę za pierwszy model o krytycznych zdolnościach cybernetycznych

OpenAI potwierdziło, że przygotowywany model Astra osiągnął poziom „Critical” w obszarze cyberbezpieczeństwa według firmowego Preparedness Framework. To pierwszy model firmy zakwalifikowany do tej kategorii. W testach Astra m.in. samodzielnie znalazła dwie nieznane wcześniej podatności zero-day i wykorzystała je w działającym łańcuchu ataku.
Według OpenAI model uzyskał 100% wyniku w ExploitBench, zestawie badającym zdolność do przygotowywania exploitów dla znanych podatności. Aby ograniczyć ryzyko, że zadania mogły znaleźć się w danych treningowych, firma stworzyła też wewnętrzny zestaw obejmujący 20 niedawno ujawnionych podatności wysokiego ryzyka. Właśnie podczas tych testów Astra odkryła dwa nieznane wcześniej błędy i użyła ich jako elementów łańcucha exploitów. OpenAI rozpoczęło proces informowania ich „właścicieli”.
Jeszcze mocniejsze wyniki przyniosły testy prowadzone przez ekspertów. Astra zbudowała pełny łańcuch działań, pozwalający wydostać się z sandboxa i wykonywać polecenia w systemie hosta po otwarciu odpowiednio przygotowanego pliku HTML. W innym scenariuszu model znalazł kilka podatności w zabezpieczonym systemie operacyjnym i połączył je w łańcuch umożliwiający lokalną eskalację uprawnień od zwykłego użytkownika do roota.
W firmowym Preparedness Framework poziom Critical oznacza m.in. możliwość identyfikacji i przygotowywania działających exploitów zero-day dla wielu dobrze zabezpieczonych rzeczywistych systemów bez prowadzenia modelu krok po kroku przez człowieka. Alternatywnym kryterium jest zdolność do opracowania i wykonania od początku do końca nowej strategii cyberataku na podstawie jedynie ogólnie określonego celu.
Mocniejszy model wymaga mocniejszych ograniczeń
OpenAI deklaruje, że przed udostępnieniem Astry rozbudowało warstwy zabezpieczeń obejmujące trening modelu, klasyfikatory systemowe, monitoring oraz mechanizmy zatrzymujące potencjalnie nieautoryzowane działania. W firmowych testach Astra odrzucała 91,5% prób obejścia zabezpieczeń w zadaniach cybernetycznych. Dla porównania GPT-5.6 Sol osiągał 59%.
Firma zamierza udostępnić Astrę w najbliższym czasie, ale dostęp do najbardziej zaawansowanych możliwości cybernetycznych będzie początkowo ograniczony do niewielkiej grupy testerów. Później defensywne zastosowania mają być stopniowo rozszerzane przez program Daybreak Blue.






















