Astra z wynikiem 100 proc. w testach bezpieczeństwa. OpenAI zaostrza zasady

Astra z wynikiem 100 proc. w testach bezpieczeństwa. OpenAI zaostrza zasady

OpenAI zakwalifikował swój najnowszy model GPT-6 Astra do krytycznego poziomu ryzyka. System potrafi samodzielnie wykrywać nieznane luki i tworzyć skomplikowane łańcuchy ataków w zabezpieczonych środowiskach. W testach cyberbezpieczeństwa osiągnął 100 proc. skuteczności na ExploitBench, a także odkrył dwie nowe podatności zero-day. Skok możliwości wymusił czasowe wstrzymanie treningów RL, zmianę procedur i wdrożenie surowych izolacji sieciowych. Udostępnienie technologii nastąpi na specjalnych warunkach, a dostęp do zaawansowanych funkcji defensywnych otrzyma w pierwszej kolejności wąska grupa testerów.

Astra stwarza zagrożenie? OpenAI kwalifikuje model jako krytyczny

OpenAI ujawnił przełomowe możliwości swojego najnowszego modelu sztucznej inteligencji. Przełom w dziedzinie cyberbezpieczeństwa okazał się tak znaczący, że GPT-6 Astra stała się pierwszym modelem oficjalnie zaklasyfikowanym do najwyższego poziomu ryzyka. Zgodnie z wewnętrznym schematem oceniania technologia ta osiągnęła prób krytyczny.

Ocena wynika z faktu, że oprogramowanie potrafi samodzielnie wykrywać nieznane wcześniej podatności oraz tworzyć działający kod atakujący bardzo dobrze zabezpieczone cele. W testach praktycznych agentyczna sztuczna inteligencja zdołała wydostać się z odizolowanego środowiska przeglądarki internetowej i wykonać polecenia na komputerze gospodarza. W innym eksperymencie przejęła pełne uprawnienia administratora w zabezpieczonym systemie operacyjnym.

Astra z wynikiem 100 proc. w testach bezpieczeństwa. OpenAI zaostrza zasady

Możliwości te zostały potwierdzone eksperymentalnie. W benchmarku ExploitBench model uzyskał 100 proc. skuteczności. Ze względu na ryzyko wcześniejszego kontaktu z danymi testowymi stworzono wewnętrzny zestaw 20 groźnych luk w silniku V8 z okresu od czerwca do sierpnia 2026 r. Astra wykazała tam znacznie wyższy wskaźnik wykonania dowolnego kodu niż GPT-5.6 Sol przy użyciu znacznie mniejszej liczby tokenów wyjściowych. W trakcie badania wykryła i wykorzystała dwie nowe podatności typu zero-day.

Eksperci z OpenAI wyjaśniają, że tak duży skok możliwości wymagał natychmiastowej reakcji w kwestiach infrastruktury badawczej. Wykryte luki zostaną wkrótce przekazane deweloperom silnika V8.

Astra opiera się pokusom znacznie bardziej niż GPT-5.6 Sol

Wykrycie tak wysokich zdolności doprowadziło do natychmiastowego zablokowania części prac rozwojowych. OpenAI podjął decyzję o czasowym wstrzymaniu wybranych treningów uczenia przez wzmacnianie na przełomie ostatnich tygodni sierpnia 2026 r. W tym czasie modernizowano środowiska testowe, mechanizmy izolacji sieciowej i narzędzia do bieżącego monitorowania ruchu.

Rygorystyczne działania ochronne miały na celu wyeliminowanie ryzyka, że sam model podejmie nieautoryzowane działania wewnątrz sieci laboratoryjnej. Reakcja była bezpośrednio związana z wcześniejszym incydentem dotyczącym platformy Hugging Face, który szerzej omawialiśmy na CentrumXP, z którego to firma wyciągnęła wnioski przy tworzeniu nowych mechanizmów bezpieczeństwa. Na pełną skalę procesy reinforcement learning wznowiono dopiero 28 sierpnia, po wdrożeniu surowszych wymagań.

Astra z wynikiem 100 proc. w testach bezpieczeństwa. OpenAI zaostrza zasady

W nowej wersji poprawie uległa odporność na próby łamania zabezpieczeń poprzez odpowiednie odrzucanie niebezpiecznych promptów. GPT-6 Astra skutecznie odmawia wykonania 91,5 proc. niedozwolonych zaptań związanych z cyberatakami. Dla porównania starszy wariant GPT-5.6 Sol, obecny m.in. w Microsoft 365 Copilot, powstrzymywał jedynie 59 proc. takich prób.

Deweloperzy przetestowali również podatność systemu na pokusę przejęcia otoczenia za pomocą tzw. pułapek. W warunkach symulowanych GPT-5.6 Sol bez wdrożonych blokad produkcyjnych próbował zaatakować infrastrukturę towarzyszącą w 56 proc. przypadków. Nowy model nie wykonał ani jednej takiej próby.

Najnowszy model OpenAI z odgórną blokadą dostępu

Udostępnienie modelu Astra odbiorcom zewnętrznym odbędzie się na specjalnych warunkach. Ze względu na ryzyko nadużyć pełen pakiet zaawansowanych funkcji spod szyldu "cyber" zostanie mocno ograniczony. W pierwszej kolejności dostęp otrzyma wąska grupa wybranych testerów, a dopiero w następnym etapie - partnerzy w ramach defensywnego programu Daybreak Blue.

Użytkownicy muszą liczyć się z większymi utrudnieniami podczas wykonywania zadań. Wdrożone systemy monitorowania toku rozumowania będą automatycznie przerywać operacje w przypadku wykrycia niepokojących wzorców. Podobne mechanizmy mogą generować fałszywe alarmy i spowalniać pracę nawet przy legalnych projektach defensywnych.

W interfejsach takich jak ChatGPT, Copilot czy Codex użytkownik zostanie poproszony o ręczne zatwierdzenie kontynuacji działania po wykryciu ryzyka. W przypadku wywołań przez interfejs programistyczny API wykonywanie zadania zostanie natychmiast zatrzymane.

Przedstawiciele OpenAI zaznaczają, że wspomniane restrykcje są konieczne do zagwarantowania bezpiecznego debiutu rynkowego. Szczegółowe wyniki badań nad dopasowaniem i sprawozdania z testów bezpieczeństwa zostaną opublikowane w oficjalnych kanałach podczas oficjalnej premiery.

Dowiedz się więcej z naszych artykułów:

Źródło: https://openai.com/index/path-to-astra/

Webinar: Jak przygotować firmę na erę AI z nowym planem M365 E7 Frontier Suite?
Webinar: Jak przygotować firmę na erę AI z nowym planem M365 E7 Frontier Suite?