OpenAI wprowadził istotne zmiany w procesie rozwoju sztucznej inteligencji. Prace nad najnowszymi modelami zostały chwilowo spowolnione po tym, jak wewnętrzne testy wykazały, że nadchodzący model Astra może osiągnąć krytyczny poziom zagrożenia w obszarze cyberbezpieczeństwa. Decyzja wiąże się również z niedawnym incydentem bezpieczeństwa na linii OpenAI-Hugging Face oraz koniecznością wdrożenia rygorystycznych procedur ochronnych na każdym etapie szkolenia systemów.
OpenAI zatrzymuje uczenie modeli na 2 tygodnie
Reakcją firmy na wykrycie zaawansowanych zdolności hakerskich w modelach było wprowadzenie dwutygodniowego przestoju w uczeniu przez wzmacnianie (RL) w odniesieniu do jednostek przeznaczonych do wdrożenia. Choć największe planowane procesy treningowe frontier RL pozostały zamrożone, mniejsze eksperymenty i ewaluacje były kontynuowane w celu weryfikacji mechanizmów zabezpieczających.
We temporarily slowed some frontier training to strengthen security and monitoring. Our largest planned frontier RL run remains on hold while smaller-scale training and evaluations help us test safeguards and gather more evidence of alignment.
— Jakub Pachocki (@merettm) August 18, 2026
I expect confidence in safety to…
Spowolniliśmy tymczasowo trenowanie modeli z linii frontier, aby wzmocnić bezpieczeństwo i monitoring. Nasz największy planowany proces RL pozostaje wstrzymany, podczas gdy mniejsze szkolenia i ewaluacje pomagają nam testować zabezpieczenia i zbierać dowody na spójność celów modelu - poinformował na platformie X dyrektor ds. badań w OpenAI, Jakub Pachocki.
Wdrożenie rygorystycznych procedur izolowania kodu
Firma podjęła natychmiastowe działania polegające na rekonfiguracji infrastruktury badawczej. Wstrzymano wykonywanie wnioskowania modeli w klastrach naukowych dla procesów mogących uruchamiać kod lub korzystać z narzędzi z dostępem do sieci. Przywrócenie tych funkcji wymagało indywidualnego przeglądu każdego obciążenia roboczego.
W ramach nowych wymogów OpenAI wdrożył rygorystyczne piaskownice (sandboxy) do izolacji niebezpiecznego kodu, zwiększył odizolowanie sieciowe od internetu, ograniczył stałe uprawnienia systemowe, a także usunął podatne na ataki usługi współdzielone. Pokaźna część zadań związanych z projektem Astra pozostaje wstrzymana do momentu ich pełnej migracji do bezpieczniejszych środowisk.
Stały nadzór pochłania potężne zasoby sprzętowe
OpenAI zaprezentował rozbudowany, wieloetapowy system monitorowania oparty na klasyfikatorach aktywacji, które analizują wewnętrzną pracę modelu przy każdym próbkowanym tokenie. W przypadku wykrycia niepokojącej aktywności sprawa przekazywana jest do automatycznych mechanizmów dochodzenia badających pełne sekwencje działań pod kątem nieautoryzowanego dostępu, kradzieży danych czy próby obejścia zabezpieczeń.
Jeśli system zgłosi naruszenie krytycznych granic bezpieczeństwa, powiadamiane są zespoły badawcze i inżynieryjne. Brak jednoznacznego wykluczenia zagrożenia w ciągu 30 minut skutkuje natychmiastowym wstrzymaniem danej operacji. Tak drobiazgowa kontrola generuje ogromne koszty sprzętowe - pochłania obecnie około 20 proc. całej mocy obliczeniowej zarezerwowanej dla monitorowanej inferencji.
Dowiedz się więcej:

