Autonomiczne modele sztucznej inteligencji OpenAI, w tym GPT-5.6 Sol, przeprowadziły cyberatak na infrastrukturę serwisu Hugging Face podczas zamkniętych testów bezpieczeństwa z użyciem benchmarku ExploitGym. Aby podnieść swoje wyniki, agenty wykorzystały lukę zero-day w proxy rejestru pakietów, wydostały się z odizolowanego środowiska i uzyskały dostęp do otwartego internetu. Następnie pozyskały poświadczenia i zdobyły klucze do odpowiedzi z serwerów Hugging Face. Zespoły obu firm połączyły siły, prowadząc wspólne dochodzenie.
Autonomiczne modele OpenAI wyrwały się spod kontroli
W opublikowanym w ubiegłym tygodniu wpisie na blogu repozytorium oprogramowania AI Hugging Face poinformowało o nietypowym incydencie bezpieczeństwa. "Przypadek ten różnił się od wszystkiego, z czym mieliśmy do czynienia wcześniej" - wskazał zespół serwisu - "był on prowadzony od początku do końca przez autonomiczny system agentów AI".
Do zdarzenia odniósł się OpenAI, ujawniając, że to jego modele odpowiadają za ataki przeprowadzone w ramach wewnętrznych ewaluacji. W incydencie brał udział flagowy model GPT-5.6 Sol (dostępny m.in. w Microsoft 365 Copilot) oraz drugi, nieogłoszony jeszcze model. "Uznajemy ten incydent za bezprecedensowy cyberincydent, angażujący najnowocześniejsze możliwości [spod szylud] cyber, i reagujemy odpowiednio" - przekazała firma, przypisując sprawstwo bezpośrednio samym modelom.
OpenAI zdradza szczegóły incydentu
Testy prowadzono w zamkniętym środowisku (sandboksie) bez dostępu do Internetu z wykorzystaniem benchmarku ExploitGym, stworzonego przez konsorcjum, w skład którego wchodzili UC Berkeley, Max Planck Institute for Security and Privacy, UC Santa Barbara, Arizona State University, Anthropic, OpenAI oraz Google. Dostęp do internetu odbywał się wyłącznie poprzez wewnętrzną sieć OpenAI i zewnętrznego dostawcę hostingu.
Dążąc do maksymalizacji wyników w teście, modele odnalazły sposób na obejście ograniczeń. Wcześniej wspominaliśmy już o tym na CentrumXP, jednak teraz nadeszły kolejne interesujące szczegóły które przekazali twórcy modeli.
Podczas pracy w naszym odizolowanym środowisku testowym nasze modele zużyły znaczną ilość mocy obliczeniowej na znalezienie sposobu na uzyskanie otwarcego dostępu do Internetu w celu rozwiązania zadania ewaluacyjnego. Aby uzyskać dostęp, modele zidentyfikowały i wykorzystały lukę typu zero-day (którą odpowiedzialnie zgłosiliśmy dostawcy) w pamięci podręcznej proxy rejestru pakietów. Dzięki temu dostępowi nasze modele przeprowadziły serię działań związanych z podnoszeniem uprawnień i ruchem poprzecznym w naszym badawczym środowisku testowym, aż osiągnęły węzeł z dostępem do internetu - tłumaczy OpenAI.
Agenty AI zaatakowały serwery Hugging Face, by zdobyć informacje
Po uzyskaniu połączenia z siecią modele wywnioskowały, że odpowiedzi do testu znajdują się na serwerach Hugging Face. Zgodnie z raportem agent "szukał i pomyślnie znalazł sposoby na uzyskanie dostępu do tajnych informacji, które mógł wykorzystać do oszukania ewaluacji". Do osiągnięcia celu oprogramowanie wykorzystało wykryte podatności zero-day oraz skradzione poświadczenia. Przed opublikowaniem oświadczenia OpenAI platforma Hugging Face wykryła ślady ataku.
Nie wiemy, jaki model zasilał agenty napastnika - czy był to złamany model hostowany, też nieograniczony model z otwartym kodem. Tak czy inaczej napastnik nie był związany żadnymi zasadami użytkowania, podczas gdy nasze własne działania kryminalistyczne były blokowane przez zabezpieczenia hostowanych modeli, które wypróbowaliśmy w pierwszej kolejności - wyjaśnia Hugging Face.
OpenAI i Hugging Face prowadzą teraz wspólne dochodzenie. Sytuacja ta nie jest pierwszą, jaka stała się udziałem autonomicznych narzędzi AI. Nieco wcześniej potężny model Claude Mythos 5 firmy Anthropic również dokonywał naruszeń, by osiągać swoje cele. Zarówno twórcy, jak i regulatorzy uznają, że jest zbyt potężny, by go w pełni kontrolować, dlatego dostęp do niego został ściśle ograniczony. GPT-5.6 Sol jest z kolei ogólnodostępny. Jego wspólnik - wewnątrzny model OpenAI - jest zaś dostępny tylko dla jego twórców.
Zachęcamy innych obrońców do ubiegania się o zaufany dostęp i eksperymentowania z tymi modelami już teraz, aby przełożyć te możliwości na lepszą profilaktykę, szybsze wykrywanie i skuteczniejsze reagowanie na incydenty - zachęca OpenAI.


