OpenAI wypuścił najpotężniejszy model. GPT-6 Astra rozpoczyna erę AGI

OpenAI wypuścił najpotężniejszy model. GPT-6 Astra rozpoczyna erę AGI

OpenAI wypuścił GPT-6 Astra, ogłaszając nadejście ery AGI. Nowy model przynosi skok wydajnościowy w inżynierii oprogramowania, nauce, automatyzacji pracy biurowej i obsłudze komputera. Astra zdominowała benchmarki ARC-AGI-3 i FrontierMath, a także jako pierwsza osiągnęła krytyczny próg zdolności z zakresu cyberbezpieczeństwa. Najpotężniejsza jak dotąd sztuczna inteligencja na dniach wejdzie do ChatGPT, Microsoft Foundry i GitHub Copilot, a prawdopodobnie także do Microsoft 365 Copilot.

Premiera GPT-6 Astra wyznacza początek ery AGI

OpenAI oficjalnie i w iście backroomsowym stylu zaprezentował swój najnowszy model AI o nazwie GPT-6 Astra. Premiera nastąpiła zaledwie dwa miesiące po debiucie rodziny GPT-5.6. Twórcy określają go mianem skoku generacyjnego w obszarach inżynierii oprogramowania, pracy zawodowej, nauki, cyberbezpieczeństwa oraz autonomicznego korzystania z komputera. Model przekracza dotychczasowe ograniczenia systemów sztucznej inteligencji, oferując niespotykaną dotąd wydajność i dokładność działania.

Dostęp do systemu w pierwszej kolejności otrzymali klienci korporacyjni z sektora cyberbezpieczeństwa w ramach programu Daybreak. W najbliższych dniach nowa technologia trafi do subskrybentów planów ChatGPT Plus, Pro, Business i Enterprise, a także zostanie udostępniona przez API, platformę Microsoft Azure oraz AWS Bedrock. Niewykluczone, że na dniach zadebiutuje także w Microsoft 365 Copilot. W przypadku deweloperów cena za wykorzystanie API wynosi 10 USD za 1 mln tokenów wejściowych i 50 USD za 1 mln tokenów wyjściowych, co zrównuje ofertę z konkurencyjnym modelem Claude Fable 5.1.

Debiut nowego modelu flagowego wiąże się z istotną zmianą w postrzeganiu zaawansowania sztucznej inteligencji. Podczas prywatnego spotkania z prasą prezes OpenAI Greg Brockman wyznał, że wraz z udostępnieniem Astry branża technologiczna weszła w "erę AGI", czyli silnej sztucznej inteligencji bądź sztucznej inteligencji ogólnego zastosowania. Według przedstawicieli firmy przełom nastąpił po tym, jak wewnętrzna wersja modelu poradziła sobie z rozwiązaniem 10 otwartych problemów z zakresu matematyki i informatyki teoretycznej, o czym informowaliśmy na CentrumXP.

Wyniki benchmarków potwierdzają dominację OpenAI

GPT-6 Astra osiąga rekordowe wyniki w popularnych benchmarkach, wyprzedzając GPT-5.6 Sol oraz produkty konkurencji. W teście ARC-AGI-3 model uzyskał 98,6% punktów, podczas gdy jej poprzednik osiągnął zaledwie 7,8% W oficjalnym komunikacie OpenAI podaje nawet wynik 99,9%. Dla porównania - model Claude Opus 5 przy wysokim nakładzie mocy obliczeniowej uzyskał tylko 30,2% Wynik na poziomie 97,6% w teście FrontierMath Tier 4 (v2) również stawia nowy model na czele stawki.

Przewaga nowego produktu uwidocznia się także w zadaniach związanych z kodowaniem i nauką. W teście DeepSWE v1.1 Astra zdobyła 74,1% punktów, wyprzedzając Gemini 3.8 Flash z wynikiem 73,7%. W benchmarku Terminal-Bench Science 0.1 różnica była jeszcze bardziej wyraźna - Astra osiągnęła 64,6% punktów przy 22,4% uzyskanych przez GPT-5.6 Sol. Z kolei w agentycznym benchmarku Agents' Last Exam nowa wersja zanotowała 59,3%, a w AutomationBench - 41,4%.

Wysokie oceny w testach przekładają się bezpośrednio na sprawność wykonywania zadań w środowisku OSWorld 2.0. Astra wykonuje zadania związane z obsługą interfejsów komputera o 47% szybciej od GPT-5.6 Sol, osiągając przy tym wyższą skuteczność. Integracja z zaktualizowanym systemem Codex pozwala na 1,9-krotne przyspieszenie wykonywania operacji w benchmarku Mind2Web, co przekłada się na błyskawiczne automatyzowanie procesów biznesowych.

Astra wyznacza nowe standardy w automatyzacji pracy biurowej

Zastosowanie zaawansowanych mechanizmów pozwala modelowi Astra na wykonywanie powtarzalnych czynności bez konieczności używania dedykowanych interfejsów API. System agentyczny potrafi samodzielnie wypełniać formularze internetowe, aktualizować dane w systemach CRM, organizować kalendarze czy zbierać informacje w sieci. Narzędzie tworzy również kompletne witryny internetowe, przeprowadza testy funkcjonalne aplikacji i automatycznie instaluje oprogramowanie.

W środowiskach korporacyjnych model wykazuje się dużą precyzją przy tworzeniu dokumentów, prezentacji i arkuszy kalkulacyjnych dostosowanych do wytycznych danej firmy, co jest szczególnie dobrą informacją dla użytkowników pakietu Microsoft 365. GPT-6 analizuje kontekst i zadaje precyzyjne pytania doprecyzowujące tylko wtedy, gdy brakujące informacje mogą wpłynąć na ostateczny rezultat prac. Gdy użytkownik nie odpowiada natychmiast, technologia kontynuuje działania w oparciu o uzasadnione założenia, czekając na decyzję człowieka przy kluczowych krokach.

Zdolność do prawidłowej interpretacji przepisów potwierdzają pierwsze testy branżowe. Astra to znacząca poprawa jakości w stosunku do GPT-5.6 Sol w złożonych zadaniach prawniczych. W naszych wczesnych testach Astra wyróżniała się podejściem do pracy prawnej w sposób właściwy dla wnikliwego prawnika: odróżnia dokumenty od ustalonych faktów, ujawnia niepoparte dowodami założenia i zamienia luki w konkretne stanowiska procesowe - skomentował Niko Grupen, szef ds. badań stosowanych w firmie Harvey.

OpenAI wprowadza rozległą ochronę przed cyberzagrożeniami

Przełomowe możliwości w dziedzinie cyberbezpieczeństwa sprawiły, że Astra stała się pierwszym modelem OpenAI sklasyfikowanym jako osiągający krytyczny próg zdolności ofensywnych i badawczych. Testy na benchmarku ExploitBench wykazały 100% skuteczności w wykrywaniu i wykorzystywaniu podatności, a w próbach na nowo odkrytych lukach z okresu od czerwca do sierpnia 2026 r. model samodzielnie odnalazł i zidentyfikował dwie dotąd nieznane luki zero-day. W teście SRE-Bench polegającym na inżynierii wstecznej kodów binarnych model uzyskał skuteczność rzędu 99,2% w czterech próbach.

Ze względu na ryzyko nadużyć technologii producent wprowadził rygorystyczne zabezpieczenia i mechanizmy odmowy wykonywania niebezpiecznych poleceń. Rozległe procedury weryfikują, czy model nie próbuje przekraczać swoich uprawnień. W specjalnym sprawdzianie opartym na incydencie z cyberatakiem na infrastrukturę Hugging Face wersja GPT-5.6 Sol bez produkcyjnych zabezpieczeń przekraczała dozwolony zakres w 48% przypadków, podczas gdy GPT-6 Astra nie złamała wyznaczonych granic w ani jednej próbie (0% naruszeń).

Z kolei integracja z platformą Microsoft Foundry zapewnia klientom biznesowym dodatkowe mechanizmy kontroli, zarządzania tożsamością w Microsoft Entra oraz szyfrowania danych. Dostęp do najbardziej zaawansowanych funkcji defensywnych w ramach programu OpenAI Daybreak będzie stopniowo rozszerzany, umożliwiając audytorom weryfikację błędów i analizę złośliwego oprogramowania bez ryzyka automatycznego tworzenia działających narzędzi hakerskich przez osoby nieuprawnione.

Źródło: https://openai.com/index/gpt-6-astra/

Webinar: Jak przygotować firmę na erę AI z nowym planem M365 E7 Frontier Suite?
Webinar: Jak przygotować firmę na erę AI z nowym planem M365 E7 Frontier Suite?