GPT-5.3-Codex i najnowsze modele dźwiękowe w Microsoft Foundry

GPT-5.3-Codex i najnowsze modele dźwiękowe w Microsoft Foundry

Najpotężniejszy modelu programistyczny od OpenAI, GPT-5.3-Codex, który po udanym debiucie na platformie Codex stał się teraz dostępny dla deweloperów poprzez API oraz na platformie Microsoft Foundry. Programiści zyskują dostęp do narzędzia, które bije rekordy wydajności w benchmarkach, takich jak SWE-bench Pro, oferując niespotykaną dotąd precyzję w rozwiązywaniu rzeczywistych problemów inżynieryjnych.

Najnowsza wersja modelu GPT-Codex to nie tylko ewolucja, ale przede wszystkim znacząca optymalizacja sposobu pracy. Dzięki usprawnieniom wprowadzonym przez OpenAI model wykonuje zadania o 25% szybciej niż jego poprzednicy, co bezpośrednio przekłada się na tempo tworzenia aplikacji. Ważną nowością jest wprowadzenie sterowalności w trakcie wykonywania zadania (mid-task steerability). Funkcja ta pozwala programistom na korygowanie kursu działań modelu bez utraty kontekstu, przez co staje się on partnerem w procesie twórczym, a nie tylko wykonawcą poleceń.

GPT-5.3-Codex wykazuje się również znacznie lepszą zdolnością do obsługi interfejsów graficznych oraz potrafi utrzymać koncentrację przy długich, wieloetapowych projektach. Typowe scenariusze to refaktoryzacja i modernizacja dużych aplikacji legacy, wykonywanie wieloetapowych migracji lub upgrade'ów, uruchamianie deweloperskich agentowych przepływów pracy, automatyzacja przeglądów kodu, generowania testów i wykrywania defektów, a także wspieranie rozwoju aplikacji w środowiskach wrażliwych na bezpieczeństwo lub regulowanych.

OpenAI i Microsoft wprowadzają równolegle nowości w sferze interakcji głosowych, prezentując modele GPT-Realtime-1.5 oraz GPT-Audio-1.5. Nowe silniki charakteryzują się wyraźną poprawą zdolności rozumowania (+5% w Big Bench Audio), dokładnością w transkrypcji danych alfanumerycznych (+10,23%) i wierniejszym podążaniem za instrukcjami (+7%).

Twórcy kładą szczególny nacisk na naturalność generowanego dźwięku. Nowe modele mają oferować płynniejszą konwersację, lepszą dykcję i bardziej ludzką prozodię. API wspiera teraz także ustrukturyzowane interakcje napędzane narzędziami bezpośrednio w strumieniu audio na żywo, co pozwala na budowanie zaawansowanych systemów głosowych potrafiących działać w czasie rzeczywistym.

Microsoft podkreśla, że nowoczesne aplikacje AI rzadko ograniczają się dziś do pojedynczego zapytania. Współczesna praca z technologią to proces rozciągnięty w czasie, wymagający stałego utrzymywania kontekstu i niezawodności narzędzi. Nowości wprowadzone do infrastruktury giganta mają być odpowiedzią na te potrzeby.

Źródło: https://techcommunity.microsoft.com/blog/azure-ai-foundry-blog/new-azure-open-ai-models-bring-fast-expressive-and-real%e2%80%91time-ai-experiences-in-m/4496184

Webinar: Jak przygotować firmę na erę AI z nowym planem M365 E7 Frontier Suite?
Webinar: Jak przygotować firmę na erę AI z nowym planem M365 E7 Frontier Suite?