Microsoft wypuścił najdokładniejszy model AI do transkrypcji na żywo

Microsoft wypuścił najdokładniejszy model AI do transkrypcji na żywo

Microsoft rozbudowuje swoją ofertę rozwiązań AI o trzy nowe modele głosowe z rodziny MAI: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 oraz MAI-Voice-2.1-Flash. Nowości zostały zaprojektowane do wspólnej pracy, aby zasilać konwersacyjne agenty głosowych o bardzo niskiej latencji. Zapewniają obsługę wielu języków, zachowanie jednolitego głosu i błyskawiczną transkrypcję w czasie rzeczywistym.

Najdokładniejszy model do transkrypcji dźwięku na żywo

Microsoft rozwija swoje autorskie portfolio sztucznej inteligencji, prezentując trzy nowe modele dedykowane obsłudze mowy: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 i MAI-Voice-2.1-Flash. Rozwiązania te stworzono z myślą o wspólnej pracy w ramach konwersacyjnych agentów głosowych, które wymagają natychmiastowego reagowania. W przeciwieństwie do poprzednich wersji przetwarzających jedynie nagrany wcześniej dźwięk nowy model transkrypcyjny działa w czasie rzeczywistym.

MAI-Transcribe-2-Streaming przesyła pierwsze hipotezy tekstowe już po około 100 ms od otrzymania dźwięku i stale koryguje treść wraz z napływem kontekstu. Pod względem dokładności rozwiązanie znalazło się na pierwszym miejscu w rankingu Artificial Analysis, gwarantując wyższą precyzję bez ponoszenia kosztów w postaci wysokich opóźnień. Model wyprzedził rozwiązania firm takich jak xAI, Meta, Google, OpenAI, ElevenLabs, Cartesia czy Nvidia. Microsoft ustalił promocyjną cenę modelu na poziom 0,54 USD za godzinę transkrypcji audio do końca 2026 r.

Połączenie ultraszybkiej transkrypcji i wydajnej syntezy mowy skraca czas odpowiedzi, dając agentom AI więcej przestrzeni na analizę danych i wywoływanie narzędzi w tle. Organizacje mogą wdrażać te rozwiązania w automatycznej obsłudze klienta, wielojęzycznych firmowych asystentach AI, a także w branży edukacyjnej i mediach do tworzenia dynamicznych symulacji czy narracji. Microsoft zaprezentował możliwości nowego zestawu narzędzi w praktyce, udostępniając demonstracyjnego bota Chatter na platformie MAI Playground.

Wiele języków i jeden naturalnie brzmiący głos

Równolegle debiutuje MAI-Voice-2.1, czyli jak do tej pory najbardziej zaawansowany model konwersji tekstu na mowę w ofercie Microsoft AI. System obsługuje 23 języki i 26 odmian lokalnych, pozwalając na wykorzystanie jednego profilu głosowego, który brzmi naturalnie w każdym języku.

Użytkownik może poprosić system o płynne przejście z języka angielskiego na mandaryński lub niemiecki, a syntezator mowy zachowa swój charakterystyczny ton bez nakładania obcego akcentu. Koszt tej usługi wynosi 22 USD za 1 milion znaków. Model umożliwia też klonowanie głosu na podstawie zaledwie kilku sekund nagrania referencyjnego, a wbudowane mechanizmy bezpieczeństwa chronią przed jego nieuprawnionym wykorzystaniem.

Ekstremalna szybkość dla wymagających systemów

W przypadku projektów o dużym natężeniu ruchu Microsoft przygotował wariant MAI-Voice-2.1-Flash. Oferuje ten sam zakres językowy, ale skupia się na maksymalnym skracaniu czasu odpowiedzi. Narzędzie potrafi wygenerować 45 sekund dźwięku przy opóźnieniu wynoszącym zaledwie 150 ms. Wersja Flash zapewnia o 55% szybsze wnioskowanie i jest o około 60% tańsza od porównywalnych rozwiązań, kosztując 15 USD za 1 milion znaków.

"Agent głosowy to pętla. Musi słyszeć, rozumieć, podejmować decyzje i mówić. I robić to wszystko w oknie, w którym człowiek nadal doświadcza interakcji jako rozmowy. Każdy element albo kupuje czas w tym oknie... albo go marnuje" - komentują twórcy nowych modeli.

Chcesz być na bieżąco? Dodaj CentrumXP do listy preferowanych źródeł w Google!

Źródło: https://microsoft.ai/news/our-first-streaming-transcription-model/

Fabcon Poland 2026: Barcelona update
Fabcon Poland 2026: Barcelona update