Nowy model audio od Microsoftu. MAI-Transcribe-2 wyprzedza konkurencję

Nowy model audio od Microsoftu. MAI-Transcribe-2 wyprzedza konkurencję

Microsoft zaprezentował model MAI-Transcribe-2, określając go jako najszybsze, najbardziej dokładne i najtańsze narzędzie do rozpoznawania mowy na rynku. Nowe rozwiązanie stanowi bezpośrednią odpowiedź na konkurencyjne technologie dostarczane przez OpenAI, ElevenLabs czy Google. Premiera ta wpisuje się w ciągłą rozbudowę autorskiego portfolio sztucznej inteligencji giganta z Redmond, stanowiąc ewolucję systemów pokazywanych w poprzednich miesiącach tego roku.

Microsoft rozwija autorskie portfolio modeli AI

Microsoft systematycznie rozszerza własne portfolio rozwiązań programistycznych. Pierwsza generacja MAI-Transcribe zadebiutowała w kwietniu 2026 r., oferując wsparcie dla 25 języków przy średnim współczynniku błędu Word Error Rate (WER) na poziomie 3,9 proc. Model wyceniono wówczas na 0,36 USD za godzinę audio.

W czerwcu gigant wypuścił wersję 1.5, w której obsługę języków rozszerzono do 43, wprowadzono funkcję ukierunkowywania słów kluczowych i znacząco przyspieszono przetwarzanie danych. Najnowsza edycja MAI-Transcribe-2 przynosi kolejny znaczący skok możliwości technicznych.

W benchmarku wielojęzycznym FLEURS nowa wersja zajmuje pierwsze miejsce dla 60 języków ze średnim wynikiem WER wynoszącym 5,2 proc. Model plasuje się także na drugim miejscu w niezależnym rankingu Artificial Analysis. Jego autorzy wskazują na wyraźną przewagę rynkową nowej architektury. To nie tylko nasz najbardziej zaawansowany model transkrypcji, ale także najbardziej wydajny i skuteczny pośród konkurencji - wyjaśnia zespół Microsoft AI.

MAI-Transcribe-2 dominuje pod względem szybkości przetwarzania audio

Nowo zaprezentowany model charakteryzuje się niespotykaną dotąd wydajnością przetwarzania plików dźwiękowych. Testy wykazały, że przetwarzanie wsadowe przebiega znacznie szybciej niż w przypadku dotychczasowych rozwiązań rynkowych. Oprogramowanie pozwala na drastyczne skrócenie czasu potrzebnego na przetworzenie materiałów audio.

Według oficjalnych pomiarów system działa do 10x szybciej niż GPT-Transcribe od OpenAI, 7x szybciej niż Scribe v2 firmy ElevenLabs i 5x szybciej niż Gemini 3.5 Transcribe opracowany przez Google. Zapewnia przy tym wyższą dokładność rozpoznawania mowy. Wyniki te potwierdzają niezależne podmioty badawcze testujące rozwiązania sztucznej inteligencji.

Zaawansowane funkcje dla zastosowań profesjonalnych

Microsoft AI wyeliminował szereg ograniczeń znanych z poprzednich wydań modelu. Nową wersję wyposażono w obsługę rozpoznawania i rozróżniania mówców, co pozwala na precyzyjne przypisywanie wypowiadanych słów do konkretnych osób biorących udział w nagraniu.

Wśród nowych udogodnień znalazły się też precyzyjne znaczniki czasu na poziomie poszczególnych słów, ułatwiające edycję i nawigację po tekście. Narzędzie radzi sobie z mieszaniem języków podczas jednej rozmowy, obsługując m.in. języki hybrydowe hinglish i spanglish. Posiada też funkcję automatycznego rozpoznawania języka oraz zaawansowane ukierunkowywanie słów kluczowych dla branżowej terminologii.

Użytkownicy otrzymują do dyspozycji dwa tryby pracy dostosowane do konkretnych potrzeb. Tryb dosłowny zachowuje pauzy i powtórzenia na potrzeby analiz prawnych, natomiast tryb czysty usuwa je dla poprawy czytelności tekstu. Dzięki nowym funkcjom, takim jak diarizacja, konfigurowalne style transkrypcji i znaczniki czasu na poziomie słów, MAI-Transcribe-2 wygrywa z innymi wiodącymi modelami, takimi jak Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large i ScribeV2, obsługując przy tym szerszy zakres rzeczywistych nagrań - przekazali twócy.

Microsoft tnie ceny. Ile kosztuje transkrypcja audio z AI?

Wraz z premierą MAI-Transcribe-2 gigant z Redmond ogłosił wyjątkowo atrakcyjne warunki finansowe dla programistów i przedsiębiorstw. Koszt korzystania z narzędzia został ustalony na poziomie 0,10 USD za godzinę materiału audio.

Jest to stawka wyraźnie niższa od początkowej ceny pierwszej wersji modelu, która wynosiła 0,36 USD. Obniżona cena ma charakter promocyjny i będzie obowiązywać wyłącznie do końca 2026 r. Firma nie ujawniła jeszcze docelowego cennika po zakończeniu okresu promocyjnego.

Niska cena modelu jest bezpośrednim następstwem wysokiej optymalizacji kodu. MAI-Transcribe-2 jest niezwykle wydajny, prowadząc na granicy Pareto dokładności i opóźnienia Artificial Analysis, łącząc wiodącą jakość transkrypcji z rynkowym liderstwem w szybkości przetwarzania wsadoweg - tłumaczy zespół programistów. Usługa jest już dostępna w Microsoft Foundry i MAI Playground, a wkrótce trafi na platformę OpenRouter.

Źródło: https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/

Webinar: Jak przygotować firmę na erę AI z nowym planem M365 E7 Frontier Suite?
Webinar: Jak przygotować firmę na erę AI z nowym planem M365 E7 Frontier Suite?