Microsoft führt das Echtzeit-Transkriptions- und Sprachsynthesemodell MAI-Transcribe-2-Streaming ein und belegt damit den ersten Platz in der Streaming-Erkennungsliste

📅 2026-10-02

Zusammenfassung:

Microsoft hat drei neue Modelle für Echtzeit-Sprachinteraktion auf den Markt gebracht, nämlich das Speech-to-Text-Modell MAI-Transcribe-2-Streaming und die Text-to-Speech-Modelle MAI-Voice-2.1 und MAI-Voice-2.1-Flash. Microsoft hofft, dass Entwickler sie kombinieren, um Sprachassistenten und Konversationsagenten zu entwickeln, die beim Zuhören etwas verarbeiten und sofort mit natürlicher Sprache reagieren können.

MAI-Transcribe-2-Streaming unterscheidet sich vom vorherigen MAI-Transcribe-2, das nur Aufnahmedateien verarbeiten kann. Es kann fortlaufend Audio-Eingangsströme empfangen und mit der Generierung von inszeniertem Text beginnen, bevor der Sprecher mit dem Sprechen fertig ist. Es wird weiterhin überarbeitet, sobald mehr Kontext vorliegt, und liefert schließlich stabile Ergebnisse. Microsoft sagte, dass das Modell 60 Sprachen unterstützt und Sprachen kontinuierlich und automatisch erkennen kann; Es wird davon ausgegangen, dass der erste Erkennungsdurchlauf etwas mehr als 100 Millisekunden nach dem Audioempfang erfolgt und für Szenarien wie Sprachagenten, Kundenservice, Untertitel bei Konferenzen und Klassenzimmern sowie Spracheingabe geeignet ist. Interne Tests von Microsoft zu Diktat und Untertiteln zeigen, dass Text etwa doppelt so schnell erscheint wie beim nächsten Mitbewerber, ein Vergleich, der auf den eigenen Bewertungen des Unternehmens basiert.

Der Streaming-Transkriptions-Benchmark von Artificial Analysis stuft das Modell hinsichtlich der Genauigkeit des endgültigen und inszenierten Textes an erster Stelle ein. Die veröffentlichten Testergebnisse ergaben, dass die endgültige Fehlerquote bei transkribierten Wörtern etwa 2,5 % betrug und der endgültige Text etwa 0,13 Sekunden nach Erkennung des Endes der Rede wiedergegeben wurde. Die Liste verglich damals 38 Modelle, testete etwa 8 Stunden Audio und deckte drei Korpustypen ab: AA-AgentTalk, VoxPopuli und Earnings22, die jeweils 50 %, 25 % und 25 % des Gesamtgewichts ausmachten. Je niedriger die Wortfehlerrate, desto besser. Dieses Ergebnis veranschaulicht die Leistung des Modells bei diesem Benchmark-Satz und bedeutet nicht, dass in allen Sprachen, verrauschten Umgebungen und realen Anwendungen die gleiche Genauigkeit erreicht werden kann.

MAI-Transcribe-2-Streaming ist derzeit für 0,54 $ pro Audiostunde erhältlich und das Angebot gilt bis Ende 2026; Im Vergleich dazu wurde MAI-Transcribe-2 ohne Streaming zuvor für 0,10 US-Dollar pro Stunde beworben. Die Echtzeitversion eignet sich eher für die kontinuierliche Interaktion, während die Batch-Version für die Aufzeichnung von Audiotranskriptionen vorgesehen ist. Die Preise der beiden können nicht einfach als direkter Vergleich bei derselben Nutzungsmethode angesehen werden.

Das neue Sprachsynthesemodell MAI-Voice-2.1 unterstützt 23 Sprachen und 26 regionale Varianten, sodass dieselbe synthetisierte Stimme zwischen verschiedenen Sprachen wechseln kann, während die Identität des Sprechers erhalten bleibt und der lokale Akzent der entsprechenden Sprache übernommen wird. Der Preis beträgt 22 US-Dollar pro 1 Million Zeichen. MAI-Voice-2.1-Flash für Anfragen mit geringer Latenz und großen Mengen unterstützt dieselbe Sprache. Microsoft gibt an, dass es 45 Sekunden Audio mit einer End-to-End-Verzögerung von etwa 150 Millisekunden erzeugen kann. Die Modellinferenzgeschwindigkeit wird um 55 % erhöht und der Preis ist etwa 60 % niedriger als bei vergleichbaren Modellen. Der Preis beträgt 15 US-Dollar pro 1 Million Zeichen. Die letztgenannten Geschwindigkeits- und Preisvorteile gehören zu den von Microsoft veröffentlichten Vergleichen.

Beide Sprachmodelle unterstützen das sprachübergreifende Klonen von Stimmen in Echtzeit, jedoch nur unter Verwendung autorisierter und genehmigter Referenzstimmen. In der Microsoft-Dokumentation wird die Funktion als eingeschränkter Zugriff aufgeführt, mit einer Referenz-Audioempfehlung von 5 bis 60 Sekunden und Schutzmaßnahmen gegen Missbrauch. MAI-Voice-2.1 eignet sich für längere Inhalte, Erzählungen und Hörbücher, während Flash eher für Echtzeitszenarien wie Sprachagenten, Assistenten und Kundenservice geeignet ist.

Alle drei Modelle können über Microsoft Foundry, MAI Playground und Vercel verwendet werden; Die beiden Voice-Modelle sind zudem an OpenRouter angebunden und können über Azure Voice Live angerufen werden. Die LiveKit-Unterstützung wird voraussichtlich später eingeführt. In der Microsoft Azure-Dokumentation werden diese Modelle derzeit als öffentliche Vorschau gekennzeichnet und es wird darauf hingewiesen, dass es kein Service Level Agreement gibt und sie nicht für den direkten Einsatz in Produktions-Workloads empfohlen werden.

Weitere Informationen:

https://microsoft.ai/news/our-first-streaming-transcription-model/

Verwandte Tags

Ähnliche Artikel

Kommentare

0/500
Captcha (click to refresh)
Keine Kommentare