Zusammenfassung:
Microsoft stärkt die Echtzeit-Sprachfunktionen der Foundry-Plattform weiter und stellt Entwicklern native Sprachagenten zur Verfügung, die Spracheingaben und Sprachausgaben direkt durchführen können, wodurch es für Unternehmen einfacher wird, Konversations-KI-Erlebnisse in Echtzeit ähnlich wie Google Gemini Live zu erstellen.

Die wichtigste Änderung des Microsoft-Updates besteht darin, dass der Foundry Agent Service damit beginnt, native Sprachfunktionen in Echtzeit zu unterstützen. Anders als bei herkömmlichen KI-Agenten, die Sprache zunächst in Text umwandeln, sie dann zur Verarbeitung an das Textmodell übergeben und schließlich den Text wieder in Sprache umwandeln, kann die native Spracharchitektur dem Echtzeit-Sprachmodell direkt ermöglichen, die Spracheingabe des Benutzers zu verarbeiten und eine Sprachantwort zu generieren, wodurch Zwischenverbindungen und daraus resultierende Verzögerungen reduziert werden.
Für Benutzer bedeutet dies, dass KI-Agenten sich natürlicher an kontinuierlichen Gesprächen beteiligen können. Benutzer müssen nicht warten, bis die Spracherkennung abgeschlossen ist oder das Modell eine vollständige Textantwort generiert, bevor sie mit der Sprachsynthese beginnen. Das System kann näher an der Echtzeit-Kommunikationsmethode zwischen Menschen sein und wichtige Aspekte der Sprachinteraktion wie Unterbrechung und Wendungsbeurteilung bewältigen.
Die Funktionen von Microsoft basieren auf der Voice Live API. Diese Schnittstelle integriert Funktionen wie Spracherkennung, generative KI, Text-zu-Sprache, Abbiegeerkennung und Unterbrechungsverarbeitung in einer einheitlichen Echtzeit-Sprachschnittstelle, sodass Entwickler ihren KI-Agenten Sprachinteraktionsfunktionen in Echtzeit hinzufügen können, ohne mehrere Sprachkomponenten separat erstellen zu müssen.
Für Unternehmen, die Foundry Agent Service zum Erstellen von KI-Agenten verwendet haben, bedeutet dies, dass die ursprünglichen textbasierten Agenten weiterhin Sprachinteraktionsfunktionen erhalten können, während sie weiterhin den ursprünglichen Toolaufruf, die Wissensdatenbank, den Speicher, den Inhaltssicherheitsschutz und die Daten- und Serviceintegrationsfunktionen auf Unternehmensebene nutzen können.
Microsoft betont insbesondere, dass der Voice Agent nicht nur ein Chatbot ist, der „Antworten vorlesen“ kann, sondern während der Sprachkommunikation in Echtzeit Tools aufrufen und Aufgaben ausführen kann. Unternehmen können diese Technologie beispielsweise nutzen, um Kundendienstsysteme aufzubauen, die es Benutzern ermöglichen, direkt über das Telefon mit KI-Agenten zu kommunizieren. Es kann auch für barrierefreie Dienste, Voice-First-Anwendungen und verschiedene interne Unternehmenssysteme verwendet werden, die eine natürliche Sprachinteraktion erfordern.
In Bezug auf die technische Architektur unterstützt Foundry derzeit zwei Hauptrouten für Sprachagenten. Eine davon ist die traditionelle Sprachpipeline, die die Sprache des Benutzers in Text umwandelt, sie dann zur Inferenz an das Textmodell weitergibt und schließlich den generierten Text in Sprache umwandelt. Das andere ist die native Speech-to-Speech-Architektur, die sich auf diese Zeit konzentriert, nämlich die Speech-to-Speech-Architektur. Das Echtzeit-Sprachmodell verarbeitet Spracheingaben direkt und generiert Sprachausgaben.
Der größte Vorteil der nativen Spracharchitektur besteht darin, dass sie die Latenz reduziert und gleichzeitig den Ton, die Pausen und den Kommunikationsrhythmus natürlicher Gespräche besser beibehält. Für Szenarien, die eine kontinuierliche Kommunikation erfordern, kommt diese Methode einem echten Echtzeitgespräch näher als die traditionelle mehrstufige Lösung „Spracherkennung → Textmodell → Sprachsynthese“.
Microsoft verbessert außerdem weiterhin die Echtzeit-Interaktionsfunktionen der Voice Live API. Durch die jüngsten Updates wurden neue native Echtzeit-Sprachtypen und weitere verbesserte Funktionen wie Echounterdrückung, intelligente Abschlusserkennung und paralleler Tool-Aufruf hinzugefügt. Die Echounterdrückung eignet sich besonders für Sprachagenten, die auf benutzerdefinierter Hardware oder nicht standardmäßigen Audioverbindungen ausgeführt werden. Es ermöglicht dem System, sich auf den tatsächlich vom Client gespielten Ton zu beziehen, wodurch das Problem der Fehlerkennung verringert wird, nachdem die KI ihre eigene Stimme gehört hat.
Neben Voice selbst stärkt Microsoft auch die Positionierung von Foundry als Plattform für die Entwicklung und den Betrieb von KI-Agenten auf Unternehmensebene. Foundry Agent Service kann für das Lebenszyklusmanagement intelligenter Agenten verantwortlich sein und Sicherheits-, Berechtigungskontroll-, Netzwerkisolations-, Betriebsverfolgungs- und Bewertungsfunktionen auf Unternehmensebene bereitstellen. Auf diese Weise müssen Unternehmen für den Betrieb, die Überwachung und die Sprachkommunikation von KI-Agenten keine Infrastruktur von Grund auf aufbauen.
Der Schritt von Microsoft zielt offensichtlich auch auf Gemini Live ab, das Google in den letzten Jahren kontinuierlich gestärkt hat. Gemini Live ist für Google zu einem wichtigen Produkt geworden, um Verbrauchern Sprach-KI-Funktionen in Echtzeit zu demonstrieren, während Microsoft Wert darauf legt, Unternehmensentwicklern ähnliche Echtzeit-Sprachfunktionen direkt zur Verfügung zu stellen, sodass Unternehmen exklusive Sprachintelligenz auf der Grundlage ihrer eigenen Daten, Tools und Geschäftsprozesse aufbauen können.
Die Positionierung der beiden ist daher nicht genau gleich. Gemini Live bietet hauptsächlich ein direkt nutzbares KI-Spracherlebnis für normale Benutzer, während Microsoft Foundry eher auf Unternehmen und Entwickler ausgerichtet ist. Der Schwerpunkt liegt darauf, Unternehmen die Möglichkeit zu geben, Echtzeit-Sprachfunktionen in Kundenservice, Telefonsysteme, interne Geschäfts- und andere professionelle Anwendungen einzubetten.
Microsoft hat in den letzten Jahren die Entwicklung von KI-Agenten von einfachen Chatbots bis hin zu Systemen vorangetrieben, die Aufgaben autonom ausführen können. Durch die Hinzufügung von Sprachfunktionen zu diesem System hat sich die Interaktion zwischen Benutzern und Agenten schrittweise von der Tastatureingabe zu natürlicheren Echtzeitgesprächen ausgeweitet. Agenten können nicht nur Fragen beantworten, sondern auch Tools aufrufen, auf Unternehmensdaten zugreifen und während Gesprächen bestimmte Aufgaben erledigen.
Derzeit integriert Microsoft schrittweise Funktionen wie Foundry Agent Service, Voice Live und verwaltete Agenten in dieselbe Unternehmens-KI-Plattform. Mit zunehmender Reife dieser Technologien wird die Infrastruktur, die Unternehmen selbst entwickeln und warten müssen, um Echtzeit-Sprachkundendienste, Telefonagenten, Sprachbüroassistenten und andere KI-Dienste aufzubauen, weiter reduziert.
Dies bedeutet auch, dass sich der Wettbewerb für KI-Sprachassistenten verlagert: vom einfachen Vergleich von Modellen, „ob sie chatten können“, hin zum Vergleich, wer Sprachinteraktion mit geringerer Latenz, umfassendere Tool-Calling-Funktionen, eine zuverlässigere Infrastruktur auf Unternehmensebene und eine bequemere Entwicklungsumgebung bieten kann. Die Hinzufügung eines nativen Echtzeit-Sprachagenten zu Foundry durch Microsoft ist ein wichtiger Schritt zur weiteren Erweiterung des Sprachagenten-Layouts im Markt für Unternehmens-KI.
Kommentare