OpenAI hat heute offiziell ein neues ChatGPT-Spracherlebnis auf Basis von GPT-Live veröffentlicht, das eine wichtige architektonische Verbesserung seiner Sprachtechnologieroute darstellt. Im Vergleich zum vorherigen Advanced Voice Mode, der 2024 für mehr Benutzer eingeführt wird, basiert die neue Version des Sprachmodus nicht mehr auf dem traditionellen Sprachsystem, sondern greift auf ein Echtzeit-Audiomodell zurück, das speziell für intelligente Sprachagenten entwickelt wurde.

Der erweiterte Sprachmodus galt einst als Weiterentwicklung des Sprachassistentenerlebnisses mit natürlicheren Dialogen, verbesserter Reaktionsgeschwindigkeit und Unterstützung für Unterbrechungen. Die von OpenAI eingeführte nachfolgende Generation von Echtzeit-Sprachmodellen zeigte jedoch schnell die Grenzen dieser alten Technologie auf.

Bereits im Mai dieses Jahres kündigte OpenAI sein bislang fortschrittlichstes Echtzeit-Sprachmodell GPT-Realtime-2 an, das Argumentationsfunktionen auf GPT-5-Ebene in Echtzeit-Audiointeraktionsszenarien einbringt. Im Vergleich zu früheren Sprachsystemen, bei denen nur „schnell sprechen und gut antworten“ im Vordergrund stand, kann GPT-Realtime-2 komplexe Anfragen besser verarbeiten, lange Gesprächskontexte stabiler verfolgen und mehrstufige Aufgaben erledigen, während die natürliche Sprechgeschwindigkeit und der Ton beibehalten werden. Auf dieser Basis hat OpenAI nun eine neue Generation des ChatGPT-Spracherlebnisses auf Basis der GPT-Live-Architektur veröffentlicht, wodurch die Interaktionsgrenze von Sprachassistenten weiter erhöht wird.

Der Kern dieses Upgrades liegt in GPT-Live, einer Vollduplex-Sprachmodellarchitektur, die es ChatGPT ermöglicht, „gleichzeitig zu sprechen, zuzuhören und zu denken“, im Gegensatz zu herkömmlichen Sprachassistenten, bei denen Sie zu Ende sprechen und dann antworten müssen. Bei tatsächlichen Interaktionen kann GPT-Live natürlich ein leichtes Ton-Feedback wie „okay“ und „hmm“ einfügen, wenn der Benutzer pausiert oder seine Rede verlangsamt, anstatt den gesamten Satz grob zu unterbrechen. Wenn der Benutzer einen Moment nachdenken muss, kann das Modell sich auch bewusst dafür entscheiden, ruhig zu bleiben, um nicht gestört zu werden.

Im Hinblick auf die Unterbrechungskontrolle können Benutzer die Frage jederzeit unterbrechen oder die Richtung ändern, und das Modell passt die Antwortlogik sofort an, um eine reibungslose Verbindung zum neuen Gesprächsziel herzustellen. Laut OpenAI kann das neue Spracherlebnis auch Fragen bewältigen, die eine vernetzte Suche, tiefergehende Überlegungen oder komplexe Aufgabenplanung erfordern, da die neuesten „Spitzenmodelle“ zur Generierung von Antworten herangezogen werden. Derzeit verwendet GPT-Live standardmäßig GPT-5.5 im Hintergrund. Dies bedeutet, dass Benutzer in einem Sprachszenario nicht nur einen menschenähnlicheren Dialogrhythmus erhalten, sondern auch eine Fähigkeit zum „Umdenken“, die dem Textmodus ähnelt.

OpenAI kündigte außerdem gleichzeitig an, dass es zwei Versionen des GPT-Live-Modells für globale ChatGPT-Benutzer einführen wird: GPT-Live-1 und GPT-Live-1 mini. Unter anderem nutzen Benutzer kostenpflichtiger Tarife wie ChatGPT Go, Plus und Pro standardmäßig das umfassendere GPT-Live-1, während kostenlose Benutzer ein Spracherlebnis mit GPT-Live-1 mini erhalten. Für Entwickler und Unternehmenskunden wird der Zugriff auf diese beiden Modelle auch über APIs möglich sein, was ihnen den Aufbau einer neuen Generation von Sprachagenten und vertikalen Anwendungen erleichtert.

Aus rhythmischer Sicht beschleunigt OpenAI das Upgrade der traditionellen Form des „Walkie-Talkie“-Sprachassistenten auf einen Vollduplex-Modus für intelligente Agenten, der näher an Gesprächen mit realen Personen herankommt. Mit der Implementierung von Modellen wie GPT-Realtime-2 und GPT-Live wandelt sich der ChatGPT-Sprachmodus von einem einfachen Sprach-Frage- und Antworttool zu einem „intelligenten Gesprächspartner“, der komplexe Aufgaben ausführen und langfristige Interaktionen in einer Sprachumgebung aufrechterhalten kann.