OpenAI öffnet Entwicklern das gleiche GPT-Live-1-Sprachmodell wie ChatGPT. Der API-Preis beträgt 0,05 US-Dollar pro Minute.

📅 2026-09-11

Zusammenfassung:

OpenAI gab kürzlich bekannt, dass GPT-Live-1, das derzeit für die ChatGPT-Sprachfunktion verwendet wird, offiziell für Entwickler geöffnet wird. Entwickler können dieses Sprachmodell nun über APIs in ihre eigenen Anwendungen und Geschäftsprozesse integrieren, um Vollduplex-Sprachassistenten zu erstellen, die Benutzern in Echtzeit zuhören und gleichzeitig reagieren können. Der Sprach-Frontend-Preis dieses Modells beträgt 0,05 US-Dollar pro Minute, und das im Hintergrund für komplexe Argumente verwendete Modell muss entsprechend dem entsprechenden Modellpreis separat abgerechnet werden.

1789093911_chatgpt_voice.webp

GPT-Live-1 ist eine neue Generation von Echtzeit-Sprachmodellen, die dieses Jahr von OpenAI eingeführt wurde. Sein größtes Merkmal ist seine Vollduplex-Architektur. Herkömmliche Sprach-KI muss normalerweise die drei Schritte Spracherkennung, Sprachmodellinferenz und Sprachsynthese nacheinander abschließen. Erst nachdem der Benutzer mit dem Sprechen fertig ist, kann das System mit der Verarbeitung beginnen und Antworten generieren. GPT-Live-1 hingegen kann eine Sprachausgabe generieren, während dem Benutzer beim Sprechen zugehört wird, sodass Unterbrechungen, Pausen, Echos und schnelle Hin- und Hergespräche natürlicher verarbeitet werden können.

Das bedeutet, dass Benutzer nicht warten müssen, bis die KI vollständig mit dem Sprechen fertig ist, bevor sie mit dem Sprechen fortfahren. Wenn der Benutzer seine Meinung ändert, Informationen hinzufügt oder direkt unterbricht, kann GPT-Live-1 sein Verhalten rechtzeitig an das laufende Gespräch anpassen. Das Modell kann auch erkennen, wann man weiter reden, wann man pausieren, wann man weiter zuhören und wann man auf Tools zurückgreifen muss.

OpenAI gab an, dass diese Architektur die Verzögerung bei der Sprachinteraktion erheblich reduzieren und die Verbindungsprobleme lösen kann, die bei tatsächlichen Gesprächen in der traditionellen Pipeline „Spracherkennung + großes Sprachmodell + Sprachsynthese“ häufig auftreten. Da GPT-Live-1 selbst sowohl Eingabe- als auch Ausgabeaudio verarbeitet, müssen Entwickler nicht mehr den komplexen Wechsel zwischen mehreren unabhängigen Modellen koordinieren.

In dem von OpenAI veröffentlichten Test war die Leistung von GPT-Live-1 im Full Duplex Bench-Test 30 Prozentpunkte höher als die von GPT-Realtime-2.1, insbesondere im Hinblick auf Abbiegeverzögerung und interaktives Verhalten. In Kombination mit GPT-6 Astra bei mittlerer Inferenzintensität erreichte GPT-Live-1 auch den ersten Platz im Tau3-Test. Tau3 wird hauptsächlich verwendet, um die Fähigkeit von Sprachagenten zu bewerten, End-to-End-Aufgaben zu erledigen.

Ein weiteres wichtiges Merkmal von GPT-Live-1 ist, dass es nicht für alle komplexen Argumentationsarbeiten verantwortlich ist. OpenAI trennt das Sprachmodell, das für das Zuhören, Sprechen und die Interaktion in Echtzeit verantwortlich ist, vom Hintergrundmodell, das für tiefes Denken verantwortlich ist. Wenn Benutzer Fragen stellen, die eine Suche, eine komplexe Analyse oder lange Aufgaben erfordern, kann GPT-Live-1 diese Aufgaben an das Hintergrundmodell übergeben und gleichzeitig die natürliche Sprachkommunikation mit dem Benutzer aufrechterhalten.

Entwickler haben daher die freie Wahl, Backend-Modelle basierend auf spezifischen Geschäftsanforderungen auszuwählen. Beispielsweise können für eine Vielzahl einfacher Aufgaben wie Reservierungen und Auftragsaktualisierungen schnellere und kostengünstigere Modelle genutzt werden; Bei komplexen Kundenproblemen können diese durch stärkere Inferenzmodelle behandelt werden. Diese Architektur ermöglicht es Entwicklern, ein Gleichgewicht zwischen Reaktionsfähigkeit, Argumentationsfähigkeiten und Nutzungskosten zu finden.

OpenAI gab an, dass dieses entkoppelte Design es GPT-Live-1 auch ermöglicht, weiterhin mit Benutzern zu kommunizieren, während Aufgaben im Hintergrund ausgeführt werden, anstatt den Benutzern eine lange Zeit des stillen Wartens zu überlassen. Das Modell kann ein natürliches Gespräch fortsetzen, während es komplexere Arbeiten im Hintergrund erledigt, und die Ergebnisse dann in das aktuelle Gespräch zurückbringen, wenn die Aufgabe abgeschlossen ist.

Praktische Anwendungen zeichnen sich bereits ab. Zu den ersten Beispielen von OpenAI gehören Sprachdienste wie Yelp Host und Hatch sowie die Sprachlernplattform Speak. Frühe Evaluierungen ergaben, dass GPT-Live-1 im Vergleich zu früheren rundenbasierten Sprachsystemen Sprachlernern mehr Zeit zum Nachdenken geben kann und die Anzahl der proaktiven Systemunterbrechungen für Benutzer um fast 80 % reduziert.

Für Unternehmen eignet sich diese Funktion besonders für Kundenservice, telefonischen Kundenservice, Reservierungen und andere Szenarien, die eine kontinuierliche Sprachinteraktion erfordern. GPT-Live-1 unterstützt Telefonszenarien nativ, sodass Entwickler damit Vollduplex-Sprachagenten erstellen können, die Telefonanrufe entgegennehmen und bearbeiten können, z. B. bei Restaurantreservierungen, beim Kundensupport und bei anderen Unternehmen, die Echtzeitkommunikation benötigen.

GPT-Live-1 bietet außerdem native automatische Spracherkennung für transkribierten Text und Modellantworttext, verbessert das Verständnis alphanumerischer Kombinationen und unterstützt gleichzeitig Keyword-Bias-Funktionen. Obwohl es sich nicht um ein rundenbasiertes Modell im herkömmlichen Sinne handelt, unterstützt es dennoch die Abbiegeerkennung nativ. Wenn Entwickler also klar steuern müssen, wann der Benutzer mit dem Sprechen aufhört und wann das System mit der Antwort beginnt, können sie ihre Anwendungen dennoch auf klare Dialogabläufe hin konzipieren.

GPT-Live-1 wurde auch für Szenen mit verrauschten Hintergrundumgebungen optimiert. Das Modell kann besser zwischen Benutzersprache, Hintergrundgeräuschen und Stille unterscheiden. Es unterbricht Gespräche nicht häufig aufgrund von Geräuschen in der Umgebung und erinnert Benutzer auch nicht ständig daran, wenn sie nur kurz nachdenken. Diese Funktion ist besonders wichtig für Telefonanrufe, Kundenservice und mobile Sprachassistenten in realen Umgebungen.

OpenAI hat außerdem die für GPT-Live-1 verfügbare Soundauswahl erweitert. Im Vergleich zu der bisher relativ begrenzten Anzahl an Echtzeitstimmen bietet die neue Version vielfältigere Stimmen und deckt eine größere Auswahl an Akzenten, Dialekten und Sprachen ab. OpenAI sagt, dass es in den kommenden Monaten weiterhin verfügbare Stimmen und Sprachen hinzufügen wird.

In Bezug auf die Modellbereitstellung müssen Entwickler nicht alle Aufgaben an GPT-Live-1 übergeben. OpenAI hofft, es als Front-End für die Sprachinteraktion in Echtzeit nutzen zu können und komplexere Aufgaben durch Hintergrundmodelle und Agenten-Frameworks zu übernehmen. Dieser Ansatz ermöglicht es Entwicklern auch, verschiedene Modelle entsprechend den tatsächlichen Anforderungen verschiedener Aufgaben zu kombinieren.

Entwickler können beispielsweise GPT-Live-1 damit betrauen, Sprachanfragen von Benutzern zu empfangen, natürliche Konversationen aufrechtzuerhalten und mit Unterbrechungen umzugehen, und dann Fragen, die eine komplexe Argumentation erfordern, an das Hintergrundmodell übergeben; Nachdem das Hintergrundmodell die Arbeit abgeschlossen hat, wandelt GPT-Live-1 die Ergebnisse in natürliche Sprachantworten um. Dieser Mechanismus gilt auch für Anwendungen, die externe Tools aufrufen müssen.

OpenAI demonstrierte auch, wie man GPT-Live-1 mit Tools wie Codex kombiniert. Entwickler können das Sprachmodell die vom Benutzer vorgeschlagenen Aufgaben empfangen lassen, dann den relevanten Kontext zur Verarbeitung an Hintergrundtools wie Codex übertragen und dann die Verarbeitungsergebnisse an GPT-Live-1 zurücksenden, das weiterhin per Sprache mit dem Benutzer kommuniziert.

Preislich ist GPT-Live-1 jetzt offiziell über die OpenAI-API verfügbar und das Sprach-Frontend kostet 0,05 $ pro Minute. Es ist wichtig zu beachten, dass es sich dabei nur um die Kosten für die Echtzeit-Sprachebene handelt. Wenn der Entwickler GPT-Live-1 mit einem Hintergrundinferenzmodell ausstattet, müssen die Kosten für den Aufruf des Hintergrundmodells anhand der entsprechenden Modellpreise separat berechnet werden.

Das bedeutet, dass für Geschäftsanwendungen, die eine große Anzahl von Sprachanrufen erfordern, die tatsächlichen Kosten nicht nur 0,05 $ pro Minute betragen, sondern sich aus der Sprachverbindungszeit und dem Inferenzverbrauch des Hintergrundmodells zusammensetzen. Allerdings können Entwickler die Gesamtkosten entsprechend der Komplexität der Aufgabe steuern, indem sie verschiedene Back-End-Modelle wählen.

Die Eröffnung von GPT-Live-1 bedeutet auch, dass OpenAI die Kerntechnologie hinter dem ChatGPT-Sprachmodus weiter von Verbraucherprodukten auf das Entwickler-Ökosystem ausdehnt. Zuvor existierte GPT-Live-1 hauptsächlich als Sprachinteraktionsfunktion von ChatGPT. Jetzt können Entwickler ähnliche Technologien direkt nutzen, um ihre eigenen Sprachanwendungen und Agenten zu erstellen.

Aus technischer Sicht hofft OpenAI, dass GPT-Live-1 nicht nur das Problem lösen wird, „der KI das Sprechen zu ermöglichen“, sondern es der KI auch ermöglichen wird, wirklich an kontinuierlichen, Echtzeit- und unterbrechbaren natürlichen Gesprächen teilzunehmen. Durch die Aufteilung von Zuhören, Sprechen, Echtzeitinteraktion und tiefem Denken versucht OpenAI, eine geringere Sprachlatenz, ein natürlicheres Gesprächserlebnis und gleichzeitig stärkere Fähigkeiten zur Verarbeitung von Hintergrundaufgaben zu erreichen.

Während sich Sprachagenten allmählich von einfachen Sprachfragen und -antworten zu komplexen Aufgaben wie telefonischer Kundenbetreuung, Reservierungen, Sprachunterricht, Geschäftsabwicklung und der Fähigkeit, selbstständig Tools zur Erledigung von Aufgaben aufzurufen, verlagern, nimmt auch die Bedeutung von Echtzeit-Sprachmodellen zu. Die offene API von GPT-Live-1 bedeutet, dass Entwickler nun die aktuelle Generation der von ChatGPT verwendeten Echtzeit-Sprachtechnologie direkt in ihre eigenen Produkte einbetten können, und der Sprachschichtpreis von 0,05 US-Dollar pro Minute ermöglicht dieser Funktion auch den offiziellen Eintritt in die kommerzielle Anwendungsphase.

Verwandte Tags

Ähnliche Artikel

Kommentare

0/500
Captcha (click to refresh)
Keine Kommentare