Das mobile ChatGPT-Terminal verfügt über eine sprachintelligente Agentenfunktion

📅 2026-09-24

Zusammenfassung:

OpenAI gab bekannt, dass die mobile ChatGPT-Anwendung damit begonnen hat, sprachbasierte intelligente Agentenfunktionen hinzuzufügen. In Zukunft können Benutzer nicht nur per Sprache mit ChatGPT chatten, sondern ihm auch direkt befehlen, komplexere praktische Arbeiten per Sprache auszuführen. Benutzer können ChatGPT beispielsweise bitten, ein Dokument zu erstellen, eine E-Mail zu verfassen, eine Slack-Nachricht zusammenzufassen oder sogar eine Reihe von Aufgaben auszuführen, für deren Ausführung mehrere Schritte erforderlich sind.

Der Kern dieses Updates besteht darin, die Agentic Work-Funktionen, die ChatGPT nach und nach dem Desktop hinzugefügt hat, auf Mobiltelefone zu übertragen. Für Plus- und Pro-Benutzer kann der Work-Tab auf dem Mobiltelefon jetzt direkt verwendet werden, um Dokumente zu erstellen, E-Mails zu entwerfen und Slack-Nachrichten zusammenzufassen. Es kann auch komplexere Arbeitsabläufe wie das Erstellen von Websites, das Erstellen von Präsentationen, die Verwendung von Cloud-Browsern und die Abwicklung finanzbezogener Aufgaben ausführen.

Für Free-and-Go-Benutzer konzentriert sich OpenAI auf die Verwendung von Plug-Ins und verbundenen Anwendungen. Dies bedeutet, dass Benutzer mit unterschiedlichen Abonnementstufen ChatGPT mit externen Tools und Anwendungen arbeiten lassen können, der konkrete Funktionsumfang jedoch unterschiedlich ist.

Dieses Update ändert auch das Verhalten des ChatGPT-Sprachmodus selbst. Laut OpenAI können Sprachgespräche jetzt eine umfassendere Textausgabe ermöglichen und Benutzer können bei der Kommunikation mit ChatGPT gleichzeitig vollständigere Textinformationen sehen. Außerdem können Benutzer einfacher zwischen Text- und Sprachmodus wechseln, ohne das aktuelle Gespräch beenden und von vorne beginnen zu müssen.

Kontinuierliches Arbeiten auf allen Geräten ist ebenfalls ein wichtiger Bestandteil dieses Updates. Benutzer können ChatGPT mit ihrem Mobiltelefon anweisen, mit der Verarbeitung einer Aufgabe per Spracheingabe zu beginnen, wenn sie unterwegs sind, und dann zum Computer zurückkehren, um die Aufgabe weiter anzuzeigen und abzuschließen. Mit anderen Worten: Das Mobiltelefon ist hauptsächlich dafür verantwortlich, jederzeit Anweisungen zu erteilen und Aufgaben zu starten, während der Desktop weiterhin komplexere Arbeitsabläufe bewältigen kann.

Diese Änderung steht im Zusammenhang mit den kontinuierlichen Investitionen von OpenAI in die Sprachinteraktion in den letzten Jahren. Im Juli dieses Jahres führte OpenAI ein neues GPT-Live-Sprachmodell ein, das sich auf die Verbesserung des natürlichen Dialogs, der Unterbrechungsverarbeitung und der kontinuierlichen Kommunikationsfähigkeiten konzentriert. Anschließend brachte OpenAI diese Sprachfunktion in Desktop-Anwendungen ein und ermöglichte es Benutzern, den intelligenten Agenten in ChatGPT zu steuern, über Sprache zu arbeiten oder Softwareentwicklungsaufgaben in Codex abzuschließen.

Frühere Desktop-Versionen ermöglichten es Benutzern bereits, komplexe mehrstufige Befehle per Sprache zu erteilen. Entwickler können ChatGPT beispielsweise direkt anweisen, einen neuen Code-Thread zu erstellen, eine Pull-Anfrage zu senden und die Grundursache einer Programmschwachstelle zu finden, ohne jeden Vorgang einzeln durchlaufen zu müssen. Dieses mobile Update folgt im Wesentlichen dieser Idee, erweitert jedoch die Sprachsteuerung und die Fähigkeiten intelligenter Agenten weiter auf Mobiltelefone.

OpenAI glaubt, dass Sprache für Menschen zu einer wichtigen Möglichkeit wird, mit KI zu interagieren, um komplexe Aufgaben zu erledigen. Anstatt anzuhalten und Text einzugeben, können Benutzer der KI beim Gehen, Pendeln oder anderen Dingen direkt über ihre Stimme mitteilen, was zu tun ist, und den intelligenten Agenten dann im Hintergrund weiter ausführen lassen.

Dieser Trend steht auch im Einklang mit OpenAIs früherer Positionierung der Sprachtechnologie. Das Unternehmen hat erklärt, dass es hofft, dass mit der weiteren Verbesserung der Modellfähigkeiten die Stimme irgendwann zu einer wichtigen Computerinteraktionsmethode wird und Benutzer der KI weiterhin befehlen können, immer komplexere und länger dauernde Aufgaben durch natürliche Sprache zu erledigen.

OpenAI demonstrierte diese Entwicklungsrichtung auch, als es im Juli dieses Jahres GPT-Live startete. Das neue Sprachmodell kann nicht nur Benutzerunterbrechungen natürlicher verarbeiten, sondern auch erweiterte Textmodelle für Such-, Argumentations- und Agentenaufgaben während der kontinuierlichen Sprachkommunikation aufrufen. Auf diese Weise ist der Sprachmodus nicht mehr nur eine Schnittstelle, die für das „Sprechen“ zuständig ist, sondern wird nach und nach zum Eingang zur Steuerung des gesamten KI-Arbeitssystems.

Dieses mobile Update bedeutet auch, dass OpenAI die Positionierung der mobilen ChatGPT-Anwendung schrittweise ändert. In der Vergangenheit war die mobile Version von ChatGPT hauptsächlich für Aufgaben wie Fragen und Antworten, Suchen, Schreiben und Voice-Chat zuständig. Jetzt können Benutzer einen kompletten Workflow direkt von ihrem Mobiltelefon aus starten und die KI den eigentlichen Vorgang in verbundenen Anwendungen und Tools erledigen lassen.

Gleichzeitig konkurriert der Ansatz von OpenAI auch mit der Richtung, die seine Konkurrenten einschlagen. Anthropic hat kürzlich auch die mobilen und Desktop-Kollaborationsfunktionen von Claude gestärkt und die Chat-Schnittstellen von Cowork und Claude weiter integriert, sodass Benutzer Aufgaben von mobilen Geräten aus initiieren und sie dann zur weiteren Bearbeitung auf den Desktop übertragen können. Allerdings haben die beiden Unternehmen immer noch unterschiedliche Auswahlmöglichkeiten in der Produktstruktur. OpenAI trennt immer noch die gewöhnliche Chat-Oberfläche von Arbeitsbereichen wie Work.

Der aktuellen Produkt-Roadmap von OpenAI zufolge werden Sprache, intelligente Agenten und geräteübergreifende Arbeit schrittweise integriert. In Zukunft müssen Benutzer nicht mehr unbedingt eine bestimmte Anwendung öffnen, bestimmte Schaltflächen finden und die Software dann Schritt für Schritt bedienen. Stattdessen können sie ihre Ziele direkt angeben, und ChatGPT ist dafür verantwortlich, die Aufgabe zu verstehen, Tools aufzurufen und mehrere Schritte auszuführen.

Dieses mobile Update fügt nicht nur eine Voice-Chat-Funktion hinzu, sondern ermöglicht ChatGPT auf dem Mobiltelefon auch die Möglichkeit, „Sprachbefehle zu verwenden“. Während OpenAI Produkte wie GPT-Live und Work weiter verbessert, wandelt sich der Sprachmodus von ChatGPT schrittweise von einem einfachen Konversationstool zu einem Portal, das Benutzer mit KI-Agenten, externen Anwendungen und tatsächlichen digitalen Arbeitsabläufen verbindet.

Verwandte Tags

Ähnliche Artikel

Kommentare

0/500
Captcha (click to refresh)
Keine Kommentare