Google veröffentlicht die digitale menschliche Interaktionsfunktion Gemini 3.8 Live Live Avatar, die der KI Echtzeit-Videogesichter verleiht

📅 2026-09-25

Zusammenfassung:

Google gab bekannt, dass es die Funktion „Live Avatar“ (digitaler Echtzeit-Mensch) in der Unternehmensplattform Gemini Enterprise offiziell eingeführt hat. Diese Technologie ist tief in die neueste Großmodellarchitektur Gemini 3.8 Live von Google integriert. Basierend auf der ursprünglichen nahezu verzögerungsfreien und äußerst flüssigen Sprachkonversation werden erstmals generative Videogenerierungsfunktionen nahezu in Echtzeit eingeführt, die es der künstlichen Konversationsintelligenz ermöglichen, ein dynamisches visuelles Bild zu erstellen, das „gleichzeitig zuhören, sehen und sprechen“ kann.

Laut der offiziellen Einführung soll Gemini 3.8 Live Live Avatar einen intuitiveren und immersiveren virtuellen Serviceassistenten für Unternehmenskunden schaffen. Durch die genaue Synchronisierung des Audiostreams mit dem zugrunde liegenden Videogenerierungsmodell kann das System eine hochpräzise Lippensynchronisierung, natürliche Änderungen des Gesichtsausdrucks und eine reibungslose sprachübergreifende Dialogkonvertierung erreichen. Derzeit unterstützt das digitale menschliche System nativ bis zu 97 Sprachen, und es kommt zu keiner Videoverzerrung oder Gesichtsverzerrung, wenn während eines Gesprächs zwischen den Sprachen gewechselt wird.

Zusätzlich zu den visuellen Durchbrüchen ist die Plattform auch mit leistungsstarken asynchronen Werkzeugaufruffunktionen ausgestattet. Während digitale Menschen eine natürliche und kohärente Konversation mit Benutzern aufrechterhalten, können sie im Hintergrund stillschweigend verschiedene externe APIs und Unternehmensdatenschnittstellen aufrufen, um komplexe mehrstufige Vorgänge wie die Registrierung des Hotel-Check-ins und das Ausfüllen von Versicherungsanspruchsdokumenten abzuwickeln. Damit verabschieden sie sich vollständig von dem Phänomen des „Absturzes“ oder des langen stillen Wartens, das bei der Verarbeitung von Hintergrundaufgaben durch KI in der Vergangenheit auftrat. Gleichzeitig kann der digitale Mensch in Kombination mit der Kamera- und Bildschirmfreigabefunktion des Endgeräts auch ein visuelles Verständnis in Echtzeit und eine interaktive Führung der vom Benutzer angezeigten physischen Objekte oder Softwareschnittstellen ermöglichen.

Um das Risiko von Deepfakes und Identitätsdiebstahl durch künstliche Intelligenz zu verhindern, hat Google im Hinblick auf Sicherheit und Compliance mehrere Sicherheitsverteidigungslinien für Live Avatar eingerichtet. Standardmäßig öffnet das System Unternehmensbenutzern nur die digitale Bibliothek menschlicher Bilder, die durch offizielle Überprüfung voreingestellt wurde, während die Berechtigung zum Anpassen exklusiver Markenbilder oder bestimmter Gesichter einem strengen Whitelist-Überprüfungsmechanismus unterliegt. Darüber hinaus wurden alle vom System generierten Echtzeit-Sprach- und dynamischen Videostreams mit unsichtbaren und nicht manipulierbaren digitalen Wasserzeichen von SynthID eingebettet, um die Transparenz und Rückverfolgbarkeit von KI-generierten Inhalten zu gewährleisten.

Derzeit sind die Funktionen von Gemini 3.8 Live und Live Avatar über US-amerikanische und europäische Rechenzentrums-Serviceknoten offiziell für Abonnementkunden auf Unternehmensebene geöffnet, und gleichzeitig wird Entwickler-API-Zugriffsunterstützung bereitgestellt. Branchenanalysten wiesen darauf hin, dass die direkte Integration generativer Videotechnologie in das zugrunde liegende Sprachmodell nicht nur die hohe Latenz beseitigt, die durch herkömmliche Video-Rendering-Suiten verursacht wird, sondern auch darauf hinweist, dass der virtuelle KI-Kundenservice und intelligente interaktive Terminals in eine neue Ära des „visuellen Dialogs mit realen Personen und in Echtzeit“ eintreten.

Verwandte Tags

Ähnliche Artikel

Kommentare

0/500
Captcha (click to refresh)
Keine Kommentare