Google führt Gemini 3.5 Transcribe ein, um die Sprach-zu-Text-Genauigkeit weiter zu verbessern

📅 2026-08-27

Zusammenfassung:

Google hat kürzlich Gemini 3.5 Transcribe veröffentlicht, das neueste Speech-to-Text-Modell der Gemini-Reihe, und nennt es das genaueste Spracherkennungsmodell der Reihe. Dieses Modell steht Entwicklern, Unternehmen und normalen Benutzern offen und konzentriert sich auf die Verbesserung der Transliterationsfähigkeiten in lauten Umgebungen, bei komplexen Fachbegriffen und bei natürlichen gesprochenen Ausdrücken.

Berichten zufolge kann Gemini 3.5 Transcribe Hintergrundgeräusche und komplexes Vokabular in Berufsfeldern besser verarbeiten. Laut Google bringt das neue Modell Leistungsverbesserungen für die Gemini-App auf der macOS-Plattform und die Rambler-Funktion der Gboard-Tastatur auf der Android-Plattform. Entwickler können dieses Modell verwenden, um Anwendungen wie Sprachagenten, Echtzeit-Untertiteltools und Analyseprozesse nach dem Anruf zu erstellen.

Google sagte, dass Gemini 3.5 Transcribe darauf ausgelegt ist, die natürlichen Sprechmuster der Benutzer zu erfassen, um semantische Absichten genauer zu verstehen, benutzerdefiniertes Vokabular zu identifizieren und Benutzern dabei zu helfen, Aufgaben per Sprache zu erledigen.

Auf funktionaler Ebene fügt das neue Modell eine Reihe von Optimierungsfunktionen hinzu, darunter automatische Selbstkorrektur, Löschung gesprochener Füllwörter wie „um“ und „ah“ und automatische Formatierung von Ausgabetext. Gleichzeitig können komplexere Aufgaben wie Dateianalyse und Bildgenerierung an andere Gemini-Modelle delegiert werden, um eine umfassendere Zusammenarbeit mit mehreren Modellen zu ermöglichen.

In Bezug auf die Genauigkeit wies Google darauf hin, dass die durchschnittliche Wortfehlerrate von Gemini 3.5 Transcribe in Streaming-Spracherkennungsszenarien 4,0 % beträgt und in Nicht-Streaming-Szenarien auf 2,6 % reduziert werden kann. Das Modell weist eine bessere Transkriptionsleistung in lauten Umgebungen auf und kann wichtige, aus Buchstaben und Zahlen bestehende Informationen wie Bestellnummern und Postleitzahlen genauer identifizieren.

In Bezug auf die Sprachunterstützung deckt Gemini 3.5 Transcribe derzeit 85 Sprachen ab und unterstützt regionale Akzente und verschiedene Dialekte. Bei vorab aufgezeichneten Audiodaten kann eine zeitgestempelte Sprachzuordnungserkennung für bis zu drei Sprecher durchgeführt werden. Darüber hinaus kann sich das Modell an benutzerdefinierte Vokabulare anpassen, um Fachbegriffe, spezielle Schreibweisen und Branchennamen zu identifizieren.

Gemini 3.5 Transcribe ist derzeit als öffentliche Vorschau über die Gemini API in Google AI Studio und Google Antigravity verfügbar. Normale Benutzer können verwandte Funktionen auf Android- und macOS-Plattformen erleben. Google plant auch die Einführung im Chrome-Browser, wo Nutzer Text direkt per Sprache in das Eingabefeld einer beliebigen Webseite eingeben können.

Vor kurzem hat Google die Weiterentwicklung der Gemini-Produktlinie weiter beschleunigt. Das Unternehmen hatte zuvor Gemini 3.7 Flash auf den Markt gebracht, um sich dem immer härter werdenden Preiswettbewerb für KI-Modelle zu stellen; Gemini in Chrome für Android wurde auch für alle Benutzer in den USA geöffnet, und Gemini Assistant ist auch in die neue Generation selbstfahrender Taxis von Waymo eingestiegen.

Verwandte Tags

Ähnliche Artikel

Kommentare

0/500
验证码
Keine Kommentare