Das Unternehmen für künstliche Intelligenz, Cohere, hat am Donnerstag sein erstes Sprachmodell Transcribe veröffentlicht. Hierbei handelt es sich um ein Open-Source-Modell zur automatischen Spracherkennung (ASR), das hauptsächlich für die Aufzeichnung von Sprache in Text, die Analyse von Sprachinhalten und andere Szenarien verwendet wird. Die Modellparametergröße beträgt etwa 2 Milliarden und ist als „leichte“ Lösung positioniert, die einfach auf Verbraucher-GPUs ausgeführt werden kann und für den Einsatz durch Unternehmen und Entwickler mit Selbsthosting-Anforderungen geeignet ist.

Transcribe unterstützt derzeit 14 Sprachen, darunter Englisch, Französisch, Deutsch, Italienisch, Spanisch, Portugiesisch, Griechisch, Niederländisch, Polnisch, Chinesisch, Japanisch, Koreanisch, Vietnamesisch und Arabisch. Cohere sagte, dass Transcribe auf der Open ASR-Liste von Hugging Face eine durchschnittliche Wortfehlerrate (WER) von 5,42 erreichte und damit Modelle wie Zoom Scribe v1, IBM Granite 4.0 1B, ElevenLabs Scribe v2 und Qwen3-ASR-1.7B Speech in diesem Benchmark übertraf.
In Bezug auf die menschliche Bewertung sagte Cohere, dass Transcribe im Vergleich zu anderen Modellen eine durchschnittliche Erfolgsquote von 61 % hatte, als menschliche Prüfer die Transkriptionsergebnisse hinsichtlich Genauigkeit, Konsistenz und Benutzerfreundlichkeit verglichen. Allerdings gab das Unternehmen auch zu, dass die Leistung des Modells in Sprachen wie Portugiesisch, Deutsch und Spanisch immer noch etwas schlechter ist als bei einigen Konkurrenzprodukten.
In Bezug auf die Leistung besagen die von Cohere angegebenen Daten, dass Transcribe etwa 525 Minuten Audio pro Minute verarbeiten kann, was im Vergleich zu ähnlichen Modellen auf einem hohen Niveau liegt. Cohere plant, das Sprachmodell in North, seine Agent-Orchestrierungsplattform für Unternehmen, zu integrieren und über die API des Unternehmens frei zugänglich zu machen. Gleichzeitig wird Transcribe auch auf der gehosteten Inferenzplattform Model Vault von Cohere gelistet, was es für Kunden einfacher macht, es direkt aufzurufen.
Spracherkennungsmodelle als Ganzes erfreuen sich rasanter Beliebtheit, da die Nachfrage nach Sprachnotizen und diktatbasierten Anwendungen wie Granola und Wispr Flow weiter wächst. In diesem Zusammenhang versucht Cohere, durch Open-Source-, leichtgewichtige und mehrsprachige Unterstützung in den Markt einzutreten und eine selbst gehostete und benutzerfreundliche Sprachinfrastruktur für Unternehmen bereitzustellen, die ihre Daten- und Bereitstellungsumgebung kontrollieren möchten.
Anfang des Jahres wurde berichtet, dass Cohere im Jahr 2025 einen jährlichen wiederkehrenden Umsatz (ARR) von rund 240 Millionen US-Dollar erzielen würde, und Firmenchef Aidan Gomez wurde mit den Worten zitiert, das Startup könne „wahrscheinlich bald“ an die Börse gehen.