Alibaba veröffentlicht Qwen3.8-Omni-Flash, mit mehreren Leistungen, die sich Gemini 3.8 Flash nähern

📅 2026-09-18

Zusammenfassung:

Das Qwen-Team von Alibaba hat kürzlich eine neue Generation des nativen, vollmodalen Modells Qwen3.8-Omni-Flash veröffentlicht, das Audio- und Videoverständnis mit KI-Agentenfähigkeiten weiter kombiniert.

Das Modell unterstützt vier Eingabeformen: Text, Bild, Audio und Video und bietet ein Kontextfenster mit 1 Million Tokens. Im Vergleich zur Vorgängergeneration Qwen3.5-Omni-Plus haben Qwen-Beamte behauptet, dass die durchschnittliche Punktzahl in 29 Benchmark-Tests um mehr als 25 % gestiegen ist und gleichzeitig die Kosten für Audio- und Audio- und Videoverarbeitung deutlich gesenkt wurden.

1789705181_banner-latest.en.webp

Eine der größten Änderungen in Qwen3.8-Omni-Flash besteht darin, dass es nicht einfach Spracherkennung, Bilderkennung und andere Funktionen zusammenfügt, sondern stattdessen verschiedene Arten von Informationen auf Modellebene nativ verarbeitet. Alibaba hofft, dies nutzen zu können, damit das Modell nicht nur Audio- und Videoinhalte „verstehen“ oder „verstehen“ kann, sondern nach dem Verständnis dieser Informationen auch weitere Aufgaben planen, Tools aufrufen und die eigentliche Arbeit abschließen kann.

In Bezug auf die Audiofähigkeiten ist die Leistung von Qwen3.8-Omni-Flash besonders herausragend. Laut von Qwen veröffentlichten Daten hat dieses Modell in einigen Audio-Benchmark-Tests Gemini 3.8 Flash übertroffen. Beispielsweise erzielte Qwen3.8-Omni-Flash im multimodalen Tool-Aufruftest WildClawBench-MM 71,0 Punkte, während Gemini 3.8 Flash 58,9 Punkte erzielte; im DailyOmni-Test erzielte Qwen 85,1 Punkte und Gemini 84,0 Punkte; im SpotSoundBench erzielten die beiden 67,2 bzw. 39,7 Punkte; im MMAU-Test erreichten sie 81,8 Punkte und 76,9 Punkte.

Die Spracherkennung bei Konferenzen mit mehreren Sprechern steht ebenfalls im Mittelpunkt dieses Upgrades. Die von Qwen veröffentlichten AliMeeting-Testdaten zeigen, dass die Sprecherfehlerrate DER von Qwen3.8-Omni-Flash 3,35 und die Wortfehlerrate cpWER mit Sprecherzuordnung 17,18 beträgt, während die vorherige Generation von Qwen3.5-Omni-Plus 88,11 bzw. 89,61 beträgt. Das bedeutet, dass sich das neue Modell in diesem Test deutlich verändert.

Allerdings liegt Qwen3.8-Omni-Flash nicht in allen Projekten vor Gemini 3.8 Flash. Beispielsweise erzielte Gemini 3.8 Flash im AgenticVBench-Test 45,0 Punkte und Qwen 36,8 Punkte; in OmniGAIA erreichten sie 78,6 bzw. 74,0 Punkte. Auch in einigen Tests zum Videoverständnis behauptete Gemini seinen Vorsprung. Daher spiegelt sich Qwens Schwerpunkt auf der „Annäherung an Zwillinge“ eher in den gesamten Audio- und Audio- und Videofähigkeiten wider und bedeutet nicht einen Gesamtvorsprung bei allen multimodalen Projekten.

Eine weitere wichtige Änderung bei Qwen3.8-Omni-Flash ist der Preis. Laut Qwen sind die geschätzten Kosten pro Stunde für die Audioeingabe im Vergleich zum Vorgängermodell um mehr als 98 % und die Kosten pro Stunde für die Audio- und Videoeingabe um mehr als 93 % gesunken. Gemäß der offiziellen Berechnungsmethode werden die sogenannten „stündlichen“ Kosten berechnet, indem der Verarbeitungspreis von zwei Minuten Material mit 30 multipliziert wird, wobei das Video die Eingabebedingung 720p und 1 Bild pro Sekunde annimmt.

Der aktuelle internationale regionale Preis, der von Alibaba Cloud bekannt gegeben wird, beträgt 0,15 US-Dollar pro Million eingegebener Token, der eingegebene Token, der in den Cache gelangt, beträgt 0,016 US-Dollar und der ausgegebene Token pro Million beträgt 0,47 US-Dollar. Die Preise auf dem chinesischen Festland und in einigen anderen Regionen können variieren. Da Audio und Video direkt als Modelleingaben verwendet werden können, eignet sich diese Preisstruktur besonders für Szenarien wie Besprechungsaufzeichnung, lange Audioanalyse, Videoüberprüfung, Untertitelgenerierung und Verarbeitung großer Mengen an Medieninhalten.

Das 1-Millionen-Token-Kontextfenster verstärkt diesen Vorteil noch weiter. Die maximale Eingabelänge von Qwen3.8-Omni-Flash liegt bei nahezu 992.000 Token, die maximale Eingabelänge im Denkmodus beträgt etwa 984.000 Token und die maximale Ausgabelänge erreicht 131.000 Token. Dies bedeutet, dass Entwickler sehr umfangreiche Audio- oder Videoinhalte direkt zur Verarbeitung an das Modell übergeben können, ohne wie in der Vergangenheit häufig Frames zerlegen und extrahieren zu müssen, und dann mehrere Modelle verwenden können, um die Spracherkennung, das visuelle Verständnis bzw. das Textargumentieren zu vervollständigen.

Die offiziellen Informationen von Alibaba Cloud zeigen, dass Qwen3.8-Omni-Flash Audioeingaben in 113 Sprachen und Dialekten verarbeiten kann und räumliche Audioanalyse unterstützt. Durch relevante Parameter kann das Modell Zweikanal-Stereo und Vierkanal-Raumaudio verarbeiten. Gleichzeitig unterstützt das Modell Funktionsaufrufe, Netzwerksuche, Kontext-Caching und andere Funktionen und kann direkt in komplexeren Agenten-Workflows verwendet werden.

Aus Sicht der Anwendungsrichtung konzentriert sich das Qwen-Team dieses Mal auf die „intelligente Bereitstellung“. Beispielsweise kann das Modell lange Videos analysieren, wichtige Inhalte lokalisieren und weitere Anruftools zur Durchführung von Aufgaben wie Videobearbeitung, Inhaltsorganisation, Besprechungszusammenfassung und Untertitelgenerierung bereitstellen. Qwen kündigte außerdem Qwen-MM-Plugins für die Entwicklung multimodaler Agenten an und plant die Einführung von Qwen-Live-Harness, um Entwickler beim weiteren Aufbau intelligenter Agentenanwendungen auf Basis von Audio- und Videoeingaben zu unterstützen.

Im Vergleich zur Vorgängergeneration Qwen3.5-Omni liegt der Schwerpunkt dieses Upgrades nicht nur auf der Verbesserung der Erkennungsgenauigkeit im herkömmlichen Sinne, sondern auch auf dem Versuch, die Art und Weise zu ändern, wie Audio- und Video-KI verwendet wird. In der Vergangenheit erforderten multimodale Anwendungen in der Regel das Extrahieren von Videobildern und das Transkribieren von Audiodaten sowie die anschließende Übergabe der unterschiedlichen Ergebnisse an das Sprachmodell zur Verarbeitung. Qwen3.8-Omni-Flash versucht, diese Links so weit wie möglich in einem nativen vollmodalen Modell zu vereinheitlichen und verwendet 1 Million Token-Kontexte, um längere Originalinhalte direkt zu verarbeiten.

Qwen3.8-Omni-Flash bietet derzeit Dienste über Alibaba Cloud Bailian an und unterstützt Regionen wie Peking, Singapur, Hongkong, China, Tokio, Japan, Frankfurt (Deutschland) und Virginia (USA). Das Modell selbst öffnet die Gewichte nicht direkt wie bei einigen Vorgängermodellen von Qwen. Alibaba öffnet dieses Mal hauptsächlich die unterstützenden multimodalen Plug-Ins und zugehörigen Entwicklungstools.

Insgesamt besteht der Kern dieses Qwen3.8-Omni-Flash-Updates nicht nur darin, die Modelllaufergebnisse zu verbessern, sondern gleichzeitig die Kosten für die Bassvideoverarbeitung zu senken, die Kontextskala zu erweitern und das Audio- und Videoverständnis mit dem Aufruf von Tools zu kombinieren. Insbesondere wurden die Kosten für die Audioeingabe um mehr als 98 % gesenkt. Wenn die tatsächlichen Nutzungskosten das offizielle Berechnungsniveau erreichen können, wird die groß angelegte automatische Analyse von Langzeitaufzeichnungen von Besprechungen, Podcasts, Live-Übertragungen und Videomaterialien einfacher und der Wettbewerb zwischen Qwen und multimodalen Modellen wie Google Gemini weiter verschärft.

Verwandte Tags

Ähnliche Artikel

Kommentare

0/500
Captcha (click to refresh)
Keine Kommentare