Qwen 3.8 Omni-Flash: Neues Modell mit Unterstützung für multimodale Eingaben und lange Kontextverarbeitung

Das neue, native multimodale Modell Qwen 3.8-Omni-Flash wurde am 18. September offiziell gestartet. Es unterstützt die Eingabe von Text, Bildern, Audio und Videos und kann Kontexte von bis zu 1M verarbeiten. Basierend auf dem Verständnis des Inhalts kann es Aufgaben selbstständig planen, Werkzeuge aufrufen und kreative Arbeiten sowie deren Lieferung abschließen.

Qwen 3.8-Omni-Flash verbessert die Audio- und Videoverarbeitung

Funktional gesehen erweitert Qwen 3.8-Omni-Flash, während es die Programmier-, Textverarbeitungs- und GUI-Fähigkeiten beibehält, weiter die Verarbeitungskapazitäten für Audio- und Videoaufgaben. Bei der Analyse von langen Videos kann das Modell mit Inhalten von mehreren Stunden umgehen, indem es basierend auf Fragen entscheidet, welche Bilder und Toninformationen relevant sind, und durch mehrfache Beweisaufnahme die Schlüsselinhalte lokalisiert. In Kombination mit Werkzeugen kann das Modell auch Protokolle, To-Do-Listen und Risikoinformationen aus Meetings extrahieren und anschließend Aufgaben wie das Versenden von E-Mails, das Schreiben von Code oder das Abrufen multimodaler Daten zur Erstellung von Berichten ausführen.

Im Bereich der Audio- und Videoerstellung kann das Modell in Szenarien wie der Produktion von Musikvideos, der Übersetzung von Kurzstücken und der Kommentierung von langen Filmen eingesetzt werden. Zum Beispiel kann das Modell bei der Erstellung von Musikvideos die Struktur, den Rhythmus und die Emotionen eines Songs verstehen und zeitgestempelte Satztexte ausgeben; bei der Übersetzung von Kurzstücken kann es Charaktererkennung, umgangssprachliche Übersetzung, Sprachsynthese, Audio-Remixing und Qualitätskontrolle des Endprodukts durchführen; bei der Verarbeitung von langen Filmen kann es die Handlung extrahieren, die Kommentierung planen, Synchronisation und Musikuntermalung durchführen sowie den Schnitt und die finale Qualitätskontrolle übernehmen.

Darüber hinaus kann das Modell Inhalte aus langen Videos in wiederverwendbare Informationsressourcen umwandeln, einschließlich der automatischen Aufbereitung von Wissenspunkten, der Zerlegung von Schritten, der Erstellung von PDF-Notizen mit Bild-Text-Korrespondenz und der weiteren Umwandlung in validierte und getestete Agent Skills. Die Echtzeit-Version Qwen 3.8-Omni-Flash-Realtime kann während des Audio- und Video-Streaming-Prozesses gleichzeitig Wahrnehmung und Reaktion durchführen und ist für Szenarien wie mündliches Üben, räumliche Audio-Wahrnehmung und intelligenten Kundenservice geeignet.

Im Rahmen der Unterstützung hat die offizielle Seite auch die Qwen-MM-Plugins erweitert und mehrere neue Fähigkeiten für das Verständnis und die Erstellung von Audio- und Videoinhalten hinzugefügt. Außerdem wurde Qwen-Live Harness als Open Source bereitgestellt, um kontinuierliche, Echtzeit-Interaktionen und Aufgabenausführungen zu ermöglichen. Laut offiziellen Daten hat Qwen 3.8-Omni-Flash im Vergleich zur vorherigen Generation Qwen 3.5-Omni-Plus in insgesamt 30 Tests die durchschnittliche Punktzahl um über 26 % verbessert; gleichzeitig ist der Preis für Audioeingaben über die API um über 98 % gesenkt worden, und der Preis für Videoeingaben um über 93 %.

Das Modell ist mittlerweile auf der Qianwen AI-Plattform verfügbar.

Originalinhalt
Dieser Artikel ist die deutsche Fassung eines Originalbeitrags von TechRitual.
Stein Yep
Stein Yep