Das Qwen Team hat Qwen2.5-Omni veröffentlicht und nach eigenen Angaben auf Hugging Face, ModelScope, DashScope und GitHub offen verfügbar gemacht. Das Unternehmen positioniert das Modell als neues multimodales Flaggschiff seiner Qwen-Reihe.

Quellenlage
PrimärquelleQwen Blog
Bestätigt durch1 unabhängiger Ursprung · 1 Quellen insgesamt
OffenDie Lizenzbedingungen und technischen Einsatzanforderungen werden im Dossier nicht genannt.

Eingaben aus vier Modalitäten, Antworten als Text und Sprache

Laut dem offiziellen Qwen-Blog verarbeitet Qwen2.5-Omni Texte, Bilder, Audio und Video. Als Ausgaben soll das Modell sowohl Text erzeugen als auch natürliche Sprache synthetisieren; beides soll als Streaming-Antwort erfolgen.

Damit verbindet die Ankündigung Wahrnehmung über mehrere Datenarten mit zwei Ausgabeformen in einem Modell. Praktisch relevant ist das vor allem für Anwendungen, die visuelle und akustische Informationen gemeinsam verarbeiten und unmittelbar antworten sollen. Der Blog liefert jedoch keine unabhängige Prüfung dazu, wie gut dies unter realen Einsatzbedingungen funktioniert.

Die Variante Qwen2.5-Omni-7B kann dem Beitrag zufolge auch über Qwen Chat ausgewählt werden.

Thinker-Talker und zeitliche Audio-Video-Ausrichtung

Als technische Grundlage beschreibt Qwen eine „Thinker-Talker“-Architektur. Sie soll multimodale Eingaben verarbeiten und parallel gestreamte Text- sowie Sprachausgaben erzeugen.

Zusätzlich nennt das Team TMRoPE, ausgeschrieben „Time-aligned Multimodal RoPE“. Diese Positionskodierung soll Zeitstempel von Videoeingaben mit Audio synchronisieren. Die Ankündigung legt damit einen Schwerpunkt auf Aufgaben, bei denen das zeitliche Zusammenspiel von Bild und Ton relevant ist.

Aus dem vorliegenden Material geht nicht hervor, welche Modelllizenz gilt, welche Hardware-Anforderungen bestehen oder welche konkreten Latenz-, Qualitäts- und Sicherheitswerte bei der Nutzung erreicht werden.

Leistungsangaben stammen vom Hersteller

Qwen erklärt, Qwen2.5-Omni erreiche bei OmniBench, einer Aufgabe mit der Integration mehrerer Modalitäten, Spitzenleistung. Diese Aussage ist eine Herstellerangabe aus dem offiziellen Blog.

Eine unabhängige Bestätigung der Benchmark-Ergebnisse oder ein Vergleich unter einheitlichen Testbedingungen mit anderen Modellen liegt im Dossier nicht vor. Daher lässt sich auf Basis der verfügbaren Quelle nicht bewerten, wie belastbar der behauptete Vorsprung ist oder wie er sich auf konkrete Anwendungen übertragen lässt.

Nächste Entwicklungsziele

Für die nähere Zukunft nennt Qwen zwei Ziele: eine bessere Befolgung von Sprachbefehlen und ein stärkeres gemeinsames Verständnis von Audio und Video. Einen Zeitplan, konkrete Produktversionen oder Messgrößen dafür nennt der Beitrag nicht.

Wie es weitergeht

Entscheidend wird sein, ob unabhängige Evaluierungen die Leistungsangaben bestätigen und ob Qwen weitere Details zu Lizenz, Betrieb und den angekündigten Verbesserungen bei Sprachbefehlen sowie Audio-Video-Verständnis veröffentlicht.

Änderungsvermerk: Erstfassung auf Grundlage eines offiziellen Qwen-Team-Blogbeitrags; Leistungsangaben sind ausdrücklich als Herstellerangaben gekennzeichnet.