Das Qwen-Team hat Qwen VLo vorgestellt, ein nach eigener Beschreibung einheitliches multimodales Modell für Bildverständnis und Bilderzeugung. Die als Vorschau gekennzeichnete Version ist über Qwen Chat verfügbar; das Unternehmen weist zugleich auf mögliche ungenaue, inkonsistente und instabile Ergebnisse hin.
Was die Vorschau können soll
Nach Angaben des Teams können Nutzende Bilder aus Textanweisungen erzeugen und hochgeladene Bilder per Anweisung verändern. Als Beispiel nennt der Blogbeitrag, einer Katze in einem Bild eine Kappe hinzuzufügen.
Darüber hinaus soll Qwen VLo bestehende Bildinformationen annotieren können, darunter Objekterkennung, Segmentierung und Kantenerkennung. Der Beitrag nennt außerdem Mehrsprachigkeit, einschließlich Chinesisch und Englisch.
Technisch beschreibt Qwen die Bilderzeugung als progressiven Prozess, bei dem ein Bild von links nach rechts und von oben nach unten aufgebaut wird. Diese Beschreibung stammt vom Anbieter; unabhängige Tests oder Vergleichswerte enthält das vorliegende Material nicht.
Bedeutung und Einordnung
Die Ankündigung bündelt Verständnis-, Bearbeitungs-, Annotierungs- und Generierungsaufgaben in einem angekündigten Modell. Für Nutzende von Qwen Chat bedeutet die Vorschau, dass diese Funktionen laut Anbieter an einem Zugangspunkt ausprobiert werden können.
Wie zuverlässig die Fähigkeiten unter unterschiedlichen Eingaben arbeiten, bleibt offen. Die vorliegenden Informationen stammen ausschließlich aus dem offiziellen Blogbeitrag von Qwen; eine unabhängige Bestätigung der Leistungsangaben liegt nicht vor.
Bekannte Grenzen
Qwen betont, dass sich Qwen VLo noch im Preview-Stadium befindet. Während der Generierung könne es zu Ungenauigkeiten, Abweichungen vom Ausgangsbild, einer unzureichenden Befolgung von Anweisungen sowie zu Instabilität beim Erkennen und Verstehen der Absicht hinter erzeugten Bildern kommen.
Mehrere Bild-Eingaben sind laut Beitrag noch nicht offiziell veröffentlicht. Gleiches gilt für die Erzeugung von Bildern mit extremen Seitenverhältnissen.
Wie es weitergeht
Entscheidend wird sein, ob Qwen die genannten noch nicht veröffentlichten Funktionen bereitstellt und ob die in der Vorschau eingeräumten Qualitäts- und Stabilitätsprobleme in einer späteren Version reduziert werden.
Änderungsvermerk: Erstfassung auf Grundlage einer offiziellen Ankündigung von Qwen vom 26. Juni 2025.