Qwen veröffentlicht Qwen-Image-2.1 mit Transparenz und Bildbearbeitung

Alibabas KI-Sparte Qwen hat Qwen-Image-2.1 veröffentlicht, ein Open-Weight-Modell für Bildgenerierung und Bildbearbeitung mit einer visuellen Komponente von 7 Milliarden Parametern. Qwen stellt das Modell in einem offiziellen Blogbeitrag vor und nennt Transparenz, Bearbeitung mehrerer Vorlagen und effizientere Berechnungen als zentrale Neuerungen.

Das Modell soll Bilder nicht nur aus Texteingaben erzeugen. Es kann vorhandene Bilder verändern, einzelne Bereiche gezielt bearbeiten und Motive aus Fotos freistellen. Außerdem kann es Bilder direkt mit transparentem Hintergrund erstellen. Damit bündelt Qwen Funktionen, für die Kreativteams bislang oft mehrere Werkzeuge einsetzen.

Die visuelle Generierungskomponente von Qwen-Image-2.1 umfasst laut Anbieter 32 Single-Stream-DiT-Schichten und 7 Milliarden Parameter. Qwen bezeichnet das System als vergleichsweise kompakt. In einem unternehmenseigenen Benchmark liege es auf einem Niveau mit vielen offenen und geschlossenen Bildmodellen. Diese Bewertung stammt jedoch vom Anbieter selbst und lässt sich anhand des Beitrags nicht unabhängig überprüfen.

Transparente Ebenen direkt erzeugen und bearbeiten

Eine zentrale Neuerung ist die native Unterstützung von Transparenz. Qwen-Image-2.1 kann auf Grundlage einer Anweisung entscheiden, ob es ein normales Bild oder eine Datei mit Transparenzkanal ausgibt. Ein Transparenzkanal legt fest, welche Bildbereiche sichtbar und welche durchsichtig sind.

Das ist etwa für Produktbilder, Gestaltungselemente, Präsentationen und Social-Media-Grafiken relevant. Solche Dateien lassen sich später auf unterschiedlichen Hintergründen verwenden. Nach Angaben von Qwen kann das Modell auch transparente Bilder bearbeiten, ohne den transparenten Hintergrund zu verlieren. Es soll beispielsweise Gesichtsausdrücke oder Schrift innerhalb einer transparenten Ebene verändern können.

Auch aus normalen Fotos kann das Modell ein gewünschtes Motiv ausschneiden und als RGBA-Datei ausgeben. Dieses Format enthält Farbwerte und Transparenzinformationen. Freigestellte Personen oder Gegenstände lassen sich dadurch einfacher in neue Layouts und Bildkompositionen übernehmen.

Mehrere Vorlagen und präzise Eingriffe

Qwen-Image-2.1 unterstützt bis zu zehn Referenzbilder in einer Anfrage. Der Anbieter zeigt Anwendungsfälle wie Gruppenporträts aus einzelnen Aufnahmen, virtuelle Anproben mit mehreren Kleidungsstücken und Raumgestaltungen aus verschiedenen Möbelbildern.

Für lokale Änderungen bietet das Modell mehrere Steuerungsmöglichkeiten:

  • Farbige Kreise können verschiedene Bearbeitungsbereiche kennzeichnen.
  • Gemalte Markierungen zeigen, wo neue Inhalte entstehen sollen.
  • Separate Masken begrenzen die Änderung, ohne das Ausgangsbild zu verdecken.

Nach Angaben von Qwen wurde auch die Bildtreue verbessert. Bei Porträts soll die Identität einer Person bei Änderungen besser erhalten bleiben. Bei Produkten will das Modell Schriftzüge, Formen und Oberflächen konsistenter bewahren. Gerade für Handel und Marketing ist das wichtig. Dennoch sollten Anwender Ergebnisse prüfen, denn generative Bildmodelle können Details verfälschen, Texte verändern oder unpassende Elemente ergänzen.

Als weitere Aufgaben nennt Qwen die Erstellung von Panoramen, Infografiken und Storyboards. Ein Selfie kann demnach zu einer breiteren Szene erweitert werden. Aus einem Foto eines Produkts oder Models soll eine ausführliche Infografik entstehen können. Figurenansichten lassen sich als Grundlage für Bildfolgen verwenden.

Für schnellere Verarbeitung setzt Qwen nach eigenen Angaben auf eine Architektur mit unterschiedlich fein arbeitenden Attention-Mechanismen sowie auf KV-Cache-Wiederverwendung. Vereinfacht gesagt, kann das System Referenzbilder und Bearbeitungsanweisungen als festen Kontext speichern. Das soll bei Aufgaben mit mehreren Eingabebildern Rechenaufwand und Speicherbedarf senken.

Qwen-Image-2.1 erscheint als Open-Weight-Modell. Entwickler und Unternehmen können die Gewichte damit unter den jeweiligen Nutzungsbedingungen selbst einsetzen und anpassen. Mit Transparenz, mehreren Referenzen und gezielter Bereichsbearbeitung richtet sich das Modell vor allem an professionelle Bildworkflows, nicht nur an die reine Prompt-basierte Bildgenerierung.

Bleib auf dem Laufenden

KI für Contentprofis: die neuesten Tools, Tipps und Trends. Alle 14 Tage in deine Inbox:

 

Weitere Infos …

Über den Autor

Mehr zum Thema:

×