Black Forest Labs FLUX 3 ist ein multimodales Modell für Bild und Video

Das deutsche Startup Black Forest Labs hat mit FLUX 3 ein neues KI-Modell vorgestellt. Es soll Bilder sowie Videos mit passendem Ton erzeugen und zugleich als Grundlage für Robotik dienen. Zunächst gibt das Unternehmen den Zugang nur im Rahmen eines genehmigungspflichtigen Frühzugangs frei.

Nach Angaben von Black Forest Labs erstellt FLUX 3 Video aus einer Texteingabe Clips von bis zu 20 Sekunden Länge. Das Modell kann auch Standbilder animieren, vorhandene Videos umgestalten, Bild und Ton aus Eingabematerial fortsetzen sowie Übergänge zwischen festgelegten Schlüsselbildern erzeugen. Zu jedem Video gehört ein nativ generierter Ton.

Der zentrale Anspruch des Unternehmens liegt im gleichzeitigen Training des Modells mit Bildern, Videos und Audio. Black Forest Labs setzt damit nicht auf mehrere getrennte Modelle, die später verbunden werden. Stattdessen soll FLUX 3 räumliche Beziehungen, Bewegungen, Geräusche und Ursache-Wirkungs-Zusammenhänge in einem gemeinsamen Modell erfassen. Sprache liefert dabei Vorgaben, Ziele und abstrakte Begriffe.

Werkzeug für Inhalte, Bearbeitung und längere Sequenzen

Die technische Grundlage nennt Black Forest Labs Self Flow. Dieser Ansatz soll Verstehen und Generieren verschiedener Medienformen in derselben Architektur verbinden. Das Unternehmen erklärt, es habe Rechenleistung und Datenbestand deutlich erweitert, um FLUX 3 gleichzeitig mit Bild, Video und Audio zu trainieren.

Für Kreativ- und Content-Teams sind vor allem die Video-Funktionen relevant. Genannt werden Text-zu-Video, Bild-zu-Video, Video-zu-Video, die Erzeugung über Schlüsselbilder, mehrsprachige Dialoge und animierte Typografie. Auch unterschiedliche Bildformate und visuelle Stile sollen möglich sein.

Ein weiterer Punkt ist die Verknüpfung einzelner Clips zu längeren Sequenzen. Dabei sollen Bildreferenzen helfen, Figuren und zentrale Motive über mehrere Szenen hinweg konsistent zu halten. Genau diese Kontinuität ist für viele professionelle Produktionen wichtiger als die Qualität eines einzelnen kurzen Clips.

Black Forest Labs sieht frühe Stärken bei Gesichtsausdrücken, bei der Zuordnung von Geräuschen zu sichtbaren Ereignissen und bei mehrsprachigen Ausgaben. Für FLUX 3 Image verspricht das Unternehmen zudem ein besseres Verständnis komplexer Anweisungen und eine präzisere Darstellung von Text. Die Bildfunktion steht jedoch noch nicht bereit. Ein Frühzugang soll in den kommenden Wochen folgen.

Das Unternehmen veröffentlicht erste Vergleichswerte für zehn Sekunden lange Videos in 720p mit Ton. In menschlichen Präferenztests sei FLUX 3 gegenüber Luma Ray 3.2 in 93 Prozent der Vergleiche bevorzugt worden, gegenüber Runway Gen 4.5 in 77 Prozent. Gegen Gemini Omni Flash und Seedance 2.0 lag der Wert jeweils bei 52 Prozent.

Diese Angaben sind mit Vorbehalt zu lesen. Black Forest Labs bezeichnet die Tests selbst als vorläufig. VentureBeat vermerkt zudem, dass Angaben zu Testmethode, Stichprobengröße, Zahl der Bewerter und Preisen fehlen. Die veröffentlichten Werte beziehen sich außerdem auf einen früheren Modellstand und nicht zwingend auf die endgültige Version.

Robotik als zweites Einsatzfeld

Mit Mimic Robotics entwickelt Black Forest Labs außerdem FLUX mimic, ein Modell für Video und Aktionsvorhersage. Die Partner wollen zeigen, dass ein auf Bewegungen und physikalische Veränderungen vortrainiertes Videomodell Roboter schneller für neue Greif- und Manipulationsaufgaben anlernen kann. Mimic Robotics erklärt, einige Aufgaben ließen sich mit nur 30 Minuten Roboterdaten anpassen. Eine unabhängige Überprüfung dieser Aussage liegt bislang nicht vor.

Geplant sind vier Produktbereiche: FLUX 3 Video, FLUX 3 Image, FLUX 3 Action und FLUX 3 Dev. Video und Action sind vorerst nur nach bestätigter Bewerbung verfügbar. Preise, öffentliche APIs und verbindliche Leistungszusagen hat Black Forest Labs noch nicht genannt. Mit FLUX 3 Dev sind offene Modellgewichte für eine multimodale Grundlage vorgesehen. Zeitpunkt, Lizenz, Modellgröße und Hardware-Anforderungen bleiben offen.

Quellen

Bleib auf dem Laufenden

KI für Contentprofis: die neuesten Tools, Tipps und Trends. Alle 14 Tage in deine Inbox:

 

Weitere Infos …

Über den Autor

Mehr zum Thema:

×