

FLUX 3
#2 in Text-zu-VideoBlack Forest Labs · v3 · 25× · zuletzt 25. Juli 2026
FLUX 3 ist das erste multimodale Foundation-Modell von Black Forest Labs (BFL), das über reine Bildgenerierung hinausgeht. Es lernt gemeinsam aus Bildern, Videos und Audio in einer einheitlichen Architektur und kann Text-zu-Video, Bild-zu-Video, Video-zu-Video sowie Keyframe-zu-Video mit nativ synchronisiertem Audio erzeugen, bis zu 20 Sekunden Länge pro Generierung. Zusätzlich wird die Architektur auf Aktionsvorhersage für Robotik erweitert (z.B. Kooperation mit mimic robotics unter dem Namen FLUX-mimic). Das Modell wurde am 23. Juli 2026 als "FLUX 3 Video" im Early Access veröffentlicht; ein offener Gewichtssatz ("FLUX 3 Dev") sowie weitere Modi wie FLUX 3 Image und FLUX 3 Action sollen in den kommenden Wochen folgen. Konkrete Angaben zu Preis, maximaler Auflösung und Generierungszeit wu