Schematischer Ablauf eines Diffusion Transformers: Ein verrauschtes Bild wird in gleichgroße Patches aufgeteilt, die zusammen mit einem Textbefehl in den Transformer-Block eingegeben werden. Nach mehreren Entrauschungsschritten entsteht ein fertiges Bild.

Diffusion Transformer

Ein Diffusion Transformer ist eine Architektur für KI-Bildgeneratoren, die zwei bewährte Prinzipien kombiniert: das schrittweise Entrauschen von Bildern und die Verarbeitungsstruktur moderner Sprachmodelle. Er bildet die Grundlage vieler aktueller Bild- und Videogeneratoren, darunter Sora und Stable Diffusion 3.

Wenn ein KI-System ein Bild erzeugt, fängt es oft mit reinem Rauschen an — also einem Bild voller zufälliger Pixel — und verfeinert es schrittweise, bis ein scharfes Ergebnis entsteht. Dieses Verfahren heißt Diffusion. Lange hat man dafür eine bestimmte Netzwerkform verwendet, das sogenannte U-Net, das Bilder in seiner Struktur wie Schichten einer Zwiebel behandelt. Ein Diffusion Transformer ersetzt dieses U-Net durch eine andere Grundstruktur: den Transformer. Transformer sind ursprünglich aus der Textverarbeitung bekannt — sie stecken etwa in ChatGPT. Die Idee des Diffusion Transformers ist, diese bewährte Struktur auch für die Bildgenerierung zu nutzen.

Warum die Wahl der Grundstruktur zählt

Das U-Net war jahrelang der Standard für Diffusionsmodelle und funktioniert gut für Bilder fester Größe. Es hat aber einen entscheidenden Nachteil: Es skaliert schlecht. Das bedeutet, ein größeres U-Net bringt irgendwann kaum noch bessere Ergebnisse, egal wie viel Rechenleistung man hineinwirft.

Transformer zeigen genau das Gegenteil. Je größer sie werden und je mehr Daten sie sehen, desto besser werden sie — fast ohne Obergrenze. Diese Eigenschaft nennt man Skalierbarkeit. Wer also bessere Bilder mit mehr Rechenaufwand erzeugen will, ist mit einem Transformer als Grundlage besser bedient. Das ist der eigentliche Grund, warum die Branche auf Diffusion Transformer umgestiegen ist.

Hinzu kommt, dass Transformer gleichzeitig Text und Bild verarbeiten können. Das macht es einfacher, aus einem Textbefehl wie „Sonnenuntergang über einem Gebirge“ ein passendes Bild zu erzeugen — der Transformer versteht beide Eingaben in derselben Sprache.

Vom Rauschen zum Bild: der Ablauf im DiT

Damit ein Transformer mit Bildern arbeiten kann, muss das Bild erst in eine für ihn passende Form gebracht werden. Bilder bestehen aus Millionen Pixeln — zu viele, um sie direkt zu verarbeiten. Deshalb teilt das Modell das Bild zuerst in kleine, gleichgroße Kacheln auf, sogenannte Patches. Jede Kachel wird als eine Art Datenpunkt behandelt, ähnlich wie ein Wort in einem Text. Der Transformer kann dann über alle Kacheln gleichzeitig nachdenken.

Anschließend beginnt das eigentliche Entrauschen. Das Modell erhält ein verrauschtes Bild und eine Anweisung — zum Beispiel den Textbefehl — und muss schätzen, welches Rauschen es entfernen soll. Dieser Schritt wird viele Male wiederholt, typischerweise zwanzig bis tausend Mal, bis ein klares Bild entsteht. Jede Wiederholung verbessert das Ergebnis ein kleines Stück.

Der entscheidende Mechanismus im Transformer heißt Attention, zu Deutsch etwa Aufmerksamkeit. Er erlaubt dem Modell, jede Kachel des Bildes mit jeder anderen in Beziehung zu setzen. Dadurch kann das Modell globale Zusammenhänge erfassen: Wenn links im Bild eine Sonne ist, weiß das Modell, dass der Himmel rechts warm gefärbt sein sollte.

DiTs in aktuellen Produkten und Forschungsdebatten

Der Begriff wurde 2022 durch eine Forschungsarbeit von William Peebles und Xinchen Shen geprägt, die zeigten, dass Transformer U-Nets bei der Bildqualität überflügeln können. Seitdem ist die Architektur zum neuen Standard geworden. Stable Diffusion 3 und sein Nachfolger nutzen Diffusion Transformer als Kern. Auch Midjourney und Adobe Firefly arbeiten mit verwandten Ansätzen.

Besonders viel Aufmerksamkeit bekam die Architektur, als OpenAI im Februar 2024 das Videogenerierungsmodell Sora vorstellte. OpenAI bestätigte, dass Sora auf einem Diffusion Transformer basiert — und zwar einem, der auch mit Videos unterschiedlicher Länge und Auflösung umgehen kann, weil Patches flexibel im dreidimensionalen Raum (Breite, Höhe, Zeit) gebildet werden.

In Tech-News taucht der Begriff vor allem dann auf, wenn neue Bildgeneratoren vorgestellt oder verglichen werden. Ein häufiger Irrtum: Manche verwechseln den Diffusion Transformer mit dem Transformer-Modell aus der Textverarbeitung. Beide teilen dieselbe Grundstruktur, sind aber für völlig unterschiedliche Aufgaben trainiert. Ein Diffusion Transformer schreibt keine Texte — er entrauscht Bilder.

Produkte dazu

Aktuelle News

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.