
Variational Autoencoder
Ein Variational Autoencoder ist ein neuronales Netz, das Daten wie Bilder in eine kompakte mathematische Beschreibung umwandelt und aus dieser Beschreibung neue, ähnliche Daten erzeugen kann. Er bildet eine der Grundlagen generativer KI und wird etwa zur Bilderzeugung und Datenkompression eingesetzt.
Ein Variational Autoencoder ist ein neuronales Netz — also ein System, das aus Beispielen lernt —, das zwei Aufgaben gleichzeitig erledigt. Es lernt, Daten wie Bilder oder Texte auf eine sehr kompakte Form zu reduzieren. Und es lernt, aus dieser kompakten Form wieder neue Daten zu erzeugen, die den gelernten ähneln, aber nicht identisch sind. Damit gehört der Variational Autoencoder zu den sogenannten generativen Modellen: Modellen, die nicht nur erkennen, sondern auch erschaffen. Er wurde 2013 von den Forschern Diederik Kingma und Max Welling vorgestellt und beeinflusst bis heute, wie moderne Bildgeneratoren aufgebaut sind.
Warum generative Modelle den VAE brauchen
Vor dem VAE gab es bereits einfachere Autoencoder. Diese können Daten komprimieren und rekonstruieren, aber nicht sinnvoll interpolieren. Interpolieren bedeutet: einen Mittelweg zwischen zwei Beispielen finden. Fragt man einen einfachen Autoencoder nach etwas, das zwischen einem Hund und einer Katze liegt, bekommt man häufig Bildrauschen statt eines plausiblen Tieres.
Der VAE löst dieses Problem. Er zwingt das Modell dazu, seinen internen Darstellungsraum geordnet zu halten. Ähnliche Dinge liegen dann im internen Raum auch nah beieinander, und der Übergang zwischen zwei Punkten ergibt immer noch etwas Sinnvolles. Das macht ihn zu einem echten Werkzeug zur Datenerzeugung — nicht nur zur Datenkopie.
Diese Eigenschaft ist praktisch wertvoll. Wer neue Trainingsdaten braucht, wer Bilder sanft verändern will oder wer ein Modell trainieren möchte, ohne Millionen echter Beispiele zu haben, kann einen VAE einsetzen, um realistisch wirkende Variationen zu erzeugen.
Encoder, Latenzraum und Decoder
Ein VAE besteht aus zwei Teilen. Der erste Teil heißt Encoder. Er nimmt ein Eingabebild — zum Beispiel ein Gesichtsfoto — und berechnet daraus eine kompakte Beschreibung. Diese Beschreibung heißt latenter Vektor, also ein Punkt in einem mehrdimensionalen Zahlenraum, dem sogenannten Latenzraum. Dieser Raum hat vielleicht 128 oder 256 Dimensionen, während ein hochauflösendes Bild Millionen von Pixeln hat. Die Verdichtung ist also enorm.
Der entscheidende Unterschied zum einfachen Autoencoder: Der VAE-Encoder berechnet nicht einen festen Punkt, sondern eine Wahrscheinlichkeitsverteilung — konkret einen Mittelwert und eine Streuung. Aus dieser Verteilung wird dann zufällig ein Punkt gezogen. Das klingt nach einem Fehler, ist aber Absicht. Durch diese Zufälligkeit lernt der Latenzraum, glatt und zusammenhängend zu sein.
Der zweite Teil heißt Decoder. Er nimmt einen Punkt aus dem Latenzraum und baut daraus wieder ein Bild auf. Beim Training wird das erzeugte Bild mit dem Original verglichen, und beide Teile lernen gemeinsam. Am Ende kann man einen beliebigen Punkt im Latenzraum wählen — auch einen, den das Modell im Training nie gesehen hat — und erhält trotzdem ein realistisches Bild.
VAEs in Produkten und aktueller Forschung
Variational Autoencoder stecken in vielen Systemen, die heute in den Nachrichten auftauchen. Bildgeneratoren wie Stable Diffusion verwenden eine Variante namens Latent Diffusion Model. Dabei übernimmt ein VAE die Vor- und Nachbereitung: Er komprimiert ein Bild in den Latenzraum, ein anderes Modell arbeitet dort, und der Decoder baut das Ergebnis wieder zu einem Bild aus. Ohne den VAE würde die Berechnung auf den vollen Pixeln laufen — das wäre um ein Vielfaches teurer.
In der Medizin werden VAEs genutzt, um aus wenigen echten Patientendaten viele synthetische Datensätze zu erzeugen. Das ist nützlich, weil echte Patientendaten aus Datenschutzgründen schwer zu beschaffen sind. In der Pharmaindustrie helfen VAEs, neue Molekülstrukturen zu erkunden: Man bewegt sich durch den Latenzraum und prüft, welche generierten Moleküle vielversprechende Eigenschaften haben könnten.
Inzwischen gibt es leistungsfähigere Alternativen zum VAE, etwa Diffusionsmodelle oder GANs (also Systeme, bei denen zwei Netze gegeneinander trainieren). Der VAE gilt dennoch als wichtiger Schritt in der Geschichte generativer KI. Wer verstehen will, wie moderne Bildgeneratoren denken, kommt am VAE nicht vorbei.