Schematischer Ablauf: Ein Eingabebild wird in gleichmäßige Kacheln zerschnitten, jede Kachel wird in einen Vektor umgewandelt, alle Vektoren zusammen ergeben die Einbettung, die an ein Sprachmodell weitergegeben wird.

Vision-Encoder

Ein Vision-Encoder ist der Teil eines KI-Modells, der ein Bild in eine Liste von Zahlen übersetzt, mit der das Modell weiterrechnen kann. Er ist die Grundlage dafür, dass KI-Systeme Bilder und Text gemeinsam verstehen können.

Ein Vision-Encoder ist der Teil eines KI-Modells, der ein Bild in eine Form bringt, mit der das Modell rechnen kann. Ein Computer sieht kein Bild so wie ein Mensch — er sieht zunächst nur eine große Tabelle mit Farbwerten, einen Zahlenwert pro Bildpunkt. Das allein nützt wenig. Der Vision-Encoder verarbeitet diese Rohdaten und erzeugt stattdessen eine kompakte Liste von Zahlen, die den Inhalt des Bildes beschreibt: Objekte, Formen, räumliche Beziehungen. Diese Liste nennt man Einbettung oder Embedding. Erst mit dieser Einbettung kann ein Modell sinnvolle Schlüsse ziehen — etwa, was auf dem Bild zu sehen ist oder wie es zu einem dazugehörigen Text passt.

Warum der Vision-Encoder der Schlüssel zu multimodalen Modellen ist

Sprach-KI und Bild-KI sprechen ursprünglich unterschiedliche Sprachen. Sprachmodelle arbeiten mit Textstücken, Vision-Encoder mit Pixeln. Damit ein Modell beides gleichzeitig verarbeiten kann — also Fragen über Bilder beantworten oder Bilder zu einer Beschreibung erzeugen — braucht es eine gemeinsame Darstellung. Der Vision-Encoder übersetzt das Bild in genau dieses Format.

Ohne einen leistungsfähigen Vision-Encoder scheitert das gesamte System an Kleinigkeiten: Ein Modell, das einen Graphen nicht korrekt liest, liefert falsche Zahlen. Eines, das Text auf einem Straßenschild nicht erkennt, ist für autonomes Fahren unbrauchbar. Die Qualität des Encoders bestimmt deshalb direkt, wie präzise das Gesamtsystem ist. Das erklärt, warum Forschungsgruppen den Vision-Encoder oft separat trainieren und austauschen, ohne das restliche Modell anfassen zu müssen.

Vom Bildpunkt zur Einbettung: was der Vision-Encoder intern tut

Die meisten modernen Vision-Encoder folgen einem Ansatz namens Vision Transformer, kurz ViT. Das Bild wird dafür zunächst in gleichmäßige quadratische Kacheln zerschnitten, oft 14×14 oder 16×16 Pixel groß. Jede Kachel wird in eine Zahl umgewandelt und wie ein Wort in einem Satz behandelt. Der Encoder schaut dann, wie diese Kacheln zueinander in Beziehung stehen — ähnlich wie ein Sprachmodell prüft, welche Wörter im Satz zusammengehören.

Das Ergebnis ist eine Folge von Vektoren — das sind geordnete Zahlenlisten, je einer pro Kachel. Zusammen bilden sie die Einbettung des gesamten Bildes. Ein wichtiger Unterschied zu älteren Methoden: Der Vision Transformer muss nicht zuerst Kanten und Linien explizit erkennen, bevor er Objekte findet. Er lernt direkt aus Beispielen, welche Muster wichtig sind — ohne dass jemand diese Regeln von Hand festlegt.

Ein weit verbreiteter Vision-Encoder heißt CLIP, entwickelt von OpenAI. CLIP wurde nicht mit beschrifteten Bildern trainiert, sondern mit Millionen von Bild-Text-Paaren aus dem Internet. Ziel war es, Bilder und passende Textbeschreibungen möglichst ähnliche Einbettungen zuzuweisen. Dadurch kann CLIP nicht nur erkennen, was auf einem Bild ist, sondern auch einschätzen, wie gut ein Text dazu passt.

Vision-Encoder in Produkten und aktuellen KI-Systemen

GPT-4o, Gemini und Llama 3.2 sind Beispiele für Modelle, die einen Vision-Encoder mit einem Sprachmodell kombinieren. Wer ChatGPT ein Foto hochlädt und fragt, was darauf zu sehen ist, schickt das Bild zuerst durch einen Vision-Encoder. Dessen Ausgabe wird dann zusammen mit dem Text der Frage ins Sprachmodell eingespeist. Beide Informationsströme laufen also zusammen, bevor eine Antwort entsteht.

Auch abseits von Chatbots ist der Vision-Encoder allgegenwärtig. Google Lens nutzt ihn, um Objekte auf Fotos zu identifizieren. Medizinische Bildgebungssysteme setzen ihn ein, um Röntgenaufnahmen automatisch auszuwerten. In der Qualitätskontrolle in Fabriken erkennen Vision-Encoder Produktionsfehler auf Kameraaufnahmen schneller als ein Mensch.

Ein häufiger Irrtum ist, Vision-Encoder mit vollständigen Bilderkennungssystemen gleichzusetzen. Ein Vision-Encoder allein gibt keine Antwort aus — er liefert nur eine Zahlenrepräsentation, die ein nachgelagertes Modell erst interpretieren muss. Er ist also ein Werkzeug innerhalb eines größeren Systems, kein eigenständiges Produkt.

Produkten dorto

Aktuelle Narichten

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.