Schema: Links ein Foto einer Küche, rechts der Satz „die Tasse links neben dem Laptop“. Beide führen über einen Bildteil und einen Sprachteil in eine gemeinsame Vergleichsebene. Von dort zeigt ein Pfeil zurück auf das Foto, wo ein Rechteck genau die gemeinte Tasse umschließt.

Spatial Grounding

Spatial Grounding bedeutet, dass ein Computerprogramm eine sprachliche Beschreibung mit einer konkreten Stelle in einem Bild oder in einem Raum verbindet. Das Programm sagt also nicht nur, was zu sehen ist, sondern auch, wo genau es sich befindet.

Wenn jemand sagt « gib mir die Tasse links neben dem Laptop », muss man zwei Dinge leisten. Man muss die Wörter verstehen, und man muss den passenden Punkt in der Umgebung finden. Genau diese Verknüpfung von Sprache und Ort nennt man Spatial Grounding, auf Deutsch etwa räumliche Verankerung. Ein Programm bekommt ein Bild und einen Satz und markiert danach die Stelle, die gemeint ist. Meist geschieht das durch einen Rahmen um das Objekt, manchmal auch durch Koordinaten in einem echten Raum. Der Unterschied zu einfacher Bilderkennung ist wichtig: Es geht nicht um die Frage « Was ist das? », sondern um « Welches davon meinst du? ».

Warum Roboter ohne Ortsangabe hilflos sind

Ein Sprachmodell kann einen Text über eine Küche schreiben, ohne je eine Küche gesehen zu haben. Ein Roboterarm kann das nicht. Er braucht eine Zahl, einen Punkt, eine Richtung. Ohne Spatial Grounding bleibt jede noch so kluge Antwort für eine Maschine unbenutzbar, weil sie sich nicht in eine Bewegung übersetzen lässt.

Dasselbe gilt für Software, die einen Computer selbstständig bedienen soll. Solche Systeme sollen etwa einen Flug buchen oder ein Formular ausfüllen. Dafür müssen sie den richtigen Knopf auf dem Bildschirm treffen, nicht nur wissen, dass es einen gibt. Klickt das System zehn Pixel daneben, ist die gesamte Aufgabe gescheitert. Genauigkeit im Raum entscheidet hier über Erfolg oder Misserfolg.

Es gibt außerdem einen Sicherheitsaspekt. Ein System, das Beschreibungen nur ungefähr verortet, kann in der Medizin oder im Straßenverkehr gefährliche Fehler machen. « Das Fahrzeug rechts vor dir » muss eindeutig ein bestimmtes Auto meinen. Deshalb testen Fachleute Modelle gezielt auf ihre Fähigkeit, zwischen mehreren ähnlichen Objekten zu unterscheiden.

Vom Satz zum Rahmen im Bild

Technisch arbeiten heutige Systeme mit zwei Teilen, die aufeinander abgestimmt werden. Ein Bildteil zerlegt das Foto in viele kleine Felder und beschreibt jedes davon durch eine Zahlenreihe. Ein Sprachteil macht dasselbe mit dem Satz. Beide Zahlenreihen liegen anschließend im selben Format vor, sodass man sie direkt vergleichen kann.

Danach sucht das Modell die Bildfelder, deren Zahlen am besten zur Beschreibung passen. Aus diesen Feldern berechnet es die vier Werte eines Rechtecks: links, oben, Breite, Höhe. Beim Training bekommt es Millionen von Bildern mit von Menschen gezeichneten Rahmen. Liegt sein Rechteck daneben, wird der Fehler zurückgerechnet und die internen Werte werden leicht angepasst. Nach vielen Durchläufen trifft das Modell zuverlässig.

Schwierig sind Beziehungen zwischen Objekten. « Der Becher hinter der Flasche » verlangt, dass das Modell die Flasche zuerst findet und dann die Tiefe im Bild abschätzt. Solche Präpositionen sind bis heute eine typische Fehlerquelle. Ein verbreiteter Irrtum ist, dass ein Modell mit guter Objekterkennung automatisch gut im Grounding sei. Es kann alle Objekte korrekt benennen und trotzdem am Wort « links » scheitern.

Vom Handyfoto bis zum Lagerroboter

Im Alltag steckt Spatial Grounding in der Bildersuche des Smartphones. Man tippt « roter Rucksack » ein und bekommt nicht nur das Foto, sondern oft auch die Stelle darauf markiert. Auch Übersetzungs-Apps, die Text in der Kamera überlagern, verankern Sprache an einem Ort im Bild. Brillen mit eingeblendeten Informationen funktionieren nach demselben Prinzip.

In den Wirtschaftsnachrichten taucht der Begriff meist im Zusammenhang mit Robotik auf. Lagerroboter, Erntemaschinen und Küchenroboter brauchen alle diese Fähigkeit. Wenn ein Unternehmen ein Modell vorstellt, das Anweisungen in Handlungen umsetzt, ist Spatial Grounding fast immer der entscheidende Baustein.

Fachleute vergleichen Systeme über feste Testsammlungen mit vorgegebenen Bildern und Sätzen. Gemessen wird, wie stark sich der vorhergesagte Rahmen mit dem richtigen überschneidet. Übliche Werte liegen bei modernen Modellen zwischen 80 und 90 Prozent Trefferquote. In unaufgeräumten, realen Umgebungen fallen diese Zahlen jedoch deutlich ab.

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.