
Landmark Detection
Landmark Detection ist ein Verfahren, bei dem ein KI-Modell auf Bildern oder in Videos bestimmte markante Punkte eines Objekts — etwa die Augenwinkel, Mundwinkel oder Nasenspitze in einem Gesicht — automatisch erkennt und deren genaue Position bestimmt. Diese Koordinaten dienen als Grundlage für viele Anwendungen, von Gesichtsfiltern in sozialen Netzwerken bis zur medizinischen Bildanalyse.
Landmark Detection bezeichnet das automatische Auffinden bestimmter Schlüsselpunkte auf einem Objekt in einem Bild. Ein Modell berechnet für jeden dieser Punkte eine genaue Position — angegeben als Koordinaten auf dem Bild. Bei einem Gesicht sind das zum Beispiel die beiden Augenwinkel, die Nasenspitze und die vier Mundwinkel. Das Ergebnis ist keine Beschreibung wie „da ist ein Gesicht“, sondern eine genaue Karte: Punkt 1 liegt bei Pixel 142/89, Punkt 2 bei 198/91 — und so weiter für alle definierten Punkte. Wie viele Punkte erkannt werden, hängt vom Modell und vom Anwendungsfall ab: einfache Systeme arbeiten mit 5 Punkten im Gesicht, spezialisierte mit 68, 98 oder noch mehr.
Warum die genaue Punktposition so viel leistet
Eine grobe Erkennung sagt nur: „Auf diesem Bild ist ein Gesicht.“ Landmark Detection sagt zusätzlich, wo genau jeder Teil dieses Gesichts sitzt. Das ist der Unterschied zwischen einer Postleitzahl und einer Hausnummer. Erst mit den genauen Koordinaten kann ein System das Bild sinnvoll weiterverarbeiten.
Ein Beispiel: Um Brillen virtuell anzuprobieren, muss die App wissen, wo genau die Augenbrauen und die Nasenbrücke sitzen — nicht nur, ob ein Gesicht vorhanden ist. Bewegt sich der Kopf, müssen die Landmarks in jedem einzelnen Videobild neu berechnet werden, damit die Brille exakt mitsitzt. Ähnliches gilt für die Erkennung von Emotionen: Aus der relativen Position von Mundwinkeln und Augenbrauen lässt sich ableiten, ob jemand lächelt oder die Stirn runzelt.
Landmark Detection ist außerdem eine Vorstufe für viele komplexere Aufgaben. Soll ein Modell prüfen, ob zwei Fotos dieselbe Person zeigen, normalisiert es zuerst beide Gesichter anhand der Landmarks — dreht und skaliert sie so, dass die Augen immer an derselben Stelle sind. Erst dann vergleicht es die Gesichter. Ohne diesen Schritt wäre der Vergleich deutlich unzuverlässiger.
Wie ein Modell die Punkte findet
Trainiert wird ein solches Modell mit Tausenden von Bildern, auf denen Menschen die Schlüsselpunkte von Hand eingezeichnet haben. Das Modell lernt dabei nicht, was ein „Mundwinkel“ begrifflich ist — es lernt, aus Mustern in Pixelfarben und -kontrasten vorherzusagen, wo der nächste Punkt wahrscheinlich liegt. Das Ergebnis des Trainings sind Gewichte, also interne Zahlenwerte des Modells, die diese Vorhersage ermöglichen.
In der Praxis arbeiten viele Systeme zweistufig. Zuerst findet ein einfaches Modell das Gesicht grob im Bild. Dann übernimmt ein zweites, spezialisiertes Modell nur den ausgeschnittenen Gesichtsbereich und bestimmt die genauen Punktpositionen. Diese Aufteilung spart Rechenzeit, weil das präzise Modell nur einen kleinen Bildausschnitt verarbeiten muss statt das gesamte Bild.
Ein bekannter Ansatz verwendet sogenannte Heatmaps: Das Modell gibt für jeden Punkt nicht direkt eine Koordinate aus, sondern eine Wahrscheinlichkeitskarte — ein kleines Bild, das zeigt, wie wahrscheinlich der gesuchte Punkt an jeder Stelle sitzt. Der hellste Fleck auf dieser Karte ist dann die vorhergesagte Position. Diese Methode ist robuster als eine direkte Koordinatenvorhersage, weil das Modell Unsicherheiten besser ausdrücken kann.
Landmark Detection in Produkten und Schlagzeilen
Am sichtbarsten ist Landmark Detection in den Kamerafiltern von Instagram, Snapchat oder TikTok. Wenn eine App in Echtzeit Hundeohren aufs Gesicht legt oder den Mund vergrößert, steckt dahinter Landmark Detection, die in jedem Frame — also jedem Einzelbild des Videos — die Gesichtspunkte neu berechnet. Dasselbe gilt für die automatische Porträtschärfe vieler Smartphones: Die Kamera-Software erkennt Augen als Landmarks und stellt darauf scharf.
In der Medizin wird das Verfahren für die Analyse von Röntgen- und MRT-Aufnahmen eingesetzt. Radiologen markieren auf solchen Aufnahmen bestimmte anatomische Punkte, um Winkel zu messen oder Wachstumsveränderungen zu verfolgen. KI-Systeme übernehmen diese Aufgabe zunehmend automatisch und reproduzierbarer als von Hand.
Auch in der Ganzkörperanalyse — etwa für Sportwissenschaft oder Physiotherapie — spielt Landmark Detection eine Rolle. Systeme wie Googles MediaPipe erkennen bis zu 33 Körperpunkte in Echtzeit, von den Schultern über die Hüften bis zu den Zehenspitzen. Damit lässt sich zum Beispiel die Lauftechnik eines Sportlers auf Haltungsfehler analysieren — ohne spezielle Anzüge oder Sensoren, nur mit einer normalen Kamera.