
Backbone
Ein Backbone ist der zentrale Kernteil eines neuronalen Netzes, der rohe Eingabedaten – etwa ein Bild oder einen Text – in eine strukturierte, maschinenlesbare Form umwandelt, mit der andere Systemteile weiterarbeiten. Wer verstehen will, wie KI-Modelle intern aufgebaut sind, stößt auf diesen Begriff fast immer als erstes.
Ein neuronales Netz – also ein Rechensystem, das grob nach dem Vorbild des menschlichen Gehirns gebaut ist und aus Eingaben lernt – besteht meist aus mehreren Teilen mit unterschiedlichen Aufgaben. Der Backbone ist der Teil, der die Hauptarbeit bei der Verarbeitung übernimmt. Er nimmt rohe Daten entgegen, zum Beispiel die Pixelwerte eines Fotos oder die Wörter eines Satzes, und rechnet daraus eine kompakte, strukturierte Darstellung heraus. Diese Darstellung nennt man auch Feature-Repräsentation – sie fasst zusammen, was das Modell in den Daten erkannt hat. Erst danach kommt ein kleinerer, spezialisierter Teil des Netzes, der aus dieser Darstellung eine konkrete Antwort macht: ein Etikett, eine Wahrscheinlichkeit, eine übersetzte Zeile.
Warum der Backbone das Herzstück eines Modells ist
Die Qualität eines KI-Systems hängt zum Großteil davon ab, wie gut sein Backbone die Eingabedaten versteht. Ein schwacher Backbone liefert eine schlechte Darstellung – und selbst der klügste nachgelagerte Teil kann daraus keine guten Ergebnisse mehr retten. Das lässt sich mit dem Fundament eines Hauses vergleichen: Alles, was darauf gebaut wird, steht und fällt mit seiner Stabilität.
Deshalb werden Backbones häufig auf riesigen Datenmengen vortrainiert, bevor man sie für eine konkrete Aufgabe einsetzt. Diesen Schritt nennt man Pretraining. Das Modell lernt dabei allgemeine Muster – etwa Kanten und Formen in Bildern oder grammatische Strukturen in Texten. Für eine neue Aufgabe muss man dann nur noch den kleineren Ausgabeteil anpassen, nicht den gesamten Backbone. Das spart erheblich Zeit und Rechenleistung.
Wie ein Backbone Daten verarbeitet
Ein Backbone besteht aus vielen hintereinandergeschalteten Schichten. Jede Schicht verfeinert die Darstellung ein Stück weiter. Am Anfang erkennt das Netz einfache Muster, zum Beispiel helle und dunkle Kanten in einem Bild. Weiter hinten im Netz entstehen abstraktere Konzepte, etwa „das hier sieht aus wie ein Ohr“ oder „dieser Satzanfang klingt nach einer Frage“. Am Ende des Backbones steht keine Antwort, sondern ein langer Zahlenvektor – eine Art kodierter Fingerabdruck der Eingabe.
Für Bilder werden oft sogenannte Convolutional Neural Networks oder neuere Architekturen wie Vision Transformers als Backbone eingesetzt. Für Text ist der Transformer das dominierende Modell. Dabei sind Backbone und Ausgabeteil klar getrennte Baugruppen – man kann denselben Backbone für viele verschiedene Aufgaben wiederverwenden, indem man jeweils einen anderen Ausgabeteil anhängt. Ein Backbone, der auf Bildern vortrainiert wurde, kann so sowohl zur Objekterkennung als auch zur Bildbeschreibung genutzt werden.
Ein verbreiteter Irrtum ist, Backbone mit dem gesamten Modell gleichzusetzen. Das stimmt nicht. Der Backbone ist bewusst aufgabenneutral gehalten. Er „weiß“ noch nicht, ob er gleich ein Objekt benennen oder ein Bild klassifizieren soll. Diese Entscheidung fällt erst im nachgelagerten Teil, dem sogenannten Head.
Backbone in Produkten und Tech-News
Wer Tech-News liest, begegnet dem Begriff meistens bei der Vorstellung neuer KI-Modelle. Wenn ein Unternehmen ankündigt, es habe einen neuen Backbone entwickelt, bedeutet das in der Regel: Der Kernteil wurde verbessert oder ausgetauscht, während die Aufgabe dieselbe bleibt. Metas Bilderkennungssystem und Googles Sprachmodelle werden beispielsweise regelmäßig mit neuen Backbones ausgestattet, ohne dass das gesamte System neu gebaut werden müsste.
Auch in Alltagsprodukten steckt das Konzept, auch wenn es dort nicht so heißt. Die Gesichtserkennung beim Entsperren eines Smartphones nutzt einen Backbone, der Gesichtskonturen in Zahlenwerte übersetzt. Die automatische Untertitelung in Videokonferenzen basiert auf einem Sprach-Backbone, der gesprochene Silben zuerst in eine abstrakte Darstellung überführt, bevor daraus Text wird. Das Wort Backbone taucht in diesen Kontexten selten auf – das Konzept dahinter jedoch immer.
In der Forschung ist der Backbone oft der teuerste und schwierigste Teil eines Projekts. Ein leistungsfähiger, öffentlich verfügbarer Backbone – wie etwa BERT für Texte oder ResNet für Bilder – kann von anderen Forscherteams als Ausgangspunkt genutzt werden. Dieser Ansatz, Transfer Learning genannt, hat die KI-Entwicklung in den letzten Jahren massiv beschleunigt, weil niemand mehr bei null anfangen muss.