
Kontrastives Pruning
Kontrastives Pruning ist ein Verfahren, bei dem man aus einem trainierten KI-Modell überflüssige Bauteile entfernt und dabei mit Gegenbeispielen prüft, welche Teile wirklich wichtig sind. Ziel ist ein kleineres, schnelleres Modell, das trotzdem die Unterschiede zwischen ähnlichen Eingaben erkennt.
Programme, die Sprache verstehen oder Bilder erkennen, bestehen aus Millionen kleiner Stellschrauben. Viele davon tragen kaum etwas zum Ergebnis bei. Sie zu löschen nennt man Pruning, also Beschneiden — wie bei einem Baum, dem man tote Äste nimmt. Kontrastives Pruning ist eine bestimmte Art, diese Entscheidung zu treffen. Man zeigt dem Programm dabei nicht nur einzelne Beispiele, sondern immer Paare: zwei sehr ähnliche Eingaben, die trotzdem verschieden behandelt werden müssen. Nur die Stellschrauben, die für diesen Unterschied nötig sind, dürfen bleiben.
Warum kleine Modelle nicht dumm werden dürfen
Große KI-Modelle sind teuer im Betrieb. Jede Anfrage kostet Rechenzeit und damit Strom und Geld. Ein Modell, das auf ein Drittel seiner Größe schrumpft, läuft entsprechend billiger. Es passt außerdem auf Geräte, die wenig Speicher haben — ein Handy zum Beispiel, oder ein Steuergerät im Auto.
Der Haken beim gewöhnlichen Beschneiden: Man misst meist nur die durchschnittliche Trefferquote. Ein beschnittenes Modell kann bei 95 Prozent aller Fälle weiter richtig liegen und trotzdem genau die schwierigen Fälle verlieren. Das sind die Fälle, in denen zwei Eingaben fast gleich aussehen, aber verschiedene Antworten verlangen. „Der Film war nicht schlecht“ und „Der Film war schlecht“ unterscheiden sich um ein Wort. Ein zu grob beschnittenes Modell überliest genau dieses Wort.
Kontrastives Pruning setzt hier an. Es bewertet Bauteile nicht danach, ob sie im Schnitt nützlich sind, sondern ob sie ähnliche Fälle auseinanderhalten. Damit bleibt die Feinunterscheidung erhalten, obwohl das Modell deutlich schrumpft. Das ist besonders in Bereichen wichtig, in denen Fehler teuer sind: bei medizinischen Bildern etwa oder bei der Betrugserkennung im Zahlungsverkehr.
Gegensatzpaare als Prüfstein
Der Ablauf beginnt mit einem fertig trainierten Modell. Man baut Paare von Eingaben: ein positives Paar, das dieselbe Bedeutung hat, und ein negatives Paar, das sich nur minimal unterscheidet, aber verschieden eingeordnet werden muss. Zwei Fotos derselben Katze aus anderem Winkel wären ein positives Paar. Ein Foto einer Katze und eines eines sehr ähnlich aussehenden Luchses wären ein negatives Paar.
Nun schaut man sich an, welche inneren Bauteile bei diesen Paaren unterschiedlich reagieren. Ein Bauteil, das bei Katze und Luchs exakt dasselbe Signal liefert, hilft nicht bei der Unterscheidung. Es ist ein Kandidat zum Löschen. Ein Bauteil, dessen Signal bei den beiden Bildern deutlich auseinandergeht, trägt die Unterscheidung — es bleibt. So entsteht eine Rangliste der Wichtigkeit.
Nach dem Löschen folgt fast immer eine kurze Nachschulung, das sogenannte Finetuning. Das Modell darf sich mit seinen verbliebenen Bauteilen neu einpendeln. Ein häufiger Irrtum ist, Pruning sei dasselbe wie Quantisierung. Bei der Quantisierung bleiben alle Bauteile erhalten, ihre Zahlen werden nur gröber gespeichert. Beim Pruning verschwinden Bauteile ganz. In der Praxis kombiniert man beides.
Wo geschrumpfte Modelle auftauchen
Sichtbar wird das Verfahren selten, seine Ergebnisse dafür ständig. Wenn ein Anbieter eine kleinere Version seines Sprachmodells veröffentlicht, steckt fast immer eine Mischung aus Pruning und verwandten Schrumpfverfahren dahinter. Die Spracherkennung, die auf dem Handy ohne Internetverbindung läuft, ist so ein Fall. Auch Übersetzungsfunktionen in Browsern arbeiten mit stark verkleinerten Modellen.
In Fachartikeln und Firmenmitteilungen taucht der Begriff meist im Umfeld von „Modellkompression“ oder „Effizienz“ auf. Wer solche Meldungen liest, sollte auf zwei Zahlen achten: um wie viel Prozent das Modell geschrumpft ist und wie viel Genauigkeit dabei verloren ging. Werte wie „50 Prozent kleiner bei unter einem Prozent Genauigkeitsverlust“ sind typische Angaben.
Für Anleger und Beobachter der Branche ist das Thema relevant, weil es die Betriebskosten von KI-Diensten direkt beeinflusst. Ein Unternehmen, das seine Modelle halbieren kann, halbiert grob auch seine Rechenrechnung. Kontrastives Pruning ist dabei kein Wundermittel, sondern eine von mehreren Stellschrauben — aber eine, die gezielt die schwierigen Fälle schützt.