Kreislaufschema mit drei Kästen: Angreifermodell erzeugt eine Eingabe, Zielmodell antwortet darauf, Bewertermodell vergibt eine Punktzahl; ein Rückpfeil führt Punktzahl und Antwort zurück zum Angreifermodell, das daraufhin eine verbesserte Eingabe schreibt.

PAIR

PAIR ist ein automatisches Verfahren, bei dem ein Sprachmodell so lange Eingaben umformuliert, bis ein anderes Sprachmodell seine Sicherheitsregeln bricht. Sicherheitsforscher nutzen es, um Schwachstellen von Chatbots zu finden, bevor Angreifer sie ausnutzen.

Chatbots wie ChatGPT haben Regeln, die bestimmte Antworten verbieten. Zu Anleitungen für Waffen oder Sprengstoff sollen sie schweigen. Trotzdem lassen sich diese Regeln durch geschickt formulierte Eingaben oft umgehen. Bisher haben Menschen solche Formulierungen mühsam von Hand gesucht. PAIR ist ein Verfahren, das diese Suche einer zweiten Software überlässt. Der Name steht für „Prompt Automatic Iterative Refinement“, also für das automatische, schrittweise Verbessern einer Eingabe.

Warum ein automatischer Angreifer die Sicherheitsforschung verändert

Vor PAIR war das Aufspüren solcher Lücken Handarbeit. Forscher probierten Formulierungen aus, verglichen Antworten und notierten, was funktionierte. Das dauerte Stunden pro Fall und ließ sich schlecht wiederholen. PAIR schafft dasselbe oft in unter einer Minute und mit weniger als zwanzig Versuchen.

Diese Geschwindigkeit ist der eigentliche Punkt. Wer ein neues Modell veröffentlichen will, kann es vorher automatisch mit tausenden Angriffsversuchen prüfen. Man nennt solche Tests Red Teaming: eine Gruppe greift das eigene System bewusst an, um Schwächen vor der Veröffentlichung zu finden. PAIR macht daraus einen Prozess, der jede Nacht durchlaufen kann.

Die Kehrseite liegt auf der Hand. Dasselbe Werkzeug hilft auch Leuten mit schlechten Absichten. Die Forschung veröffentlicht solche Methoden trotzdem, weil Angreifer sie ohnehin früher oder später entwickeln. Verteidiger sollen den Vorsprung behalten.

Der Kreislauf aus Angreifer, Ziel und Bewertung

PAIR verwendet drei Sprachmodelle in verschiedenen Rollen. Das erste ist der Angreifer und erfindet die Eingaben. Das zweite ist das Zielmodell, also der Chatbot, den man prüfen will. Das dritte bewertet die Antwort auf einer Skala und meldet, wie nah der Versuch am Ziel war.

Der Ablauf ist eine Schleife. Der Angreifer schreibt eine Eingabe, das Ziel antwortet, der Bewerter vergibt eine Punktzahl. Diese Punktzahl und die Antwort gehen zurück an den Angreifer. Er sieht also, warum sein Versuch scheiterte, und schreibt einen besseren. Nach wenigen Runden hat er die Formulierung deutlich geschärft.

Ein Vergleich macht das anschaulich. Ein Verkäufer am Telefon merkt nach jedem Nein, welches Argument nicht zieht, und wechselt die Strategie. Genau diese Rückmeldung fehlt älteren Angriffsverfahren. Diese hängen wirre Zeichenketten an die Eingabe und probieren blind Millionen Varianten durch. PAIR bleibt dagegen bei normaler Sprache, was den Angriff auch auf andere Modelle übertragbar macht.

PAIR in Sicherheitsberichten und Modell-Tests

Direkt im Alltag begegnet dir PAIR nicht. Du findest den Begriff aber in den technischen Berichten, die Firmen wie OpenAI, Anthropic oder Google zu neuen Modellen veröffentlichen. Dort steht oft, gegen welche Angriffsverfahren getestet wurde. PAIR gehört seit 2023 zum Standardrepertoire dieser Prüfungen.

Auch in Nachrichten über KI-Regulierung taucht das Thema auf. Der EU AI Act verlangt für besonders leistungsfähige Modelle dokumentierte Sicherheitstests. Automatisierte Angriffsverfahren sind ein praktischer Weg, diese Pflicht zu erfüllen. Anbieter können damit belegen, dass sie systematisch nach Lücken gesucht haben.

Ein häufiger Irrtum: PAIR ist kein Programm zum Herunterladen, das jeden Chatbot knackt. Es ist eine Methode, ein beschriebenes Vorgehen. Und es funktioniert nicht immer. Gut abgesicherte Modelle halten vielen Durchläufen stand, andere fallen schon nach drei Runden. Genau dieser Unterschied ist die Kennzahl, die Sicherheitsforscher am Ende interessiert.

Produkten dorto

Aktuelle Narichten

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.