
Policy Prover
Ein Policy Prover ist ein Programm, das mathematisch beweist, ob ein System eine vorgegebene Verhaltensregel unter allen möglichen Bedingungen einhält. In der KI-Entwicklung wird er eingesetzt, um sicherzustellen, dass ein Modell oder ein autonomes System niemals gegen festgelegte Grenzen verstößt.
Ein Policy Prover ist ein Werkzeug, das eine Regel — auf Englisch « Policy » — formal überprüft. « Formal » bedeutet hier: nicht durch Ausprobieren, sondern durch einen mathematischen Beweis. Der Prover geht alle denkbaren Situationen durch und zeigt entweder, dass die Regel immer gilt, oder er liefert ein konkretes Gegenbeispiel. Das Ziel ist absolute Sicherheit: keine Ausnahme, die beim Testen zufällig nicht aufgetaucht ist. Policy Prover stammen ursprünglich aus der Softwareverifikation, also dem Bereich, der prüft, ob Programme korrekt arbeiten. Heute werden sie zunehmend auf KI-Systeme angewendet, weil dort die Folgen von Regelbrüchen besonders schwerwiegend sein können.
Warum ein Test allein nicht reicht
Wenn man ein System testet, prüft man immer nur eine begrenzte Auswahl von Situationen. Ein autonomes Fahrzeug könnte tausend Mal korrekt bremsen — und beim tausendundeinsten Mal versagen, weil dieser Fall im Test nie vorkam. Ein Policy Prover schließt diese Lücke. Er macht keine Stichproben, sondern analysiert das Verhalten des Systems für alle möglichen Eingaben auf einmal.
Das ist besonders in sicherheitskritischen Bereichen wichtig. In der Luftfahrt, in der Medizintechnik oder bei autonomen Waffensystemen reicht es nicht, dass etwas « meistens » funktioniert. Hier braucht man einen Beweis. Für KI-Modelle, die eigenständig Entscheidungen treffen, stellt sich dieselbe Forderung: Wer garantiert, dass das Modell eine bestimmte Grenze nie überschreitet? Ein Policy Prover kann genau das garantieren — oder zeigen, dass die Garantie nicht zu halten ist.
Wie ein Policy Prover einen Beweis führt
Der Prover bekommt zwei Dinge: eine Beschreibung des Systems und eine formale Regel. Die Regel wird in einer Logiksprache ausgedrückt, zum Beispiel: « Der Ausgabewert liegt immer zwischen 0 und 1 » oder « Das Modell empfiehlt nie Handlung X, wenn Bedingung Y gilt. » Das System — etwa ein neuronales Netz, also ein aus vielen Recheneinheiten bestehendes Modell — wird ebenfalls mathematisch beschrieben.
Der Prover sucht dann systematisch nach einem Widerspruch. Er versucht, eine Eingabe zu konstruieren, bei der die Regel bricht. Gelingt das nicht, gilt die Regel als bewiesen. Dieses Verfahren heißt formale Verifikation. Es nutzt Methoden aus der Logik und der Mathematik, etwa sogenannte SAT-Solver oder SMT-Solver — Programme, die prüfen, ob eine logische Aussage erfüllbar ist. Bei einfachen Systemen geht das schnell. Bei großen neuronalen Netzen mit Milliarden von Parametern ist es rechnerisch extrem aufwendig und bleibt eine offene Forschungsfrage.
Ein wichtiger Unterschied zu anderen Sicherheitsverfahren: Ein Policy Prover sagt nichts darüber, ob die Regel selbst sinnvoll ist. Er prüft nur, ob sie eingehalten wird. Wer eine falsche Regel beweist, hat trotzdem ein falsches System — nur ein bewiesenes.
Policy Prover in KI-Systemen und aktuellen Debatten
In der Praxis taucht das Thema überall dort auf, wo KI-Systeme autonom handeln sollen. Drohnen, die selbst Ziele auswählen, Handelssysteme, die ohne menschliche Kontrolle kaufen und verkaufen, oder medizinische Diagnosesysteme — bei all diesen Anwendungen wird diskutiert, ob formale Beweise für bestimmte Verhaltensregeln verlangt werden sollten. Die EU-KI-Verordnung aus dem Jahr 2024 schreibt für Hochrisiko-KI-Systeme umfangreiche Nachweise vor; Policy Prover sind ein Werkzeug, um solche Nachweise zu erbringen.
Forschungsgruppen wie das Alignment-Team von Anthropic oder das Mechanistic-Interpretability-Lab von DeepMind beschäftigen sich damit, wie man Policy Prover auf große Sprachmodelle anwenden kann. Das Problem: Solche Modelle haben so viele Parameter, dass vollständige Beweise bislang nur für sehr vereinfachte Varianten gelingen. Ein realistischer Einsatz für Systeme wie GPT-4 oder Gemini ist noch nicht möglich.
Trotzdem ist das Konzept bereits jetzt einflussreich. Es verschiebt die Diskussion über KI-Sicherheit von « wir haben genug getestet » hin zu « wir können es beweisen ». Das ist ein grundlegend anderer Anspruch — und einer, der die Entwicklung sicherheitskritischer KI in den nächsten Jahren stark prägen wird.