RoboHarm

RoboHarm

RoboHarm ist ein Testverfahren, das prüft, ob Roboter mit KI-Steuerung sich zu gefährlichen Handlungen überreden lassen. Es sammelt schädliche Aufträge und misst, wie oft ein System sie ausführt statt sie zu verweigern.

RoboHarm ist ein Prüfverfahren für Roboter, die von einem Sprachmodell gesteuert werden. Ein Sprachmodell ist ein Computerprogramm, das Texte versteht und selbst Texte erzeugt. Sitzt so ein Programm in einem Roboter, kann man ihm Aufträge einfach in normaler Sprache sagen. Genau das ist aber auch die Gefahr: Man kann dem Roboter auch etwas Schädliches auftragen. RoboHarm sammelt solche schädlichen Aufträge in einer festen Liste und schickt sie an das System. Gezählt wird, wie oft der Roboter den Auftrag verweigert und wie oft er ihn ausführt.

Warum ein Sprachmodell in einem Körper riskanter ist

Bei einem Chatprogramm bleibt ein Fehler meistens Text auf einem Bildschirm. Wenn ein Chatbot eine gefährliche Anleitung ausspuckt, ist das schlimm, aber niemand wird direkt verletzt. Ein Roboter dagegen hat Arme, Räder oder Greifer. Er kann etwas umstoßen, Flüssigkeiten mischen oder eine Person anfahren. Der Schaden ist damit nicht mehr nur Information, sondern körperlich und sofort.

Dazu kommt ein zweites Problem. Ein Roboter kennt die Bedeutung seiner Umgebung oft schlechter als ein Mensch. Ein Reinigungsmittel ist für ihn zunächst nur ein Behälter mit einem Griff. Ob das Umschütten in ein Glas harmlos oder lebensgefährlich ist, muss das Modell aus Sprache und Bildern erschließen. RoboHarm macht sichtbar, wie oft dieses Erschließen misslingt.

Solche Tests sind außerdem wichtig, weil Hersteller sonst nur ihre eigenen Zahlen nennen. Ein öffentlich beschriebener Test erlaubt Vergleiche zwischen verschiedenen Systemen. Aufsichtsbehörden und Versicherer greifen zunehmend auf solche Vergleichswerte zurück. Ohne sie bleibt Sicherheit ein Werbeversprechen.

Vom schädlichen Auftrag zur Prozentzahl

Zuerst erstellen die Forscher einen Katalog von Aufträgen, die klar schädlich sind. Typische Gruppen sind körperliche Gewalt, Sachbeschädigung, Diebstahl, Überwachung und der falsche Umgang mit Chemikalien. Jeder Auftrag wird in mehreren Varianten formuliert. Eine Variante ist direkt, eine andere ist in eine harmlose Geschichte verpackt. Solche Umformulierungen nennt man Jailbreaks, also Versuche, die Sicherheitsregeln eines Modells zu umgehen.

Dann läuft der Test. Er findet meist in einer Simulation statt, also in einer Computernachbildung der echten Welt. Das ist billiger und niemand kann verletzt werden. Für jeden Durchgang wird protokolliert, ob der Roboter den Auftrag ablehnt, ihn teilweise beginnt oder ihn vollständig ausführt. Ein zusätzliches Bewertungsprogramm oder ein Mensch entscheidet, welcher dieser Fälle vorliegt.

Am Ende steht eine Kennzahl, oft die Erfolgsquote der Angriffe. Liegt sie bei 30 Prozent, hat fast jeder dritte schädliche Auftrag zu einer Handlung geführt. Hier liegt ein häufiger Irrtum: Eine Quote von null Prozent bedeutet nicht, dass der Roboter sicher ist. Sie bedeutet nur, dass er die geprüften Aufträge bestanden hat. Ein Test kann immer nur das messen, was in seiner Liste steht.

Wo die Zahlen auftauchen

Am häufigsten begegnet man RoboHarm in Forschungsarbeiten zur Robotik-Sicherheit. Solche Arbeiten erscheinen als Vorabdruck im Internet und werden dann in Tech-Medien aufgegriffen. Typische Schlagzeilen lauten, dass sich Roboter mit einfachen Tricks zu gefährlichen Aktionen überreden ließen. Die genannten Prozentzahlen stammen fast immer aus Tests dieser Art.

Interessant ist der Begriff auch für Anleger und Unternehmen. Hersteller von Lagerrobotern, Pflegerobotern oder humanoiden Maschinen müssen künftig belegen, dass ihre Systeme geprüft wurden. Ein schlechter Wert in einem bekannten Test kann eine Produkteinführung verzögern. Verwandte Testreihen für reine Chatprogramme heißen zum Beispiel HarmBench oder AdvBench. RoboHarm unterscheidet sich von ihnen dadurch, dass am Ende eine Bewegung steht und nicht ein Satz.

Produkte dazu

Aktuelle News

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.