
Runtime-Harness
Ein Runtime-Harness ist die Software-Umgebung, die ein KI-Modell während seiner Ausführung umgibt: Sie nimmt Eingaben entgegen, gibt dem Modell Werkzeuge an die Hand, führt dessen Vorschläge aus und sammelt die Ergebnisse. Ohne dieses Gerüst könnte ein Modell nur Text ausgeben, aber nichts tatsächlich tun.
Ein KI-Modell selbst kann erstaunlich wenig. Es bekommt Text hinein und gibt Text hinaus, sonst nichts. Es kann keine Datei öffnen, keine Suchanfrage stellen und kein Programm starten. Damit aus dieser reinen Textmaschine ein nützliches Werkzeug wird, baut man ein Gerüst darum herum. Dieses Gerüst heißt Runtime-Harness, also sinngemäß “Laufzeit-Geschirr”: Es hält das Modell im Betrieb an der richtigen Stelle fest und verbindet es mit der Außenwelt. Der englische Begriff “harness” bezeichnet ursprünglich das Zuggeschirr eines Pferdes, und das Bild passt gut: Das Pferd liefert die Kraft, das Geschirr sorgt dafür, dass daraus eine gezogene Kutsche wird.
Warum das Modell allein noch kein Produkt ist
In den Nachrichten steht meist nur der Modellname: GPT, Claude, Gemini, Llama. Das klingt so, als wäre das Modell das ganze Produkt. Tatsächlich ist es nur der Motor. Ob dieser Motor gut fährt, hängt stark davon ab, was drumherum gebaut wurde. Zwei Firmen können dasselbe Modell einsetzen und trotzdem völlig unterschiedlich gute Ergebnisse erzielen.
Das zeigt sich besonders bei Programmier-Assistenten. Zwei Anbieter nutzen dasselbe Sprachmodell für das Schreiben von Code. Der eine lässt das Modell einfach drauflos schreiben. Der andere führt den Code sofort aus, fängt die Fehlermeldung ab und gibt sie dem Modell zurück. Der zweite Ansatz liefert deutlich bessere Ergebnisse, obwohl das Modell identisch ist. Der Unterschied liegt komplett im Harness.
Deshalb ist das Harness auch ein Sicherheitsthema. Es entscheidet, welche Werkzeuge das Modell überhaupt benutzen darf. Ein Modell mit uneingeschränktem Zugriff auf ein Firmennetzwerk ist ein Risiko. Ein Modell, das nur in einem abgeschotteten Testbereich arbeiten darf, ist beherrschbar. Diese Grenze zieht nicht das Modell, sondern das Gerüst darum herum.
Der Kreislauf aus Vorschlag und Rückmeldung
Ein Harness arbeitet in Runden. Zuerst stellt es dem Modell die Aufgabe zusammen: die Frage des Nutzers, dazu Anweisungen und eine Liste der verfügbaren Werkzeuge. Das Modell antwortet nicht nur mit Text, sondern kann auch einen Werkzeugaufruf vorschlagen. Es sagt zum Beispiel sinngemäß: “Bitte lies die Datei rechnung.txt.”
Wichtig ist, dass das Modell diese Datei nicht selbst liest. Es äußert nur einen Wunsch in Textform. Das Harness prüft diesen Wunsch, führt die Aktion aus und schickt das Ergebnis zurück. Danach beginnt die nächste Runde. Dieser Kreislauf läuft so lange, bis die Aufgabe erledigt ist oder eine Grenze erreicht wird.
Solche Grenzen sind fest eingebaut. Typisch sind eine maximale Anzahl an Runden, ein Zeitlimit und ein Kostenlimit. Sie verhindern, dass sich ein Modell in einer Endlosschleife verfängt. Ein Harness protokolliert außerdem jeden Schritt. Diese Protokolle sind später wichtig, um Fehler nachzuvollziehen.
Vom Benchmark bis zum Chatfenster
Am sichtbarsten sind Harnesses bei Programmier-Werkzeugen wie Cursor, GitHub Copilot oder Claude Code. Auch jeder Chatbot, der im Internet suchen oder Code ausführen kann, steckt in einem Harness. Wenn ein Assistent sagt, er habe “gerade nachgeschaut”, dann hat in Wahrheit das Harness die Suche durchgeführt und das Ergebnis weitergereicht.
Der Begriff taucht auch in Fachnachrichten über Bestenlisten auf. Bei Tests wie SWE-bench müssen Modelle echte Programmierfehler beheben. Firmen streiten regelmäßig darüber, wie viel des Ergebnisses am Modell lag und wie viel am Harness. Ein aufwendiges Gerüst mit vielen Wiederholungsversuchen hebt die Trefferquote spürbar. Vergleiche sind deshalb nur fair, wenn beide Seiten dasselbe Harness benutzen.
Häufig verwechselt wird das Harness mit dem Modell selbst oder mit dem Systemprompt, also der festen Grundanweisung an das Modell. Der Systemprompt ist nur ein Teil dessen, was das Harness zusammenstellt. Ein verwandter Begriff ist das Agenten-Framework: Damit sind fertige Baukästen wie LangChain gemeint, mit denen man ein Harness schneller zusammenbauen kann.