Direct Preference Optimization

Direct Preference Optimization

Direct Preference Optimization (DPO) ist ein Verfahren, mit dem man ein KI-Sprachmodell darauf trainiert, menschliche Vorlieben besser zu erfüllen – ohne dafür ein separates Bewertungsmodell zu benötigen. Es gilt als einfachere und stabilere Alternative zu RLHF, dem bis dahin üblichen Ansatz.

Wenn ein Sprachmodell fertig trainiert ist, kann es Sätze bilden – aber noch nicht zuverlässig beurteilen, welche Antwort hilfreicher oder korrekter ist. Um das zu verbessern, zeigt man ihm Beispiele menschlicher Urteile: Hier sind zwei Antworten auf dieselbe Frage, welche ist besser? Aus diesen Vergleichen lernt das Modell, was Menschen bevorzugen. Direct Preference Optimization, kurz DPO, ist eine Methode, die genau das macht. Sie ist seit 2023 weit verbreitet und hat einen älteren, aufwendigeren Ansatz namens RLHF – also Verstärkendes Lernen aus menschlichem Feedback – in vielen Projekten abgelöst.

DPOs Rolle im Feinschliff von Sprachmodellen

Ein Modell, das nur auf rohem Textmaterial trainiert wurde, antwortet technisch korrekt – aber oft nicht so, wie ein Mensch es sich wünscht. Es kann zu lang, zu vage oder im falschen Ton antworten. DPO ist der Feinschliff, der das ändert. Er findet am Ende des Trainingsprozesses statt und formt das Verhalten des Modells in der Praxis.

Ohne diesen Schritt wären Chatbots wie ChatGPT oder der Assistent in einem Smartphone kaum alltagstauglich. Das Basiswissen ist nach dem Vortraining vorhanden, aber erst die Präferenzoptimierung macht Antworten höflich, klar und auf den Punkt. Viele der Qualitätsunterschiede, die Nutzer zwischen verschiedenen KI-Produkten wahrnehmen, entstehen genau in diesem Schritt.

Paarvergleiche statt Punktrichter

Das Trainingsmaterial für DPO besteht aus Tripeln: eine Frage, eine bevorzugte Antwort und eine abgelehnte Antwort. Menschen – oder manchmal ein anderes KI-Modell – haben diese Paare bewertet. DPO nutzt diese Vergleiche direkt, um die Gewichte des Modells anzupassen. Es erhöht die Wahrscheinlichkeit, dass das Modell die bevorzugte Antwort wählt, und senkt sie für die abgelehnte.

Der entscheidende Unterschied zu RLHF liegt im Aufbau. RLHF trainiert zunächst ein eigenes Bewertungsmodell, das lernt, menschliche Urteile vorherzusagen, und nutzt dieses dann als Schiedsrichter. Das ist ein zweistufiger Prozess mit zwei Modellen, der fehleranfällig und rechenintensiv ist. DPO überspringt die Zwischenstufe komplett. Es leitet mathematisch ab, welche Modellanpassung den Vergleichen am besten entspricht, und wendet diese direkt an.

Ein bekanntes Problem bei RLHF ist das sogenannte Reward Hacking: Das Modell lernt, den Schiedsrichter auszutricksen, statt wirklich besser zu werden – ähnlich wie ein Schüler, der auf die Eigenheiten eines Lehrers optimiert statt auf den Stoff. DPO umgeht dieses Risiko, weil es keinen separaten Schiedsrichter gibt, den man austricksen könnte.

DPO in Produkten und Forschung

DPO wurde 2023 in einem Forschungspapier der Stanford University vorgestellt und verbreitete sich danach schnell. Die meisten modernen Open-Source-Modelle – etwa die Llama- oder Mistral-Familie – nutzen DPO oder eng verwandte Varianten für ihren Feinschliff. Auch kommerzielle Anbieter haben das Verfahren übernommen oder experimentieren damit.

In der Fachpresse taucht DPO vor allem in Berichten über neue Modellversionen auf. Wenn ein Unternehmen ankündigt, sein Modell sei « besser ausgerichtet » oder « sicherer im Umgang mit heiklen Themen », steckt oft DPO oder ein ähnliches Verfahren dahinter. Der Begriff « Alignment » – also die Frage, ob ein Modell das tut, was Menschen wirklich wollen – ist eng mit DPO verknüpft.

Inzwischen gibt es mehrere Weiterentwicklungen von DPO, etwa IPO oder SimPO, die einzelne Schwächen des Originalverfahrens beheben sollen. Die Grundidee bleibt dieselbe: Paarvergleiche statt aufwendiger Zwischenmodelle. DPO hat damit eine ganze Forschungsrichtung angestoßen, die sich mit der Frage beschäftigt, wie man menschliche Urteile möglichst direkt ins Modell überträgt.

Aktuelle News

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.