
Cargo Cult Science
Cargo Cult Science bezeichnet Forschung, die äußerlich wie echte Wissenschaft aussieht, aber deren Kernprinzipien – vor allem die ehrliche Fehlersuche an den eigenen Ergebnissen – nicht erfüllt. In der KI-Branche wird der Begriff verwendet, wenn Experimente zwar protokolliert und veröffentlicht werden, die Methoden aber so gewählt sind, dass ein positives Ergebnis fast unvermeidlich ist.
Nach dem Zweiten Weltkrieg beobachteten Anthropologen auf Inseln im Pazifik ein seltsames Phänomen. Die dortigen Bewohner hatten während des Krieges erlebt, wie Flugzeuge landeten und Güter — Konserven, Kleidung, Werkzeug — brachten. Als die Soldaten abzogen, blieben die Inseln leer. Manche Gemeinschaften bauten daraufhin Attrappen von Landebahnen, trugen Kopfhörer aus Holz und winkten imaginären Maschinen: Sie ahmten die äußere Form nach, ohne zu verstehen, was die Flugzeuge tatsächlich herbeigeführt hatte. Der Physiker Richard Feynman griff dieses Bild 1974 in einer berühmten Rede auf. Er nannte Forschung, die die Rituale der Wissenschaft kopiert, ohne deren Kern zu erfüllen, Cargo Cult Science. Seitdem ist der Begriff ein geläufiger Vorwurf — auch in der KI-Forschung.
Der Kern des Problems: Selbsttäuschung statt Selbstkritik
Echte Wissenschaft verlangt laut Feynman vor allem eines: dass der Forscher alles tut, um sich selbst zu widerlegen. Wer ein Experiment so aufbaut, dass es sein Lieblingsresultat bestätigen muss, betreibt keinen Erkenntnisgewinn — er inszeniert ihn nur. Das klingt wie ein seltener Einzelfall, ist es aber nicht.
In der Praxis passiert das oft unbewusst. Man wählt die Vergleichsmethode, gegen die das eigene Modell am besten aussieht. Man testet so lange verschiedene Einstellungen, bis ein beeindruckender Wert herauskommt — und veröffentlicht nur diesen Wert. Man optimiert auf einen Benchmark, der eigentlich messen soll, ob ein Modell allgemein gut ist. Am Ende steht eine Zahl, die gut aussieht, aber wenig darüber sagt, ob das System in der Realität funktioniert.
Warum KI-Forschung besonders anfällig ist
In keinem anderen Forschungsfeld der letzten Jahre wurden so viele Ergebnisse so schnell veröffentlicht wie in der KI. Auf der Plattform arXiv erscheinen täglich Hunderte neuer Studien. Der Druck, aufzufallen, ist enorm — für Forscher an Universitäten genauso wie für Teams in Unternehmen, die Investoren beeindrucken wollen. Das schafft einen Anreiz, Ergebnisse so zu präsentieren, dass sie möglichst eindrucksvoll wirken.
Ein konkretes Strukturproblem heißt P-Hacking oder auch HARKing (Hypothesizing After Results are Known): Man probiert viele Varianten durch und formuliert die Hypothese erst im Nachhinein so, als hätte man genau das von Anfang an gesucht. Statistisch gesehen findet man bei genug Versuchen fast immer irgendein positives Ergebnis — ob es real ist oder Zufall, lässt sich dann kaum noch auseinanderhalten. Studien schätzen, dass ein erheblicher Teil veröffentlichter KI-Ergebnisse sich nicht reproduzieren lässt, also bei unabhängiger Wiederholung nicht standhält.
Hinzu kommt das Problem der Benchmark-Sättigung. Wenn ein Datensatz lange genug als Maßstab dient, werden Modelle zunehmend genau auf ihn zugeschnitten. Die Punktzahl steigt — aber die tatsächliche Fähigkeit, neue Probleme zu lösen, bleibt dahinter zurück. Das Modell hat das Ritual gelernt, nicht den Inhalt.
Wo der Begriff in der KI-Debatte auftaucht
Cargo Cult Science begegnet einem vor allem in kritischen Kommentaren zu KI-Benchmarks. Wenn ein Unternehmen ankündigt, sein Modell habe einen bestimmten Test erstmals besser als ein Mensch bestanden, folgt oft die Gegenfrage: Wurde das Modell auf genau diesen Test trainiert? Ist der Test überhaupt noch aussagekräftig, wenn ihn alle optimieren? Diese Skepsis ist kein Angriff auf KI als solche — sie ist ein Einfordern echter Wissenschaft.
Auch in Debatten um reproduzierbare Forschung taucht der Begriff auf. Mehrere Forschergruppen haben in den letzten Jahren systematisch versucht, veröffentlichte KI-Ergebnisse nachzubauen — mit ernüchternden Ergebnissen. Manche Modelle, die in Papieren herausragende Leistungen zeigten, schnitten unter kontrollierten Bedingungen kaum besser ab als ältere, einfachere Ansätze.
Der Begriff wird aber auch als Warnung gegenüber Unternehmen verwendet, die KI einsetzen, ohne zu verstehen, warum ein Modell funktioniert. Wer ein System produktiv einsetzt, nur weil es im Test gut aussah, ohne die Schwächen zu kennen, baut im übertragenen Sinne eine Holzlandebahn — und wartet auf Ergebnisse, die so nicht kommen werden.