arXiv

arXiv

arXiv ist eine kostenlose Internetplattform, auf der Forscher ihre Aufsätze veröffentlichen, bevor eine Fachzeitschrift sie geprüft hat. In der KI-Forschung erscheinen dort die meisten wichtigen Arbeiten zuerst.

arXiv ist eine öffentliche Website, auf die Wissenschaftler ihre Aufsätze hochladen. Jeder kann diese Texte kostenlos lesen und herunterladen. Der Name wird « Archiv » ausgesprochen, denn das große X steht für den griechischen Buchstaben Chi. Die Plattform gibt es seit 1991, gestartet wurde sie von einem Physiker in den USA. Heute liegen dort über zwei Millionen Aufsätze aus Physik, Mathematik, Informatik und weiteren Fächern. Betrieben wird arXiv von der Cornell University, finanziert über Spenden und Mitgliedsbeiträge von Universitäten.

Warum KI-Neuigkeiten dort zuerst stehen

Normalerweise läuft Forschung so: Man schreibt einen Aufsatz und schickt ihn an eine Fachzeitschrift. Dort lesen andere Forscher den Text und suchen Fehler. Dieses Prüfverfahren heißt Peer Review, also Begutachtung durch Fachkollegen. Es dauert oft sechs Monate bis zwei Jahre.

In der KI-Forschung ist das viel zu langsam. Ein Verfahren, das heute neu ist, kann in einem Jahr schon überholt sein. Deshalb laden Teams bei Google, Meta oder OpenAI ihre Ergebnisse direkt auf arXiv. Solche noch ungeprüften Texte nennt man Preprints, also Vorabdrucke. Berühmte Arbeiten wie « Attention Is All You Need », die Grundlage heutiger Sprachmodelle, wurden dort veröffentlicht.

Für Journalisten und Investoren ist arXiv damit eine Art Frühwarnsystem. Wer verstehen will, woran ein Konzern gerade arbeitet, schaut dort nach. Umgekehrt gilt: Ein Preprint ist keine gesicherte Wahrheit. Die Prüfung durch Fachleute fehlt ja noch.

Vom Upload zur Nummer

Ein Forscher lädt seinen Aufsatz als Datei hoch, meist als PDF. Er wählt eine Kategorie, zum Beispiel « cs.LG » für maschinelles Lernen innerhalb der Informatik. Danach schauen freiwillige Moderatoren kurz darüber. Sie prüfen aber nicht, ob die Ergebnisse stimmen. Sie sortieren nur offensichtlichen Unsinn und falsch einsortierte Texte aus.

Nach meist einem Tag ist der Text online und bekommt eine feste Nummer, etwa 1706.03762. Die erste Hälfte nennt Jahr und Monat, die zweite ist eine laufende Zählung. Über diese Nummer kann jeder den Aufsatz dauerhaft zitieren und wiederfinden.

Ändert der Autor später etwas, entsteht keine neue Nummer. Stattdessen kommt eine Versionsangabe dazu, also v1, v2, v3. Alle alten Versionen bleiben sichtbar. So kann man nachvollziehen, was ein Team ursprünglich behauptet hat. Ein Aufsatz kann später zusätzlich in einer Zeitschrift erscheinen. Die arXiv-Fassung bleibt trotzdem stehen.

arXiv in Nachrichten und im Studium

In Tech-Artikeln steht oft ein Satz wie: « Das Team beschreibt die Methode in einem Paper auf arXiv. » Dahinter steckt dann ein Link auf die Nummer. Man kann dem Link folgen und den Originaltext selbst ansehen. Die ersten Absätze, Abstract genannt, fassen das Ergebnis in wenigen Sätzen zusammen. Dieser Teil ist oft auch ohne Fachwissen halbwegs verständlich.

Auch technische Berichte zu bekannten Produkten liegen dort. Zu vielen Sprachmodellen gibt es einen sogenannten Model Card oder Technical Report auf arXiv. Wer wissen will, mit welchen Daten ein Modell trainiert wurde, findet dort die offiziellen Angaben.

Ein häufiger Irrtum: Weil ein Text auf arXiv steht, sei er von Fachleuten geprüft. Das ist falsch. Auf arXiv landen auch Arbeiten, die nie eine Zeitschrift akzeptiert. Verwandt, aber anders sind Plattformen wie bioRxiv für Biologie oder SSRN für Wirtschaft. Sie folgen demselben Prinzip in anderen Fächern.

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.