BrowseComp-Benchmark

BrowseComp-Benchmark

Der BrowseComp-Benchmark ist ein Schwierigkeitstest für KI-Systeme, der misst, wie gut sie komplexe Fakten durch wiederholtes Suchen im Web eigenständig herausfinden können. Anders als einfache Wissensfragen verlangen seine Aufgaben viele aufeinanderfolgende Suchschritte – und lassen sich kaum durch Raten lösen.

Ein Benchmark ist ein standardisierter Test, mit dem man messen kann, wie gut ein System eine bestimmte Aufgabe löst. Der BrowseComp-Benchmark wurde 2025 von OpenAI entwickelt und testet, ob eine KI schwierige Fakten selbstständig im Internet recherchieren kann. Die Aufgaben sind so gestaltet, dass eine einzige Suche nicht reicht. Das Modell muss mehrere Suchanfragen hintereinander stellen, Zwischenergebnisse bewerten und daraus eine präzise Antwort zusammensetzen. Richtig oder falsch lässt sich bei jeder Aufgabe eindeutig prüfen – Schummeln durch vage Antworten funktioniert nicht. Der Name setzt sich aus „Browse“ (englisch für „im Web stöbern“) und „Comp“ (kurz für „Competition“ oder „Comprehension“) zusammen.

Warum BrowseComp eine eigene Messlatte braucht

Viele ältere Benchmarks sind mittlerweile zu einfach. Aktuelle KI-Modelle lösen sie fast fehlerfrei, sodass man kaum noch Unterschiede zwischen ihnen erkennen kann. Das nennt man Sättigung: Der Test trennt die Guten nicht mehr von den Besten.

BrowseComp setzt deshalb bewusst auf Aufgaben, bei denen selbst Menschen mit freiem Internetzugang oft scheitern. In OpenAIs eigenen Tests lösten menschliche Tester nur etwa 50 % der Fragen korrekt. Einfache KI-Modelle ohne Suchfunktion kamen auf unter 2 %. Das zeigt: Der Test misst eine Fähigkeit, die wirklich noch nicht gemeistert ist.

Dahinter steckt ein grundsätzliches Problem. Eine KI, die nur auf gespeichertem Wissen beruht, versagt bei Fragen zu aktuellen Ereignissen oder sehr spezifischen Fakten. BrowseComp zwingt das Modell, aktiv zu suchen – und bewertet, ob es das systematisch und zuverlässig tut.

Aufbau und Ablauf eines BrowseComp-Tests

Jede Aufgabe im Benchmark hat exakt eine richtige Antwort – zum Beispiel einen Namen, eine Jahreszahl oder einen Ort. Die Fragen sind absichtlich so formuliert, dass man sie nicht aus dem Gedächtnis beantworten kann. Typisch ist etwa: „Welche Person hat sowohl Preis X als auch Preis Y gewonnen und lebte außerdem in Stadt Z?“ Wer die Antwort kennt, hat sie wahrscheinlich nie zuvor gesehen.

Das KI-System muss dann eigenständig entscheiden: Wonach suche ich zuerst? Was tue ich mit widersprüchlichen Treffern? Wann bin ich sicher genug, um zu antworten? Dieser Ablauf – Suchen, Auswerten, erneut Suchen – wird als „agentic browsing“ bezeichnet, also selbstgesteuertes Surfen mit einem klaren Ziel.

Die Auswertung ist bewusst binär: Eine Antwort zählt entweder als richtig oder als falsch. Das verhindert, dass Modelle Punkte sammeln, indem sie unverbindliche Umschreibungen liefern. Wer nur halb richtig antwortet, bekommt null Punkte – genau wie bei einem Mathetest, bei dem der richtige Rechenweg ohne korrektes Ergebnis nicht zählt.

BrowseComp in der Praxis und in den Schlagzeilen

Seit seiner Veröffentlichung im Frühjahr 2025 taucht BrowseComp regelmäßig in Vergleichstests zwischen großen KI-Systemen auf. OpenAIs eigenes Modell „o3 with browsing“ erzielte beim Ersttest rund 51 % – ein Wert, der zuvor keiner KI gelungen war und gleichzeitig zeigt, wie viel Luft nach oben bleibt.

In Tech-Medien wird der Benchmark vor allem dann zitiert, wenn Unternehmen neue „Research-Agenten“ vorstellen – also KI-Systeme, die selbstständig im Netz recherchieren sollen. BrowseComp liefert dabei eine gemeinsame Messgröße, mit der sich Behauptungen wie „unser Modell recherchiert besser als die Konkurrenz“ überprüfen lassen.

Für normale Nutzer ist der Benchmark unsichtbar, aber er hat direkte Auswirkungen. Wer heute einen KI-Assistenten bittet, aktuelle Informationen zu einem Thema zusammenzusuchen, profitiert von Verbesserungen, die durch Tests wie BrowseComp angetrieben wurden. Je höher ein Modell auf diesem Benchmark abschneidet, desto zuverlässiger erledigt es im Alltag Rechercheaufgaben – ohne dass der Nutzer jeden Suchschritt selbst überwachen muss.

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.