Synthszr Charts — die großen AI-Marken im Wettkampf ums Podium
synthszr charts
uc-berkeley

Uc Berkeley · 2× · zuletzt 15. Sept. 2026

25
Momentum

ExploitGym ist ein von Forschern der UC Berkeley (RDI-Zentrum) zusammen mit dem Max-Planck-Institut für Sicherheit und Datenschutz, UC Santa Barbara, Arizona State University, Anthropic, OpenAI und Google veröffentlichtes Benchmark zur Bewertung der Fähigkeit von KI-Agenten, Software-Schwachstellen in funktionierende Exploits umzuwandeln. Es umfasst reale Schwachstellen aus Userspace-Programmen, der V8-JavaScript-Engine und dem Linux-Kernel, verpackt in containerisierten, reproduzierbaren Umgebungen. Agenten erhalten einen Proof-of-Vulnerability-Input und müssen daraus einen Exploit mit unautorisierter Codeausführung entwickeln; getestet wurden u.a. Claude Code, Codex CLI und Gemini CLI als Agenten-Scaffolds. Der Code ist als Open-Source-Projekt auf GitHub (sunblaze-ucb/exploitgym) unter A

Momentum-Verlauf
18.06.16.09.

Features

Autonomie-GradVollautonome Agenten mit bis zu 2 Stunden Zeitbudget pro Aufgabe (Skalierung bis 6 Stunden beobachtet), ohne menschliches Eingreifen
KanäleGitHub-Repository (Open-Source-Release), arXiv-Preprint, Berkeley RDI Blog
LizenzQuellcode: Apache-2.0; gebündelte Task-Daten behalten jeweilige Upstream-Lizenzen
ModalitätenText/Code (Quellcode, Vulnerability-Beschreibung, PoV-Input, Terminal-/Shell-Interaktion)
PlattformContainerisierte Docker-Umgebungen, steuerbar via Python/uv, Controller-Firewall-LLM-Proxy-Architektur
PreisKostenlos / Open Source (kein kommerzielles Produkt, keine Preisangabe verfügbar)
Release-Datum11. Mai 2026 (arXiv v1); aktuelle Benchmark-Version v1.0
Tool-/MCP-IntegrationenAgenten-CLIs: Claude Code, Codex CLI, Gemini CLI; Tools wie GDB, socat, netcat im Container; LLM-Proxy blockiert Remote-MCP/Web-Suche standardmäßig

Weitere Produkte in dieser Kategorie: Agenten-Frameworks

Belege (2)

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.