← älter | home →
US und China-Startups kämpfen um die besten Open-Source-ModelleSynthszr
synthszr #281 vom Dienstag, den 06.10.2026

US und China-Startups kämpfen um die besten Open-Source-Modelle

  • • Reflection AI bringt mit Beam ein leistungsstarkes Open-Source-Modell heraus
  • • Metas Agent Muse erstellt geheime Profile über Freunde und Familie des Nutzers
  • • Amerikanische KI-Modelle nur noch 3 Prozent besser als die chinesischen Varianten

US-Startup veröffentlicht Open-Source-Modell und verspricht China-Modelle zu toppen

Reflection AI hat am Montag, dem 5. Oktober 2026, Beam vorgestellt, ein reines Textmodell mit 501 Milliarden Parametern, von denen pro Token 23 Milliarden aktiv sind. Das Modell ist zunächst nur über ein Early-Access-Programm mit Warteliste zugänglich, es befindet sich nach Angaben des Unternehmens im abschließenden Red-Teaming. Die Gewichte sollen „später diesen Monat“ unter Apache-2.0-Lizenz erscheinen, zusammen mit Dokumentation und Fine-Tuning-Werkzeugen. Herunterladen kann das Modell derzeit niemand.

Reflection vergleicht Beam vor allem mit GLM-5.2 von Z.ai, einem Open Weight-Modell mit rund 744 Milliarden Parametern und 40 Milliarden aktiven. Die eigenen Angaben: vergleichbare Reasoning-Werte bei drei- bis viermal geringerem Inference-Compute, gestützt auf Werte zu DeepSWE, Humanity’s Last Exam und Terminal Bench 2.1. Das Unternehmen bezeichnet diese Rechnung selbst als „annähernden Compute-Vergleich“ statt als gemessene Inferenzkosten; sie klammert die Verarbeitung des Eingabe-Prompts, kontextabhängige Attention-Operationen und Serving-Overhead aus. In Reflections eigener Tabelle liegt Beam bei den meisten Coding-Zeilen hinter GLM-5.3, Kimi K3 und DeepSeek V4.1 Flash. Eine unabhängige Evaluation gibt es bislang nicht.

Zum Trainingsablauf nennt das Unternehmen konkrete Zahlen. Begonnen wurde mit einem kleinen Prototyp, aus dem eine Reihe immer größerer Modelle hervorging, bis hin zu Beam Base. Dieses Basismodell entstand auf einem Cluster von 6.144 Grafikkarten und wurde auf 23,8 Billionen Token aus dem offenen Web und kommerziellen Quellen trainiert, mit hohem Code-Anteil und eigenen Filtern je Programmiersprache. Beam Base war in unter vier Wochen fertig, es folgte eine Midtraining-Phase, die Kontextfenster und Reasoning erweiterte. Für die rechenintensivste Phase startete Reflection 10.000 GB300-Karten und 1,3 Milliarden Reinforcement-Learning-Sandboxes für Aufgaben wie Codegenerierung, Websuche und Agentenbetrieb. Laut Unternehmen dauerte auch diese Phase vier Wochen, bei 71 Fehlern mit einer medianen Wiederanlaufzeit von acht Minuten.

Die Finanzierungsgeschichte dahinter ist steil. Misha Laskin, zuvor verantwortlich für Reward Modeling bei Googles Gemini-Projekt, und Ioannis Antonoglou, Mitentwickler von AlphaGo, gründeten Reflection im März 2024 in Brooklyn zunächst zur Automatisierung von Softwareentwicklung. Im März 2025 kam das Unternehmen mit 130 Millionen Dollar bei rund 545 Millionen Bewertung aus dem Stealth-Modus, im Juli 2025 folgte der Code-Agent Asimov. Im Oktober 2025 nahm Reflection 2 Milliarden Dollar bei 8 Milliarden Bewertung auf, unter anderem von Nvidia und Sequoia, bei rund 60 Mitarbeitern, und positionierte sich als offenes Frontier-Labor für Unternehmen und Regierungen. Laskin begründete den Kurs damals mit DeepSeek und Qwen als Weckruf: Ohne Gegenbewegung werde der globale Standard für künstliche Intelligenz von anderen gesetzt.

2026 kamen Infrastruktur und Staatskunden dazu. Im März unterzeichnete Reflection eine Absichtserklärung mit Shinsegae über ein 250-Megawatt-Rechenzentrum in Südkorea, im Mai wurde das Unternehmen Modellanbieter für die Genesis Mission des US-Energieministeriums und bedient damit die 17 nationalen Labore. Im Juni bestätigte Reflection den Abschluss der Runde bei 25 Milliarden Dollar Pre-Money-Bewertung und sicherte sich über einen Compute-Deal Zugang zum Colossus-Rechenzentrum von SpaceX. Berichtet wird von einem Volumen von 6,3 Milliarden Dollar für gemietete Nvidia-GB300-NVL72-Systeme mit je 72 Grafikkarten, auf denen Beam trainiert wurde. Im Juli sagte Nebius Rechenleistung im Wert von über einer Milliarde Dollar mit GB300-Chips bis 2029 zu. Beam ist nach dieser Darstellung das erste offene Modell eines US-Startups, das sich bei vergleichbaren Aufgaben mit den chinesischen Spitzenmodellen messen kann; zu geschlossenen Frontier-Modellen bleibt ein Abstand. → implicator, The Information, SiliconANGLE

Synthszr Take: Von 545 Millionen auf 25 Milliarden Bewertung in fünfzehn Monaten, und die Rechnungen dafür sind längst geschrieben: 6,3 Milliarden für gemietete GB300-Systeme über SpaceX, über eine Milliarde an Nebius bis 2029. Diese Verpflichtungen laufen, während Beam noch im Red-Teaming steckt und die Gewichte erst „später diesen Monat“ kommen sollen. Eine solche Bewertung ist im Kern eine Vorfinanzierung von Rechenzeit, die sich in zahlenden Kunden zurückverdienen muss, und zwar schneller, als die nächste Veröffentlichung aus Hangzhou oder Peking den Abstand wieder einebnet. Dass Beam in Reflections eigener Tabelle bei den meisten Coding-Zeilen hinter GLM-5.3, Kimi K3 und DeepSeek V4.1 Flash liegt und bislang keine unabhängige Messung vorliegt, ist für die Kapitalgeber das teuerste Detail dieser Ankündigung. Der Maßstab für die nächste Runde sind die 17 nationalen Labore und die Regierungskunden, die am Ende Rechnungen begleichen.

Metas Agent Muse legt heimlich Profilseiten über Freunde und Familie an

Metas persönlicher KI-Agent Muse ist darauf ausgelegt, „eine Seite für jede Person im Leben des Nutzers“ anzulegen, inklusive persönlicher Vorgeschichte und Beziehungsdetails. Diese internen Anweisungen hat der unabhängige KI-Sicherheitsforscher Karan Joshi über einen normalen Chatverlauf herausgeholt; WIRED berichtete darüber am 3. Oktober. Nach Angaben von Meta speist sich der Kontext aus öffentlichen und vom Nutzer selbst geteilten Informationen, etwa der Rechnung eines Handwerkers oder den Lieblingsblumen des Partners. Parallel schilderte der Technologie-Kolumnist Jason Aten am 19. September bei Inc., Muse habe ihm angeboten, ein Gespräch aus seinem Podcast zu recherchieren, und eine Deadline-Nachricht seines Redakteurs markiert, obwohl er den Zugriff auf Nachrichten abgelehnt und Full Disk Access deaktiviert hatte. Meta-Kommunikationschef Andy Stone bestreitet einen Zugriff ohne diese Freigaben, Consumer-Engineering-Chef David Singleton nennt die Erklärung des Agenten selbst verwirrt; der Widerspruch ist bislang ungeklärt, ein Rechtebruch nicht unabhängig belegt. → Techpresso

Synthszr Take: Die Grenzüberschreitung kommt hier als Hilfsangebot daher: Der Agent fragt nicht um Erlaubnis, er schlägt etwas vor, das du ihm nie erzählt hast. Aten hatte den Nachrichtenzugriff abgelehnt und Full Disk Access ausgeschaltet, trotzdem lag plötzlich die Deadline-Mail seines Redakteurs auf dem Tisch, und ob das ein Bug, ein Benachrichtigungs-Banner oder etwas anderes war, kann bis heute niemand sauber sagen. So fühlt sich ein Agent an, der dauerhaft in Metas Cloud weiterläuft: Du schließt die App, er arbeitet weiter, und beim nächsten Öffnen weiß er mehr als beim letzten Mal.

Bloomberg: Chinas KI-Modelle liegen nur noch 3 Prozent hinter US-Spitzenmodellen

Der Vorsprung amerikanischer KI-Modelle gegenüber chinesischen ist laut einer Bloomberg-Untersuchung auf rund 3 Prozent geschrumpft. Als Treiber nennt die Analyse nicht neue Rekordwerte bei der Rohleistung, sondern hohe Effizienz und niedrige Kosten auf chinesischer Seite. Den Auslöser datiert ein zweiter Bericht von implicator.ai auf den September: Nach dem jüngsten DeepSeek-Release sei die Lücke in den gängigen Leistungstests auf diese 3 Prozent zusammengefallen. Welche Benchmark-Familien in die Rechnung eingehen und wie stark einzelne Testsätze gewichtet werden, geht aus den referierten Meldungen nicht hervor. → TechOrange 科技報橘

Synthszr Take: Drei Prozentpunkte Abstand liegen in einem Bereich, den Benchmark-Suiten kaum noch sauber auflösen, und damit verliert die Frage nach dem besten Modell ihren praktischen Wert. Spannend wird die zweite Zahl aus demselben Newsletter: Eine Stanford-geführte Studie findet, dass das billigere Modell in 32 Prozent der Vergleiche am Ende teurer kommt, weil es mehr Durchläufe und mehr Token braucht. Chinas Labore optimieren genau an dieser Stelle, weil Chip-Exportkontrollen ihnen keine Wahl lassen; Knappheit war über zwei Jahre hinweg ihre härteste Trainingsbedingung.

OpenAIs GPT-6.1 Sol kostet ein Fünftel von Astra und schlägt es im Test

OpenAI hat auf der DevDay-Keynote am 29. September 2026 das Modell GPT-6.1 Sol vorgestellt und bewirbt es nach eigenen Angaben als „Near-Astra intelligence for a fifth of the price“. Der Eintrag dazu auf Hacker News sammelte 1.066 Punkte und über 950 Kommentare. Simon Willison, der die Keynote live mitschrieb, ließ das Modell anschließend durch seinen Pelikan-SVG-Test laufen und hält die Ergebnisse für nicht nennenswert verschieden von denen der GPT-6-Familie; getestet wurden mehrere Stufen des Reasoning Effort von Medium bis Max. Ein weiterer Kommentator verglich die Modelle in einem Pac-Man-Bakeoff, bei dem jedes Modell ein spielbares Pac-Man bauen muss. Dort erreichte GPT 6.1 Sol 91 Punkte bei rund neun Minuten Laufzeit und 51 Cent Kosten. → Simon Willison from Simon Willison’s Newsletter

Synthszr Take: Im Pac-Man-Test kostet ein Durchlauf mit Sol 51 Cent und bringt 91 Punkte, während Astra für 2,42 Dollar bei 87 Punkten landet. Das eigene Spitzenmodell vom Frühjahr ist damit das schwächste Preis-Leistungs-Angebot im eigenen Haus, und OpenAI schreibt diese Einordnung gleich in die Ankündigung. Opus 5.5 holt acht Punkte mehr als Sol, zum rund vierfachen Preis: Diese Rechnung muss jedes Team aufmachen, das Agenten im Dauerbetrieb laufen lässt, und sie fällt je nach Aufgabe unterschiedlich aus.

Berliner n8n-Chef: Claude tötet uns nicht

n8n-Gründer Jan Oberhauser hat im Podcast von Aakash Gupta erklärt, warum sein Workflow-Tool trotz Claude Code und OpenAIs Agent Builder weiter wächst. Als OpenAI am 6. Oktober 2025 den Agent Builder vorstellte, erklärten zahlreiche Posts n8n und Zapier für erledigt; laut Oberhauser wurde es eine der besten Wochen in der Firmengeschichte. Im Mai investierte SAP bei einer Bewertung von 5,2 Milliarden Dollar, mehr als dem Doppelten des Vorjahreswerts, und bettete n8n in sein Agentenwerkzeug Joule Studio ein. Nach Angaben des Unternehmens kommt n8n inzwischen auf über 200.000 GitHub-Sterne, 1,5 Millionen aktive Nutzer und 1.200 Kunden im Enterprise-Produkt. Oberhauser beschreibt den Unterschied zu Claude Code über die Orchestrierungsschicht: Freigabeschritte vor riskanten Aktionen, eine Protokollierung jeder Ausführung Knoten für Knoten samt Neustart ab diesem Punkt, dazu Versionshistorie und Übergabe an Kollegen per Einladung statt per GitHub. → Aakash Gupta from Product Growth

Synthszr Take: Oberhausers Vierschritt ist die kompakteste Produktlehre zu Agenten, die man derzeit bekommen kann: beschreiben, freigeben, protokollieren, übergeben. Schritt eins beherrscht inzwischen jedes brauchbare Modell in der Kommandozeile, über die Schritte zwei bis vier entscheidet sich, ob ein Ablauf eine Demo bleibt oder in den Betrieb geht. Der Satz vom Unterschied zwischen 95 Prozent und 100 Prozent Zuverlässigkeit beschreibt die ganze Arbeit, die in Produktentwicklungsteams gerade unterschätzt wird, weil das erste Ergebnis so schnell da ist.

Münchener Robotik-Startup ist jetzt auch ein Unicorn

Das Münchner Robotik-Startup RobCo hat laut einem exklusiven Bericht des Wall Street Journal Anteile in einer Transaktion verkauft, die das Unternehmen mit mehr als einer Milliarde Dollar bewertet. Das ist doppelt so viel wie bei der vorherigen Runde Anfang desselben Jahres. RobCo baut autonome Industrieroboter, die wiederkehrende manuelle Tätigkeiten in Produktionsbetrieben übernehmen, etwa das Stapeln von Paletten oder das Abwiegen von Rohstoffen. Neues Vorzeigeprodukt ist ein zweiarmiger, selbstlernender Roboter namens Alfie, der nach Angaben des Unternehmens die Arbeitsweise eines Menschen an der Fertigungslinie nachbilden soll. → Wall Street Journal

Synthszr Take: Eine Verdopplung der Bewertung binnen eines Jahres, ohne dass eine einzige Umsatzzahl öffentlich auf dem Tisch liegt: Hier wird eine Erwartung bepreist, keine Lieferhistorie. Kapital sucht gerade händeringend nach einem europäischen Namen für Physical AI, und Alfie liefert genau das Bild, das sich in einem Investment Memo gut ausmalt: ein zweiarmiger Humanoid-Verschnitt an der Linie. Industrieroboter werden allerdings über Stillstandszeiten, Servicetechniker in erreichbarer Entfernung und mehrjährige Wartungsverträge verkauft; Vorführvideos zählen beim Einkäufer im Mittelstand wenig.

Notion-Designer Nathan Baschez hält persönliche KI-Agenten für die falsche Wette

Nathan Baschez argumentiert in einem Gastbeitrag für den Newsletter The Leverage gegen die in Silicon Valley verbreitete These, Personal Agents seien die Allzwecklösung für die Zukunft der Arbeit. Anlass ist eine Welle von Produktstarts: Laut dem Newsletter hat in den vergangenen zwei Monaten gefühlt jede Firma im Umkreis von 20 Meilen um Stanford ein Produkt dieser Kategorie veröffentlicht, darunter Grok Bots, Muse und OpenAIs Dots. Der Herausgeber schreibt, dass er bei so viel Einigkeit im Valley reflexhaft nach einer Gegenstimme suche, und hat Baschez darum gebeten. Baschez ist derzeit Produktdesigner bei Notion, zuvor war er Gründer von Lex und Every und arbeitete bei Gimlet Media und Substack; er hat die erste Version von Product Hunt gestaltet und gebaut. → Nathan Baschez from The Leverage

Synthszr Take: Grok Bots, Muse und Dots in zwei Monaten, und alle drei unterstellen, dass Arbeit ein Einzelsport ist. Der Einwand von Baschez sitzt, bleibt aber zu zurückhaltend: Was einen Vorgang in einer Organisation aufhält, ist fast immer eine Freigabe von jemandem mit anderen Zielen, und daran ändert ein noch so gut informierter Assistent nichts. Wo Automatisierung in Unternehmen wirklich trägt, war vorher geklärt, wer bei Unsicherheit übernimmt und ab welcher Schwelle ein Mensch den Fall auf den Tisch bekommt; diese Klärung verkauft kein Anbieter als Lizenz.

OpenAI macht Text-Wasserzeichen in der API freiwillig, in der EU verpflichtend

OpenAI lässt Entwickler ab sofort weltweit Wasserzeichen für Textausgaben ausgewählter Modelle über die API aktivieren. Die Funktion ist standardmäßig ausgeschaltet; nach Angaben des Unternehmens sollen Kunden selbst entscheiden, wie Wasserzeichen zu ihren Transparenzpflichten und ihren Produkten passen. Aktiviert wird auf Projekt- oder Organisationsebene, einzelne API-Aufrufe müssen danach nicht angepasst werden. Parallel soll in den kommenden Wochen Text aus ChatGPT und Codex für Nutzer in der EU automatisch mit einem unsichtbaren Wasserzeichen versehen werden, über alle Tarife hinweg. Hintergrund ist Artikel 50 des EU AI Act, der Anbieter generativer Systeme verpflichtet, erzeugten Text maschinenlesbar erkennbar zu machen; für bereits am Markt tätige Anbieter läuft die Frist bis zum 2. Dezember.

Das Verfahren heißt textGrain und bettet ein statistisches Signal in die Wortwahl des Modells ein, indem bei mehreren passenden Alternativen bestimmte Wörter bevorzugt werden. Über längere Passagen ergibt sich daraus ein Muster, das ein Detektor erkennen soll. OpenAI gibt an, textGrain habe in eigenen Tests die Erkennungsleistung von Googles SynthID für Text erreicht oder übertroffen, räumt aber ein, dass gute Werte unter Idealbedingungen keine verlässliche Erkennung im Alltag garantieren. Die Technologie soll als frei verfügbare Software veröffentlicht werden.

Die veröffentlichten Messwerte zeigen die Grenzen. Bei einer angestrebten Falsch-Positiv-Rate von einem Prozent erkannte der Detektor Wasserzeichen in rund 80 Prozent der 200-Token-Passagen und etwa 95 Prozent der 400-Token-Passagen, gemessen an Antworten zu psychologischen Fragen. Bei Inhalten mit weniger sprachlichem Spielraum, etwa Mathematik, fällt die Quote deutlich ab; Code gilt ebenfalls als schwer zu kennzeichnen. Bearbeitung schwächt das Signal zusätzlich: Werden in einer 400-Token-Passage 10 Prozent der Wörter durch Synonyme ersetzt, sinkt die Erkennung von etwa 92 auf 66 Prozent, bei 25 Prozent auf 17 Prozent.

Den Detektor gibt OpenAI vorerst nicht frei. Zugang können ab sofort geprüfte Forscher und Fachorganisationen beantragen, die Vergabe erfolgt im Einzelfall. Das Werkzeug meldet laut Unternehmen nur, ob ein OpenAI-Wasserzeichen vorliegt, ohne Nutzer zu identifizieren oder Prompts und Konversationen offenzulegen. Für Bilder und Audio bleiben die bestehenden Prüfwerkzeuge öffentlich zugänglich, darunter die Content Provenance API und Content Credentials nach dem C2PA-Standard, die seit 2024 im Einsatz sind.

Anthropic war im August vorangegangen und hatte Wasserzeichen für Claude angekündigt, allerdings mit anderem Zuschnitt: Die Kennzeichnung wird auf Modellebene angewendet und greift damit unabhängig davon, über welches Produkt oder welche Oberfläche der Text entsteht, einschließlich der API. Als Begründung nannte das Unternehmen, es gebe bislang keinen verlässlichen Weg, die Technik regional zu begrenzen. Ein Opt-out für API-Entwickler beschreibt Anthropic nicht. Betroffen von der Dezember-Frist sind neben beiden Anbietern auch Microsoft, Google und Meta. → OpenAI, The New Stack, Engadget, The Verge

Synthszr Take: Ein Wasserzeichen, das standardmäßig aus ist, kennzeichnet vor allem die Ausgaben derjenigen, die ohnehin transparent sein wollen. Spam-Farmen, Essay-Mühlen und Desinformationsdienste lassen den Schalter einfach aus, und das kostet sie nichts. Selbst mit eingeschaltetem Signal zerfällt die Beweiskraft schnell: 10 Prozent der Wörter durch Synonyme ersetzt, und die Erkennung sackt von 92 auf 66 Prozent ab, bei 25 Prozent bleiben 17 übrig. Dass der Detektor nur ausgewählten Forschungseinrichtungen offensteht, macht die Kennzeichnung für Schulen, Redaktionen und Gerichte auf absehbare Zeit praktisch wertlos. Als Compliance-Antwort auf Artikel 50 ist das sauber gebaut, als Instrument gegen Missbrauch taugt es wenig; am Ende wird die Variante zählen, die ab Dezember in der EU automatisch läuft.

Im Artikel erwähnt

Search is about rankings, AI is not.

RAIDAR (may update)

Search is about rankings, AI is not.

From a ranking, you can't tell which audience sees which answer, which sources the models trust, or which areas no one has claimed yet. RAIDAR maps all of it across every model, customer segment, and market, down to the sources that feed the answers. Not a ranking. A map that tells you where to move. For brands that want to know.

More about RAIDAR →

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.