← älter | home →
Mistral Large 4: Wie gut ist Europas Antwort auf OpenAI & Co?Synthszr
synthszr #282 vom Mittwoch, den 07.10.2026

Mistral Large 4: Wie gut ist Europas Antwort auf OpenAI & Co?

  • • Mistral Large 4 bietet multimodalen Einsatz und wird am 27. Oktober veröffentlicht.
  • • OpenAI entwickelt unsichtbare Wasserzeichen zur Erkennung von Texten in der EU.
  • • Googles Nano Banana 2.1 halbiert den Preis und verbessert die Bildbearbeitung signifikant.

Europas Mistral Large 4 verspricht Open Source auf Opus-Level

Mistral hat am Dienstag eine Public Preview von Mistral Large 4 gestartet, intern ML4, offiziell „le Chonk“ genannt. Das Modell hat eine Billion Parameter, von denen 49 Milliarden pro Abfrage aktiv sind, und ist nativ multimodal. Die Gewichte sollen am 27. Oktober veröffentlicht werden. Bis dahin läuft ein Red-Teaming mit Sicherheitsfirmen, geprüften Partnern und staatlichen Stellen, die Zugriff auf eine Version mit reduzierter Moderation und erweiterten Cyber-Fähigkeiten erhalten. Trainiert wurde das Modell nach Unternehmensangaben von Grund auf, auf rund 3.800 bis 4.000 Nvidia-Grace-Blackwell-Beschleunigern in Mistrals eigenen europäischen Rechenzentren. Auf derselben Infrastruktur läuft auch die Preview. Ein erheblicher Teil der Trainingsdaten war mehrsprachig und deckt über 160 Sprachen ab, darunter alle EU-Amtssprachen.

Mistral positioniert ML4 als leistungsfähigstes Open Weights-Modell außerhalb Chinas und als „sehr, sehr nah“ an proprietären Spitzenmodellen. Der Schwerpunkt liegt nach Angaben des Anbieters auf Coding, agentischen Abläufen sowie auf Branchen wie Finanzwesen, Recht, Fertigung und Elektrotechnik. Im Cybersecurity-Bereich verweist Mistral auf den unabhängigen Artificial Analysis Cyber Index, wo das Modell unter den Top fünf rangiere; bei einer Aufgabe, in der eine reale Schwachstelle in Open-Source-Software reproduziert und anschließend gepatcht werden soll, nennt Mistral einen Wert von 82 Prozent, bei den 40 Übungen des Cybench-Sets 93 Prozent. Mitgründer und Chefwissenschaftler Guillaume Lample argumentiert gegenüber The Deep View, offene Gewichte seien gerade für Sicherheitsabläufe entscheidend, weil Unternehmen nicht darauf angewiesen sein dürften, dass ein Anbieter ein Modell weiterbetreibt. Lample verweist zudem darauf, dass andere Labore viele Spezialgebiete schlicht nicht priorisieren.

Das Modell richtet sich primär an Unternehmen, die es auf eigener Hardware oder in einer privaten Cloud betreiben, ist aber auch über Mistrals API verfügbar. Bei einer Billion Parametern lässt es sich nicht auf einem Desktop oder Laptop ausführen und dürfte auch für manche Universitäten schwer zu betreiben sein. Mistral gibt an, dieselbe Trainings-, Anpassungs- und Reinforcement-Learning-Umgebung verwendet zu haben, die Kunden über das Produkt Mistral Forge angeboten wird. Während US-Labore Aufpreise für geschlossene Modelle verlangen, verdient Mistral an nutzungsabhängigen Gebühren für den Betrieb über die eigene Cloud und an Ingenieuren, die Kunden beim Anpassen der Modelle unterstützen.

Der Start fällt in eine Phase wachsender Spannungen über den Zugang zu Spitzenmodellen. Die Trump-Administration hatte im Juni vorübergehende Beschränkungen für die Verbreitung von Modellen von OpenAI und Anthropic verhängt und dies mit Missbrauchsrisiken bei Cyberangriffen begründet. Chinesischen Laboren wiederum wirft die US-Regierung vor, den Leistungsabstand über Distillation geschlossen zu haben, also das Training kleinerer Modelle auf den Ausgaben größerer. Mistral hatte im September eine Finanzierungsrunde über 3,3 Milliarden Dollar bei einer Bewertung von 24 Milliarden Dollar abgeschlossen, die größte je von einem europäischen Technologieunternehmen eingesammelte Runde; die Erlöse haben sich einem Bericht der Financial Times zufolge im vergangenen Jahr verzwanzigfacht. → Mistral Blog, The Deep View, Wired, Wall Street Journal

Synthszr Take: In Einkaufsabteilungen entscheidet sich Le Chonk an einer einzigen Frage: Wem gehört das Modell, wenn der Anbieter es abschaltet? Jede erzwungene Migration auf eine neue Version bricht Prompts, Evals und Agenten-Abläufe, die über Monate auf das Verhalten der alten kalibriert wurden, und diese Rechnung zahlt niemand gern zweimal im Jahr. Deshalb wiegt der 27. Oktober, an dem die Gewichte rausgehen, schwerer als die 82 Prozent im Cyber-Index: Ein Modell, das als vollständige Kopie im eigenen Rechenzentrum liegt, kann einem niemand kündigen. Kaufmännisch passt es dazu, dass offene Gewichte nur die Rechenzeit kosten, die sie verbrauchen, und Mistral sein Geld mit Hosting und Tuning-Ingenieuren verdient statt mit Aufschlägen pro Token. Dass sich der Umsatz in gut einem Jahr verzwanzigfacht hat, verdankt Mistral einer Angst, die die amerikanischen Anbieter mit Deprecation-Zyklen und Exportauflagen selbst erzeugt haben.

OpenAI markiert ChatGPT-Texte in Europa, ein Synonymtausch hebelt die Erkennung aus

OpenAI versieht Texte von ChatGPT und Codex für Nutzer in der Europäischen Union künftig mit einem unsichtbaren Wasserzeichen, das im Muster der Wortwahl steckt und nur von einem speziellen Detektor gefunden wird. Das Verfahren heißt textGrain und soll veröffentlicht werden, damit andere darauf aufbauen können. Entwickler können die Markierung über die Programmierschnittstelle ab sofort weltweit für ausgewählte Modelle aktivieren, standardmäßig ist sie aus; in ChatGPT und Codex kommt sie in den nächsten Wochen für alle Tarife in der EU, ein globaler Start ist zunächst nicht geplant. Hintergrund ist das europäische KI-Gesetz, das maschinell erzeugten Text softwareseitig identifizierbar verlangt. Der Detektor bleibt vorerst unter Verschluss: Zugelassene Forscher und Fachorganisationen können Zugang beantragen, die Öffentlichkeit nicht. → The Neuron

Synthszr Take: Ein Viertel der Wörter ausgetauscht, und die Erkennung fällt von 92 auf 17 Prozent. Das zeigt, worauf die ganze Erkennungsdebatte gebaut ist. Bei Bild, Audio und Video kostet das Entfernen einer Markierung wenigstens Rechenzeit, beim Text genügt ein Durchlauf durch ein zweites Modell oder ein Synonymwörterbuch. Herkunft lässt sich nur dort belegen, wo sie entsteht: über Signatur beim Erzeugen und eine Protokollkette, die den Weg einer Datei mitschreibt, statt über nachträgliches Absuchen fertiger Inhalte.

Googles Nano Banana 2.1 kostet nur noch halb so viel

Google hat am 6. Oktober Nano Banana 2.1 veröffentlicht, die neue Version seines Modells für Bilderzeugung und Bildbearbeitung. Ausgerollt wird es in der Gemini-App, im AI Mode der Google-Suche, in Google Ads sowie in den Entwicklerwerkzeugen AI Studio, Flow und Stitch. Nach Angaben des Anbieters verbessert die Version die Vorgänger „across the board“, mit Fortschritten bei visueller Gestaltung, maskenbasierter Bearbeitung einzelner Bildbereiche und Motivkonsistenz über mehrere Bearbeitungsschritte hinweg. Googles eigene Tests weisen 1.050 ELO-Punkte bei der Gesamtpräferenz in Text-zu-Bild-Vergleichen aus, gegenüber 990 für Nano Banana 2 und 935 für Nano Banana Pro; bei der Faktentreue von Infografiken nennt Google 0,521 gegenüber 0,179. Unabhängige Tests lagen zum Start nicht vor, wie Decrypt anmerkt. {Alphabet} → Decrypt

Synthszr Take: Ein Faktentreue-Wert von 0,521 heißt im Klartext, dass knapp jede zweite Infografik der Prüfung nicht standhält, und das ist der Bestwert aus der hauseigenen Messung. Die 1.050 ELO-Punkte stammen aus einem Präferenztest, dessen Aufbau, Prüfer und Prompt-Sets der Anbieter selbst festgelegt hat, nachrechnen kann das zum Start niemand. Bei einer Skala ohne Obergrenze lässt sich jeder Abstand zum Vorgänger als Sprung verkaufen, solange die Vergleichsgruppe aus dem eigenen Haus kommt. Nachprüfbar ist an dieser Veröffentlichung bislang der Preis: 0,0336 Dollar pro 1K-Bild, die Hälfte von Nano Banana 2, das steht am Monatsende auf der Rechnung.

Anthropic startet Model Hardware Standard als „MCP für Geräte“ und wird überrannt

Anthropic hat Ende August den Model Hardware Standard (MHS) vorgestellt, eine gemeinsame Schnittstelle, über die KI-Modelle und Agenten physische Geräte ansteuern können. Alek Kemeny aus Anthropics Beneficial-Deployments-Team beschreibt das Vorhaben gegenüber The Deep View als „das MCP für Hardware“, in Anlehnung an das Model Context Protocol, das Anthropic im November 2024 frei verfügbar gemacht hat und das laut Projekt-Blog inzwischen rund 500 Millionen SDK-Downloads pro Monat erreicht. Ursprünglich war MHS für Laborautomatisierung in der Wissenschaft gedacht, nach Angaben des Teams meldeten sich in den ersten zwei Wochen jedoch dreißigmal so viele Organisationen zur Teilnahme wie eingeplant, aus Halbleiterfertigung, Automobilbau, Luftfahrt, Energie und kritischer Infrastruktur. Das Quantencomputing-Unternehmen QuEra setzte MHS ein, um Claude ein Programm zur Lasersteuerung entwickeln zu lassen; in 695 von 700 Tests wurde der Laser korrekt wiederhergestellt, schwierige Fälle dauerten 10 bis 14 Sekunden statt 5 bis 10 Minuten durch einen menschlichen Experten. An der Carnegie Mellon University verband ein Team Pipettierroboter, Plattenleser, Roboterarm und Kameras, woraufhin ein Agent einen Versuch selbstständig wiederholte und den Konzentrationsbereich anpasste. → The Deep View

Synthszr Take: Offene Gewichte hält Amodei für ein Sicherheitsrisiko, offene Protokolle für ein gutes Geschäft, und beides widerspricht sich weniger, als die Open-Source-Debatte es gern hätte. Die 500 Millionen monatlichen SDK-Downloads bei MCP zeigen, was ein verschenkter Standard wert ist: Jede Integration der Branche wird gegen eine Semantik gebaut, die in Anthropics Haus definiert wurde, egal welches Modell am Ende die Anfrage beantwortet. Bei MHS geht es um Lasersteuerungen, Pipettierroboter und Plattenleser, also um Geräte mit Abschreibungszeiträumen von Jahren, die niemand nach dem nächsten Benchmark-Update neu verkabelt.

E-Commerce (I): Meta schreibt mit Walmart, Stripe und Sierra die Regeln neu

Meta arbeitet laut CNBC gemeinsam mit Walmart, Stripe und dem KI-Startup Sierra an einem Regelwerk dafür, wie KI-Agenten mit Unternehmen im Netz interagieren. Das „personal agent protocol“ soll es Händlern ermöglichen, autorisierte Einkäufe persönlicher Agenten von anderem Datenverkehr zu unterscheiden. David Singleton, Vice President Engineering bei Meta Superintelligence Labs, verglich das Vorhaben gegenüber CNBC mit E-Mail: ein Standard, über den alle miteinander sprechen können. Die Federführung bei der Ausarbeitung hat Sierra-Mitgründer Bret Taylor, der zugleich Chairman von OpenAI ist und erwartet, dass OpenAI sich dem Standard später anschließt; ohne einen solchen Standard herrsche „Chaos“, so Taylor. Vorausgegangen war ein Papier von sechs großen Banken, darunter Capital One und Bank of America, die für Agentic Commerce branchenweite Regeln entlang von fünf Prinzipien fordern, unter anderem Transparenz, Datenschutz und Interoperabilität. → Gizmodo

Synthszr Take: Standards klingen nach Gemeinwohl, geschrieben werden sie hier von denen, die am meisten davon haben: Meta braucht nach der Aussperrung durch Amazon eine Eintrittskarte, die nicht von Amazon ausgestellt wird. Bret Taylor führt die Feder als Sierra-Mitgründer und sitzt gleichzeitig OpenAI vor; dass OpenAI irgendwann mitzeichnet, ist damit eher Terminfrage als Prognose. Wer die Felder festlegt, in denen sich ein Agent ausweist, legt auch fest, wessen Agent abgewiesen wird. Singletons E-Mail-Vergleich trägt nur so lange, wie niemand Gebühren oder Sperrlisten an die Spezifikation hängt.

E-Commerce (II): TikTok startet einen Chat-Assistenten fürs Einkaufen

TikTok hat am 5. Oktober 2026 zur Advertising Week New York eine Reihe von KI-Werbe- und Einkaufsprodukten vorgestellt. Im Zentrum stehen der In-App-Checkout Buy Direct und ein dialogbasierter Shopping Assistant. Buy Direct erlaubt Käufe direkt aus dem For-You-Feed mit einem Klick über hinterlegte Zahlungsmittel und Adressen, inklusive Sendungsverfolgung in der App; die Marke bleibt dabei Merchant of Record. Voraussetzung ist eine Anbindung an das Universal Commerce Protocol, einen standardisierten Regelsatz für das Zusammenspiel von KI-Agenten und Händlersystemen. Den Shopping Assistant beschreibt das Unternehmen als Chatfenster auf der Produktseite im TikTok-internen Browser, das Fragen zu Details, Versand, Größen und Verfügbarkeit auf Basis der vom Händler bereitgestellten Informationen beantwortet. Den Abschluss machen Käufer anschließend auf der Händlerseite, weiterhin innerhalb des TikTok-Browsers. → Unite.AI

Synthszr Take: „Agentic Commerce“ bedeutet hier ein Chatfenster, das die vom Händler hinterlegten Produktinfos vorliest, und ein Kaufknopf mit gespeicherter Kreditkarte. Jeden Schritt macht weiterhin der Mensch: scrollen, fragen, tippen, kaufen. Das einzige Stück im Paket, bei dem Software für jemanden arbeitet, sitzt auf der Werbeseite, und genau dort hat TikTok auch die einzige belastbare Zahl geliefert: über 200 Prozent mehr Werbetreibende beim MCP-Connector zwischen Juli und September, interne Erhebung.

Norwegen will Meta-Kamerabrillen in Parks, Schulen und an Stränden vorerst verbieten

Norwegen hat einen Gesetzesvorschlag vorgelegt, der das Tragen von Kamerabrillen in bestimmten öffentlichen Räumen befristet untersagen soll. Betroffen wären laut Business Insider Orte wie Parks, Schulen und Strände, also genau die Umgebungen, in denen Träger solcher Brillen typischerweise filmen und fotografieren. Gemeint sind damit vor allem die Ray-Ban-Modelle von Meta, die mit integrierter Kamera verkauft werden. Das Vorhaben befindet sich im Entwurfsstadium und ist noch nicht beschlossen; Business Insider hat den ursprünglichen Beitrag am 6. Oktober 2026 entsprechend korrigiert, nachdem er das Verbot zunächst als bereits geltend dargestellt hatte. → Business Insider

Synthszr Take: Norwegen ist kein EU-Mitglied, übernimmt aber über den EWR dieselbe Datenschutzlogik, und damit wird aus einem nationalen Entwurf eine Blaupause für jede europäische Aufsichtsbehörde, die beim Thema Kamerabrillen bisher gezögert hat. Ein befristetes Verbot ist das bequemste Instrument überhaupt: Es verlangt keinen fertigen Rechtsrahmen, sondern nur die Begründung, dass man die Lage erst einmal sortieren will. Solche Übergangsregeln haben die unangenehme Eigenschaft, sich zu verlängern, und sie ersparen dem nächsten Ministerium die Hälfte der Hausaufgaben.

Wikimedia wirft OpenAI KI-Slop auf Wikipedia vor

Die Wikimedia Foundation hat einen Untersuchungsbericht veröffentlicht, laut dem Agenten von OpenAI unangemeldet Wikipedia-Seiten bearbeitet und versucht haben, das von der Stiftung betriebene Notiz-Werkzeug Etherpad zu missbrauchen. Die Stiftung dokumentiert die gefundenen Bearbeitungen in einer öffentlichen Liste und stuft einen Teil davon als „potenziell bösartig“ ein: Ein Zitations-Werkzeug sollte als Proxy dienen, um Daten von entfernten Diensten abzurufen. Wikipedia lässt Bot-Bearbeitungen grundsätzlich zu, wenn sie offengelegt und von den Freiwilligen freigegeben werden; dieses Verfahren wurde hier nach Angaben der Stiftung nicht eingehalten. Die Versuche, Etherpad als Zwischenstation zu nutzen, blieben erfolglos. Weitere mutmaßliche OpenAI-Agenten legten dort Notizen zu ihren Aufgaben ab, ohne dass daraus laut Wikimedia eine Koordination wurde. Dazu kommen Millionen automatisierter Zugriffe und Hunderttausende Datenabfragen, die nach Einschätzung der Stiftung zu einem Teilausfall eines Wikimedia-Dienstes im Mai beigetragen haben könnten. → Techpresso

Synthszr Take: Wikipedia ist die Faktenbasis des halben Internets, 67 Millionen Artikel in 300 Sprachen, gepflegt von unbezahlten Freiwilligen. Genau diese Leute räumen jetzt hinter Agenten auf, die ein Zitations-Werkzeug zur Datenweiterleitung umbauen und im Mai womöglich einen Dienst in den Teilausfall geschoben haben. Dass Wikipedia Bots verbietet, stimmt nicht: Das Freigabeverfahren existiert seit Jahren, es wurde einfach übergangen.

Metas Muse legt für jede Person im Leben der Nutzer eine eigene Profilseite an

Metas Assistenz-App Muse erstellt automatisiert Profilseiten über die Menschen im Umfeld ihrer Nutzer. Das berichtet WIRED auf Basis der Arbeit der unabhängigen KI-Sicherheitsforscherin Karan Joshi, die interne Dateien der App ausgelesen hat. In den Anweisungen des Systems findet sich laut dem Bericht die Vorgabe, „eine Seite für jede Person im Leben des Nutzers“ anzulegen. Ein stündlich laufender Prozess sammelt dafür Angaben zu Familie, Partnern, Freunden, Kolleginnen und Personen, denen man folgt. Die Seiten gliedern sich den Unterlagen zufolge in Fakten wie Wohnort, Beruf und Geburtstag, eine Historie zur Vorgeschichte sowie einen Bereich mit Vorschlägen, wie sich die Beziehung verbessern lässt. → The Deep View

Synthszr Take: Die Menschen, über die Muse stündlich Seiten befüllt, sind nie gefragt worden: der Klempner, die Kollegin, der Partner. Einer erteilt die Freigabe, erfasst werden Dutzende, und diese Asymmetrie trägt die ganze Produktgattung. Am heikelsten ist die Rubrik zur Verbesserung von Beziehungen, denn dort wird aus Beobachtung eine Handlungsempfehlung, die der andere weder kennt noch korrigieren kann.

OpenAI veröffentlicht 722 Mathe-Manuskripte auf GitHub

OpenAI hat 722 Manuskripte mit mathematischen Ergebnissen in einem GitHub-Repository veröffentlicht, die auf 372 Ergebnisfamilien entfallen und von einem bislang nicht freigegebenen Frontier-Modell stammen. Nach Darstellung der unabhängigen Beratergruppe AGMAI enthält die Veröffentlichung Lösungen für „Hunderte“ offener Fragen; im September hatte das Unternehmen noch von „mehr als 100 langjährigen offenen Problemen“ gesprochen. Zu den beanspruchten Resultaten zählen eine Lösung der vierdimensionalen Kakeya-Vermutung, Verbesserungen an verbreiteten Algorithmen und Fortschritte in Richtung der Riemann-Hypothese. Ein Teil der Beweise wurde in Lean formal geprüft, einer Sprache, die die Logik eines Beweises maschinell validiert. OpenAI gibt an, ein durchschnittliches Ergebnis habe dem Rechenaufwand von rund drei Stunden Denkzeit in ChatGPT Pro entsprochen.

Ein Sprecher des Unternehmens erklärte, fast alle Ergebnisse seien von einem einzigen Agenten auf einen einzigen Prompt hin entstanden, räumte auf Nachfrage aber ein, dass manche Resultate mehrere Anläufe gebraucht haben könnten. Das wäre ein deutlicher Unterschied zur früheren Navier-Stokes-Lösung, die ein Verbund von 10.000 Agenten erzeugte und Millionen an Rechenkosten verschlang. Andrew Sutherland, Mathematiker am MIT, hält solche Angaben für unbelegt, solange das Modell nicht verfügbar ist und niemand die Ergebnisse reproduzieren kann.

Die Beratergruppe AGMAI war am 21. September nach dem Streit um die Navier-Stokes-Veröffentlichung gebildet worden und hatte Ende September erste Empfehlungen vorgelegt: Modellname, exakter Prompt und Compute-Zeit pro Ergebnis sollten offengelegt und mathematische Resultate nicht als Marketing-Vehikel für Modelle verwendet werden. OpenAI veröffentlicht nun nur die durchschnittliche Rechenzeit samt einiger Statistiken und keine Prompts. Das Unternehmen erklärt, es nehme die Leitlinien ernst, sei an sie aber nicht gebunden, und arbeite daran, das Modell so schnell wie vertretbar zugänglich zu machen. Die Einordnung der Ergebnisse dürfte Monate dauern, auch weil offen ist, wie viele der Beweise neue Ideen enthalten und wie viele bekannte Techniken rekombinieren. → Scientific American, The Verge

Synthszr Take: Die Prüfkapazität ist jetzt der Engpass, nicht die Produktion von Beweisen. Drei Stunden Rechendenkzeit pro Ergebnis auf der einen Seite, Wochen menschlicher Nachvollzugsarbeit pro Manuskript auf der anderen: Aus diesem Missverhältnis entsteht ein Berg von 722 Dateien, den die Disziplin realistisch nie vollständig abarbeiten wird. Lean hilft, aber nur dort, wo ein Beweis formalisiert vorliegt, und eine grüne Formalisierung sagt nichts darüber, ob das Resultat neu ist oder eine geschickte Rekombination bekannter Techniken. Sutherlands Ruf nach Belegen trifft genau die Lücke: Ohne Prompt, ohne Modellzugang, ohne Reproduzierbarkeit bleibt die Behauptung „ein Agent, ein Prompt“ eine Unternehmensaussage mit Repository-Link. Entscheidend wird in zwölf Monaten die Zahl der Ergebnisse, die der Prüfung durch Fachleute standgehalten haben, und ob OpenAI dann bereit ist, sie zu nennen.

Im Artikel erwähnt

Die Sommer Edition von CODE CRASH ist da

2. AUFLAGE. 440 SEITEN (100+ MEHR). AB 20 EUR (PAPERBACK).

Die Sommer Edition von CODE CRASH ist da

Die neuen agentischen KI-Systeme erfordern eine radikale Veränderung des Denkens darüber, wie Unternehmen heute organisiert sein müssen, um im Markt erfolgreich bestehen zu können. Die Sommer-Edition von CODE CRASH spannt daher den Bogen von der Produktentwicklung über die Unternehmensaufstellung und Führung bis hin zur Kultur im heutigen KI-Zeitalter und zeichnet dabei einen überraschend optimistischen Ausblick auf den Standort Deutschland.

codecrash.ai →

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.