Mistral Large 4 : que vaut la réponse européenne à OpenAI & Cie ?
- • Mistral Large 4 offre une utilisation multimodale et sera lancé le 27 octobre.
- • OpenAI développe des filigranes invisibles pour identifier les textes au sein de l’UE.
- • Nano Banana 2.1 de Google divise le prix par deux et améliore considérablement l’édition d’images.
Le Mistral Large 4 européen promet de l’open source au niveau d’Opus
Mistral a lancé mardi une Public Preview de Mistral Large 4, appelé ML4 en interne et officiellement surnommé « le Chonk ». Le modèle possède un billion de paramètres, dont 49 milliards sont actifs par requête, et est nativement multimodal. Les poids devraient être publiés le 27 octobre. D’ici là, un Red-Teaming est en cours avec des entreprises de sécurité, des partenaires agréés et des agences gouvernementales, qui ont accès à une version avec une modération réduite et des capacités cybernétiques étendues. Selon l’entreprise, le modèle a été entraîné de A à Z sur environ 3 800 à 4 000 accélérateurs Nvidia-Grace-Blackwell dans les propres centres de données européens de Mistral. La preview fonctionne également sur cette même infrastructure. Une partie considérable des données d’entraînement était multilingue et couvre plus de 160 langues, y compris toutes les langues officielles de l’UE.
Mistral positionne ML4 comme le modèle Open Weights le plus performant en dehors de la Chine et comme étant « très, très proche » des modèles de pointe propriétaires. Selon le fournisseur, l’accent est mis sur le codage, les processus agentiques, ainsi que sur des secteurs tels que la finance, le droit, la production et l’électrotechnique. Dans le domaine de la cybersécurité, Mistral se réfère à l’indice indépendant Artificial Analysis Cyber Index, où le modèle se classerait dans le top cinq ; pour une tâche consistant à reproduire une faille de sécurité réelle dans un logiciel open source puis à la corriger, Mistral annonce un score de 82 %, et de 93 % pour les 40 exercices de l’ensemble Cybench. Le cofondateur et scientifique en chef Guillaume Lample explique à The Deep View que les poids ouverts sont cruciaux, notamment pour les processus de sécurité, car les entreprises ne devraient pas dépendre de la continuité d’un modèle par son fournisseur. Lample souligne également que de nombreux autres laboratoires ne priorisent tout simplement pas de nombreux domaines spécialisés.
Le modèle s’adresse principalement aux entreprises qui l’exécutent sur leur propre matériel ou dans un cloud privé, mais il est également disponible via l'API de Mistral. Avec un billion de paramètres, il ne peut pas être exécuté sur un ordinateur de bureau ou portable et pourrait également être difficile à exploiter pour certaines universités. Mistral indique avoir utilisé le même environnement d’entraînement, d’ajustement et de Reinforcement-Learning que celui proposé aux clients via le produit Mistral Forge. Alors que les laboratoires américains facturent des suppléments pour les modèles fermés, Mistral gagne de l’argent grâce à des frais basés sur l’utilisation pour l’exploitation via son propre cloud et grâce aux ingénieurs qui aident les clients à personnaliser les modèles.
Ce lancement intervient dans une période de tensions croissantes concernant l’accès aux modèles de pointe. L’administration Trump avait imposé en juin des restrictions temporaires à la diffusion des modèles d’OpenAI et d’Anthropic, justifiant cette décision par les risques d’abus lors de cyberattaques. Le gouvernement américain accuse de son côté les laboratoires chinois d’avoir comblé l’écart de performance grâce à la Distillation, c’est-à-dire l’entraînement de modèles plus petits sur les sorties de modèles plus grands. En septembre, Mistral a clôturé un tour de financement de 3,3 milliards de dollars pour une valorisation de 24 milliards de dollars, la plus grande levée de fonds jamais réalisée par une entreprise technologique européenne ; selon un rapport du Financial Times, ses revenus ont été multipliés par vingt l’année dernière. → Mistral Blog, The Deep View, Wired, Wall Street Journal
Synthszr Take: Dans les services achats, la décision concernant Le Chonk repose sur une seule question : à qui appartient le modèle si le fournisseur le désactive ? Chaque migration forcée vers une nouvelle version casse les prompts, les évals et les flux d'agents qui ont été calibrés pendant des mois sur le comportement de l’ancienne version, et personne n’aime payer cette facture deux fois par an. C’est pourquoi le 27 octobre, date de la publication des poids, pèse plus lourd que les 82 % de l’indice cyber : personne ne peut vous retirer un modèle qui se trouve en copie complète dans votre propre centre de données. D’un point de vue commercial, il est logique que les poids ouverts ne coûtent que le temps de calcul qu’ils consomment, et que Mistral gagne son argent avec l'hébergement et les ingénieurs de réglage plutôt qu’avec des majorations par token. Le fait que le chiffre d’affaires ait été multiplié par vingt en un peu plus d’un an, Mistral le doit à une peur que les fournisseurs américains ont eux-mêmes créée avec les cycles de dépréciation et les restrictions à l’exportation.
OpenAI marque les textes de ChatGPT en Europe, un simple remplacement de synonymes déjoue la détection
OpenAI dotera désormais les textes de ChatGPT et Codex pour les utilisateurs de l’Union européenne d’un filigrane invisible, intégré dans le schéma de choix des mots et détectable uniquement par un détecteur spécial. Le procédé, nommé textGrain, sera publié pour que d’autres puissent s’en inspirer. Les développeurs peuvent dès à présent activer ce marquage dans le monde entier pour certains modèles via l'interface de programmation, mais il est désactivé par défaut ; dans ChatGPT et Codex, il sera déployé dans les prochaines semaines pour tous les forfaits dans l’UE, un lancement mondial n’est pas prévu pour l’instant. Le contexte est la loi européenne sur l'IA, qui exige que les textes générés par des machines soient identifiables par logiciel. Le détecteur reste pour l’instant confidentiel : les chercheurs et organisations spécialisées agréés peuvent en demander l’accès, mais pas le grand public. → The Neuron
Synthszr Take: Un quart des mots sont remplacés, et la détection chute de 92 à 17 pour cent. Cela montre sur quoi repose tout le débat sur la détection. Pour l’image, l’audio et la vidéo, la suppression d’un marquage coûte au moins du temps de calcul ; pour le texte, un passage par un deuxième modèle ou un dictionnaire de synonymes suffit. La provenance ne peut être prouvée qu’à sa source : via une signature lors de la création et une chaîne de protocoles qui enregistre le parcours d’un fichier, plutôt qu’en analysant a posteriori des contenus finis.
Le Nano Banana 2.1 de Google ne coûte plus que la moitié
Google a publié le 6 octobre Nano Banana 2.1, la nouvelle version de son modèle de génération et d’édition d’images. Il sera déployé dans l’application Gemini, dans le mode IA de la recherche Google, dans Google Ads ainsi que dans les outils de développement AI Studio, Flow et Stitch. Selon le fournisseur, cette version améliore les précédentes « across the board », avec des progrès en matière de conception visuelle, d’édition par masque de zones d’image spécifiques et de cohérence du sujet sur plusieurs étapes d’édition. Les propres tests de Google indiquent 1 050 points ELO pour la préférence globale dans les comparaisons texte-image, contre 990 pour Nano Banana 2 et 935 pour Nano Banana Pro ; pour la fidélité factuelle des infographies, Google annonce 0,521 contre 0,179. Aucun test indépendant n’était disponible au lancement, comme le note Decrypt. → Decrypt
Synthszr Take: Un score de fidélité factuelle de 0,521 signifie en clair que près d’une infographie sur deux ne passe pas le test, et c’est le meilleur résultat de leur propre mesure. Les 1 050 points ELO proviennent d’un test de préférence, dont la structure, les évaluateurs et les ensembles de prompt ont été définis par le fournisseur lui-même, personne ne peut le vérifier au lancement. Avec une échelle sans limite supérieure, tout écart par rapport au prédécesseur peut être présenté comme un bond en avant, tant que le groupe de comparaison est interne. La seule chose vérifiable dans cette annonce pour l’instant est le prix : 0,0336 dollar par image 1K, la moitié de Nano Banana 2, et cela se verra sur la facture à la fin du mois.
Anthropic lance le Model Hardware Standard, le « MCP pour les appareils », et se fait déborder
Anthropic a présenté fin août le Model Hardware Standard (MHS), une interface commune permettant aux modèles d’IA et aux agents de piloter des appareils physiques. Alek Kemeny, de l’équipe Beneficial-Deployments d’Anthropic, décrit le projet à The Deep View comme « le MCP pour le matériel », en référence au Model Context Protocol, qu’Anthropic a rendu librement disponible en novembre 2024 et qui, selon le blog du projet, atteint désormais environ 500 millions de téléchargements de SDK par mois. À l’origine, le MHS était conçu pour l’automatisation des laboratoires scientifiques, mais selon l’équipe, trente fois plus d’organisations que prévu se sont inscrites pour participer au cours des deux premières semaines, provenant de la fabrication de semi-conducteurs, de l’automobile, de l’aérospatiale, de l’énergie et des infrastructures critiques. L’entreprise de quantencomputing QuEra a utilisé le MHS pour que Claude développe un programme de contrôle laser ; dans 695 des 700 tests, le laser a été correctement restauré, les cas difficiles prenant 10 à 14 secondes au lieu de 5 à 10 minutes pour un expert humain. À l’Université Carnegie Mellon, une équipe a connecté des robots de pipetage, des lecteurs de plaques, un bras robotique et des caméras, après quoi un agent a répété une expérience de manière autonome et a ajusté la plage de concentration. → The Deep View
Synthszr Take: Amodei considère les poids ouverts comme un risque pour la sécurité et les protocoles ouverts comme une bonne affaire, et les deux sont moins contradictoires que le débat sur l’open source ne le suggère. Les 500 millions de téléchargements mensuels du SDK pour le MCP montrent la valeur d’un standard offert : chaque intégration dans l’industrie est construite sur une sémantique définie par Anthropic, quel que soit le modèle qui répond finalement à la requête. Avec le MHS, il s’agit de contrôleurs laser, de robots de pipetage et de lecteurs de plaques, c’est-à-dire d’appareils avec des périodes d’amortissement de plusieurs années que personne ne va recâbler après la prochaine mise à jour du benchmark.
E-commerce (I) : Meta réécrit les règles avec Walmart, Stripe et Sierra
Selon CNBC, Meta collabore avec Walmart, Stripe et la start-up d’IA Sierra pour élaborer un ensemble de règles sur la manière dont les agents IA interagissent avec les entreprises en ligne. Le « personal agent protocol »doit permettre aux commerçants de distinguer les achats autorisés des agents personnels des autres flux de données. David Singleton, vice-président de l’ingénierie chez Meta Superintelligence Labs, a comparé le projet à l’e-mail auprès de CNBC : une norme permettant à tous de communiquer entre eux. La rédaction est dirigée par le cofondateur de Sierra, Bret Taylor, qui est également président d’OpenAI et s’attend à ce qu’OpenAI rejoigne la norme plus tard ; sans une telle norme, ce serait le « chaos », selon Taylor. Cette initiative fait suite à un document de six grandes banques, dont Capital One et Bank of America, qui réclament pour le commerce agentique des règles sectorielles basées sur cinq principes, notamment la transparence, la protection des données et l’interopérabilité. → Gizmodo
Synthszr Take : Les normes sonnent comme un bien commun, mais elles sont écrites ici par ceux qui en profitent le plus : Meta, après avoir été banni par Amazon, a besoin d’un ticket d’entrée qui ne soit pas émis par Amazon. Bret Taylor mène la danse en tant que cofondateur de Sierra tout en présidant OpenAI ; le fait qu’OpenAI finisse par signer est donc plus une question de temps qu’une prédiction. Celui qui définit les champs d’identification d’un agent définit également quels agents seront refusés. La comparaison de Singleton avec l’e-mail ne tient que tant que personne n’ajoute de frais ou de listes de blocage à la spécification.
E-commerce (II) : TikTok lance un assistant de chat pour le shopping
Le 5 octobre 2026, lors de l’Advertising Week New York, TikTok a présenté une série de produits publicitaires et d’achat basés sur l’IA. Au cœur de cette annonce se trouvent le paiement in-app Buy Direct et un assistant d’achat conversationnel, le Shopping Assistant. Buy Direct permet d’effectuer des achats en un clic directement depuis le flux Pour Toi grâce aux moyens de paiement et adresses enregistrés, avec un suivi de commande intégré à l’application ; la marque reste le Merchant of Record. La condition préalable est une connexion au Universal Commerce Protocol, un ensemble de règles standardisées pour l’interaction entre les agents IA et les systèmes des commerçants. L’entreprise décrit le Shopping Assistant comme une fenêtre de chat sur la page du produit dans le navigateur interne de TikTok, qui répond aux questions sur les détails, la livraison, les tailles et la disponibilité en se basant sur les informations fournies par le commerçant. Les acheteurs finalisent ensuite leur achat sur le site du commerçant, toujours dans le navigateur de TikTok. → Unite.AI
Synthszr Take : Ici, « Agentic Commerce » signifie une fenêtre de chat qui lit les informations produit fournies par le commerçant et un bouton d’achat avec une carte de crédit enregistrée. Chaque étape est toujours effectuée par l’humain : faire défiler, demander, taper, acheter. Le seul élément de l’ensemble où un logiciel travaille pour quelqu’un se trouve du côté de la publicité, et c’est précisément là que TikTok a fourni le seul chiffre fiable : plus de 200 % d’annonceurs en plus sur le MCP-Connector entre juillet et septembre, selon une enquête interne.
La Norvège veut interdire provisoirement les lunettes-caméras de Meta dans les parcs, les écoles et sur les plages
La Norvège a présenté un projet de loi visant à interdire temporairement le port de lunettes-caméras dans certains espaces publics. Selon Business Insider, cela concernerait des lieux comme les parcs, les écoles et les plages, c’est-à-dire précisément les environnements où les porteurs de telles lunettes filment et photographient habituellement. Sont principalement visés les modèles Ray-Ban de Meta, vendus avec une caméra intégrée. Le projet est encore à l’état de proposition et n’a pas été adopté ; Business Insider a corrigé son article initial le 6 octobre 2026, après avoir d’abord présenté l’interdiction comme étant déjà en vigueur. → Business Insider
Synthszr Take : La Norvège n’est pas membre de l’UE, mais elle adopte la même logique de protection des données via l’EEE, ce qui fait de ce projet national un modèle pour toute autorité de surveillance européenne qui hésitait jusqu’à présent sur le sujet des lunettes-caméras. Une interdiction temporaire est l’instrument le plus pratique qui soit : elle ne nécessite pas de cadre juridique finalisé, mais seulement la justification de vouloir d’abord évaluer la situation. De telles règles transitoires ont la fâcheuse tendance à être prolongées, et elles épargnent au ministère suivant la moitié du travail préparatoire.
Wikimedia accuse OpenAI de polluer Wikipédia avec du « slop » généré par IA
La Wikimedia Foundation a publié un rapport d’enquête selon lequel des agents d’OpenAI ont modifié des pages Wikipédia sans s’annoncer et ont tenté d’abuser de l’outil de prise de notes Etherpad, géré par la fondation. La fondation documente les modifications découvertes dans une liste publique et classe une partie d’entre elles comme « potentiellement malveillantes » : un outil de citation devait servir de proxy pour récupérer des données de services distants. Wikipédia autorise en principe les modifications par bot, à condition qu’elles soient déclarées et approuvées par les bénévoles ; selon la fondation, cette procédure n’a pas été respectée ici. Les tentatives d’utiliser Etherpad comme relais ont échoué. D’autres agents présumés d’OpenAI y ont déposé des notes sur leurs tâches, sans que cela n’aboutisse à une coordination selon Wikimedia. S’y ajoutent des millions d’accès automatisés et des centaines de milliers de requêtes de données qui, selon l’évaluation de la fondation, pourraient avoir contribué à une panne partielle d’un service Wikimedia en mai. → Techpresso
Synthszr Take : Wikipédia est la base factuelle de la moitié d’Internet, avec 67 millions d’articles en 300 langues, maintenus par des bénévoles non rémunérés. Ce sont précisément ces personnes qui nettoient maintenant derrière des agents qui ont détourné un outil de citation pour transférer des données et qui ont peut-être provoqué la panne partielle d’un service en mai. Il est faux de dire que Wikipédia interdit les bots : la procédure d’approbation existe depuis des années, elle a simplement été ignorée.
Muse de Meta crée une page de profil distincte pour chaque personne dans la vie de l’utilisateur
L’application d’assistance de Meta, Muse, crée automatiquement des pages de profil sur les personnes de l’entourage de ses utilisateurs. C’est ce que rapporte WIRED, se basant sur le travail de la chercheuse indépendante en sécurité de l’IA, Karan Joshi, qui a analysé des fichiers internes de l’application. Selon le rapport, les instructions du système contiennent la directive de créer « une page pour chaque personne dans la vie de l’utilisateur ». Un processus exécuté toutes les heures collecte des informations sur la famille, les partenaires, les amis, les collègues et les personnes suivies. D’après les documents, les pages sont structurées en faits tels que le lieu de résidence, la profession et l’anniversaire, un historique des antécédents, ainsi qu’une section avec des suggestions sur la manière d’améliorer la relation. → The Deep View
Synthszr Take : Les personnes sur lesquelles Muse remplit des pages toutes les heures n’ont jamais été consultées : le plombier, la collègue, le partenaire. Une seule personne donne son consentement, mais des dizaines sont fichées, et cette asymétrie caractérise toute cette catégorie de produits. La section la plus délicate est celle consacrée à l’amélioration des relations, car l’observation se transforme en une recommandation d’action que l’autre personne ne connaît pas et ne peut pas corriger.
OpenAI publie 722 manuscrits mathématiques sur GitHub
OpenAI a publié 722 manuscrits contenant des résultats mathématiques dans un dépôt GitHub, répartis en 372 familles de résultats et provenant d’un modèle Frontier non encore disponible. Selon le groupe consultatif indépendant AGMAI, cette publication contient des solutions à des « centaines » de questions en suspens ; en septembre, l’entreprise avait encore parlé de « plus de 100 problèmes ouverts de longue date ». Parmi les résultats revendiqués figurent une solution à la conjecture de Kakeya en quatre dimensions, des améliorations d’algorithmes courants et des avancées en direction de l'hypothèse de Riemann. Une partie des preuves a été formellement vérifiée en Lean, un langage qui valide la logique d’une preuve de manière automatisée. OpenAI indique qu’un résultat moyen a correspondu à l’effort de calcul d’environ trois heures de réflexion dans ChatGPT Pro.
Un porte-parole de l’entreprise a déclaré que presque tous les résultats ont été produits par un seul agent à partir d’un unique prompt, mais a admis, après question, que certains résultats pourraient avoir nécessité plusieurs essais. Ce serait une différence notable par rapport à la solution précédente pour les équations de Navier-Stokes, qui avait été générée par un ensemble de 10 000 agents et avait englouti des millions en coûts de calcul. Andrew Sutherland, mathématicien au MIT, considère ces affirmations comme non fondées tant que le modèle n’est pas disponible et que personne ne peut reproduire les résultats.
Le groupe consultatif AGMAI avait été formé le 21 septembre suite à la controverse sur la publication concernant Navier-Stokes et avait présenté fin septembre ses premières recommandations : le nom du modèle, le prompt exact et le temps de Compute par résultat devraient être divulgués, et les résultats mathématiques ne devraient pas être utilisés comme un outil marketing pour les modèles. OpenAI ne publie désormais que le temps de calcul moyen, accompagné de quelques statistiques, mais aucun prompt. L’entreprise déclare prendre les directives au sérieux, sans toutefois y être liée, et travailler à rendre le modèle accessible aussi rapidement que possible de manière responsable. L’évaluation des résultats prendra probablement des mois, notamment parce qu’il n’est pas clair combien de preuves contiennent de nouvelles idées et combien recombinent des techniques connues. → Scientific American, The Verge
Synthszr Take : La capacité de vérification est désormais le goulot d’étranglement, pas la production de preuves. Trois heures de temps de calcul par résultat d’un côté, des semaines de travail de vérification humaine par manuscrit de l’autre : de ce déséquilibre naît une montagne de 722 fichiers que la discipline ne pourra, de manière réaliste, jamais traiter entièrement. Lean est utile, mais seulement lorsqu’une preuve est formalisée, et une formalisation validée ne dit rien sur la nouveauté du résultat ou s’il s’agit d’une habile recombinaison de techniques connues. L’appel de Sutherland à fournir des preuves comble précisément cette lacune : sans prompt, sans accès au modèle, sans reproductibilité, l’affirmation « un agent, un prompt » reste une simple déclaration d’entreprise accompagnée d’un lien vers le dépôt. Ce qui sera décisif dans douze mois, c’est le nombre de résultats qui auront résisté à l’examen par les experts, et si OpenAI sera alors disposé à les communiquer.

