← älter | home →
Startups américaines et chinoises : la course aux meilleurs modèles open sourceSynthszr
synthszr #281 du mardi 6 octobre 2026

Startups américaines et chinoises : la course aux meilleurs modèles open source

  • • Reflection AI lance Beam, un puissant modèle open source
  • • Agent Muse de Meta crée des profils secrets sur les amis et la famille de l’utilisateur
  • • Les modèles d’IA américains ne sont plus que 3 % plus performants que les variantes chinoises

Une startup américaine publie un modèle open source et promet de surpasser les modèles chinois

Reflection AI a présenté Beam le lundi 5 octobre 2026, un modèle exclusivement textuel de 501 milliards de paramètres, dont 23 milliards sont actifs par token. Le modèle n’est initialement accessible que via un programme d’accès anticipé (Early Access) avec liste d’attente ; selon l’entreprise, il est en phase finale de red teaming. Les poids devraient être publiés « plus tard ce mois-ci » sous licence Apache 2.0, accompagnés de la documentation et des outils de fine-tuning. Personne ne peut télécharger le modèle pour le moment.

Reflection compare principalement Beam au GLM-5.2 de Z.ai, un modèle Open Weight d’environ 744 milliards de paramètres, dont 40 milliards sont actifs. Selon leurs propres indications : des performances de raisonnement comparables pour un coût de calcul (inference-compute) d’inférence trois à quatre fois inférieur, en se basant sur les résultats de DeepSWE, Humanity’s Last Exam et Terminal Bench 2.1. L’entreprise qualifie elle-même ce calcul de « comparaison approximative du compute » plutôt que de coûts d’inférence mesurés ; il exclut le traitement du prompt d’entrée, les opérations d'attention dépendantes du contexte et le surcoût de service (serving overhead). Dans le propre tableau de Reflection, Beam se situe derrière GLM-5.3, Kimi K3 et DeepSeek V4.1 Flash pour la plupart des lignes de code. Il n’existe pas encore d'évaluation indépendante.

L’entreprise fournit des chiffres concrets sur le processus d’entraînement. Tout a commencé par un petit prototype qui a donné naissance à une série de modèles de plus en plus grands, jusqu’à Beam Base. Ce modèle de base a été créé sur un cluster de 6 144 cartes graphiques et entraîné sur 23,8 billions de tokens provenant du web ouvert et de sources commerciales, avec une forte proportion de code et des filtres propres à chaque langage de programmation. Beam Base a été achevé en moins de quatre semaines, suivi d’une phase de mid-training, qui a élargi la fenêtre de contexte et le raisonnement. Pour la phase la plus intensive en calcul, Reflection a lancé 10 000 cartes GB300 et 1,3 milliard de sandboxes de reinforcement learning pour des tâches telles que la génération de code, la recherche web et les opérations d’agents. Selon l’entreprise, cette phase a également duré quatre semaines, avec 71 erreurs et un temps de redémarrage médian de huit minutes.

L’histoire du financement derrière cette ascension est fulgurante. Misha Laskin, anciennement responsable du Reward Modeling pour le projet Gemini de Google, et Ioannis Antonoglou, co-développeur d'AlphaGo, ont fondé Reflection en mars 2024 à Brooklyn, initialement pour automatiser le développement de logiciels. En mars 2025, l’entreprise est sortie du mode furtif (stealth mode) avec 130 millions de dollars pour une valorisation d’environ 545 millions. En juillet 2025, l'agent de code Asimov a suivi. En octobre 2025, Reflection a levé 2 milliards de dollars pour une valorisation de 8 milliards, notamment auprès de Nvidia et Sequoia, avec environ 60 employés, et s’est positionnée comme un laboratoire de pointe (frontier lab) ouvert pour les entreprises et les gouvernements. Laskin a justifié cette orientation à l’époque en citant DeepSeek et Qwen comme un signal d’alarme : sans contre-mouvement, le standard mondial de l’intelligence artificielle serait défini par d’autres.

En 2026, l’infrastructure et les clients gouvernementaux se sont ajoutés. En mars, Reflection a signé une lettre d’intention avec Shinsegae pour un centre de données de 250 mégawatts en Corée du Sud. En mai, l’entreprise est devenue fournisseur de modèles pour la mission Genesis du ministère américain de l’Énergie, desservant ainsi les 17 laboratoires nationaux. En juin, Reflection a confirmé la clôture de son tour de financement avec une valorisation pré-financement (pre-money) de 25 milliards de dollars et a obtenu l’accès au centre de données Colossus de SpaceX via un accord de calcul (compute deal). On rapporte un volume de 6,3 milliards de dollars pour la location de systèmes Nvidia-GB300-NVL72, chacun doté de 72 cartes graphiques, sur lesquels Beam a été entraîné. En juillet, Nebius a promis une puissance de calcul d’une valeur de plus d’un milliard de dollars avec des puces GB300 jusqu’en 2029. Selon cette présentation, Beam est le premier modèle ouvert d’une startup américaine capable de rivaliser avec les meilleurs modèles chinois sur des tâches comparables ; un écart subsiste par rapport aux modèles de pointe (frontier models) fermés. → implicator, The Information, SiliconANGLE

Synthszr Take : Passer de 545 millions à 25 milliards de valorisation en quinze mois, et les factures sont déjà écrites : 6,3 milliards pour des systèmes GB300 loués via SpaceX, plus d’un milliard à Nebius jusqu’en 2029. Ces engagements sont en cours alors que Beam est encore en phase de red teaming et que les poids ne doivent arriver que « plus tard ce mois-ci ». Une telle valorisation est essentiellement un préfinancement de temps de calcul qui doit être rentabilisé par des clients payants, et ce plus rapidement que la prochaine publication de Hangzhou ou de Pékin ne comble à nouveau l’écart. Le fait que Beam, dans le propre tableau de Reflection, soit derrière GLM-5.3, Kimi K3 et DeepSeek V4.1 Flash pour la plupart des lignes de code et qu’il n’y ait pas encore de mesure indépendante, est le détail le plus coûteux de cette annonce pour les investisseurs. Le critère pour le prochain tour de financement sera les 17 laboratoires nationaux et les clients gouvernementaux qui, au final, paieront les factures.

L’agent Muse de Meta crée secrètement des pages de profil sur les amis et la famille

L'agent d’IA personnel de Meta, Muse, est conçu pour créer « une page pour chaque personne dans la vie de l’utilisateur », incluant l’historique personnel et les détails relationnels. Ces instructions internes ont été obtenues par le chercheur indépendant en sécurité de l’IA, Karan Joshi, via une conversation de chat normale ; WIRED en a fait état le 3 octobre. Selon Meta, le contexte se nourrit d’informations publiques et partagées par l’utilisateur lui-même, comme la facture d’un artisan ou les fleurs préférées du partenaire. Parallèlement, le chroniqueur technologique Jason Aten a raconté le 19 septembre chez Inc. que Muse lui avait proposé de faire des recherches sur une conversation de son podcast et avait signalé un message de son rédacteur en chef concernant une date limite, bien qu’il ait refusé l’accès aux messages et désactivé le Full Disk Access. Le directeur de la communication de Meta, Andy Stone, nie tout accès sans ces autorisations, tandis que le chef de l’ingénierie grand public, David Singleton, qualifie l’explication de l’agent lui-même de confuse ; la contradiction reste à ce jour inexpliquée et une violation des droits n’a pas été prouvée de manière indépendante. → Techpresso

Synthszr Take : Le dépassement des limites se présente ici sous la forme d’une offre d’aide : l’agent ne demande pas la permission, il propose quelque chose que vous ne lui avez jamais dit. Aten avait refusé l’accès aux messages et désactivé le Full Disk Access, mais le mail de son rédacteur en chef concernant la date limite s’est soudainement retrouvé sur la table, et personne ne peut dire avec certitude s’il s’agissait d’un bug, d’une bannière de notification ou d’autre chose. C’est l’impression que donne un agent qui tourne en permanence dans le cloud de Meta : vous fermez l’application, il continue de travailler, et à la prochaine ouverture, il en sait plus que la fois précédente.

Bloomberg : les modèles d’IA chinois n’ont plus que 3 % de retard sur les meilleurs modèles américains

L’avance des modèles d’IA américains sur les modèles chinois s’est réduite à environ 3 %, selon une enquête de Bloomberg. L’analyse identifie comme moteurs non pas de nouveaux records de performance brute, mais une efficacité élevée et des coûts bas du côté chinois. Un second rapport d’implicator.ai date le déclencheur en septembre : après la dernière sortie de DeepSeek, l’écart dans les tests de performance courants se serait réduit à ces 3 %. Les communiqués cités ne précisent pas quelles familles de benchmarks sont prises en compte dans le calcul ni comment les différents ensembles de tests sont pondérés. → TechOrange 科技報橘

Synthszr Take : Un écart de trois points de pourcentage se situe dans une marge que les suites de benchmarks peinent à distinguer nettement, ce qui fait perdre à la question du « meilleur » modèle sa pertinence pratique. Le deuxième chiffre du même bulletin d’information est intéressant : une étude menée par Stanford révèle que le modèle le moins cher s’avère finalement plus coûteux dans 32 % des comparaisons, car il nécessite plus de passages et plus de tokens. Les laboratoires chinois optimisent précisément sur ce point, car les contrôles à l’exportation de puces ne leur laissent pas le choix ; la pénurie a été leur condition d’entraînement la plus difficile pendant plus de deux ans.

Le GPT-6.1 Sol d’OpenAI coûte un cinquième d’Astra et le surpasse dans les tests

Lors de la keynote du DevDay le 29 septembre 2026, OpenAI a présenté le modèle GPT-6.1 Sol et le promeut, selon ses propres termes, comme offrant une « intelligence proche d’Astra pour un cinquième du prix ». L’article correspondant sur Hacker News a recueilli 1 066 points et plus de 950 commentaires. Simon Willison, qui a retranscrit la keynote en direct, a ensuite soumis le modèle à son test SVG de pélican et considère les résultats comme n’étant pas significativement différents de ceux de la famille GPT-6 ; plusieurs niveaux de Reasoning Effort, de Medium à Max, ont été testés. Un autre commentateur a comparé les modèles dans un « Pac-Man-Bakeoff », où chaque modèle doit créer un jeu Pac-Man jouable. Le GPT 6.1 Sol y a obtenu 91 points en environ neuf minutes d’exécution et pour un coût de 51 centimes. → Simon Willison from Simon Willison’s Newsletter

L’avis de Synthszr : Dans le test Pac-Man, une partie avec Sol coûte 51 centimes et rapporte 91 points, tandis qu’Astra atteint 87 points pour 2,42 dollars. Le propre modèle phare du printemps devient ainsi l’offre la moins intéressante de la maison en termes de rapport qualité-prix, et OpenAI intègre cette évaluation directement dans son annonce. Opus 5.5 obtient huit points de plus que Sol, pour environ quatre fois le prix : c’est un calcul que chaque équipe qui fait tourner des agents en continu doit faire, et le résultat varie en fonction de la tâche.

Le PDG de n8n, basé à Berlin : Claude ne nous tue pas

Le fondateur de n8n, Jan Oberhauser, a expliqué dans le podcast d’Aakash Gupta pourquoi son outil de workflow continue de croître malgré Claude Code et l’Agent Builder d’OpenAI. Lorsque OpenAI a présenté l’Agent Builder le 6 octobre 2025, de nombreuses publications ont déclaré n8n et Zapier finis ; selon Oberhauser, ce fut l’une des meilleures semaines de l’histoire de l’entreprise. En mai, SAP a investi sur la base d’une valorisation de 5,2 milliards de dollars, soit plus du double de la valeur de l’année précédente, et a intégré n8n dans son outil d’agent Joule Studio. Selon l’entreprise, n8n compte désormais plus de 200 000 étoiles sur GitHub, 1,5 million d’utilisateurs actifs et 1 200 clients pour son produit Enterprise. Oberhauser décrit la différence avec Claude Code par la couche d’orchestration : des étapes de validation avant les actions risquées, une journalisation de chaque exécution nœud par nœud avec possibilité de redémarrage à partir de ce point, ainsi qu’un historique des versions et la passation aux collègues par invitation plutôt que par GitHub. → Aakash Gupta from Product Growth

L’avis de Synthszr : Les quatre étapes d’Oberhauser constituent la leçon de produit la plus concise sur les agents que l’on puisse trouver actuellement : décrire, valider, journaliser, transférer. La première étape est maîtrisée par n’importe quel modèle correct en ligne de commande, mais ce sont les étapes deux à quatre qui déterminent si un processus reste une démo ou passe en production. La phrase sur la différence entre 95 % et 100 % de fiabilité décrit tout le travail actuellement sous-estimé par les équipes de développement de produits, car le premier résultat est obtenu si rapidement.

Une startup de robotique munichoise est désormais aussi une licorne

La startup de robotique munichoise RobCo a vendu des parts dans le cadre d’une transaction qui valorise l’entreprise à plus d’un milliard de dollars, selon un rapport exclusif du Wall Street Journal. C’est le double de la valorisation de sa levée de fonds précédente au début de la même année. RobCo construit des robots industriels autonomes qui effectuent des tâches manuelles répétitives dans les usines de production, comme l’empilage de palettes ou le pesage de matières premières. Son nouveau produit phare est un robot auto-apprenant à deux bras nommé Alfie, qui, selon l’entreprise, est conçu pour imiter la façon de travailler d’un être humain sur une chaîne de montage. → Wall Street Journal

L’avis de Synthszr : Un doublement de la valorisation en un an, sans qu’un seul chiffre d’affaires ne soit publiquement sur la table : on évalue ici une attente, pas un historique de livraisons. Le capital cherche désespérément un nom européen pour la Physical AI, et Alfie fournit précisément l’image qui se prête bien à un mémo d’investissement : un robot à deux bras aux allures d’humanoïde sur la chaîne de production. Cependant, les robots industriels se vendent sur la base des temps d’arrêt, de la disponibilité de techniciens de service à proximité et de contrats de maintenance pluriannuels ; les vidéos de démonstration comptent peu pour l’acheteur d’une PME.

Nathan Baschez, designer chez Notion, considère les agents IA personnels comme un mauvais pari

Dans une contribution pour la newsletter The Leverage, Nathan Baschez s’oppose à la thèse répandue dans la Silicon Valley selon laquelle les Personal Agents seraient la solution universelle pour l’avenir du travail. Cette réflexion est suscitée par une vague de lancements de produits : selon la newsletter, au cours des deux derniers mois, il semble que chaque entreprise dans un rayon de 20 miles autour de Stanford ait lancé un produit de cette catégorie, y compris Grok Bots, Muse et les Dots d’OpenAI. L’éditeur écrit qu’un tel consensus dans la Valley le pousse par réflexe à chercher un contre-avis, et il a donc sollicité Baschez. Ce dernier est actuellement designer produit chez Notion, après avoir été le fondateur de Lex et Every et avoir travaillé chez Gimlet Media et Substack ; il a conçu et développé la première version de Product Hunt. → Nathan Baschez from The Leverage

L’avis de Synthszr : Grok Bots, Muse et Dots en deux mois, et tous trois partent du principe que le travail est un sport individuel. L’objection de Baschez est pertinente, mais reste trop modérée : ce qui bloque un processus dans une organisation, c’est presque toujours l’approbation de quelqu’un ayant des objectifs différents, et un assistant, aussi bien informé soit-il, n’y change rien. Là où l’automatisation est réellement efficace en entreprise, on a préalablement défini qui prend le relais en cas d’incertitude et à partir de quel seuil un humain doit traiter le cas ; cette clarification n’est vendue sous licence par aucun fournisseur.

OpenAI rend les filigranes textuels optionnels dans l’API, mais obligatoires dans l’UE

OpenAI permet désormais aux développeurs du monde entier d’activer des filigranes pour les sorties de texte de certains modèles via l'API. La fonction est désactivée par défaut ; selon l’entreprise, les clients doivent décider eux-mêmes comment les filigranes s’intègrent à leurs obligations de transparence et à leurs produits. L'activation se fait au niveau du projet ou de l’organisation, les appels API individuels n’ont pas besoin d’être modifiés par la suite. Parallèlement, dans les semaines à venir, le texte généré par ChatGPT et Codex pour les utilisateurs de l’UE sera automatiquement pourvu d’un filigrane invisible, et ce pour tous les abonnements. Le contexte est l’article 50 de l'EU AI Act, qui oblige les fournisseurs de systèmes génératifs à rendre le texte généré reconnaissable par machine ; pour les fournisseurs déjà présents sur le marché, la date limite est fixée au 2 décembre.

Le procédé, nommé textGrain, intègre un signal statistique dans le choix des mots du modèle en privilégiant certains mots parmi plusieurs alternatives appropriées. Sur de longs passages, cela crée un motif qu’un détecteur est censé reconnaître. OpenAI affirme que, lors de ses propres tests, textGrain a atteint ou dépassé les performances de détection de SynthID de Google pour le texte, mais admet que de bons résultats dans des conditions idéales ne garantissent pas une détection fiable au quotidien. La technologie devrait être publiée en tant que logiciel open source.

Les mesures publiées montrent les limites. Pour un taux de faux positifs cible de un pour cent, le détecteur a reconnu les filigranes dans environ 80 % des passages de 200 tokens et environ 95 % des passages de 400 tokens, sur la base de réponses à des questions psychologiques. Pour les contenus avec moins de flexibilité linguistique, comme les mathématiques, le taux de détection chute considérablement ; le code est également considéré comme difficile à marquer. L’édition affaiblit encore le signal : si 10 % des mots d’un passage de 400 tokens sont remplacés par des synonymes, le taux de détection passe d’environ 92 % à 66 %, et chute à 17 % si 25 % des mots sont remplacés.

Pour l’instant, OpenAI ne rend pas le détecteur public. Les chercheurs et les organisations spécialisées vérifiés peuvent dès à présent en demander l’accès, l’attribution se faisant au cas par cas. Selon l’entreprise, l’outil signale uniquement la présence d’un filigrane OpenAI, sans identifier les utilisateurs ni divulguer les prompts et les conversations. Pour les images et l’audio, les outils de vérification existants restent accessibles au public, notamment l'API Content Provenance API et les Content Credentials conformes à la norme C2PA, qui sont utilisés depuis 2024.

Anthropic avait pris les devants en août en annonçant un filigrane pour Claude, mais avec une approche différente : le marquage est appliqué au niveau du modèle et fonctionne donc indépendamment du produit ou de l’interface par lequel le texte est généré, y compris l’API. Pour justifier sa décision, l’entreprise a expliqué qu’il n’existait jusqu’à présent aucun moyen fiable de limiter géographiquement cette technologie. Anthropic ne décrit pas d'opt-out pour les développeurs API. Outre ces deux fournisseurs, Microsoft, Google et Meta sont également concernés par l’échéance de décembre. → OpenAI, The New Stack, Engadget, The Verge

Synthszr Take : Un filigrane désactivé par défaut identifie surtout les productions de ceux qui veulent de toute façon être transparents. Les fermes à spam, les usines à dissertations et les services de désinformation n’ont qu’à laisser l’interrupteur désactivé, et cela ne leur coûte rien. Même avec le signal activé, la force probante s’effrite rapidement : remplacez 10 % des mots par des synonymes, et la détection chute de 92 à 66 %, et avec 25 % de mots remplacés, il ne reste que 17 %. Le fait que le détecteur ne soit accessible qu’à des instituts de recherche sélectionnés rend le marquage pratiquement sans valeur pour les écoles, les rédactions et les tribunaux dans un avenir prévisible. En tant que réponse de conformité à l’article 50, c’est une solution bien conçue, mais en tant qu’instrument contre les abus, elle est peu efficace ; au final, la variante qui comptera sera celle qui sera automatiquement appliquée dans l’UE à partir de décembre.

Mentioned in this article

Le search, c'est une question de classement. Pas l'IA.

RAIDAR (may update)

Le search, c'est une question de classement. Pas l'IA.

Un classement ne vous dit pas quel audience voit quelle réponse, quelles sources les modèles privilégient, ni quels territoires personne n'a encore revendiqués. RAIDAR cartographie tout — à travers chaque modèle, chaque segment client et chaque marché, jusqu'aux sources qui alimentent les réponses. Pas un classement. Une carte qui vous dit où aller. Pour les marques qui veulent savoir.

En savoir plus sur RAIDAR →

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.