Tokens onéreux : Fable 5, un échec auprès des entreprises clientes
- • Les clients d'Anthropic préfèrent les modèles moins chers à Fable 5
- • OpenAI et Meta s'engagent dans une guerre des prix acharnée sur les tokens d'IA
- • L'iPhone pliable d'Apple sera lancé à plus de 2 000 dollars
Avant l’introduction en bourse, les clients d’Anthropic se tournent vers des modèles moins chers
Le modèle phare d’Anthropic, Claude Fable 5, séduit nettement moins les entreprises clientes américaines que les modèles plus anciens et moins chers de la société. Le modèle a été lancé le 9 juin à des prix de 10 dollars par million d’input-token et 50 dollars par million d'output-token. Selon les données de facturation de 70 000 entreprises analysées par le prestataire de services de paiement Ramp, la part de Fable 5 dans les dépenses totales d’Anthropic est d’environ 11 % ou moins. La répartition pour juillet montre Opus 4.8 en tête avec 28,0 %, suivi de Sonnet 4.6 avec 8,3 % et Fable 5 avec 8,0 % ; Opus 5, lancé seulement le 24 juillet, atteint 3,5 %. Miles Clements, associé chez Accel, qui a investi près d’un milliard de dollars dans Anthropic, déclare que la plupart des utilisateurs n’ont pas besoin de travailler à la limite des performances. Le lancement de Fable 5 avait été interrompu en juin car la Maison Blanche avait forcé un retrait pour des raisons de sécurité nationale ; l’administration Trump a ensuite autorisé la reprise. Les analystes et les investisseurs attribuent principalement la faible utilisation au prix et aux performances, et non à l’interruption.
Ces chiffres surviennent dans les semaines précédant l’introduction en bourse. Le chiffre d’affaires annualisé d’Anthropic s’élevait à 65 milliards de dollars en juillet, contre 47 milliards en mai. L’entreprise s’attend à un troisième trimestre rentable selon ses propres calculs et mentionne aux investisseurs 6 000 clients avec des dépenses annuelles d’au moins 100 000 dollars. L’introduction en bourse pourrait avoir lieu dans les prochaines semaines et valoriser l’entreprise à au moins deux billions de dollars, plus que toute introduction en bourse précédente, y compris les 75 milliards de dollars de SpaceX (86,2 milliards avec l'option de surallocation). Le chiffre d’affaires annualisé d’OpenAI a augmenté de 35 % au cours du trimestre actuel pour atteindre plus de 40 milliards de dollars, porté par le lancement de GPT 5.6 en juillet.
Parallèlement, la concurrence sur les prix s’intensifie. OpenAI a réduit de 80 % le tarif de son niveau d’entrée rapide Luna et de 20 % celui de son modèle phare Sol. Meta propose Muse Spark 1.2 à un niveau « Contributor », où les données personnelles peuvent être utilisées pour l’entraînement, pour 0,10 et 0,20 dollar par million de tokens, contre 1,25 et 4,25 dollars pour le tarif standard ; les lectures de cache (cache-reads) y coûtent 0,002 dollar. Anthropic n’a pas encore suivi ces baisses de prix et signale, via son canal pour les développeurs, des goulots d’étranglement de capacité pour stabiliser des limites hebdomadaires plus élevées. L’entreprise loue 300 mégawatts à SpaceX pour 1,25 milliard de dollars par mois. Outre OpenAI, Anthropic et Google, des entreprises comme Z.AI, DeepSeek, Kimi, Meta et Grok fournissent désormais des modèles avec Open Weights, adaptés aux sessions agentiques ; les modèles phares sont environ cinq à dix fois plus chers par token, mais consomment moins de tokens pour la même tâche. L’investisseur Gavin Baker souligne que les contrats de deux à trois ans pour la capacité GPU à environ 2 dollars par heure-GPU arrivent à expiration et devraient plutôt se situer autour de 4 dollars lors de leur renouvellement.
Du côté des développeurs, l’utilisation s’oriente vers des configurations mixtes. Dans un essai publié dimanche, Drew Breunig décrit un processus où Fable 5 se charge de l’architecture et du briefing, tandis que l’implémentation de routine est confiée à GLM 5.2 de Z.ai, qu’il estime à environ un neuvième du coût pour son cas de comparaison. Selon lui, le modèle moins cher n’a besoin de performer que pour des tâches prévisibles avec un bon contexte. Pour le traffic de Fable, la documentation de l'API d’Anthropic prévoit une conservation de 30 jours. Breunig transpose l’argument de Herb Sutter sur la fin du « repas gratuit » pour les processeurs au développement de l’IA : jusqu’à présent, le modèle suivant pouvait compenser des prompts faibles et un contexte léger pour un prix similaire. → Martin Alderson, PYMNTS, Simon Willison’s Weblog, RuntimeWire
Synthszr Take: Une valorisation de deux billions de dollars vend l’idée qu’une avance au sommet peut se traduire par des prix plus élevés. Les données de facturation de 70 000 entreprises disent autre chose pour juillet : 8,0 % pour Fable 5, 28,0 % pour l’ancien Opus 4.8, un vote fait avec la carte de crédit. Le timing rend la situation délicate du côté des coûts, car 1,25 milliard de dollars par mois pour 300 mégawatts représentent une ligne de coûts fixes qui ne bouge pas, alors qu’à côté, un tarif d’entrée chute de 80 % et que Meta offre quasiment ses tokens à dix centimes. La croissance de 47 à 65 milliards en chiffre d’affaires annualisé en deux mois est réelle, mais elle provient des modèles bon marché, pas du produit qui justifie la prime. Un prix d’émission qui intègre cette prime parie contre ses propres statistiques de facturation.
La guerre des prix de l’inférence : OpenAI baisse Luna de 80 %, Meta offre presque ses tokens
Martin Alderson décrit sur son blog une chute des prix de l’inférence en IA qui s’accélère durant l’été 2026. OpenAI a réduit de 80 % le prix de son niveau abordable Luna et de 20 % celui de son modèle phare Sol. Meta propose son modèle Open Weights Muse Spark 1.2 au niveau « Contributor », où, selon Alderson, Meta peut s’entraîner sur les données des utilisateurs, pour 0,10 et 0,20 dollar par million de tokens ; le prix régulier est de 1,25 et 4,25 dollars. Les lectures de cache (cache-reads) y sont facturées 0,002 dollar par million de tokens. Anthropic n’a pas encore suivi cette tendance : le Financial Times rapporte, sous le titre que le meilleur modèle d’Anthropic perd des utilisateurs tandis que les outils moins chers gagnent du terrain, la faible demande pour Fable 5 à 10 et 50 dollars. → Martin Alderson
Synthszr Take: Une chute de prix de 80 % ne se volatilise pas, elle se répercute sur la consommation. À 0,10 dollar le million de tokens, des opérations deviennent rentables que personne n’aurait envisagées à 10 et 50 dollars : des analyses nocturnes complètes de toute la base de code au lieu d’une question économe par ticket. Le bilan pour le fournisseur individuel semble alors moins bon, mais le volume total de tokens sur le marché est bien plus grand, et cette demande se heurte à des contrats GPU qui sont renégociés de 2 à environ 4 dollars de l’heure.
La consommation électrique des data centers doublera d’ici 2030 pour atteindre 950 térawattheures
Le goulot d’étranglement de l’infrastructure IA se déplace des puces vers les gigawatts, écrit Linas Beliūnas dans sa newsletter, en référence au rapport de l’AIE sur l’énergie et l’IA d’avril 2026. Selon l’AIE, la consommation mondiale d’électricité des data centers a augmenté de 17 % en 2025, et de 50 % pour les installations dédiées à l’IA. L’agence prévoit un doublement de la consommation, passant de 485 térawattheures en 2025 à environ 950 térawattheures d’ici 2030. Beliūnas soutient que le capital ne peut pas fournir cette puissance : un nouveau campus IA a besoin de turbines, de transformateurs, de raccordements au réseau, de permis et d’une communauté locale qui l’accepte, et plusieurs de ces éléments ont des délais plus longs que les puces qu’ils doivent alimenter. Il décrit la situation comme une collision entre une demande au rythme du logiciel et une offre au rythme de l’infrastructure. → Linas from Linas’s Newsletter
Synthszr Take: 485 térawattheures aujourd’hui, 950 en 2030, et les réseaux ne suivent pas le même rythme de croissance. Une commande de GPU a un délai de livraison en semaines, une sous-station électrique en années, et c’est précisément sur cette différence que s’effondrent les beaux calculs de nombreux projets de data centers. L’aspect politique est encore plus délicat, car les permis et l’accord des riverains ne peuvent être commandés, peu importe le capital investi.
Jeremy Howard qualifie Mojo de plus grand bond en avant de la programmation depuis des décennies
Simon Willison renvoie dans son blog à un article de Jeremy Howard qui qualifie le nouveau langage de programmation Mojo de progrès potentiellement le plus significatif de ces dernières décennies. Mojo est conçu comme un sur-ensemble de Python et est développé par une équipe dirigée par Chris Lattner, qui était auparavant responsable de LLVM, Clang et Swift. Selon les développeurs, le code Python existant devrait fonctionner sans modification, complété par des outils linguistiques pour la programmation proche du matériel : « fn » pour les fonctions typées et compilées, et « struct » comme alternative aux classes optimisée pour la mémoire. Dans une vidéo, Howard montre une multiplication de matrices qui, grâce à ces outils, est accélérée de plus de 2000 fois sans que le code ne devienne illisible. Willison cite explicitement cette vidéo comme la partie la plus convaincante de l’argumentation. → Simon Willison from Simon Willison’s Newsletter
Synthszr Take: Le texte date de mai 2023, et c’est précisément ce qui le rend intéressant aujourd’hui. À l’époque, cette accélération de 2000 fois sonnait comme la fin de C++ dans la stack IA ; trois ans plus tard, les modèles tournent toujours en Python et les kernels en CUDA. Les langages s’imposent grâce aux bibliothèques, aux gestionnaires de paquets et aux personnes qui les utilisent déjà, et Lattner a lui-même parcouru ce chemin ardu deux fois avec LLVM et Swift.
L’iPhone pliable d’Apple sera lancé à plus de 2 000 dollars
Selon la newsletter Power On de Mark Gurman (Bloomberg), Apple présentera son premier iPhone pliable lors d’un événement le 9 septembre ou aux alentours de cette date. L’appareil devrait coûter plus de 2 000 dollars, devenant ainsi le téléphone le plus cher de la gamme. D’après des personnes qui l’ont déjà utilisé, la charnière et les agencements d’applications de type iPad sur le grand écran interne sont convaincants. Il manque un téléobjectif, et l’authentification se fait par Touch ID au lieu de Face ID. Apple arrive tard dans une catégorie que Samsung, Huawei et Google développent depuis des années, dernièrement avec le Galaxy Z Fold 8. En 2025, les appareils pliables représentaient environ 1,6 % de toutes les livraisons de smartphones, la Chine constituant plus de la moitié du marché mondial avec plus de 10 millions d’unités. → www.bloomberg.com
Synthszr Take: Plus de 2 000 dollars, pas de téléobjectif, Touch ID au lieu de Face ID : Apple vend le retour de l’émerveillement et se fait payer l’anticipation d’avance. Le deuxième mouvement se produit dans la foulée, car avec cet événement, les prix des iPhones normaux augmentent également, après que les Mac et les iPad ont déjà augmenté en moyenne de 23 % il y a deux mois. Un appareil « halo » au sommet de la gamme déplace la perception de ce qu’un téléphone peut coûter, et toute la gamme en dessous glisse vers le haut avec lui.
Le créateur de Bun réécrit un million de lignes de Zig en Rust, pour 165 000 dollars de tokens
Jarred Sumner a porté le runtime JavaScript Bun de Zig à Rust et a documenté le processus dans un billet de blog longuement annoncé, auquel Simon Willison fait référence. Le déclencheur a été la liste de bugs : une grande partie des plantages était due, selon Sumner, à des erreurs de type use-after-free, double-free et des oublis de libération de mémoire dans les chemins d’erreur, soit exactement la classe d’erreurs que le compiler de Rust intercepte dans le code sécurisé. Le portage a été rendu possible par la suite de tests de Bun, écrite en TypeScript, qui a pu servir de Conformance Suite indépendante du langage avec environ un million d’assertions. Un harnais d'agents a pris en charge la majeure partie de la traduction, d’abord à titre expérimental avec une version précoce du modèle désormais disponible sous le nom de Mythos/Fable. Pendant onze jours, Sumner a, selon ses propres dires, suivi manuellement les sorties du workflow et a fait ajuster la boucle par Claude, au lieu de corriger individuellement le code défectueux ; à cela se sont ajoutées des code-reviews contradictoires. → Simon Willison from Simon Willison’s Newsletter
Synthszr Take: Les 165 000 dollars de tokens sont le poste de dépense le moins cher de cette opération. Ce qui a rendu la réécriture possible, c’est une suite de tests avec un million d’assertions, écrite en TypeScript à une époque où personne ne pensait encore aux coding-agents, ainsi que onze jours pendant lesquels Sumner a lu les sorties du workflow et affiné la boucle, au lieu de patcher le code à la main. Le modèle a produit les lignes ; la décision de savoir quand un million de lignes ajoutées sont prêtes à être mergées est venue de quelqu’un qui a l’ancienne base de code Zig en tête.
Le robot humanoïde chinois court le 100 mètres plus vite que Bolt, puis s’écrase contre un mur
Lors des « Robot Olympics » à Pékin, un robot humanoïde chinois a parcouru le 100 mètres samedi avec près de deux dixièmes de seconde de moins que le record du monde d’Usain Bolt. Semafor classe la performance comme une catégorie de record à part entière, mais souligne la rapidité du développement : le meilleur temps de l’année précédente a été battu de plus de dix secondes. Immédiatement après avoir franchi la ligne d’arrivée, la machine s’est écrasée contre un mur rembourré car elle a des difficultés à freiner. Selon le rapport, les jeux ont surtout accru l’attention portée au fabricant leader Unitree. → Semafor
Synthszr Take: Accélérer relève de la mécanique, s’arrêter de la technique de régulation, et seule l’une de ces deux disciplines est décisive pour une utilisation commerciale. Un sprint est une boucle de contrôle ouverte à pleine puissance, sans aucune décision intermédiaire. Freiner exige que la machine calcule en temps réel l’impulsion, la surface et la fin de la piste, et c’est à cause de cela qu’elle s’est écrasée contre le mur rembourré. L’amélioration de dix secondes par rapport à l’année précédente montre à quelle vitesse les actionneurs et la propulsion mûrissent, tandis que la logique de sécurité ne suit visiblement pas ce rythme.
La course de rattrapage de la Chine en IA : qui sont les chercheurs derrière ce succès ?
Un portrait de la génération de chercheurs qui a porté le bond surprenant de la Chine en IA met pour la première fois l’accent sur les personnes plutôt que sur les modèles. Il décrit une cohorte de scientifiques qui ont suivi leur formation et parfois débuté leur carrière dans le système de recherche occidental et qui travaillent aujourd’hui dans des laboratoires chinois sur des modèles frontières. Selon le rapport, ces parcours expliquent le changement de rythme de ces derniers mois, les percées architecturales individuelles jouant un rôle moins important. Le texte replace ainsi ce bond dans un débat qui, jusqu’à présent, a été mené presque exclusivement sur les benchmarks, les contrôles à l’exportation de puces et les coûts d’entraînement. Parallèlement, le débat de politique intérieure sur les infrastructures s’est intensifié aux États-Unis. Le sénateur John Fetterman de Pennsylvanie a rejeté samedi l'« AI doomsdaying » et a soutenu la ligne du président Trump visant à accélérer la construction de data centers pour l’IA. Le démocrate se positionne ainsi contre le gouverneur de son propre État, Josh Shapiro. La justification de Fetterman : la Chine gagne toujours lorsque les États-Unis surréagissent aux risques de la technologie. L’argument chinois dans ce débat sert donc à justifier le rythme de construction, tandis que la question des spécialistes et des chercheurs est à peine abordée dans le discours politique. → Wall Street Journal, newsmax
Synthszr Take: On peut accélérer la construction de data centers avec des permis et du capital, mais pas une génération de chercheurs. Le bond de la Chine est dû à des personnes formées dans le système scientifique américain qui sont ensuite retournées dans leur pays, et c’est le seul ingrédient de toute cette équation qui ne peut être contrôlé par des restrictions à l’exportation. Fin mai, nous décrivions ici l’interdiction de sortie du territoire pour les experts chinois en IA : Pékin traite depuis longtemps les cerveaux comme une réserve stratégique, tandis que Washington se dispute sur les délais de construction des hangars à serveurs. L’avertissement de Fetterman contre une réaction excessive est pertinent, mais il vise le mauvais goulot d’étranglement, car le béton et les transformateurs peuvent être commandés, mais pas un spécialiste diplômé en Reinforcement Learning. Le prochain round se décidera sur la direction que prendront les parcours professionnels, et cela ne figure dans aucun tableau de benchmark.
Le modèle de code anonyme Ox Alpha surprend les développeurs, la piste mène à Zhipu
Le 20 août 2026, un modèle de codage nommé Ox Alpha est apparu sur la place de marché de modèles OpenRouter, sans nom de société, sans logo, sans annonce, listé sous le label de fournisseur générique « Stealth ». OpenRouter le décrit comme un modèle de raisonnement pour le codage, le travail agentique continu et les charges de production. L'agent de codage open-source OpenCode a annoncé qu’il offrirait le modèle gratuitement et avec une utilisation quasi illimitée pendant une semaine, jusqu’au 27 août environ. L’opérateur anonyme annonce une capacité de 100 billions de tokens par jour, ce qui correspond à environ cent fois ce que Visa déclare consommer en un mois entier.
Techniquement, c’est surtout la fenêtre de contexte de 1 048 576 tokens qui se démarque, ainsi que l’entrée de texte, d’image et de vidéo, le function calling et la sortie JSON structurée. La plupart des modèles prêts pour la production se situent entre 8 000 et 200 000 tokens. Le débit est d’environ 29 tokens par seconde. Le développeur Ben Davis a confronté le modèle à l’évaluation d’agents de codage DeepSWE et a rapporté 8 tâches résolues sur 10, contre 65 % pour Claude Fable 5 et 52 % pour GPT-5.6-Sol. Une évaluation plus large par la communauté sur 113 tâches a ensuite atteint environ 63 %. Le PDG de Stripe, Patrick Collison, dont l’entreprise a convenu de l’acquisition d’OpenRouter le 19 août, a qualifié le modèle de « très impressionnant » sur X.
La recherche de son origine a commencé en quelques heures. Par tokenizer-fingerprinting, Joseph W. Elstner a comparé le comptage de tokens du modèle avec quatorze vocabulaires publics, d’abord avec 95 entrées de test et 126 appels API ; l’ancienne version de GLM correspondait exactement à 84 échantillons, le meilleur candidat non-GLM à 46. Un second passage le 23 août avec le vocabulaire publié de GLM-5 a donné 95 correspondances sur 95 avec une erreur absolue moyenne de 0,00. Un deuxième chercheur, Chetaslua, est parvenu au même résultat avec 30 échantillons sur 14 systèmes d’écriture, y compris un décalage constant de 75 tokens par requête, ce qui suggère un prompt système invisible pré-inséré. Pour l’entrée vidéo, trois propriétés indépendantes de l’encodeur correspondaient à celles du GLM-5V-Turbo de Zhipu, y compris une consommation d’environ 147 tokens par seconde de vidéo.
L’indice le plus fort est venu d’une requête délibérément erronée : Chetaslua a défini le paramètre top_p sur la chaîne « abc », ce qui a provoqué le retour par le serveur d’une stack trace Java avec la classe interne com.wd.paas.api.domain.v4.chat.ChatCompletionRequest, dont le chemin pointe vers les points de terminaison documentés de Zhipu, open.bigmodel.cn et api.z.ai. Aucune entreprise n’a confirmé l’opération jusqu’à présent. Parallèlement, d’autres interprétations circulent, notamment la thèse sur Wccftech selon laquelle il pourrait s’agir d’une version non publiée du MAI de Microsoft ; sur Reddit, des publications s’opposent, excluant ou jugeant très probable une origine chinoise.
La question des données reste ouverte. OpenRouter indique que le fournisseur anonyme stocke les prompts et les complétions, mais ne les utilise pas pour l’entraînement. La liste du modèle et les conditions d’utilisation applicables de la plateforme décrivent ce point de manière contradictoire. Les développeurs envoient donc potentiellement du code propriétaire à un opérateur dont l’identité n’est officiellement pas claire. → Tech Times, Business Insider, implicator, TechCrunch
Synthszr Take: Un modèle sans nom, sans logo et sans communiqué de presse obtient en trois jours plus d’attention de la part des experts que la plupart des lancements officiels en trois mois. L’anonymat est ici le marketing du produit : il transforme chaque développeur en un enquêteur qui brûle volontairement 126 appels API pour en déterminer l’origine, et partage ensuite gratuitement les résultats sur X. Personne ne lit un communiqué de presse deux fois, mais une stack trace Java avec le chemin de classe com.wd.paas.api, si. Le prix est payé ailleurs : les prompts sont stockés chez un opérateur dont le nom est officiellement inconnu, et les conditions se contredisent précisément sur ce qu’il est permis d’en faire. Lorsque la fenêtre de gratuité se fermera vers le 27 août, on verra si les 63 % du grand benchmark survivent au mythe.

