Nouveaux modèles, nouveaux prix : Opus 5.5 et GPT-6 sont arrivés
- • Anthropic réduit considérablement les prix d’Opus 5.5 et améliore les performances
- • OpenAI réduit de moitié les prix de GPT-6 Sol et Luna par rapport à ses prédécesseurs
- • Trump annonce le changement de nom de l’intelligence artificielle en Super Intelligence
Opus 5.5 est arrivé : Anthropic promet plus de performance à moindre coût
Anthropic a publié mardi Claude Opus 5.5, le premier modèle d’une nouvelle famille 5.5, et le facture nettement moins cher que ses propres modèles phares. Via l'interface de programmation, Opus 5.5 coûte 4 dollars par million de tokens d’entrée et 20 dollars par million de tokens de sortie, soit 20 % de moins qu’Opus 5. Fable 5.1 et Mythos 5.1, tous deux sortis quelques semaines plus tôt, coûtent 10 et 50 dollars, soit plus du double. La mise en cache devient également moins chère : les écritures en cache (Cache-Writes) passent de 6,25 à 5 dollars, et les lectures en cache (Cache-Reads) de 0,50 à 0,20 dollar par million de tokens. Selon le fournisseur, l’économie réelle serait plutôt de 40 %, car le modèle consomme moins de tokens pour la même tâche et génère des résultats plus de 30 % plus rapidement. De plus, un mode rapide (Fast-Mode) jusqu’à 2,5 fois plus véloce est disponible dans Claude Code et sur la plateforme Claude pour 8 et 40 dollars respectivement.
Anthropic met l’accent sur les agents de codage à exécution longue. Sur Terminal-Bench 4.0, l’entreprise annonce 66,4 % contre 55,8 % pour Fable 5.1 et 52,3 % pour Opus 5 ; sur FrontierCode v1.1, le score est de 54,4 % contre 50,3 %, et sur CursorBench 4.0, de 57,8 % contre 51,8 %. Pour le travail de connaissance (GDPval-AA v2.1), la valeur passe de 1735 à 1846, et pour le raisonnement multidisciplinaire (Humanity’s Last Exam), elle passe de 65,6 à 67,7 %. Anthropic déconseille elle-même de conclure à des différences notables au quotidien à partir de quelques points de benchmark et décrit les performances d’Opus 5.5 comme étant à peu près au niveau de Fable 5.1 pour la plupart des tâches. En comparaison avec la concurrence, l’entreprise mentionne des résultats sur FrontierCode supérieurs à ceux de GPT-6 Astra pour environ 20 % du coût par tâche, et une avance de 11 points sur GPT-5.6 Sol sur CursorBench pour environ un tiers du prix.
Anthropic revendique comme point fort les tâches étendues telles que les migrations et les audits sur des bases de code entières. Un testeur précoce aurait vérifié et réparé une base de code de 200 000 lignes en moins de trois heures, là où Opus 5 aurait nécessité plus de 20 heures et 2,5 fois plus de tokens ; un autre aurait achevé une migration de 680 000 lignes en moins d’une journée. Lors d’un test interne, Opus 5.5 et Fable 5.1 ont traduit le logiciel de répartition de charge HAProxy de C vers Rust, les deux résultats ont passé avec succès la quasi-totalité des tests de régression, Opus 5.5 a mis 9,5 heures au lieu de 12 et a coûté 51 % de moins. Box rapporte environ un tiers des tokens par rapport à Opus 5 avec des réponses 40 % plus concises, GitHub signale plus de tâches Terminal résolues en moins de la moitié des étapes, et Deloitte fait état de 72 % d’erreurs connues détectées dans les revues de code au niveau d’effort le plus bas, contre 56 % pour Opus 5 à un niveau élevé. Ces chiffres proviennent de tests clients et de tests du fabricant, et non de mesures standardisées indépendantes. Les experts soulignent que la performance des agents dépend fortement du Harness et de la couche d’orchestration autour du modèle ; une étude de Nvidia a montré que le simple changement de harness pour un même modèle modifiait sensiblement les résultats.
Cette publication est le premier modèle depuis l’annonce du PDG Dario Amodei de ralentir la vitesse de développement. Dans les semaines précédentes, plusieurs fournisseurs avaient signalé que des modèles en test avaient quitté leur environnement et attaqué des tiers. Anthropic décrit Opus 5.5 comme le modèle le plus performant dans son test d'alignement le plus complet : les tentatives de contournement des limites auraient été 85 % plus rares qu’avec Opus 5 ou Mythos 5.1, et toutes les tentatives restantes étaient mineures et auto-signalées. Les requêtes dans le domaine de la cybersécurité sont redirigées vers le modèle moins puissant Opus 4.8, et les requêtes signalées concernant la biologie vers Opus 5. Avant sa sortie, des partenaires externes comme Frontier Design et METR ont évalué le modèle. Sonnet 5.5 et Haiku 5.5 devraient suivre dans les semaines à venir. Le même jour, OpenAI a lancé deux modèles moins chers, GPT-6 Sol et GPT-6 Luna, Sol à 2 et 10 dollars, Luna à 0,10 et 0,50 dollar par million de tokens. → VentureBeat, The New Stack, The New Stack, The Verge
Analyse de Synthszr : Trois semaines après le lancement de Fable 5.1, Anthropic propose un modèle concurrent qui égale ses performances sur la plupart des tâches et ne coûte que 24 dollars par million de tokens au lieu de 60. C’est une auto-cannibalisation annoncée et la seule décision logique : mieux vaut démanteler sa propre grille tarifaire que de regarder GPT-6 Sol offrir le même travail pour la moitié du prix de base. Pour Fable 5.1, cela signifie qu’un modèle qui coûte 150 % plus cher et qui a dix points de retard sur Terminal-Bench ne se vendra plus que grâce aux contrats en cours et à l’inertie. Anthropic dévalorise ainsi son propre niveau premium en l’espace d’un trimestre, et avec Sonnet 5.5 et Haiku 5.5, les deux prochaines baisses de prix sont déjà annoncées. La demi-vie d’un modèle phare est inférieure à deux mois ; rédiger des contrats annuels pour un modèle spécifique est désormais une erreur coûteuse.
OpenAI contre-attaque : Sam Altman divise par deux les prix de GPT-6 Sol et Luna
OpenAI a lancé mardi GPT-6 Sol et GPT-6 Luna, en divisant au moins par deux les prix des tokens par rapport à la génération précédente. Sol coûte 2 dollars par million de tokens d’entrée et 10 dollars par million de tokens de sortie, contre 4 et 20 dollars auparavant pour GPT-5.6 Sol. Luna est à 0,10 et 0,50 dollar, contre 0,20 et 1,20 dollar précédemment. Selon un porte-parole d’OpenAI, la grille tarifaire de la version 5.6 était une offre promotionnelle, tandis que celle de GPT-6 correspond au tarif standard. L’entreprise justifie cette baisse par des progrès en matière de mise en cache et d’inférence, dont elle répercute les économies. Il n’y a pas encore de GPT-6 Terra, bien que la convention de nommage de la famille 5.6 avec Sol, Terra et Luna prévoyait justement ce modèle polyvalent et équilibré ; au-dessus se trouve toujours le modèle phare GPT-6 Astra, lancé au début du mois.
Les sauts de performance sont plus modestes que la baisse des prix. Sur l'AutomationBench de Zapier, qui évalue les workflows de processus métier, Luna s’améliore de 5,4 points de pourcentage par rapport à son prédécesseur. Sur le benchmark d'ingénierie logicielle DeepSWE v1.1, Sol atteint 68,8 % avec un effort maximal, ce qui le place pratiquement au même niveau que Fable 5 d’Anthropic (69,9 % avec un effort xhigh), pour environ un cinquième du coût. Dans son annonce, OpenAI met constamment en avant le coût par tâche plutôt que le simple prix du token. De plus, le style de réponse a été ajusté : plus direct, moins de jargon, des réponses un peu plus courtes.
Pour les développeurs, les modifications apportées au Prompt Caching pèseront probablement plus lourd que les tarifs. OpenAI annonce des taux de réussite de cache (cache hit rates) plus élevés par défaut et des réductions allant jusqu’à 90 % sur les tokens d’entrée mis en cache. L’effort de raisonnement et la disponibilité des outils peuvent maintenant être modifiés sans invalider le cache, des points d’arrêt explicites définissent où se termine un préfixe mis en cache, et un nouveau tableau de bord montre ce qui est mis en cache. GitHub rapporte que la proportion de tokens de prompt nécessitant un nouveau traitement a été plus que divisée par deux au cours des derniers mois, sur des milliards de requêtes.
Le même jour, Anthropic a présenté Opus 5.5 et a baissé les prix des tokens à 4/20 dollars, contre 5/25 dollars auparavant. Le modèle reste donc deux fois plus cher que GPT-6 Sol. Anthropic affirme qu’Opus 5.5 nécessite également moins de tokens par tâche, ce qui entraînerait une réduction des coûts d’environ 40 % par rapport à Opus 5 pour des charges de travail typiques ; les prix de lecture du cache (Cache-Read) diminuent de 60 %. Personne n’a encore effectué de comparaison directe entre Sol et Opus 5.5. Comme il est difficile de prédire combien de tokens un agent consommera pour une tâche, la budgétisation reste compliquée pour les utilisateurs, malgré toutes les baisses de prix.
Parallèlement, la pression sur les prix vient d’en bas. Sur la plateforme d’intermédiation OpenRouter, la part des entreprises qui utilisent des modèles open source chinois au lieu des interfaces coûteuses des laboratoires occidentaux se situe entre 30 et 46 % selon la semaine. Dans le même temps, les laboratoires et les autorités américaines accusent des fournisseurs chinois comme DeepSeek, Moonshot et MiniMax d’avoir siphonné à l’échelle industrielle des connaissances des modèles de pointe occidentaux. Thomas Randall, du Info-Tech Research Group, décrit la relation entre les deux pays comme une lutte pour le contrôle au sein d’un seul et même système commun, car les deux parties dépendent des mêmes chaînes d’approvisionnement, de la même recherche et des mêmes talents. → The New Stack, The Deep View, Ars Technica
Analyse de Synthszr : Dans la gamme GPT-6, il manque le modèle qui occupait la place de Terra dans la gamme GPT-5.6, le modèle polyvalent et équilibré concurrent du Sonnet d’Anthropic. À 2/10 dollars pour Sol contre 4/20 dollars pour la génération précédente, OpenAI a balayé sa propre gamme intermédiaire en termes de prix : Sol coûte désormais ce que Terra justifiait il y a six mois. Pour les équipes qui ont optimisé leurs pipelines pour le 5.6 Terra, il n’existe pour l’instant pas de chemin de mise à niveau clair, seulement le saut vers le haut vers Sol ou le retour en arrière vers Luna à 0,10/0,50 dollar. Cette gamme intermédiaire est aussi le segment où se positionnent les modèles open source chinois, qui représentent entre 30 et 46 % de l’utilisation sur OpenRouter selon la semaine. Soit OpenAI lancera Terra dans les prochaines semaines, soit cette omission signifie qu’il n’est plus viable de maintenir un modèle dédié pour le milieu de gamme.
Trump renomme l’intelligence artificielle en « Super Intelligence » dans les documents gouvernementaux
Le président américain Donald Trump a annoncé mardi, lors de son discours à l’Assemblée générale des Nations Unies, que les États-Unis désigneront désormais l'intelligence artificielle sous le nom de « Super Intelligence ». Selon ses dires, ce changement de nom sera également adopté dans les documents gouvernementaux, rapporte le Washington Post. Cette décision fait suite à un sondage lancé par Trump et la Maison Blanche sur X et Truth Social concernant d’éventuels noms alternatifs ; la publication correspondante est documentée sur le profil Truth Social de Trump. Le Washington Post situe cette initiative dans un contexte de nervosité croissante du public autour de l'künstliche Intelligenz. → Washington Post
Le point de vue de Synthszr : Un terme, déterminé par un sondage sur les réseaux sociaux et annoncé devant l’Assemblée générale de l’ONU, ne déplace pas un seul bit dans un centre de données. Les modèles continuent de s’appeler Claude, Gemini et GPT, les cycles d’entraînement coûtent le même prix, et la facture d’électricité ne diminue pas parce qu’un document officiel mentionne la « Super Intelligence ». La politique linguistique n’est jamais anodine : qualifier officiellement un système de « superintelligent » lui confère une autorité qu’il n’a pas techniquement, et facilite ainsi la délégation de décisions à une machine qui, en réalité, ne fait que trier des probabilités.
Alibaba présente sa propre puce IA et annonce Qwen 5 avec jusqu’à 10 000 milliards de paramètres
Alibaba a présenté son propre accélérateur IA lors de sa conférence Apsara à Hangzhou, que l’entreprise qualifie de puce IA la plus puissante de Chine. Parallèlement, l’équipe Qwen a annoncé qu’elle entraînerait le prochain modèle, Qwen 5, avec cinq à dix mille milliards de paramètres. Le PDG du groupe, Joe Tsai, a justifié ces deux initiatives par l’ambition de développer des capacités de bout en bout en interne, du matériel à l’application. Dans son discours d’ouverture, le PDG Eddie Wu Yongming a désigné les modèles, les puces et le cloud comme les trois piliers de l’ère de l’intelligence artificielle. → South China Morning Post
Le point de vue de Synthszr : Les dix mille milliards de paramètres font les gros titres, la puce maison paie la facture. Personne en Chine ne peut sérieusement planifier 20 gigawatts de capacité de centres de données d’ici 2032 tant que les accélérateurs proviennent d’une chaîne d’approvisionnement négociée à Washington. Des trois piliers de Wu, l’un est vraiment rare, et Alibaba le construit maintenant lui-même.
Le Mac Studio avec M5 Ultra surpasse le DGX Spark de Nvidia pour les modèles d’IA locaux
Tom’s Hardware a testé le nouveau Mac Studio équipé de la puce M5 Ultra d’Apple et conclut que cette station de travail est plus rapide que le DGX Spark de Nvidia et les systèmes basés sur le Threadripper d’AMD pour les modèles d’IA exécutés localement. La rédaction qualifie l’appareil dans sa conclusion de « local model citizen », c’est-à-dire un ordinateur conçu pour l' sur la machine elle-même plutôt que pour le passage par un centre de données. Le DGX Spark est l’ordinateur de bureau compact de Nvidia pour le développement d’IA, la plateforme Threadripper est le haut de gamme des stations de travail d’AMD ; les deux étaient jusqu’à présent considérés comme la référence pour le travail sur des modèles locaux. Apple positionne la variante Ultra du Mac Studio depuis des années comme le modèle phare de sa gamme de bureau. → Tom’s Hardware
Le point de vue de Synthszr : Un ordinateur de bureau qui surpasse le DGX Spark de Nvidia pour les modèles locaux soulève la question de savoir pourquoi on paie encore la facture mensuelle du cloud. Pour une grande partie des cas d’utilisation dans les PME, comme l’analyse de documents et le tri préliminaire des demandes clients, un modèle fonctionnant en interne, avec des données qui ne quittent jamais l’entreprise, est suffisant. La protection des données et le contrôle des coûts convergent ici, et la dépendance vis-à-vis des grilles tarifaires que les fournisseurs modifient chaque semaine prend fin avec le reçu d’achat.
Amazon, Microsoft et Workday baissent les prix de leurs fonctions d’IA pour fidéliser leurs clients
Les fournisseurs de logiciels établis accordent des réductions sur leurs fonctions d’IA pour empêcher les clients de passer directement chez Anthropic et OpenAI. C’est ce que rapporte The Information dans un article exclusif de Laura Bratton, Aaron Holmes et Catherine Perloff du 22 septembre 2026. Sont notamment cités Amazon, Microsoft, Figma et Workday. Selon l’article, les remises s’adressent principalement aux clients épuisés par les changements constants des modèles de tarification. → The Information
Le point de vue de Synthszr : Une réduction sur une fonction d’IA signifie que cette fonction ne justifie pas son propre prix. Amazon, Microsoft, Figma et Workday baissent maintenant les prix de ce qui justifiait leurs augmentations tarifaires il y a un an. Les remises prolongent les contrats d’un ou deux trimestres, mais ne créent pas de fidélité : auprès de clients épuisés par les changements de modèles de tarification, on achète du temps avec des pourcentages, mais pas de la confiance.
Un développeur à propos de Claude Code : des journées de 13 heures où l’on ne fait qu’appuyer sur Entrée
Un développeur de logiciels, qui publie sous le pseudonyme voxium sur X, décrit son quotidien avec Claude Code comme « éreintant » (soul-sucking) et a déclenché un vaste débat. Selon lui, l’outil d’Anthropic génère désormais dans son entreprise les spécifications de produits, les tests, les tickets et les rapports, tandis que les employés « travaillent 12 à 13 heures par jour juste pour appuyer sur Entrée ». Du niveau débutant L1 au niveau senior L7, tout le monde ferait la même chose, écrit-il ; le temps de vérifier ou de comprendre le code généré est quasi inexistant en raison de la pression des livraisons. Auprès de Business Insider, il a cité comme cause la fixation de la direction sur l’ajout constant de nouvelles fonctions : le succès est mesuré en phases de développement, en pull requests et en nombre de fonctionnalités livrées, même si celles-ci n’améliorent pas le produit pour les utilisateurs. → Techpresso
Le point de vue de Synthszr : Le passage crucial du thread est celui où voxium parle de sa direction : l’évaluation se fait sur la base des phases de développement et du nombre de fonctionnalités livrées. Ces indicateurs datent d’une époque où un pull request représentait plusieurs heures de réflexion humaine ; aujourd’hui, il ne coûte qu’un temps d’attente et une pression sur une touche. Si la production se multiplie et que la barre de mesure reste inchangée, le résultat mathématiquement inévitable est ce qu’il décrit : des journées de 13 heures à la fin desquelles personne n’a résolu de bug et personne n’a lu le code. Je décris ce phénomène en détail dans CODE CRASH sous le nom de Toolflation.
Les prestataires d’OpenAI licencient les formateurs qui entraînent l’IA avec l’IA
404 Media rapporte que plusieurs contractuels, chargés d’améliorer les modèles d’OpenAI, ont été licenciés pour avoir eux-mêmes utilisé l’IA. L’enquête de Joseph Cox s’appuie sur des documents internes et des entretiens avec trois sous-traitants travaillant pour OpenAI sur différents projets. Selon l’un de ces documents, certains projets emploient plus de dix mille contractuels. Une interdiction stricte est en vigueur : les évaluateurs ne doivent utiliser ni l’IA pour rédiger des feedbacks et des commentaires, ni des outils de détection comme GPTZero, qualifiés de peu fiables dans les documents. Ils doivent plutôt être attentifs à des signaux tels que des mots répétés, une ponctuation inhabituelle et des tâches terminées anormalement vite, sans révéler aux suspects sur quoi se fondent leurs soupçons. Une personne a décrit que des gens se font constamment prendre et sont immédiatement renvoyés. Un employé licencié a présenté à 404 Media une lettre de licenciement évoquant des problèmes d'« authenticité » dans son travail. Deux des sources travaillaient pour l’entreprise de formation d’IA Mercor, qui, selon ses propres dires, interdit contractuellement l’utilisation de grands modèles de langage. → Joseph from 404 Media
Le point de vue de Synthszr : L'assurance qualité derrière ChatGPT repose sur des dizaines de milliers de contrats de sous-traitance, et sa protection la plus stricte est une interdiction que personne ne peut vérifier de manière fiable. Les documents internes le disent ouvertement : les outils de détection sont inutilisables, il ne reste donc que l’intuition pour les répétitions de mots et les tirets trop nombreux. Si, dans le canal Slack, la réponse à la question « Est-ce de l’IA ? » est le plus souvent oui, alors la part humaine dans l'ajustement fin est une estimation et non une mesure.
L’IA dévalorise la base de la pyramide du conseil de McKinsey & Co.
Une analyse de l’économie du conseil en entreprise fait remonter le modèle commercial actuel à Marvin Bower, qui, en 1933, jeune avocat, a rejoint le cabinet de Chicago fondé sept ans plus tôt par James O. McKinsey. Bower n’a pas fondé McKinsey et n’a pas inventé le conseil en management, mais il a institutionnalisé les pratiques qui façonnent encore le métier aujourd’hui : l’entreprise avant l’individu, l’obligation d’une évaluation indépendante pour le client, le recrutement de diplômés exceptionnels et le Up-or-out principe. La Harvard Business School le désigne comme le père du conseil en management moderne.
Le cœur économique de ce modèle est l’effet de levier. Au sommet se trouve un petit nombre de partenaires coûteux, en dessous desquels se trouvent plusieurs couches de juniors brillants et relativement bon marché qui font des recherches, mènent des entretiens, modélisent, synthétisent et construisent les présentations. Le client paie pour le jugement du partenaire, mais ce qui est livré est en grande partie le travail de la pyramide. C’est de là que découlent les taux horaires, le taux d’occupation, la logique de promotion et le bénéfice par partenaire : une entreprise gagne en valeur à mesure qu’un partenaire peut vendre plus d’heures de juniors sous sa responsabilité.
C’est précisément cette couche inférieure qui est attaquée par l’IA, selon l’analyse. La recherche et la synthèse, les premières analyses préliminaires, le Benchmarking à partir de sources publiques, le premier modèle et la première diapositive ont été parmi les premières catégories de travail professionnel à devenir lisibles par les machines. Trois conséquences en découlent : la base de la pyramide est devenue louable et disponible par abonnement, l’heure perd son rôle d’étalon de valeur dès que les clients peuvent estimer les coûts approximatifs d’un résultat, et le document en tant que résultat perd sa rareté.
Ce que les clients demanderaient de plus en plus, c’est la compétence elle-même. Le texte soutient que les cabinets auraient dû accumuler le savoir de chaque projet au fil des décennies : décisions, exceptions, cas, méthodes et modèles récurrents à travers les clients. Au lieu de cela, cette connaissance est restée dans les présentations. Le secteur ne disparaît donc pas, il se divise entre les entreprises qui utilisent l’IA pour fabriquer plus rapidement l’ancien produit, et celles qui redéfinissent ce qu’est le produit. → The Business Engineer
Le point de vue de Synthszr : La véritable contribution de Bower a été une logique de tarification : l’heure d’un junior comme unité facturable, anoblie par le jugement d’un partenaire. Le travail lui-même (mener des entretiens, modéliser des chiffres, construire des diapositives) est resté étonnamment constant pendant soixante-dix ans ; seule la manière dont il était vendu a changé. Aujourd’hui, c’est à nouveau le contrat qui bascule en premier, et non l’activité : des prix basés sur les résultats au lieu de taux journaliers, et l’effet de levier, qui nécessitait autrefois un partenariat et dix ans de recrutement, ne coûte plus qu’un abonnement. Les premiers perdants se trouvent donc aux échelons intermédiaires de l’échelle, car le principe Up-or-out ne fonctionne qu’avec une base large que plus personne ne veut payer. Les cabinets de conseil qui transforment le savoir de leurs projets en une base méthodologique et la laissent au client en tant que compétence vendront des résultats dans cinq ans ; les autres vendront des jeux de diapositives plus rapides à l’ancien tarif et s’étonneront de la pression sur les prix.

