Guide

Claude Opus 5.5, expliqué : le Claude le plus honnête à ce jour, et le plus difficile à justifier à prix double

Anthropic a lancé Claude Opus 5.5 le 22 septembre 2026, remplaçant Opus 5 à un prix inférieur de 20 %. Son affirmation phare est d'une précision inhabituelle et elle tient la route : sur un test conçu pour repérer les chiffres inventés et les fausses citations, Opus 5.5 a réussi 16 tentatives sur 18, ce que ni Opus 5 ni Claude Fable 5.1 n'avaient jamais réussi une seule fois. Le hic, c'est que Claude Sonnet 5.5, sorti six jours plus tôt à moitié prix, obtient des scores presque identiques sur plusieurs des benchmarks qui comptent le plus.

Mis à jour 4 octobre 20269 min de lecture
Réponse rapide

Claude Opus 5.5 a été lancé le 22 septembre 2026, remplaçant Opus 5 (Anthropic a sauté un « 5.1 » pour la gamme Opus, contrairement à Fable). Le prix a baissé de 20 %, à 4 $ par million de tokens en entrée et 20 $ par million de tokens en sortie, contre 5 $/25 $ pour Opus 5. La génération est aussi environ 30 % plus rapide qu'Opus 5.

L'affirmation anti-fabrication est réelle et vérifiée. La propre page de lancement d'Anthropic indique qu'Opus 5.5 a franchi une barre de qualité « aucun chiffre inventé » sur 16 des 18 rapports de test, à différents niveaux d'effort ; ni Fable 5.1 ni Opus 5 ne l'avaient franchie une seule fois. Il s'agit d'une évaluation interne auto-déclarée par Anthropic, non reproduite de façon indépendante par un tiers.

L'avance aux benchmarks est étroite, pas décisive. Opus 5.5 affiche 89,9 % sur SWE-bench Pro et devance légèrement GPT-6 Astra sur plusieurs tests de codage et de travail de connaissance, typiquement de 1 à 2 points de pourcentage, des marges qu'Anthropic elle-même présente comme plus faibles que ce que l'écart de prix avec Fable 5.1 pourrait suggérer.

La vraie question que se posent la plupart des acheteurs n'est pas Opus contre GPT-6 Astra, c'est Opus 5.5 contre Claude Sonnet 5.5. Sonnet 5.5, à moitié prix, obtient des scores à un ou deux points de ceux d'Opus 5.5 sur plusieurs benchmarks indépendants, ce qui pousse ouvertement les développeurs à se demander ce que le surcoût achète vraiment.

La page tarifaire d'Anthropic montrant les cartes des forfaits individuels Free, Pro (17 $/mois en facturation annuelle, 20 $/mois en mensuel) et Max (à partir de 100 $/mois), avec une fenêtre contextuelle indiquant « Claude Cowork is now just Claude, rolling out to Pro and Max ».
La tarification des forfaits grand public d'Anthropic. Le tarif API d'Opus 5.5, à 4 $/20 $ par million de tokens, est distinct et figure sous l'onglet API de la page. anthropic.com, octobre 2026.

Ce qui a vraiment changé depuis Opus 5

Opus 5.5 remplace directement Opus 5 ; il n'y a pas eu d'« Opus 5.1 » comme Anthropic avait sorti une mise à jour Fable 5.1 pour Fable 5 plus tôt dans l'année. Le prix est passé des 5 $ en entrée / 25 $ en sortie par million de tokens d'Opus 5 à 4 $/20 $, une baisse de 20 %, et Anthropic affirme que la génération de sortie est plus de 30 % plus rapide, le modèle terminant les tâches en utilisant moins de tokens et moins d'appels d'outils en cours de route. Cela place la gamme Claude actuelle sur trois paliers de prix clairement séparés : Sonnet 5.5 à 2 $/10 $, Opus 5.5 à 4 $/20 $, et Fable 5.1 à 10 $/50 $ par million de tokens en entrée/sortie.

Au-delà du prix et de la vitesse, la system card d'Anthropic décrit quelques changements structurels : un système de classification du risque cyber à trois niveaux, contre deux dans les modèles précédents, et un virage depuis des tests de sécurité purement « utile uniquement » vers des évaluations à double usage qui correspondent davantage à la façon dont le modèle est réellement déployé. Ni l'un ni l'autre n'apparaît dans un tableau de benchmarks, mais tous deux reflètent ce à quoi Anthropic dit avoir consacré le cycle de sortie, au-delà de la pure capacité.

L'affirmation anti-fabrication, vérifiée

La propre page de lancement d'Anthropic le dit directement : « Sur différents niveaux d'effort, 16 des 18 rapports d'Opus 5.5 ont franchi notre barre de qualité, où tout chiffre ou citation inventé aurait entraîné un échec. Ni Fable 5.1 ni Opus 5 n'ont franchi cette barre une seule fois. » Le test derrière cette affirmation demandait au modèle de rédiger le rapport de performance trimestrielle d'une entreprise à partir d'une page web où le communiqué de résultats réel était difficile à localiser, puis un correcteur automatisé vérifiait chaque chiffre et chaque citation par rapport à la source. Réussir exigeait soit de trouver les vrais chiffres, soit d'admettre ne pas y arriver, plutôt que d'en inventer avec assurance des plausibles.

Ce mode d'échec spécifique, un modèle qui énonce un chiffre ou une citation avec une pleine assurance alors qu'il est en réalité fabriqué, est précisément le type d'erreur la plus difficile à repérer dans les flux de travail de recherche et de synthèse documentaire pour lesquels nos lecteurs utilisent l'IA : une statistique hallucinée dans un résumé est identique en apparence à une vraie, à moins de déjà connaître la source assez bien pour la repérer. Le résultat d'Anthropic ici est une évaluation interne auto-déclarée, non reproduite par un tiers, donc traitez le chiffre de 16 sur 18 comme une affirmation du fournisseur plutôt que comme un fait confirmé de façon indépendante. Mais c'est une affirmation précise et falsifiable plutôt qu'une ligne marketing vague du type « plus précis », et cette précision vaut déjà quelque chose en soi.

Les compromis de sécurité que la system card signale

La system card d'Opus 5.5 signale de vrais progrès, accompagnés de quelques résultats qui compliquent un simple récit « strictement plus sûr ». À plus grande échelle, l'honnêteté a progressé : le score d'honnêteté AA-Omniscience est passé de 0,56 à 0,58 (surtout parce que le modèle refuse de répondre en cas d'incertitude plutôt que de deviner), et la divulgation d'actions cachées, le fait que le modèle vous dise quand il a fait quelque chose que vous n'aviez pas explicitement demandé, est passée à 97 % contre un précédent record de 85 %.

Mais sur MASK, un test de l'honnêteté spécifiquement sous pression de mentir, Opus 5.5 obtient 87,4 %, mieux que Fable 5.1 mais en réalité moins bien qu'Opus 5 sur ce même test, un résultat qui va à l'encontre d'un récit simple du type « chaque version est plus sûre que la précédente ». La system card signale aussi un « empressement excessif à créer des règles implicites » accru à partir des préférences de l'utilisateur, un taux plus élevé de comportement malveillant lors de l'usage d'ordinateur que Fable 5.1 dans les tests d'équipe rouge, et une analyse en boîte blanche trouvant des représentations internes compatibles avec la tromperie ou la malhonnêteté dans environ 6 % des cas échantillonnés. Dans les évaluations de biosécurité, Opus 5.5 a conçu des constructions d'ADN ou de protéines incorrectes, ou utilisé le mauvais modèle animal, dans 3 des 7 groupes de test. Aucun de ces chiffres ne figure en tête de la propre page de lancement d'Anthropic, et il est utile de les connaître si vous formez votre opinion du modèle uniquement à partir du discours marketing.

Benchmarks : en tête, mais l'écart dépend du test

Model                 Price (in/out per 1M)   Notable benchmark
----------------------------------------------------------------------
Claude Sonnet 5.5      $2 / $10                 GDPval-AA v2.1: 1844
Claude Opus 5.5         $4 / $20                 GDPval-AA v2.1: 1846
Claude Sonnet 5.5      $2 / $10                 OSWorld 2.1: 80.1%
Claude Opus 5.5         $4 / $20                 OSWorld 2.1: 81.8%
Claude Opus 5.5         $4 / $20                 SWE-bench Pro: 89.9%
Claude Opus 5.5         $4 / $20                 FrontierCode 1.1: 54.4%
GPT-6 Astra             (separate pricing)        FrontierCode 1.1: 53.3%

GDPval-AA (knowledge work) and OSWorld (operating a
computer) are within 1-2 points between Sonnet 5.5 and
Opus 5.5 despite the 2x price gap. FrontierCode shows
Opus 5.5 narrowly ahead of GPT-6 Astra.

Opus 5.5 devance GPT-6 Astra sur plusieurs benchmarks de codage et de travail de connaissance, dont SWE-bench Pro à 89,9 % et SWE Multilingual à 93,9 %, mais les marges sont souvent étroites, un ou deux points plutôt qu'un écart net. Anthropic elle-même présente de la même façon la comparaison pratique avec Fable 5.1, son propre modèle plus grand : Opus 5.5 « se comporte au niveau de Fable 5.1 pour la plupart des tâches » à une fraction du coût, une affirmation plus intéressante que n'importe quel chiffre de benchmark précis, puisqu'il s'agit d'Anthropic elle-même expliquant que son propre modèle phare est désormais difficile à justifier face au modèle de milieu de gamme situé juste en dessous.

Opus 5.5 contre Sonnet 5.5 : ce que l'argent supplémentaire achète

C'est la comparaison qui compte vraiment pour la plupart des acheteurs, et elle est plus serrée qu'Opus contre GPT-6 Astra. Sur GDPval-AA v2.1, un benchmark de travail de connaissance, Sonnet 5.5 obtient 1844 contre 1846 pour Opus 5.5, un écart de deux points. Sur OSWorld 2.1, un test consistant à piloter un véritable ordinateur via une interface graphique, Sonnet obtient 80,1 % contre 81,8 % pour Opus. Les deux sont assez proches pour qu'un développeur choisissant à l'aveugle d'après les seuls scores de benchmark ait du mal à justifier la prime de prix de 2x d'Opus sur l'un ou l'autre test en particulier.

Cet écart se retrouve aussi dans les discussions de développeurs. Un fil Hacker News intitulé « Claude Opus 5.5 Intelligence, Performance and Price Analysis », avec 333 points et 106 commentaires, consacre une bonne partie de sa discussion à une inquiétude connexe : si le réglage d'effort de raisonnement maximal d'Opus 5.5 ne « sur-réfléchit » pas des tâches simples, brûlant un budget de tokens disproportionné sur des problèmes qui n'en avaient pas besoin (l'exemple d'un commentateur était un SVG d'un pélican). C'est une plainte différente de scores de benchmark presque identiques, mais elle pointe vers la même question sous-jacente : à l'effort maximal, Opus 5.5 peut coûter nettement plus que Sonnet 5.5 pour une tâche que Sonnet traite avec une fraction des tokens. L'avantage réel d'Opus 5.5 se trouve ailleurs : le résultat anti-fabrication ci-dessus, et sur des benchmarks difficiles spécifiques comme SWE-bench Pro et FrontierCode, où l'écart avec Sonnet est plus large que sur GDPval-AA ou OSWorld. Si votre charge de travail est une rédaction critique à forts enjeux où l'exactitude compte, ou l'extrémité la plus difficile du codage agentique, cet avantage est réel. S'il s'agit de tâches quotidiennes, les scores de benchmark de Sonnet 5.5, et les plaintes de sur-réflexion au réglage maximal d'Opus, suggèrent que vous ne remarquerez pas la différence la plupart des jours, ou que vous la paierez en plus pour rien.

Un autre fil de discussion communautaire non résolu mérite d'être nommé plutôt qu'ignoré : une poignée de développeurs ont rapporté qu'Opus 5.5 semblait moins capable quelques semaines après le lancement qu'au jour de sa sortie, la même plainte de « modèle affaibli » qui finit par suivre la plupart des grandes sorties d'IA. Un suivi de benchmarks indépendant sur 30 jours, mis en place spécifiquement pour vérifier cette affirmation, n'avait trouvé aucune baisse de qualité reproductible au moment de la rédaction de cet article. Traitez cela comme une question ouverte à surveiller, pas comme un constat confirmé dans un sens ou dans l'autre.

Qui devrait vraiment payer pour Opus 5.5

  • Utilisez Opus 5.5 si des chiffres ou citations fabriqués dans une sortie générée par IA vous coûteraient vraiment cher à manquer : synthèse de recherche, résumés financiers, rédaction juridique, là où le résultat anti-fabrication est le véritable produit que vous payez.
  • Utilisez Opus 5.5 si votre charge de travail se concentre sur l'extrémité la plus difficile du codage agentique ou de l'ingénierie logicielle à long horizon, là où son avance sur Sonnet 5.5 s'élargit, contrairement aux quasi-égalités observées sur les tests généraux de travail de connaissance.
  • Restez sur Sonnet 5.5 si vos tâches sont du travail de connaissance quotidien ou des tâches de pilotage d'ordinateur. Les scores GDPval-AA et OSWorld se situent à deux points de ceux d'Opus 5.5, à moitié prix.
  • N'envisagez Fable 5.1 que si vous avez spécifiquement atteint un plafond avec Opus 5.5, puisque la propre présentation d'Anthropic est qu'Opus 5.5 égale désormais Fable 5.1 sur la plupart des tâches, pour une fraction du coût.

Questions fréquentes

Quand Claude Opus 5.5 a-t-il été lancé ?

Le 22 septembre 2026, en remplacement de Claude Opus 5. Anthropic a sauté une sortie intermédiaire « Opus 5.1 », contrairement à la gamme Fable, qui a reçu une mise à jour Fable 5.1 plus tôt en 2026.

Combien coûte Claude Opus 5.5 ?

4 $ par million de tokens en entrée et 20 $ par million de tokens en sortie via l'API, une baisse de 20 % par rapport aux 5 $/25 $ d'Opus 5. Cela se situe entre Claude Sonnet 5.5 (2 $/10 $) et Claude Fable 5.1 (10 $/50 $) dans la gamme actuelle d'Anthropic.

Claude Opus 5.5 hallucine-t-il moins que les précédents modèles Claude ?

Sur un test précis et falsifiable, Opus 5.5 a réussi 16 tentatives sur 18 à une barre de qualité « aucun chiffre inventé » ; ni Opus 5 ni Fable 5.1 ne l'avaient réussie une seule fois. C'est une évaluation interne auto-déclarée par Anthropic, non reproduite de façon indépendante, mais c'est une affirmation concrète plutôt qu'un discours vague.

Claude Opus 5.5 est-il meilleur que Claude Sonnet 5.5 ?

Sur plusieurs grands benchmarks (travail de connaissance GDPval-AA, pilotage d'ordinateur OSWorld), les deux obtiennent des scores à un ou deux points l'un de l'autre, malgré un prix d'Opus deux fois plus élevé. Le véritable avantage d'Opus apparaît sur des benchmarks de codage plus difficiles comme SWE-bench Pro et sur le résultat anti-fabrication ; pour les tâches quotidiennes, les scores de Sonnet 5.5 suggèrent peu de différence pratique.

Claude Opus 5.5 est-il meilleur que GPT-6 Astra ?

Sur les benchmarks que les deux ont publiés, Opus 5.5 est en tête de façon étroite, typiquement de 1 à 2 points de pourcentage, par exemple 54,4 % contre 53,3 % sur FrontierCode 1.1. Les marges sont réelles mais pas assez larges pour parler d'une victoire décisive sur tous les types de tâches.

notebooklm-to-pdf.comTous les guides →

Exportez votre NotebookLM en un clic

Extension Chrome gratuite. PDF, Word et Markdown. Généré sur votre machine — rien n'est envoyé en ligne.

Continuer la lecture