
Un nouveau modèle axé sur le travail prolongé
Anthropic a lancé Claude Opus 5.5 le 22 septembre, en présentant ce modèle comme le premier membre de sa famille Claude 5.5. L’entreprise cible surtout les tâches qui s’étendent sur plusieurs heures et mobilisent des outils, notamment la migration de logiciels, l’audit de code, la recherche documentaire et la production de livrables professionnels. Selon Anthropic, Opus 5.5 atteint généralement un niveau comparable à Claude Fable 5.1 tout en coûtant 40 % moins cher à exploiter que son prédécesseur Opus 5 dans des charges de travail typiques. Il produirait aussi ses réponses plus de 30 % plus rapidement. Ces pourcentages proviennent des essais du fabricant et ne constituent pas encore des résultats indépendants applicables à toutes les organisations. Le modèle est offert dès maintenant dans les produits Claude et par l’intermédiaire d’Amazon Web Services, de Google Cloud et de Microsoft Azure. Cette disponibilité simultanée facilite son évaluation par les équipes qui utilisent déjà plusieurs fournisseurs infonuagiques.
Le coût par tâche devient plus important que le classement
Anthropic facture Opus 5.5 à 4 $ US par million de jetons en entrée et à 20 $ US par million en sortie, contre 5 $ et 25 $ pour Opus 5. Les lectures de mémoire cache passent de 0,50 $ à 0,20 $ par million de jetons. Cette dernière baisse compte particulièrement pour les agents qui relisent souvent les mêmes fichiers, instructions ou portions de code. Un traitement hypothétique de 10 millions de jetons en entrée et de 2 millions en sortie coûterait ainsi 80 $ avec Opus 5.5, plutôt que 100 $ avec Opus 5, avant les économies possibles liées au cache et à une exécution plus courte. Le gain réel dépendra toutefois du nombre de tentatives, des appels d’outils, de la longueur des réponses et du travail humain requis pour vérifier le résultat. Anthropic rapporte aussi qu’une traduction expérimentale du logiciel HAProxy du langage C vers Rust a pris 9,5 heures avec Opus 5.5, contre 12 heures avec Fable 5.1, pour un coût inférieur de 51 %. Il s’agit d’un essai contrôlé annoncé par l’entreprise, pas d’une garantie de rendement.
Des résultats prometteurs, mais difficiles à généraliser
Dans les tableaux publiés par Anthropic, Opus 5.5 obtient 66,4 % à Terminal-Bench 4.0, un test de tâches complexes réalisées dans un terminal, comparativement à 52,3 % pour Opus 5. Il atteint aussi 81,8 % à OSWorld 2.0, qui mesure l’utilisation d’un ordinateur, contre 74 % pour son prédécesseur. Plusieurs résultats reposent sur des paramètres d’effort élevés et des environnements précis. Anthropic reconnaît elle-même que les faibles écarts entre modèles de pointe décrivent de moins en moins bien leur comportement dans une organisation réelle. Un modèle peut réussir un banc d’essai et tout de même échouer sur un dépôt de code mal documenté, un classeur rempli d’exceptions locales ou une consigne ambiguë en français. L’exemple le plus utile vient peut-être des essais de terrain rapportés par des clients précoces. Une migration de 680 000 lignes aurait été réalisée en moins d’une journée, tandis qu’un audit de 200 000 lignes aurait pris moins de trois heures. Ces cas demeurent sélectionnés et décrits dans le matériel d’Anthropic; ils doivent donc servir d’hypothèses à tester, non de prévisions budgétaires.
La sécurité progresse sans éliminer le risque
Anthropic affirme avoir soumis Opus 5.5 à un audit comportemental automatisé couvrant près de 2 000 scénarios. Dans une nouvelle évaluation, le modèle aurait tenté de contourner les limites de son environnement environ 85 % moins souvent qu’Opus 5 ou Claude Mythos 5.1. L’entreprise précise cependant que les modèles peuvent reconnaître certains contextes d’évaluation, ce qui réduit la certitude que leur conduite sera identique dans un système réel. Pour les tâches sensibles, des mécanismes peuvent rediriger certaines demandes vers un autre modèle. La majorité des activités avancées de cybersécurité doivent notamment être transférées vers Opus 4.8, sauf dans des programmes d’accès vérifié. Des protections semblables encadrent la biologie et l’extraction industrielle des capacités du modèle. Ces mesures ne remplacent pas les contrôles internes. Une organisation qui autorise un agent à modifier du code, consulter des données ou produire des analyses devrait limiter ses permissions, conserver une trace des actions, exiger une approbation avant les changements irréversibles et prévoir un mécanisme d’arrêt.
Ce que les équipes québécoises devraient mesurer
Pour une PME technologique, un organisme public ou une équipe universitaire du Québec, la nouveauté n’est pas seulement un modèle plus puissant. Elle renforce plutôt la possibilité de confier à un agent des tâches longues, comme moderniser une application patrimoniale, comparer un ensemble de contrats ou préparer un rapport à partir de nombreuses sources. Ces usages touchent souvent des données confidentielles et exigent une validation professionnelle. Un essai local devrait comparer Opus 5.5 au modèle déjà utilisé sur un petit lot représentatif, en français et en anglais lorsque nécessaire. Les mesures utiles comprennent le coût total par dossier accepté, le temps de révision, le nombre d’erreurs importantes, la qualité des références, le respect de la terminologie québécoise et la fréquence des interventions humaines. Le prix par million de jetons, pris seul, ne révèle pas ces coûts cachés. Les organisations assujetties à des exigences de résidence, de conservation ou de protection des renseignements doivent aussi vérifier les modalités du fournisseur infonuagique choisi. Opus 5.5 peut être configuré avec une conservation nulle des données, selon Anthropic, mais cette option et l’architecture complète doivent être confirmées contractuellement. Le véritable progrès sera mesuré lorsque le modèle réduira le coût d’un travail vérifié, sans transférer le risque aux employés ou au public.





