
Un petit modèle destiné aux tâches nombreuses et bien définies
Anthropic a lancé Claude Haiku 5.5 le 7 octobre. Ce modèle compact vise les tâches rapides, répétitives et sensibles au coût : résumer des documents, compacter un historique de conversation, interroger une base de données, classer des demandes ou répondre dans un service à la clientèle. Il peut aussi agir comme sous-agent pendant qu’un modèle plus puissant conserve la responsabilité d’un travail complexe. L’idée est de confier chaque étape à la capacité réellement nécessaire plutôt que d’utiliser le modèle le plus cher partout. Haiku 5.5 est offert sur la plateforme Claude ainsi que chez Amazon Web Services, Google Cloud et Microsoft Azure. Son identifiant pour les développeurs est claude-haiku-5-5. Anthropic le présente comme son modèle standard le plus rapide, tout en précisant que les modèles Opus exécutés dans leur mode accéléré peuvent être plus rapides. Il devient aussi le premier Haiku doté d’un réglage d’effort : une application peut choisir de dépenser moins de calcul pour une réponse simple ou davantage lorsque la tâche demande plus de raisonnement.
Le prix baisse surtout sous la barre des 100 000 jetons
Pour une requête dont l’entrée ne dépasse pas 100 000 jetons, le tarif annoncé est de 0,10 $ US par million de jetons en entrée et de 0,50 $ en sortie. Au-delà de cette longueur, il passe à 0,50 $ en entrée et à 2,50 $ en sortie. Les lectures du cache coûtent respectivement 0,01 $ et 0,05 $, selon le même seuil. La différence compte : une entreprise qui envoie systématiquement de très longs dossiers ne bénéficiera pas du prix le plus bas sur toute sa charge. Anthropic affirme que Haiku 5.5 coûte en moyenne environ 75 % moins cher à exécuter que Haiku 4.5. La réduction affichée atteint 90 % pour les requêtes de 100 000 jetons ou moins et 50 % pour les requêtes plus longues. La moyenne tient aussi compte du nouveau découpage des jetons, qui peut produire un peu plus de jetons pour une même tâche. Le fournisseur indique qu’environ 90 % des requêtes adressées à l’ancien Haiku se situaient sous le seuil de 100 000. Pour prévoir un budget, il faudra donc mesurer la longueur réelle des entrées et des sorties plutôt que multiplier un prix vedette par le nombre d’appels.
Les tests du fournisseur montrent un bond en usage d’ordinateur
Dans les résultats publiés par Anthropic, Haiku 5.5 obtient 72,4 % sur le sous-ensemble hors ligne d’OSWorld 2.1, un test où un agent doit accomplir des tâches dans un environnement informatique. Haiku 4.5 y obtenait 15,7 %, tandis que GPT‑6 Luna est donné à 48,9 % dans le tableau comparatif. Sur Terminal-Bench 4.0, consacré aux tâches agentiques en ligne de commande, Haiku 5.5 atteint 39,2 %, contre 70,6 % pour Sonnet 5.5. Ces écarts illustrent à la fois le progrès du petit modèle et la place qui reste aux modèles plus puissants. Les chiffres sont fournis par Anthropic et reposent sur ses conditions d’évaluation. Ils ne garantissent pas le même résultat dans une caisse populaire, une boutique en ligne ou un centre d’appels québécois. Un gain spectaculaire sur un banc d’essai peut aussi cacher des erreurs rares mais coûteuses. Avant un remplacement, une organisation devrait comparer les modèles sur ses propres cas, dans les deux langues utilisées, avec les outils réellement accessibles et les mêmes limites de temps. Il faut mesurer la qualité, la latence, le nombre de reprises et le coût total d’une tâche réussie.
Le bon usage ressemble à une chaîne de tri, pas à un cerveau unique
La baisse des coûts rend possible une architecture plus spécialisée. Un premier Haiku peut identifier la langue d’un message, un deuxième extraire le numéro de dossier et un troisième proposer une catégorie. Les cas simples suivent leur route; les demandes ambiguës sont transmises à Sonnet, Opus ou à une personne. Dans un commerce, le petit modèle pourrait résumer des centaines de commentaires ou repérer les commandes qui semblent incomplètes. Il ne devrait pas décider seul d’un remboursement important ou d’une exclusion. Cette organisation permet de réserver le calcul plus coûteux aux exceptions, mais elle multiplie les points de contrôle. Chaque sous-agent peut perdre une nuance, transmettre un champ erroné ou produire une confiance trompeuse. Le système doit conserver la demande originale, la sortie de chaque étape, la version du modèle et la décision finale. Une zone d’abstention est nécessaire lorsque l’information manque. Le prix par jeton devient alors une composante parmi d’autres : la surveillance, la reprise des erreurs, la protection des renseignements personnels et l’intervention humaine font également partie du coût réel.
Des garde-fous plus stricts, avec des limites à tester localement
Anthropic affirme que Haiku 5.5 s’améliore dans presque toutes ses évaluations d’alignement par rapport à Haiku 4.5, avec moins de comportements jugés mal alignés et moins de coopération avec des demandes abusives. Ses protections en cybersécurité sont plus strictes que celles de Haiku 4.5, mais moins restrictives que celles appliquées à certains modèles récents. Elles permettent davantage de tâches défensives que Sonnet 5.5, tout en bloquant les essais d’intrusion et d’autres techniques plus susceptibles d’être utilisées à mauvais escient. Les protections en biologie suivent celles des autres modèles récents de la famille. Ces affirmations reposent sur la fiche système et les tests du fournisseur. Elles ne remplacent pas une évaluation du produit complet, puisque les instructions, les outils connectés, les données et les permissions modifient le risque. Une équipe qui veut profiter de Haiku 5.5 devrait commencer par un flux réversible, fixer un plafond de dépenses, tester les cas limites et prévoir une comparaison continue avec le modèle remplacé. Le lancement montre surtout que la compétition se déplace : la valeur ne vient plus seulement du modèle le plus puissant, mais de la capacité à exécuter des millions de petites décisions assez vite, assez bien et à un coût prévisible.





