Confier le tri de dix mille tickets support à un modèle haut de gamme revient à envoyer un camion de déménagement livrer une lettre. Claude Haiku 5.5, dévoilé par Anthropic le 7 octobre 2026, s’affiche à 0,10 $ le million de tokens en entrée, dix fois moins que son prédécesseur. La vraie question n’est plus de savoir s’il faut l’adopter, mais où placer exactement la ligne entre exécution rapide et raisonnement lourd.
Artificial Analysis, laboratoire d’évaluation indépendant, mesure le modèle à 43 points sur son Intelligence Index en effort maximal. Sonnet 5.5 culmine à 56. Treize points séparent donc un exécutant à bas coût d’un stratège confirmé.
Claude Haiku 5.5 : ce que révèlent les benchmarks indépendants
L’Intelligence Index d’Artificial Analysis agrège dix évaluations : travail de bureau agentique, code en terminal, raisonnement, documents professionnels, contexte long. Haiku 4.5 plafonnait à 17 points sur cette même échelle. La progression n’est pas marginale, elle change de catégorie.
À tarif comparable, Haiku 5.5 devance GPT-6 Luna d’OpenAI (38), Gemini 3.8 Flash (41) et GLM-5.3 Flash (42). Il talonne Kimi K3 (44), un modèle ouvert de 2 800 milliards de paramètres.
Sur AA-Briefcase, l’évaluation privée de travail de bureau, le modèle atteint 1 578 points Elo. Il entre dans l’intervalle de confiance de GPT-6 Astra et de Claude Fable 5.1 en effort élevé. Pour un modèle vendu à ce prix, le résultat surprend les équipes qui suivent le marché de près.

Le réglage d’effort change tout, y compris la facture
Le score de 43 s’obtient au réglage d’effort maximal, une première pour un modèle de la gamme Haiku. En configuration par défaut, Artificial Analysis relève 34 points pour 0,05 $ par tâche. Le mode low tombe à 29 points pour 0,02 $, le mode xhigh grimpe à 41 points pour 0,12 $.
Ce détail décide du budget annuel d’une équipe. Payer quatre fois plus cher pour gagner deux points n’a de sens que sur des workflows où l’erreur coûte plus que le token.
Fiabilité factuelle : la faiblesse structurelle
Sur AA-Omniscience, le modèle ne délivre que 36 % de réponses factuelles correctes. GPT-6 Luna monte à 44 %, Gemini 3.8 Flash à 55 %. En revanche, son taux d’hallucination descend à 40 %, contre 77 % pour Luna : il préfère admettre son ignorance plutôt qu’inventer.
Traduction concrète : Haiku 5.5 excelle sur l’information qu’on lui fournit dans le prompt. Il devient nettement moins fiable quand on attend de lui une connaissance interne. Voilà une des limites de l’IA générative les plus documentées, et elle ne disparaît pas avec la baisse des prix.
Les tâches professionnelles à confier en priorité à Claude Haiku 5.5
Le point commun des bons cas d’usage ? Des demandes courtes, cadrées, répétées à fort volume, avec la source glissée dans le prompt. Prenons une agence qui traite 10 000 documents par mois, à 5 000 tokens en entrée et 500 en sortie par document.
Sur la grille publique d’Anthropic, la note atteint environ 7,50 $ avec Haiku 5.5, 75 $ avec Haiku 4.5 et 150 $ avec Sonnet 5.5. L’arbitrage devient difficile à ignorer.
- Classification de données et routage : tickets support, leads entrants, avis clients, intentions de recherche à regrouper pour le SEO. Un premier test en effort low ou medium suffit souvent.
- Synthèse de documents récurrents : comptes rendus de réunion, reporting hebdomadaire, veille concurrentielle. Box annonce l’utiliser pour ses synthèses financières, avec 11 points de mieux que Haiku 4.5 et une latence divisée par deux.
- Recherche d’informations dans un corpus fourni : contrats, appels d’offres, fiches fournisseurs. AlphaSense rapporte 0,84 contre 0,76 pour Haiku 4.5 sur 400 requêtes réelles.
- Hygiène CRM : HubSpot déclare 92,8 % sur sa suite de tâches dédiées, le meilleur score observé sur un petit modèle.
- Catalogue e-commerce : catégorisation de produits, extraction d’attributs depuis les fiches fournisseurs, normalisation des libellés.
- Assistance clientèle de premier niveau, avec escalade prévue vers un modèle plus lourd. Artificial Analysis mesure entre 178 et 188 tokens par seconde selon le réglage : une vitesse que les utilisateurs ressentent immédiatement.
Cette accélération ouvre la voie à une automatisation des tâches jusqu’ici réservée aux grands modèles. Encore faut-il valider chaque cas d’usage sur ses propres données.
Sous-agents et navigation web : deux pistes concrètes
Anthropic recommande explicitement Haiku 5.5 comme sous-agent de Sonnet 5.5 et d’Opus 5.5. Le modèle puissant joue le chef de projet, Haiku exécute les lots répétitifs. Cognition l’a intégré ainsi comme assistant d’Opus 5.5 dans son agent de code Devin.
Dans un workflow multi-agents, l’économie devient visible : ce sont les sous-agents qui consomment le plus de tokens. Réserver le modèle haut de gamme à l’orchestration divise la facture sans toucher à la qualité finale.
Deuxième piste : les agents qui pilotent un navigateur. Anthropic revendique 72,4 % sur OSWorld 2.1 (sous-ensemble hors ligne), contre 15,7 % pour Haiku 4.5 et 83,9 % pour Sonnet 5.5. Ces chiffres viennent de l’éditeur et n’ont pas encore été vérifiés par des laboratoires indépendants.
Concrètement, cela ouvre le relevé de prix concurrents, le contrôle qualité de pages produit ou la saisie dans un back-office dépourvu d’API. À condition de respecter les conditions d’utilisation des sites visés. Pour tester sans budget dédié, les abonnés Max et Team reçoivent un crédit API mensuel de 100 à 500 $.
Les tâches à éviter : quand Haiku 5.5 coûte plus qu’il ne rapporte
Faut-il tout basculer sur le petit modèle ? Non, et Anthropic le reconnaît : Sonnet 5.5 et Opus 5.5 restent devant sur le code agentique et les raisonnements longs. Les analyses indépendantes ajoutent quatre zones de risque.
Réponses factuelles sans source et code complexe
Avec 36 % de bonnes réponses sur AA-Omniscience, Haiku 5.5 n’est pas le modèle à interroger à froid sur une réglementation ou une fiche technique. Fournissez-lui le document de référence, ou passez par un modèle connecté à la recherche web.
Sur Terminal-Bench 4.0, il atteint 33 %, contre 0 % pour Haiku 4.5 et 13 % pour GPT-6 Luna. Le progrès est net, mais les 70,6 % revendiqués par Anthropic pour Sonnet 5.5 restent hors de portée. Une refonte de thème WordPress ou un script de migration gagnera à rester sur le grand modèle.
Workflows SaaS, longs prompts et effort maximal
Haiku 5.5 obtient 35 % sur AutomationBench-AA, loin des 53 à 60 % de ses concurrents directs. Artificial Analysis attribue l’écart à un bug de sécurité qui le pousse à refuser trop souvent des actions légitimes. Anthropic travaille sur un correctif ; en attendant, gardez vos automatisations critiques sur le modèle actuel.
Le tarif d’appel ne vaut que sous 100 000 tokens de prompt. Au-delà, il passe à 0,50 $ en entrée et 2,50 $ en sortie, soit cinq fois plus. Mille analyses de documents de 120 000 tokens coûtent environ 62,50 $, contre 12,50 $ si les mêmes fichiers sont découpés en deux moitiés de 60 000 tokens. Le découpage a toutefois un coût caché : le modèle perd la vue d’ensemble.
Reste le réglage maximal. Il produit environ 162 000 tokens de sortie par tâche, trois fois plus que GPT-6 Luna, et passer de xhigh à max rapporte 2 points pour 1,8 fois plus de tokens. Sur des milliers d’appels quotidiens, ce choix se justifie rarement. Partez de medium, montez seulement si vos tests le réclament.
Deux garde-fous méritent une place dans tout déploiement : la confidentialité des données échangées avec l’API, et une validation humaine sur les décisions sensibles, recrutement, crédit, santé ou résiliation contractuelle.
Haiku 5.5 ou Sonnet 5.5 : comment répartir les tâches
Pour une équipe marketing, le réflexe rentable consiste à garder un modèle haut de gamme sur les livrables qui engagent la marque. Le travail préparatoire, lui, descend sans dommage sur Haiku. La répartition ci-dessous sert de point de départ, pas de règle figée.
| Tâche | À confier à Haiku 5.5 ? | Sonnet 5.5 ou Opus 5.5 |
|---|---|---|
| Tri, classification, routage | Oui, en effort low ou medium | Surdimensionné |
| Résumé de documents sous 100 000 tokens | Oui | Pour les synthèses à fort enjeu |
| Extraction et questions-réponses sur documents fournis | Oui | Si raisonnement croisé entre plusieurs sources |
| Assistance clientèle de premier niveau | Oui, avec escalade prévue | Pour les cas complexes escaladés |
| Sous-agent d’un workflow multi-agents | Oui, sur les lots répétitifs | En orchestrateur |
| Réponses factuelles sans source fournie | À éviter (36 % sur AA-Omniscience) | Préférable, avec recherche web |
| Code agentique complexe | À éviter (33 % sur Terminal-Bench 4.0) | Oui |
| Workflows SaaS automatisés | Pas avant le correctif (35 % sur AutomationBench-AA) | Oui |
| Analyse de documents de plus de 100 000 tokens | Tarif multiplié par cinq, à chiffrer | À comparer, cache compris |
Ce que change une baisse de prix sur les arbitrages d’équipe
La rédaction professionnelle illustre bien le basculement. Un premier jet, un plan, une reformulation de notes brutes : Haiku 5.5 les produit à un coût négligeable. La relecture éditoriale, l’angle d’un article, le ton d’une campagne restent du ressort d’un modèle plus fin ou d’un humain.
Le cache de lecture, facturé 0,01 $ le million de tokens, renforce encore l’écart. Une équipe qui envoie le même contexte à chaque appel divise sa facture sans rien changer à la qualité. Avant toute bascule, demandez à vos développeurs la distribution de taille des prompts dans les logs : si une part notable dépasse 100 000 tokens, l’économie fond.
Selon Anthropic, 90 % des requêtes envoyées à Haiku 4.5 restaient sous ce seuil, ce qui explique la baisse de coût moyenne d’environ 75 % annoncée par l’éditeur, nouveau tokenizer compris. À noter : ce tokenizer consomme légèrement plus de tokens par tâche, et Artificial Analysis précise que ses coûts par tâche restent provisoires faute d’intégrer ce palier.
Reste un point que les chiffres ne règlent pas. Un modèle moins cher pousse à automatiser davantage, y compris des décisions qui méritaient un regard humain. Fixer la frontière relève du choix d’organisation, pas du benchmark.
Pour situer Haiku 5.5 face au reste de la gamme, le point complet sur les modèles Claude indisponibles aide à comprendre quels usages restent réservés aux versions supérieures. Et si vous cherchez des repères tarifaires avant d’arbitrer, notre analyse des arbitrages entre modèles Anthropic complète utilement ces mesures.
