Skip to content

Claude Haiku 5.5 : ce qui change pour les développeurs

Claude Haiku 5.5, le petit modèle d'Anthropic, baisse ses prix, gagne un réglage d'effort et un contexte d'un million de tokens. Ce qu'il faut savoir.

Publié le 3 min de lecture
Claude Haiku 5.5 : ce qui change pour les développeurs

Anthropic a lancé le 7 octobre Claude Haiku 5.5, la nouvelle version de son plus petit modèle de langage. L'éditeur le présente comme le modèle le moins cher et le plus rapide de sa gamme, pensé pour les tâches à fort volume. Pour les développeurs, la nouveauté tient autant à la baisse des tarifs qu'à plusieurs changements d'API qui imposent de revoir le code existant.

Des prix en forte baisse

Haiku 5.5 est facturé 0,10 dollar par million de tokens en entrée et 0,50 dollar par million en sortie, pour les requêtes jusqu'à 100 000 tokens. Au-delà, le tarif passe à 0,50 et 2,50 dollars. À titre de comparaison, Haiku 4.5 coûtait 1 dollar en entrée et 5 dollars en sortie.

Anthropic annonce un coût d'exécution inférieur d'environ 75 % en moyenne. L'éditeur précise que ce calcul tient compte d'un nouveau tokenizer : selon la documentation, un même texte produit environ 30 % de tokens de plus qu'avec Haiku 4.5. Les estimations de coûts et les limites max_tokens sont donc à recalculer.

Dans le même temps, l'éditeur divise par deux le prix des lectures en cache de Claude Sonnet 5.5, ramené à 0,10 dollar par million de tokens.

Un réglage d'effort et un contexte élargi

C'est la première fois qu'un modèle Haiku propose un paramètre d'effort réglable. Il permet d'arbitrer entre qualité de réponse, vitesse et coût. Le modèle utilise par défaut la « réflexion adaptative » : il décide lui-même quand et combien raisonner avant de répondre.

La fenêtre de contexte passe à un million de tokens, contre 200 000 pour Haiku 4.5, et la sortie maximale à 128 000 tokens, contre 64 000. La longueur minimale d'un prompt pouvant être mis en cache tombe à 512 tokens, contre 4 096 auparavant.

Pour quels usages

Anthropic positionne Haiku 5.5 sur les tâches répétitives et sensibles à la latence : résumés, classification, extraction, requêtes de bases de données, support client en direct ou navigation web automatisée. Le modèle est aussi pensé comme « sous-agent », appelé par Sonnet 5.5 ou Opus 5.5 pour déléguer des sous-tâches dans des projets de code. Pour le code agentique complexe, l'éditeur continue de recommander ses modèles plus gros.

Les chiffres de performances publiés par Anthropic montrent un net progrès sur Haiku 4.5, mais ils restent ceux de l'éditeur et demandent à être confirmés par des évaluations indépendantes. Pour comprendre ce qui distingue un petit modèle d'un grand, notre explication sur le fonctionnement des grands modèles de langage reste un bon point de départ.

Attention aux changements cassants

La migration depuis Haiku 4.5 n'est pas transparente. La documentation liste plusieurs changements qui provoquent des erreurs :

  • la réflexion étendue manuelle avec budget_tokens n'est plus acceptée ;
  • les paramètres temperature, top_p et top_k peuvent renvoyer une erreur ;
  • le préremplissage d'un message de l'assistant n'est plus accepté : la conversation doit se terminer par un message utilisateur ;
  • une réponse peut commencer par des blocs de réflexion, qu'il faut filtrer par type et non par position.

Le modèle, identifié claude-haiku-5-5, est disponible sur l'API Claude, Amazon Bedrock, Google Cloud et Microsoft Foundry. Cette sortie s'inscrit dans une semaine chargée en annonces, avec notamment Mistral Large 4 côté européen.

Articles liés

Mistral Large 4 est en préversion publique : 1 000 milliards de paramètres, entrée multimodale et poids ouverts attendus fin octobre 2026.
Derrière ChatGPT, Claude ou Gemini se cache une même mécanique. On explique sans jargon ce qu'est un grand modèle de langage et ce qu'il sait (ou non) faire.
AI Act : l'omnibus numérique repousse les règles sur l'IA à haut risque à fin 2027 et 2028. Ce qui s'applique déjà et les prochaines échéances.