Claude Haiku 5.5 : ce qui change pour les développeurs
Claude Haiku 5.5, le petit modèle d'Anthropic, baisse ses prix, gagne un réglage d'effort et un contexte d'un million de tokens. Ce qu'il faut savoir.
Anthropic a lancé le 7 octobre Claude Haiku 5.5, la nouvelle version de son plus petit modèle de langage. L'éditeur le présente comme le modèle le moins cher et le plus rapide de sa gamme, pensé pour les tâches à fort volume. Pour les développeurs, la nouveauté tient autant à la baisse des tarifs qu'à plusieurs changements d'API qui imposent de revoir le code existant.
Des prix en forte baisse
Haiku 5.5 est facturé 0,10 dollar par million de tokens en entrée et 0,50 dollar par million en sortie, pour les requêtes jusqu'à 100 000 tokens. Au-delà, le tarif passe à 0,50 et 2,50 dollars. À titre de comparaison, Haiku 4.5 coûtait 1 dollar en entrée et 5 dollars en sortie.
Anthropic annonce un coût d'exécution inférieur d'environ 75 % en moyenne. L'éditeur précise que ce calcul tient compte d'un nouveau tokenizer : selon la documentation, un même texte produit environ 30 % de tokens de plus qu'avec Haiku 4.5. Les estimations de coûts et les limites max_tokens sont donc à recalculer.
Dans le même temps, l'éditeur divise par deux le prix des lectures en cache de Claude Sonnet 5.5, ramené à 0,10 dollar par million de tokens.
Un réglage d'effort et un contexte élargi
C'est la première fois qu'un modèle Haiku propose un paramètre d'effort réglable. Il permet d'arbitrer entre qualité de réponse, vitesse et coût. Le modèle utilise par défaut la « réflexion adaptative » : il décide lui-même quand et combien raisonner avant de répondre.
La fenêtre de contexte passe à un million de tokens, contre 200 000 pour Haiku 4.5, et la sortie maximale à 128 000 tokens, contre 64 000. La longueur minimale d'un prompt pouvant être mis en cache tombe à 512 tokens, contre 4 096 auparavant.
Pour quels usages
Anthropic positionne Haiku 5.5 sur les tâches répétitives et sensibles à la latence : résumés, classification, extraction, requêtes de bases de données, support client en direct ou navigation web automatisée. Le modèle est aussi pensé comme « sous-agent », appelé par Sonnet 5.5 ou Opus 5.5 pour déléguer des sous-tâches dans des projets de code. Pour le code agentique complexe, l'éditeur continue de recommander ses modèles plus gros.
Les chiffres de performances publiés par Anthropic montrent un net progrès sur Haiku 4.5, mais ils restent ceux de l'éditeur et demandent à être confirmés par des évaluations indépendantes. Pour comprendre ce qui distingue un petit modèle d'un grand, notre explication sur le fonctionnement des grands modèles de langage reste un bon point de départ.
Attention aux changements cassants
La migration depuis Haiku 4.5 n'est pas transparente. La documentation liste plusieurs changements qui provoquent des erreurs :
- la réflexion étendue manuelle avec
budget_tokensn'est plus acceptée ; - les paramètres
temperature,top_pettop_kpeuvent renvoyer une erreur ; - le préremplissage d'un message de l'assistant n'est plus accepté : la conversation doit se terminer par un message utilisateur ;
- une réponse peut commencer par des blocs de réflexion, qu'il faut filtrer par type et non par position.
Le modèle, identifié claude-haiku-5-5, est disponible sur l'API Claude, Amazon Bedrock, Google Cloud et Microsoft Foundry. Cette sortie s'inscrit dans une semaine chargée en annonces, avec notamment Mistral Large 4 côté européen.