Sonnet 5.5 réduit l’écart avec Opus sur le code et le travail agentique

Anthropic complète la famille Claude 5.5 avec Sonnet 5.5, un modèle annoncé plus rapide et moins coûteux à la tâche que Sonnet 5. Ses progrès se concentrent sur le code agentique, le Computer Use, l’analyse visuelle et les tâches professionnelles, avec de nouveaux garde-fous pour les usages cyber.

30 % plus rapide, à tarification identique

La famille Claude 5.5 accueille un deuxième modèle. Sonnet 5.5 conserve les tarifs de Sonnet 5 à 2 dollars par million de tokens en entrée, 10 dollars en sortie et 0,20 dollar pour les lectures de cache.

Anthropic affirme toutefois que le modèle utilise généralement moins de tokens pour accomplir une même tâche. Dans ses tests, le coût par tâche peut ainsi diminuer jusqu’à 30 %. La génération est également annoncée plus de 30 % rapide que celle de Sonnet 5.

Le positionnement reste distinct d’Opus 5.5. Anthropic réserve son modèle supérieur aux travaux complexes nécessitant davantage de jugement, tandis que Sonnet cible les tâches quotidiennes mieux définies, la correction de code et la création de documents, présentations ou feuilles de calcul.

Haiku 5.5 doit compléter la famille dans les prochaines semaines pour les usages à fort volume et plus sensibles aux coûts. Un bond sur Terminal-Bench 4.0

Le changement le plus marqué concerne le code agentique. Anthropic rapporte 70,6 % sur Terminal-Bench 4.0 pour Sonnet 5.5, contre 10,3 % pour Sonnet 5.

Sur FrontierCode 1.1, Sonnet 5.5 atteint 46,2 % à son meilleur niveau d’effort rapporté, contre 42,4 % pour Sonnet 5 et 49,3 % pour Opus 5.5. CursorBench 4.0 place Sonnet 5.5 à 55,5 %, à proximité des 57,8 % d’Opus 5.5.

Anthropic observe également une évolution dans la manière dont le modèle utilise ses outils. Lors de tests comparatifs, Sonnet 5.5 regroupait davantage les appels indépendants plutôt que de les exécuter successivement, réduisant le nombre d’étapes et la quantité de tokens consommés. Le Computer Use se rapproche d’Opus

L’écart se resserre aussi sur certaines tâches réalisées en dehors du code. Sonnet 5.5 obtient 80,1 % sur OSWorld 2.1 pour le Computer Use, contre 57 % pour Sonnet 5 et 81,8 % pour Opus 5.5 dans les résultats communiqués par Anthropic.

Sur Chartography, consacré à la compréhension de graphiques, Sonnet atteint 61,6 %, contre 15,6 % pour son prédécesseur et 64,4 % pour Opus.

Le modèle obtient également 1 844 points sur GDPval-AA v2.1, une évaluation portant sur des tâches professionnelles issues de 44 métiers et neuf secteurs. Opus 5.5 atteint 1 846 points sur la même évaluation.

Anthropic précise que cette proximité sur certains benchmarks ne signifie pas que les deux modèles deviennent interchangeables. Ses tests internes et externes continuent de placer Opus devant Sonnet pour les travaux ouverts et complexes nécessitant un jugement prolongé. Le niveau d’effort devient un levier de coût

Sonnet 5.5 conserve plusieurs niveaux d’effort afin de moduler le temps consacré au raisonnement. Claude Code et les applications Claude utilisent Medium par défaut, tandis que Claude Platform démarre sur High.

Anthropic indique que sur plusieurs benchmarks, Sonnet 5.5 réglé sur Low ou Medium dépasse le meilleur score de Sonnet 5 pour environ un dixième du coût par tâche.

La comparaison évolue lorsque l’effort augmente. Sonnet 5.5 peut alors se rapprocher des résultats d’Opus 5.5, mais également de son coût d’exécution. Des garde-fous cyber hérités des modèles supérieurs

Les capacités cyber progressent suffisamment pour qu’Anthropic applique pour la première fois à un modèle Sonnet des protections proches de celles d’Opus 5.5.

Les tâches de développement logiciel ordinaires restent accessibles, mais certaines requêtes cyber considérées comme plus risquées peuvent basculer vers Sonnet 5. L’entreprise prévoit également d’étendre son Cyber Verification Program afin de fournir différents niveaux d’accès à Sonnet 5.5, Opus 5.5 et Claude Mythos.

Sonnet 5.5 reçoit aussi des classificateurs destinés à limiter les attaques de distillation cherchant à extraire ses capacités à grande échelle. Les protections liées à la biologie restent celles de Sonnet 5.

Claude Sonnet 5.5 est accessible sur les plateformes Claude ainsi que via Amazon Web Services, Google Cloud et Microsoft Azure. Son identifiant sur Claude Platform est `claude-sonnet-5-5`.