
Tech • IA • Robotique • Jeu
Anthropic a lancé Claude Opus 5.5, un nouveau modèle phare présenté comme une amélioration majeure en codage, utilisation de l’ordinateur et travail de la connaissance, avec des coûts plus faibles et des performances plus rapides que Opus 5.
Claude Opus 5.5 est décrit comme une avancée substantielle par rapport à Opus 5, en particulier en codage agentique, utilisation de l’ordinateur et tâches complexes de connaissance. Il atteindrait sur de nombreuses tâches un niveau proche de Claude Fable 5.1 tout en étant environ 30 % plus rapide et en coûtant près de 40 % de moins par tâche que Opus 5.
Le tarif de base est annoncé à 4 $ par 1 million de tokens en entrée et 20 $ par 1 million de tokens en sortie. Un mode rapide dans Claude Code et sur la plateforme plus large offre des vitesses jusqu’à 2,5x plus rapides, au prix de 8 $ par 1 million de tokens en entrée et 40 $ par 1 million de tokens en sortie. Le modèle reste décrit comme gourmand en tokens, ce qui signifie que les gros travaux peuvent consommer un volume d’usage important malgré des prix unitaires plus bas.
Dans les évaluations de codage, Opus 5.5 surpasserait des rivaux de pointe, dont Fable 5.1 et GPT-6 Astra, sur des tests comme Terminal Bench 4.0, tout en établissant de nouveaux records sur Cursor Bench et GPQA Evolve. Sur OS World, un benchmark pour les tâches d’utilisation de l’ordinateur, il afficherait aussi de meilleurs résultats que les modèles concurrents.
Comme le modèle coûte moins cher à exécuter, les limites de session de Claude Code sont élargies. Les limites de session de 5 heures augmentent de 20 %, et les utilisateurs obtiendraient environ 25 % d’usage supplémentaire dans ces limites. Les offres Plus, Pro, Max et Team reçoivent aussi une option de réinitialisation manuelle pour plus de flexibilité.
Un test cité concernait une migration de code de 680 000 lignes achevée en moins de un jour, un travail qui prendrait normalement des semaines. Un autre exemple indique que le modèle a optimisé 39 pages sur 40 d’un site web sans en casser le comportement, soulignant son orientation vers de longues tâches d’ingénierie en plusieurs étapes plutôt que vers de simples interactions courtes prompt-réponse.
Le modèle a été utilisé pour générer des prototypes interactifs complets à partir d’un seul prompt, dont un jeu de course de style Mario Kart, un bac à sable de type Minecraft et un jeu de tir façon Call of Duty Zombies. Les fonctionnalités mentionnées incluaient des personnages jouables, des effets sonores, des inventaires, des objets achetables, un éclairage animé et des interactions avec l’environnement, ce qui suggère une génération plus solide de logique front-end et de gameplay que les modèles précédents.
Au-delà des jeux, Opus 5.5 aurait recréé entièrement en code une séquence animée de style lancement sans ressources externes, et généré de zéro une mosaïque animée de 13 000 tuiles. Dans une autre comparaison, il a produit un modèle de véhicule autonome 3D plus détaillé que GPT-6 Astra, avec des capteurs, shaders et détails de carrosserie plus précis.
Une sortie de meilleure qualité peut toujours impliquer un coût total plus élevé. Dans une comparaison, une île volcanique avec des dinosaures détaillée a coûté environ 3,40 $ avec Opus 5.5, contre 1,60 $ pour Opus 5, mais le nouveau modèle a produit un résultat bien plus riche, avec notamment des scènes sous-marines en coupe, de la faune, de la végétation et des effets atmosphériques. Une seule génération SVG à fort raisonnement aurait consommé 20 % à 27 % de la limite de session d’une offre à 20 $.
Ce lancement s’inscrit dans l’accent mis par Anthropic sur un déploiement prudent des modèles de pointe. L’entreprise affirme que Opus 5.5 a été testé par des évaluateurs externes, dont METR et Frontier Design, et qu’il a obtenu son meilleur score d’évaluation de l’alignement à ce jour lors de l’examen de sécurité le plus complet de la société.
Claude Opus 5.5 semble renforcer la position de Anthropic sur le segment haut de gamme du marché de l’IA en combinant de meilleures performances en codage et utilisation de l’ordinateur avec une tarification unitaire plus basse. Sa principale limite pourrait être sa forte consommation de tokens sur les tâches exigeantes, ce qui pourrait le rendre surtout attractif pour des travaux complexes et à forte valeur plutôt que pour un usage quotidien.
Poser une question