
Tech • IA • Robotique • Jeu
Une comparaison pratique des niveaux d’effort de Claude Opus 5 a montré que medium et extra offraient le meilleur équilibre entre qualité, vitesse et coût pour transformer une archive de travail structurée en jeu de gestion jouable.
Le test demandait à Claude Opus 5 de créer un petit jeu jouable à partir d’un système de fichiers professionnel structuré, décrit comme un vault. Le jeu reproduisait un environnement de travail réel, avec collègues, tâches récurrentes, planification de contenu, factures, entretiens et opérations de studio. Le modèle a déduit des détails comme les noms, rôles, couleurs de marque, horaires et agencement de l’espace de travail à partir de fichiers existants, plutôt que d’un prompt très détaillé.
L’exercice a été conçu comme un benchmark en une seule tentative sur tous les modes d’effort disponibles de Claude Opus 5, avec le même prompt à chaque fois. La comparaison portait sur la qualité du résultat, la profondeur du raisonnement, les étapes de vérification, le temps de génération, l’usage des tokens et le coût estimé en dollars. Elle testait aussi si le modèle pouvait parcourir le contexte antérieur et organiser des informations dispersées en un produit cohérent.
En mode low, le modèle a généré un jeu isométrique fonctionnel en 12 minutes 39 secondes. Il a utilisé environ 78 000 tokens de sortie standard et près de 5 millions de tokens en cache, pour un coût estimé à 3,82 $. Le résultat comprenait des missions, des personnages, une interface de base et des détails d’entreprise reconnaissables, mais les déplacements et interactions restaient plus simples, avec une navigation par cases et davantage d’aspérités visibles.
En mode medium, le jeu est devenu nettement plus soigné, avec des déplacements plus libres, une présentation visuelle plus forte, de meilleurs repères d’interface et des touches plus immersives, comme une musique liée à certains personnages. Le modèle a aussi recréé les éléments du studio et les détails de l’environnement avec une fidélité supérieure. Cette version a pris près de 30 minutes, coûté 9,94 $, utilisé environ 186 000 tokens standard, et atteint 57 étapes de raisonnement, faisant du passage de low à medium l’amélioration la plus marquante du test.
La comparaison concluait que extra offrait le meilleur ratio qualité-prix pour les projets devant dépasser le simple prototype rapide. Il était présenté comme le réglage le plus susceptible d’être utilisé en production après des essais initiaux en mode medium. Le résultat restait fluide et utilisable tout en montrant une meilleure maîtrise de la structure, de la finition et de l’exécution.
Le réglage max poussait plus loin la complexité brute du développement, en ajoutant des comportements plus avancés et une ambition technique plus large. Mais cela impliquait des compromis: des temps d’exécution plus longs, environ 50 % de tokens en plus que les autres modes avancés, et un résultat moins élégant à utiliser. Pour les applications web ou les outils interactifs plus légers, cette complexité supplémentaire paraissait inutile, même si la génération de code sous-jacente était plus ambitieuse.
Le test a aussi mis en lumière une confusion autour du mode ultra. Il n’était pas décrit comme un niveau supérieur à max, mais comme quelque chose de plus proche de extra, avec orchestration de sous-agents obligatoire et gestion parallèle des tâches. Dans ce benchmark, ultra s’est révélé très proche de extra en temps, coût et qualité, car l’exercice consistait en une construction unique de bout en bout, et non en un flux de travail profitant de sous-tâches parallèles.
Un enseignement notable était que de grands volumes de tokens peuvent surestimer la dépense réelle. Une grande partie du travail a été facturée comme tokens en cache, moins coûteux, car le système réutilise le contexte répété et les éléments intermédiaires pendant la génération itérative et l’auto-vérification. C’est pourquoi un projet semblant consommer des millions de tokens restait malgré tout sous les 10 $ dans certains modes.
La qualité du résultat dépendait fortement d’une archive bien organisée de dossiers et de documents. Le test soutenait que les utilisateurs qui conservent un dépôt de travail clair — clients, factures, idées, formats et notes stratégiques — peuvent obtenir des résultats bien plus riches des outils d’IA. Dans cette configuration, le modèle ne se contentait pas de générer du code; il transformait l’archive elle-même en source de construction d’univers, de mécaniques et de conception des tâches.
Pour les utilisateurs souhaitant publier des projets générés par l’IA, le flux de travail pointait vers Hostinger Connector, qui relie les contrôles d’hébergement aux agents de codage via une intégration MCP. L’idée est de permettre à un assistant IA de déployer, mettre à jour et gérer des projets directement sur un domaine ou sous-domaine, sans exiger de connaissances techniques avancées. Un hébergement d’entrée de gamme était annoncé à 3,59 €, l’intégration étant présentée comme un moyen de réduire la friction entre prototype et lancement.
Ce benchmark suggère que Claude Opus 5 est surtout utile lorsqu’il est associé à une base de connaissances personnelle riche et organisée, et utilisé pour augmenter la créativité humaine plutôt que la remplacer. Pour la plupart des utilisateurs, medium et surtout extra semblent être les réglages les plus pratiques pour transformer un contexte de travail réel en logiciel fonctionnel.
Poser une question