
Tech • IA • Robotique • Jeu
GPT-6.1 Sol s’impose comme le modèle d’IA le plus solide en polyvalence selon le rapport performance/coût, avec des capacités proches du très haut de gamme tout en surpassant ses rivaux sur le prix et l’efficacité en tokens.
OpenAI propose désormais trois niveaux principaux: GPT-6 Astra à 10 $ par million de tokens en entrée et 50 $ en sortie, GPT-6.1 Sol à 2 $ en entrée et 10 $ en sortie, et GPT-6 Luna à 0,10 $ en entrée et 0,50 $ en sortie. Ce changement reflète une tendance plus large du marché: une intelligence plus élevée devient moins chère, et les modèles intermédiaires égalent de plus en plus les anciens systèmes phares dans le travail concret.
GPT-6.1 Sol ferait progresser ses capacités d’un niveau interne de 36 à 48, soit un gain de 12 points, tout en réduisant le coût de production. En termes de rapport intelligence/coût, il devient particulièrement attractif aux niveaux de raisonnement moyens et élevés, où il est présenté comme plus rentable que GPT-6 Astra malgré le positionnement premium d’Astra.
Face à Opus 5.5, GPT-6.1 Sol est décrit comme globalement au même niveau d’intelligence, avec environ un point d’écart selon le benchmark, mais avec un avantage majeur en efficacité. À travail équivalent, GPT-6.1 utiliserait 7 à 8 fois moins de tokens que Opus 5.5, ce qui réduit fortement le coût d’exploitation. Claude Fable 5.1 est positionné plus près d’Astra sur la dynamique tarifaire, mais avec une consommation de tokens plus lourde.
La comparaison place Kimi K3 et GLM 5.3 nettement derrière les meilleurs modèles américains. Leur niveau est présenté autour de 34 à 35 points, contre plus de 50 pour les meilleurs systèmes américains. Kimi était d’abord perçu comme une alternative moins chère, mais sa consommation de tokens et son niveau d’intelligence plus faible, cité à 44, réduisent cet avantage dans les charges réelles.
La lecture la plus utile d’un benchmark d’IA repose sur trois questions: la tâche, la fiabilité du résultat et le coût pour l’obtenir. Ce cadre devient de plus en plus important à mesure que les fournisseurs mettent en avant de hauts scores pouvant masquer une inférence coûteuse ou de faibles performances en usage réel d’outils, en code et dans des workflows contraints.
Sur un benchmark d’ingénierie logicielle décrit comme Deep SWE, GPT-6.1 Sol gagne plus de 10 points d’autonomie par rapport à GPT-6 Sol en moins d’une semaine d’évolution du modèle. Il se rapprocherait de GPT-6 Astra tout en coûtant environ cinq fois moins cher, ce qui en fait l’une des meilleures options pour le code, l’automatisation et les projets no-code.
Un point d’équilibre est signalé au-delà du niveau XI, où la rentabilité baisse pour tous les modèles parce que le raisonnement supplémentaire commence à suranalyser les tâches. Pour beaucoup de travaux difficiles, XI représente le meilleur compromis, mais pour l’usage quotidien, le réglage High peut offrir un meilleur rendement en évitant une consommation inutile de tokens.
Un exemple métier détaillé montre un agent utilisant GPT-6.1 Sol pour traiter des factures, vérifier les données Stripe, confirmer l’identité du client, déterminer le traitement de la TVA à l’intérieur ou à l’extérieur de l’Union européenne, détecter les paiements en plusieurs fois, générer des factures d’acompte et archiver les documents conformes dans Google Drive. Une tâche qui prenait auparavant 30 à 40 minutes par facture devient un workflow automatisé, avec une séquence de préparation et d’envoi d’email d’environ huit minutes.
Même avec une meilleure autonomie, les workflows à forte responsabilité exigent encore des étapes d’arrêt et de vérification avant exécution. Le schéma recommandé consiste à séparer l’analyse et la préparation de l’envoi ou du classement final, afin qu’une personne puisse valider les résultats avant toute action juridique, financière ou fiscale.
L’une des limites les plus importantes reste la compréhension documentaire. GPT-6 Sol est donné à environ 24 % de confiance sur la compréhension des relations dans les PDF, tandis que GPT-6.1 Sol monte à environ 30 %. GPT-6 Astra atteint environ 40 %, et Opus 5.5 autour de 32 %, mais à un coût bien plus élevé. L’ingestion brute de PDF reste donc peu fiable pour les tâches professionnelles complexes, sauf si la structure et les relations du document sont explicitement conçues.
GPT-6.1 Sol est présenté comme nettement plus sûr que GPT-6 Sol pour l’usage d’outils et le respect des limites système, en respectant les restrictions trois fois plus souvent et en étant deux fois plus sûr en usage courant. À l’inverse, GPT-6 Luna est jugé inadapté aux tâches à forte responsabilité, avec un taux d’échec décrit comme proche de 30 %.
Pour la plupart des utilisateurs et des entreprises, GPT-6.1 Sol offre actuellement le meilleur équilibre entre prix, capacité et sécurité opérationnelle. Le changement de fond ne concerne pas seulement des modèles plus intelligents, mais aussi des agents d’IA abordables capables d’exécuter de vrais workflows métier avec supervision, plutôt qu’un simple prompting.
Poser une question