Tech • IA • Robotique • Jeu

VIDÉO
ENFR

Ça fait peur ! J'ai testé GPT 6.1 et c'est dingue !

9.4/10
IAParlons IA30 septembre 2026 à 07:0021:27
Lecteur audio
0:00 / 0:00

INTRO

GPT-6.1 Sol s’impose comme le modèle d’IA le plus solide en polyvalence selon le rapport performance/coût, avec des capacités proches du très haut de gamme tout en surpassant ses rivaux sur le prix et l’efficacité en tokens.

POINTS CLÉS

Une nouvelle grille tarifaire

OpenAI propose désormais trois niveaux principaux: GPT-6 Astra à 10 $ par million de tokens en entrée et 50 $ en sortie, GPT-6.1 Sol à 2 $ en entrée et 10 $ en sortie, et GPT-6 Luna à 0,10 $ en entrée et 0,50 $ en sortie. Ce changement reflète une tendance plus large du marché: une intelligence plus élevée devient moins chère, et les modèles intermédiaires égalent de plus en plus les anciens systèmes phares dans le travail concret.

Pourquoi GPT-6.1 Sol se distingue

GPT-6.1 Sol ferait progresser ses capacités d’un niveau interne de 36 à 48, soit un gain de 12 points, tout en réduisant le coût de production. En termes de rapport intelligence/coût, il devient particulièrement attractif aux niveaux de raisonnement moyens et élevés, où il est présenté comme plus rentable que GPT-6 Astra malgré le positionnement premium d’Astra.

Concurrence avec les modèles Anthropic

Face à Opus 5.5, GPT-6.1 Sol est décrit comme globalement au même niveau d’intelligence, avec environ un point d’écart selon le benchmark, mais avec un avantage majeur en efficacité. À travail équivalent, GPT-6.1 utiliserait 7 à 8 fois moins de tokens que Opus 5.5, ce qui réduit fortement le coût d’exploitation. Claude Fable 5.1 est positionné plus près d’Astra sur la dynamique tarifaire, mais avec une consommation de tokens plus lourde.

Écart avec les concurrents chinois

La comparaison place Kimi K3 et GLM 5.3 nettement derrière les meilleurs modèles américains. Leur niveau est présenté autour de 34 à 35 points, contre plus de 50 pour les meilleurs systèmes américains. Kimi était d’abord perçu comme une alternative moins chère, mais sa consommation de tokens et son niveau d’intelligence plus faible, cité à 44, réduisent cet avantage dans les charges réelles.

Les benchmarks comptent plus que les scores affichés

La lecture la plus utile d’un benchmark d’IA repose sur trois questions: la tâche, la fiabilité du résultat et le coût pour l’obtenir. Ce cadre devient de plus en plus important à mesure que les fournisseurs mettent en avant de hauts scores pouvant masquer une inférence coûteuse ou de faibles performances en usage réel d’outils, en code et dans des workflows contraints.

L’autonomie logicielle progresse fortement

Sur un benchmark d’ingénierie logicielle décrit comme Deep SWE, GPT-6.1 Sol gagne plus de 10 points d’autonomie par rapport à GPT-6 Sol en moins d’une semaine d’évolution du modèle. Il se rapprocherait de GPT-6 Astra tout en coûtant environ cinq fois moins cher, ce qui en fait l’une des meilleures options pour le code, l’automatisation et les projets no-code.

Le plafond de rentabilité

Un point d’équilibre est signalé au-delà du niveau XI, où la rentabilité baisse pour tous les modèles parce que le raisonnement supplémentaire commence à suranalyser les tâches. Pour beaucoup de travaux difficiles, XI représente le meilleur compromis, mais pour l’usage quotidien, le réglage High peut offrir un meilleur rendement en évitant une consommation inutile de tokens.

Cas d’usage réel: traitement autonome des factures

Un exemple métier détaillé montre un agent utilisant GPT-6.1 Sol pour traiter des factures, vérifier les données Stripe, confirmer l’identité du client, déterminer le traitement de la TVA à l’intérieur ou à l’extérieur de l’Union européenne, détecter les paiements en plusieurs fois, générer des factures d’acompte et archiver les documents conformes dans Google Drive. Une tâche qui prenait auparavant 30 à 40 minutes par facture devient un workflow automatisé, avec une séquence de préparation et d’envoi d’email d’environ huit minutes.

La revue humaine reste essentielle

Même avec une meilleure autonomie, les workflows à forte responsabilité exigent encore des étapes d’arrêt et de vérification avant exécution. Le schéma recommandé consiste à séparer l’analyse et la préparation de l’envoi ou du classement final, afin qu’une personne puisse valider les résultats avant toute action juridique, financière ou fiscale.

La compréhension des PDF reste faible

L’une des limites les plus importantes reste la compréhension documentaire. GPT-6 Sol est donné à environ 24 % de confiance sur la compréhension des relations dans les PDF, tandis que GPT-6.1 Sol monte à environ 30 %. GPT-6 Astra atteint environ 40 %, et Opus 5.5 autour de 32 %, mais à un coût bien plus élevé. L’ingestion brute de PDF reste donc peu fiable pour les tâches professionnelles complexes, sauf si la structure et les relations du document sont explicitement conçues.

La sécurité et les restrictions s’améliorent

GPT-6.1 Sol est présenté comme nettement plus sûr que GPT-6 Sol pour l’usage d’outils et le respect des limites système, en respectant les restrictions trois fois plus souvent et en étant deux fois plus sûr en usage courant. À l’inverse, GPT-6 Luna est jugé inadapté aux tâches à forte responsabilité, avec un taux d’échec décrit comme proche de 30 %.

CONCLUSION

Pour la plupart des utilisateurs et des entreprises, GPT-6.1 Sol offre actuellement le meilleur équilibre entre prix, capacité et sécurité opérationnelle. Le changement de fond ne concerne pas seulement des modèles plus intelligents, mais aussi des agents d’IA abordables capables d’exécuter de vrais workflows métier avec supervision, plutôt qu’un simple prompting.

Poser une question

Sur le même sujet : IA