
Tech • IA • Robotique • Jeu
OpenAI serait sur le point de profiter de son Dev Day du 29 septembre pour présenter O, un assistant « toujours actif » pensé pour des tâches de longue durée. Des indices dans ChatGPT évoquent 63 langues, plusieurs offres payantes et un fonctionnement sur des heures, jours ou semaines plutôt qu’en simple aller-retour conversationnel. Le nom de code AON renverrait à une infrastructure agentique capable d’exécuter du code, faire de la recherche et poursuivre un objectif en environnement cloud. En parallèle, l’éditeur semble étendre l’accès à une API ultra-rapide, ce qui renforcerait son offensive sur les agents et les workflows automatisés.
Google testerait anonymement un nouveau checkpoint dans la LMSYS Chatbot Arena sous l’étiquette Gemini 3.8 Flash, alors que les performances observées dépasseraient largement celles attendues pour cette gamme. La fuite la plus citée mentionne le nom de code Barryium B, possiblement un jalon précoce de Gemini 4 Pro, après un checkpoint antérieur baptisé Argon. Les démonstrations rapportées insistent sur la vision, le code et le rendu graphique, avec des sorties détaillées en SVG, en scènes 3D et en simulation. Les temps de génération auraient aussi fortement baissé par rapport à une première vague de tests observée autour du 17 septembre.
La nouvelle hiérarchie des modèles se joue moins sur la puissance brute que sur un triptyque intelligence, coût et efficacité en tokens. Claude Opus 5.5 apparaît comme le modèle premium le plus équilibré, avec un niveau élevé de qualité sans dérive excessive de consommation. En face, GPT-6 Sol et GPT-6 Astra domineraient sur l’usage des tokens, un critère central pour les agents, le code et les déploiements à grande échelle via API. Dans cette lecture économique, GPT-6 Sol ressortirait comme l’un des meilleurs compromis coût-performance du moment.
Anthropic recommande de revoir les habitudes de prompting avec Opus 5.5, dont l’effort par défaut passe à moyen au lieu de élevé sur la génération précédente. L’éditeur conseille de tester les niveaux d’effort sur des tâches réelles plutôt que de conserver des réglages hérités, car plus de raisonnement interne n’implique pas mécaniquement une meilleure réponse. Autre consigne: supprimer les instructions redondantes et préciser plus clairement la tâche, le contexte et les critères de fin. Objectif affiché: réduire les tokens et la latence tout en stabilisant la qualité.
Jev, le modèle de TypeSafe spécialisé dans la classification, s’impose comme une alternative taillée pour les workflows structurés plutôt que pour le dialogue généraliste. Sur un test de 216 e-mails, il aurait traité un message en 0,3 seconde contre 1,3 seconde pour Claude Opus, avec un total de 65 secondes sur l’ensemble du lot. Sa promesse n’est pas d’écrire mieux, mais de trancher vite entre catégories, scores et probabilités dans des outils comme n8n. Le positionnement en fait un premier filtre efficace pour le tri, le routage, le spam, la modération ou la qualification commerciale.
La compétition mondiale ne se limite plus aux laboratoires américains, et les groupes chinois accélèrent aussi sur l’échelle et l’infrastructure. Des informations de marché indiquent que ByteDance avancerait vers un système de 10 billions de paramètres, signe d’une montée en puissance sur les modèles géants. Cette trajectoire s’ajoute aux tests offensifs de Google, OpenAI et Anthropic, dans un contexte où la différenciation passe autant par l’entraînement que par le déploiement. L’enjeu n’est plus seulement la qualité des réponses, mais la capacité à industrialiser coût, vitesse et sécurité.
En France, le numérique représenterait déjà environ 5 % de l’empreinte carbone, et l’essor de l’IA accentuerait la pression sur l’électricité, les matériaux et l’eau. L’analyse rappelle que l’impact ne vient pas seulement des requêtes visibles, mais de tout le système composé des terminaux, réseaux télécoms et centres de données. Le bilan environnemental doit aussi intégrer le cycle de vie complet, de l’extraction minière à la fabrication, puis au refroidissement et à l’exploitation des serveurs. L’IA n’est donc pas un sujet séparé du numérique: elle en accélère les tensions structurelles.
MetaMuse mise sur une interface très simple, mais agrège des fonctions d’agent déjà larges: navigation web, achats assistés, audio à la demande, appels téléphoniques et accès distant aux fichiers. L’outil peut explorer des sites comme eBay ou Facebook Marketplace, comparer des annonces et résumer les meilleures options; un test cite sept offres pour un appareil photo. Des garde-fous imposent une validation humaine pour les connexions et paiements, avec recours possible à Link pour la carte bancaire. Le produit illustre la bascule du marché vers des assistants orientés action plutôt que simple conversation.