
Tech • IA • Robotique • Jeu
Anthropic a repositionné Claude Opus 5.5 comme nouveau point de référence généraliste face à GPT-6 Sol, GPT-6 Astra et Grock 4.7. Les comparaisons rapportent de meilleurs résultats en écriture, design, raisonnement et qualité de livrable final, avec une baisse de prix de 20 % à 40 % selon les offres évoquées. Le modèle est aussi présenté comme plus rapide et plus discipliné en consommation de tokens que les générations précédentes. En pratique, la bataille ne se joue plus seulement sur les benchmarks, mais sur le coût total pour produire un résultat exploitable.
Anthropic testerait Claude Sonnet 5.5 avec une tarification agressive de 2 $/M tokens en entrée, 10 $/M en sortie et 0,20 $/M depuis le cache. La fuite évoque une fenêtre de 1 million de tokens et jusqu'à 128 000 tokens en sortie, des niveaux rares pour une offre grand public. Les premiers aperçus suggèrent des gains en code et en génération visuelle structurée, avec des démonstrations allant du SVG détaillé à un sandbox type Minecraft. Si ces paramètres sont confirmés, Anthropic accentuerait la pression tarifaire sur OpenAI et sur tout le segment premium.
Meta a clarifié sa feuille de route en articulant ses annonces autour de Muse, de lunettes intelligentes et de casques VR plus légers. Le message change sensiblement: l'IA n'est plus vendue comme une prouesse abstraite, mais comme un assistant personnel utile, accessible et monétisable à grande échelle. Cette approche tranche avec les discours plus anxiogènes sur la superintelligence, en privilégiant la praticité quotidienne et l'intégration produit. Mark Zuckerberg cherche ainsi à transformer un portefeuille d'initiatives jusque-là dispersées en écosystème cohérent grand public.
Un modèle masqué sous Gemini 3.8 Flash dans la LMSYS Chatbot Arena est largement soupçonné d'être un checkpoint de Gemini 4 Pro, potentiellement nommé Barryium B. Les testeurs rapportent des performances anormalement élevées en vision, code et scènes 3D, avec une rapidité supérieure aux anciennes variantes Pro. Les sorties observées incluent des rendus SVG complexes, une manette PS5, une F1 stylisée et des simulations visuelles détaillées. Google n'a rien confirmé, mais l'intensification de ces tests alimente l'hypothèse d'un lancement rapproché.
DeepSeek Elastic Compute, publié le 19 septembre, met en avant une brique clé de la prochaine phase de l'IA: l'entraînement d'agents dans des environnements sûrs et extensibles. Le système open source peut exécuter environ 3 millions de sandboxes par jour, plus de 380 000 simultanément et en lancer 5 000 par seconde. Un cluster type mobiliserait 160 serveurs, 30 000 cœurs CPU et 250 To de mémoire, avec quatre niveaux de sandbox allant du script à la machine virtuelle complète. Le goulot d'étranglement se déplace donc des seuls GPU vers l'orchestration sécurisée de mondes d'exécution pour agents.
Microsoft prépare une évolution de Copilot vers Autopilot, avec des agents persistants dotés de mémoire, stockage et ordinateur cloud dédié. L'objectif est de dépasser l'assistant bureautique ponctuel pour créer des logiciels capables d'agir en continu dans des espaces de travail virtualisés. Cette architecture permet de conserver le contexte, de manipuler des fichiers et d'enchaîner des tâches sans repartir d'une simple fenêtre de chat. L'atout décisif de Microsoft reste la distribution, avec plus de 100 millions d'abonnés grand public et une présence profonde dans Windows, Office et l'IT d'entreprise.
À l'ONU, Donald Trump a rejeté toute supervision mondiale contraignante de l'IA, profitant de la position des États-Unis au Conseil de sécurité. Il a même défendu le terme de super intelligence à la place d'« intelligence artificielle », signalant une approche plus stratégique que prudentielle. Cette ligne politique rend peu probable l'émergence rapide de garde-fous internationaux robustes, malgré les alertes venues de chercheurs et d'entreprises. En parallèle, le débat sécurité se tend autour d'incidents d'agents autonomes présentés soit comme signaux d'alarme, soit comme tests artificiellement permissifs.
Un workflow autonome a permis de produire deux sites de spa médical à partir d'un seul prompt, avec GPT-6 Astra en 1 h 18 et Claude en 2 h 45. Le dispositif s'appuyait sur le framework Seed, une orchestration nommée Paul, l'analyse de 10 sites concurrents et l'automatisation navigateur via Playwright CLI. Le résultat montre que des agents peuvent déjà enchaîner recherche, direction artistique, collecte d'assets et production web de bout en bout. Mais la qualité prête pour un client dépend encore fortement des retouches humaines de post-production plutôt que de la seule première passe.