
Tech • IA • Robotique • Jeu
Beam, le nouveau modèle ouvert de Reflection, offre aux États-Unis leur première réponse largement compétitive aux principaux systèmes d’IA téléchargeables chinois, même si les laboratoires chinois restent en tête sur les meilleurs benchmarks et que Mistral relance l’Europe dans la course.
Les modèles ouverts ont représenté 56 % de tout le trafic IA sur AI Gateway de Vercel en août, contre moins de 10 % en décembre. Au cours de l’année écoulée, les modèles chinois ont compté pour environ 41 % des téléchargements sur Hugging Face, ce qui reflète la manière dont des laboratoires comme DeepSeek, Qwen, Kimi et GLM en sont venus à dominer l’IA haut de gamme disponible librement.
La startup new-yorkaise Reflection, fondée en 2024 par les anciens chercheurs de Google DeepMind Misha Laskin et Yanis Antaglu, a lancé Beam, un modèle mixture-of-experts de 501 milliards de paramètres. Bien que seulement 23 milliards de paramètres soient actifs par token, l’entreprise l’a entraîné sur 23,8 billions de tokens de texte et de code, puis a mené une phase de reinforcement learning de quatre semaines sur 10 500 puces Nvidia GB300 avec plus de 100 millions de tentatives de tâches dans 1,3 milliard de sandbox isolées.
Sur DeepSWE, un benchmark de bugs logiciels, Beam a obtenu 44, égalant GLM 5.2 mais derrière GLM 5.3 à 61, Kimi K3 à 68 et DeepSeek V4.1 Flash à 74. Sur Humanity’s Last Exam, Beam a obtenu 36 contre 47 pour Kimi K3. Ce résultat place Beam à peu près au niveau de la génération précédente chinoise plutôt qu’à la frontière actuelle.
Reflection soutient que la valeur de Beam ne réside pas dans le score brut maximal, mais dans le rapport coût-performance. L’entreprise affirme que Beam peut égaler GLM 5.2 sur le raisonnement difficile tout en utilisant trois à quatre fois moins de calcul, et qu’il creuse cet avantage face à de très grands modèles comme Qwen 3.8 Max. Beam a été explicitement récompensé pour des réponses concises et utiles plutôt que longues, et propose un effort d’inférence ajustable pour privilégier la vitesse ou la profondeur.
Reflection a indiqué qu’environ 110 000 tentatives s’exécutaient simultanément pendant la phase de reinforcement learning de Beam, tandis que le modèle continuait à être mis à jour sans déstabiliser l’entraînement. Les ingénieurs ont signalé 71 pannes pendant l’exécution sans l’interrompre, ajouté des systèmes d’évaluation séparés pour réduire le reward hacking, étendu le contexte à 1 million de tokens et observé que Beam s’améliorait dans l’usage du web et l’appel d’outils même sans entraînement direct spécifique à la navigation.
Beam doit être publié sous licence Apache 2.0, autorisant l’usage commercial, et un successeur plus puissant est déjà en cours d’entraînement. Reflection, soutenue par Nvidia, Sequoia et CRV, était valorisée à 25 milliards de dollars en juin et a sécurisé de la capacité de calcul via des accords incluant SpaceX et Nebius. Son argumentaire vise les entreprises et gouvernements qui veulent des modèles ouverts mais ne veulent pas, ou ne peuvent pas, dépendre de systèmes chinois.
Un jour après la présentation de Beam, Mistral a dévoilé Magistral Large 4, un modèle de 1,05 billion de paramètres avec 52 milliards de paramètres actifs, des capacités d’image, un contexte de 1 million de tokens et une prise en charge de plus de 160 langues. Il a été entraîné sur environ 3 800 puces Nvidia dans des centres de données européens et est tarifé à 1,36 $ par million de tokens d’entrée et 4,18 $ par million de tokens de sortie avant une diffusion plus large.
Mistral a déclaré que son nouveau modèle surpassait DeepSeek V4 Pro et Qwen 3.8 Max sur son score combiné en programmation et se classait deuxième derrière Claude Opus 5 dans une évaluation à l’aveugle de programmation professionnelle. L’entreprise a aussi mis en avant ses performances de sécurité: 82 % sur un test de recréation et correction de vulnérabilités, 93 % de réussite sur 40 défis de type hacking, et 93,3 % de blocage des attaques par prompt injection, tout en refusant plus souvent que d’autres modèles ouverts les requêtes ouvertement malveillantes.
Reflection affirme que les États-Unis ont perdu leur élan dans les modèles ouverts après Llama 3 de Meta, tandis que les laboratoires chinois ont fait de l’ouverture une priorité stratégique et un outil diplomatique. Mistral avance un argument similaire de souveraineté pour l’Europe, en affirmant que l’IA peut être entraînée, exécutée et déployée entièrement sous le droit européen. Le résultat est une compétition de plus en plus régionale pour savoir qui fournira les systèmes ouverts les plus performants aux entreprises et aux gouvernements.
Beam ne détrône pas encore les meilleurs modèles ouverts chinois, mais il donne aux États-Unis un acteur crédible et efficace dans un marché en forte croissance. Avec la montée en puissance de Mistral également, la prochaine phase de la concurrence dans l’IA ouverte se déplace de la nouveauté vers l’infrastructure, les coûts et la confiance politique.
Poser une question