Article complet du Daily Podcast
Fuite Gemini 4 RSI : Astra et Fable écrasés dans les benchmarks
Une entrée Arena baptisée “gemini-3.8-flash” alimente l’hypothèse d’un test masqué de Gemini 4 Pro. Le tableau de benchmarks divulgué la place devant GPT-6 Astra et Claude Fable 5.1, mais les données officielles récentes d’Android Bench rappellent une nuance essentielle : le Gemini 3.8 Flash public ne se comporte pas comme ce prétendu poids lourd caché.
Une fuite qui commence par un nom trompeur
L’affaire ne se résume pas à dire que Gemini 3.8 Flash serait soudainement devenu le meilleur modèle du marché. Le point central est plus subtil: plusieurs publications du 18 septembre décrivent une entrée Arena affichée sous le nom gemini-3.8-flash, mais dont le comportement paraît trop ambitieux pour un modèle Flash normalement optimisé pour la vitesse . C’est précisément cet écart entre le nom et le comportement observé qui a transformé une simple rumeur de leaderboard en possible fuite de Gemini 4 Pro.
La version la plus spectaculaire vient d’un article de Pedaily reprenant Xinzhiyuan: un nouveau modèle apparu sur Arena sous l’étiquette gemini-3.8-flash serait soupçonné d’être Gemini 4 Pro, et un scorecard largement relayé le placerait devant GPT-6 Astra et Claude Fable 5.1 en codage, agents, raisonnement et utilisation d’ordinateur . Une analyse de Qiniu, publiée elle aussi le 18 septembre, adopte un ton plus prudent: elle distingue ce qui est confirmé, à savoir l’existence d’un emballement autour d’une entrée Arena et de démonstrations de développeurs, de ce qui reste non prouvé, notamment l’identité du modèle, les scores, les prix, la mémoire et la fenêtre de contexte .
Cette différence est cruciale. Si l’entrée Arena correspond simplement au Gemini 3.8 Flash public, l’histoire relève surtout du buzz. Si elle correspond à un checkpoint masqué, Google pourrait être en train de tester un modèle de classe Gemini 4 sous un alias familier, afin de recueillir des préférences sans déclencher l’effet de marque. À ce stade, les éléments publics permettent seulement une conclusion prudente: des testeurs ont vu une entrée gemini-3.8-flash inhabituellement performante et en ont déduit qu’elle pourrait cacher Gemini 4 Pro .
Ce que prétend le tableau de benchmarks divulgué
Le tableau qui a fait exploser la rumeur attribue quatre victoires à “Gemini 4 Pro” face à GPT-6 Astra et Claude Fable 5.1. Le résumé publié par Atoms le 18 septembre reprend les chiffres suivants: 88,7 % sur DeepSWE v1.1 pour Gemini 4 Pro contre 86,9 % pour Astra et 69,1 % pour Fable 5.1; 2064 Elo sur GDPval-AA v2 contre 1994 et 1853; 95,3 % sur Terminal-bench 2.1 contre 94,1 % et 92,8 %; puis 86,8 % sur OSWorld-2.0 contre 84,5 % et 77,9 % .
Ces scores expliquent la rapidité de propagation de la rumeur. L’avance revendiquée sur Astra est parfois étroite, mais symboliquement forte: le génie logiciel, l’usage du terminal et le contrôle d’environnement informatique sont les terrains où les grands laboratoires cherchent à démontrer une utilité économique réelle. L’écart revendiqué face à Fable 5.1 est beaucoup plus large sur DeepSWE et OSWorld, ce qui donne à la fuite l’allure d’un saut générationnel plutôt que d’un simple rattrapage .
Mais Atoms précise aussi que ni les résultats ni les prix affichés dans ce tableau n’ont été vérifiés indépendamment . Cette réserve doit accompagner toute lecture de la fuite. Une image de benchmark sans protocole reproductible, sans paramètres de génération, sans environnement d’outils, sans identifiant de modèle et sans contrôle de contamination ne vaut pas un classement public vérifié. C’est un signal, pas encore une preuve.
Pourquoi les démos ont davantage convaincu que les chiffres
Les chiffres n’ont pas circulé seuls. Les articles du 18 septembre évoquent aussi une série de démonstrations visuelles et interactives: dessins SVG, site web au style graphite qui se dessine au défilement, pélican à vélo avec contrôles, pagode voxel, hélicoptère, et petits prototypes proches du jeu vidéo . Ces démos ont pesé dans la perception de la fuite parce qu’elles montrent des productions que les développeurs peuvent juger directement, même sans auditer le benchmark.
Elles renforcent aussi l’anomalie de départ. Un modèle Flash répond normalement vite, en acceptant une partie du compromis entre profondeur et latence. Or l’entrée Arena décrite dans les récits aurait pris beaucoup plus de temps sur certaines générations, pour produire des artefacts visuels et codés d’un niveau inhabituel . L’argument n’est donc pas seulement statistique, il est comportemental: cadence, finition et complexité ne ressembleraient pas à un endpoint Flash standard.
Cela ne prouve pas pour autant qu’il s’agit de Gemini 4. Il pourrait s’agir d’une variante expérimentale de Gemini 3.8, d’un réglage “high reasoning”, d’un changement de harness, d’un routage temporaire vers un backend plus fort, ou bien d’un futur modèle caché derrière un nom existant. Le nom affiché par Arena ne suffit pas à identifier le système.
Le volet RSI: récit puissant, preuves fragiles
Le terme RSI donne au titre une dimension encore plus explosive. Le rapport repris par Pedaily affirme que, selon la rumeur, Google aurait mis en œuvre une forme de recursive self-improvement en interne, ce qui permettrait à Gemini 4 Pro de se mesurer directement à Astra et Fable . Qiniu, plus prudent, indique qu’aucune preuve officielle ou académique ne confirme l’existence d’une telle boucle RSI chez Google, même si les discussions autour de l’auto-amélioration récursive et de la recherche assistée par IA nourrissent le récit autour de Gemini 4 .
C’est le cadrage le plus solide. La RSI, ou amélioration récursive, désigne l’idée qu’un système d’IA contribue à améliorer les méthodes, outils ou modèles qui serviront à produire les générations suivantes. Si un laboratoire l’avait réellement industrialisée, l’impact stratégique serait majeur. Mais passer de “Google s’intéresse à la RSI” à “ce modèle Arena est un Gemini 4 Pro issu de la RSI” reste un saut trop grand au vu des preuves disponibles au 19 septembre.
Il faut donc séparer deux affirmations. La première: une entrée Arena nommée gemini-3.8-flash paraît très forte et pourrait être un checkpoint masqué de classe Gemini 4. La seconde: cette force viendrait d’une boucle RSI interne. La première repose sur des observations communautaires et plusieurs reprises médiatiques; la seconde demeure spéculative.
Le rappel à l’ordre d’Android Bench 2.0
La difficulté principale pour interpréter cette fuite vient des données officielles publiées par Google autour d’Android Bench 2.0. Le blog Android Developers a annoncé le 17 septembre une nouvelle version intégrant des tâches longues, des évaluations d’agents et une notation continue, avec l’ajout de Gemini 3.8 Flash, Gemini 3.7 Flash, OpenAI GPT-6, Anthropic Fable 5.1, Kimi K3 et Qwen 3.8 Max . Dans ce cadre officiel, GPT-6 Astra arrive en tête avec un taux de réussite de 28 % .
La couverture de 9to5Google souligne le contraste: Google a évalué Gemini 3.7 et 3.8 Flash aux côtés de GPT-6 et Fable 5.1, et GPT-6 Astra domine ce benchmark centré sur des tâches Android longues et complexes plutôt que sur de petits changements incrémentaux . Cela ne réfute pas la fuite, car le modèle divulgué n’est peut-être pas le Gemini 3.8 Flash public testé dans Android Bench. En revanche, cela interdit de conclure simplement que “Gemini 3.8 Flash écrase Astra et Fable” dans des conditions publiques et reproductibles.
Le point éditorial essentiel est donc le suivant: la fuite et le benchmark officiel peuvent coexister si les systèmes testés ne sont pas les mêmes. Le Gemini 3.8 Flash public peut être derrière Astra sur Android Bench 2.0, tandis qu’un checkpoint non publié de Gemini 4 Pro pourrait circuler sous un alias ambigu sur Arena. L’ambiguïté n’est pas un détail: c’est le cœur de l’histoire.
Pourquoi Google testerait sous un alias familier
Si Google teste réellement un modèle plus puissant sous le nom gemini-3.8-flash, la logique est compréhensible. Un alias connu permet de comparer les sorties sans annoncer un produit, d’éviter de créer trop tôt des attentes autour de Gemini 4, et de limiter l’effet de halo qui apparaîtrait si les utilisateurs voyaient “Gemini 4 Pro” avant de voter. Les tests de type Arena sont plus utiles lorsque les utilisateurs jugent les résultats plutôt que la marque.
Il existe aussi une raison de calendrier. Les reprises du 18 septembre replacent la fuite dans un contexte d’attente prolongée autour d’un nouveau modèle Gemini de niveau Pro . Si Google dispose d’un système capable de rivaliser avec Astra et Fable, des tests aveugles lui permettraient de collecter des signaux de préférence et d’éprouver le comportement outillé avant lancement. Si ce n’est pas le cas, l’alias lui laisse aussi une marge d’expérimentation sans transformer chaque checkpoint en promesse publique.
Conclusion
Au 19 septembre, la formulation la plus sûre n’est pas que Google a officiellement lancé Gemini 4 Pro. Ce n’est pas le cas. La formulation solide est qu’une entrée nommée gemini-3.8-flash a suscité un intérêt crédible parce que son comportement rapporté, ses démos et son tableau de benchmarks divulgué paraissent trop puissants pour une version Flash ordinaire .
L’idée selon laquelle Gemini 4 “détruit” Astra et Fable vient du scorecard divulgué, pas d’un leaderboard public vérifié. Les données officielles d’Android Bench 2.0 placent même GPT-6 Astra devant dans un scénario difficile de développement Android . Mais si l’entrée Arena est bien un checkpoint Gemini 4 Pro masqué, alors la fuite signale quelque chose d’important: Google pourrait être plus proche que prévu de revenir dans la bataille des modèles frontière, non pas avec un Flash plus rapide, mais avec un poids lourd caché derrière un badge Flash.
Sources des dernières 72 heures
- [1]刚刚,Gemini 4 Pro偷跑上线,碾压Astra和Fable_投资界18 sept. 2026, 03:46 UTC
- [2]Gemini 4 Pro偷跑上线?匿名现身Arena,网传基准碾压Astra和Fable(2026年9月) | 七牛云18 sept. 2026, 00:00 UTC
- [3]Gemini 4 Pro Leaks: The Lasted SOTA Model?18 sept. 2026, 00:00 UTC
- [4]Android Bench 2.0: pokonywanie kolejnych granic dzięki wymagającym zadaniom długoterminowym17 sept. 2026, 00:00 UTC
- [5]Android Bench 2.0 focuses on long-horizon tasks, agent evaluations17 sept. 2026, 16:00 UTC
Article généré par IA à partir d’une recherche web récente, puis conservé comme instantané éditorial daté.

Commentaires
Sois le premier à commenter.