Tech • IA • Robotique • Jeu

VIDÉO
ENFR

Article complet — noté 10/10

OpenProblemBench évalue les progrès de l’IA sur 82 problèmes scientifiques non résolus

Un nouveau préprint publié sur arXiv présente OpenProblemBench, un banc d’essai conçu pour mesurer la capacité des systèmes d’IA à progresser sur des questions scientifiques dont la réponse n’est pas encore connue. Le jeu comprend 82 problèmes ouverts en mathématiques et en physique théorique, s’appuie sur plusieurs évaluateurs IA plutôt que sur des corrigés, et indique que la configuration la plus performante domine le taux de résolution jugée, tandis que d’autres modèles produisent souvent des avancées partielles mais incomplètes [1].

Se connecter pour suivre
Généré le 9 octobre 2026 à 06:091988 motsSource originale — ArXiv - Artificial Intelligence

Un test sans corrigé préétabli

OpenProblemBench arrive avec une idée simple, mais difficile à mettre en œuvre: si les questions scientifiques les plus importantes sont encore ouvertes, alors un banc d’essai de l’IA scientifique ne peut pas se limiter à des problèmes dont la réponse est déjà connue. Le préprint, soumis à arXiv le 8 octobre 2026, présente l’initiative comme un moyen de tester si l’IA peut contribuer à la frontière du savoir, et non seulement reconstruire des résultats déjà établis .

Le benchmark rassemble 82 problèmes de recherche non résolus issus des mathématiques et de la physique théorique. Chaque problème est accompagné d’un contexte, d’hypothèses, de progrès antérieurs, de références et d’une description de ce qu’une résolution devrait démontrer . Cette présentation est essentielle, car la tâche ne consiste pas à donner un simple résultat numérique ou une preuve courte. Le système doit comprendre ce qui reste ouvert, choisir une piste productive, distinguer indice et démonstration, et éviter d’exagérer la portée de son raisonnement .

Le périmètre est volontairement restreint, mais ambitieux. Les auteurs indiquent avoir privilégié des problèmes dont les solutions proposées peuvent être évaluées au moyen de critères mathématiques ou computationnels relativement clairs: inspection des étapes décisives d’une preuve, vérification des constructions par rapport aux hypothèses, ou reproduction de calculs déterminants . OpenProblemBench cherche donc un équilibre délicat: les questions restent ouvertes, mais les affirmations de progrès doivent pouvoir être examinées.

Ce que contient OpenProblemBench

Le jeu de données comprend 46 problèmes de mathématiques et 36 problèmes de physique . La partie mathématique couvre notamment l’arithmétique, la géométrie algébrique, la topologie, l’analyse, les systèmes dynamiques, la combinatoire, l’optimisation et la logique. La partie physique inclut la mécanique statistique, les systèmes intégrables, l’information quantique, les théories de jauge et des champs, l’optique, ainsi que des domaines de physique mathématique .

L’échelle temporelle des questions est très large. Les auteurs indiquent qu’un problème remonte à la question de Goldbach de 1742, tandis qu’un autre provient de travaux d’abord mis en ligne en 2025 puis publiés en 2026 . Le benchmark s’étend donc de conjectures relativement récentes à des difficultés vieilles de plusieurs siècles. Cette diversité impose de la prudence: OpenProblemBench n’est pas un examen uniforme, mais une collection de cibles de recherche dont la difficulté, le style disciplinaire et les critères de vérification varient fortement.

La construction du benchmark repose sur la littérature scientifique. Les auteurs expliquent avoir identifié des questions candidates à partir d’informations dérivées de publications, puis avoir consulté les articles sources et la littérature ultérieure afin d’évaluer si les problèmes demeuraient ouverts au moment de la curation . Les questions retenues ont ensuite été transformées en énoncés autonomes, avec le contexte, l’importance scientifique, les progrès connus et les références nécessaires .

Cette méthode répond à une tension centrale de l’évaluation de l’IA scientifique. On ne peut pas demander à un modèle de résoudre un problème ouvert à partir d’une seule phrase, mais donner trop d’indices risque de transformer la tâche en exercice guidé. OpenProblemBench fournit donc le cadre scientifique tout en laissant au système la responsabilité de l’acte de recherche: preuve, contre-exemple, classification, réduction, calcul ou argument permettant réellement de faire avancer la question.

Comment évaluer sans réponse connue

Puisque les problèmes sont non résolus, OpenProblemBench ne peut pas comparer les sorties à un corrigé classique. Le protocole utilise donc quatre modèles évaluateurs qui examinent indépendamment chaque soumission figée pour juger sa correction, sa complétude et son degré de progrès, sans solution de référence . Ces évaluateurs sont GPT-5.6-Sol, Kimi-K3, GLM-5.3 et Qwen3.8-Max .

Le protocole demande à chaque évaluateur d’identifier les obligations imposées par l’énoncé, de vérifier les hypothèses et les quantificateurs, d’inspecter les étapes décisives de preuve, et d’évaluer les calculs fournis . L’évaluateur doit juger l’argument tel qu’il est soumis, sans combler une lemme manquante ni importer la conclusion d’un autre évaluateur . Cette règle est cruciale, car le travail sur des problèmes ouverts échoue souvent précisément entre l’idée plausible et la preuve complète.

Les catégories de verdict dépassent l’opposition vrai-faux. Une soumission peut être classée comme résolue, partielle ou non résolue; les résultats partiels sont ensuite qualifiés de triviaux, non triviaux ou décisifs . Un progrès non trivial peut correspondre à une famille significative, une borne améliorée ou une réduction utile, tandis qu’un progrès décisif désigne un résultat qui lève un obstacle central et modifie substantiellement le travail restant . Le benchmark mesure aussi les suraffirmations, par exemple lorsqu’un résultat conditionnel est présenté comme inconditionnel ou qu’une vérification finie est extrapolée à une famille infinie .

OpenProblemBench ressemble ainsi moins à un test standardisé qu’à une simulation structurée d’évaluation scientifique. Il ne demande pas seulement si un système trouve une solution, mais aussi s’il produit un progrès honnête, bien délimité et réutilisable lorsque la résolution complète n’est pas disponible.

Les résultats rapportés

L’étude initiale évalue sept configurations de solveurs sur les 82 problèmes, soit 574 soumissions finales et 2 296 évaluations . Les configurations testées incluent GPT-6-Astra, GPT-5.6-Sol, Kimi-K3, GLM-5.3, Qwen3.8-Max, GLM-5.3-Flash et DeepSeek-V4.1-Flash, exécutés dans différents environnements décrits par l’article .

GPT-6-Astra obtient le meilleur taux moyen de résolution jugée. Le résumé arXiv indique un taux moyen de 14,0% pour GPT-6-Astra, contre 5,5% à 6,7% pour les grands modèles ouverts évalués et 2,4% à 3,7% pour les modèles Flash . Dans la version HTML détaillée, ce taux est donné comme 14,02%, et Astra présente aussi la plus grande part moyenne de résultats classés résolus, décisifs ou non triviaux, à 84,45% .

Le classement derrière le leader est plus nuancé. Les jugements de résolution complète restent rares pour toutes les autres configurations, avec des taux moyens compris entre 2,44% et 7,01% . Mais le taux de résolution masque des différences utiles: Qwen3.8-Max et Kimi-K3 reçoivent des jugements résolus ou substantiellement partiels dans 73,48% et 74,09% des évaluations, contre 63,11% pour GPT-5.6-Sol . Kimi-K3 obtient aussi la plus grande part de progrès partiels décisifs, à 6,10%, ce qui suggère que certaines de ses meilleures tentatives lèvent des obstacles majeurs sans aller jusqu’à la résolution complète .

Les modèles Flash ne se résument pas non plus à une performance faible. GLM-5.3-Flash obtient moins de jugements résolus que GLM-5.3 en moyenne, 3,66% contre 5,49%, mais leurs parts combinées de résultats résolus, décisifs et non triviaux sont proches, à 63,72% et 62,80% . Cela indique que des configurations plus légères ou plus rapides peuvent produire des avancées intermédiaires utiles, même si elles ferment moins souvent l’argument complet.

Pourquoi les progrès partiels comptent

Dans l’évaluation de la recherche, le progrès partiel n’est pas un lot de consolation. En mathématiques et en physique théorique, une réduction utile, un cas spécial exact, une voie de contre-exemple ou un certificat computationnel peut transformer un problème sans le résoudre entièrement. OpenProblemBench tente précisément de mesurer cette couche intermédiaire.

L’article rapporte 2 288 évaluations complètes sur 2 296 examens principaux . Parmi les 2 095 jugements partiels, 768 sont triviaux, 1 252 non triviaux et 75 décisifs . Ces chiffres sont comptés au niveau des évaluations, ce qui signifie qu’une même soumission peut recevoir des appréciations différentes selon l’évaluateur, mais ils montrent qu’un simple classement par taux de résolution serait trop grossier.

Les études de cas mettent en évidence plusieurs différences récurrentes entre les tentatives fortes et les travaux inachevés. Dans certains exemples, les systèmes qui réussissent reformulent le problème d’une manière qui attaque directement la conclusion exigée, tandis que d’autres construisent des pipelines de calcul ou des simulations sans parvenir à une preuve . Dans d’autres cas, des observations finies doivent être transformées en argument général couvrant tous les cas admissibles . Un troisième motif concerne la fermeture des lacunes: une soumission peut sembler convaincante jusqu’au moment où une normalisation non démontrée, une condition d’injectivité, un cas exceptionnel ou une correspondance mathématique devient indispensable .

Ce ne sont pas des détails de présentation. Ils constituent le cœur du raisonnement scientifique. Un système qui propose des idées mais décrit mal leur portée peut accélérer l’exploration tout en augmentant le travail de vérification humaine. En suivant les suraffirmations, OpenProblemBench traite donc la fiabilité du compte rendu comme une compétence de recherche à part entière .

Outils, accès web et conditions d’exécution

OpenProblemBench montre également que la performance ne dépend pas seulement des poids du modèle. L’article présente une comparaison de Qwen3.8-Max avec différents environnements et paramètres d’accès au web, sur les mêmes 82 énoncés, avec GLM-5.3 comme évaluateur .

Dans cette comparaison, Qwen3.8-Max sous OpenCode sans accès web obtient 7 jugements résolus et 68 résultats partiels non triviaux ou décisifs . Sous Claude Code sans accès web, il obtient 5 jugements résolus et 59 résultats partiels non triviaux ou décisifs . L’activation de l’accès web dans Claude Code maintient le nombre de résolutions à 5, mais fait remonter les progrès substantiels à 68, avec davantage de résultats décisifs .

Cela ne signifie pas que l’accès web résout automatiquement les problèmes ouverts. Dans cette comparaison précise, il n’augmente pas le taux global de résolution jugée, mais il favorise davantage de progrès substantiels . Le résultat rappelle un point important pour les benchmarks scientifiques: les agents, les outils, les politiques de recherche d’information, les budgets de temps et les environnements d’exécution font partie du système évalué.

Les limites à garder en tête

Les auteurs soulignent que les résultats d’OpenProblemBench sont des jugements de modèles, non des validations scientifiques définitives. Ils indiquent qu’un examen indépendant par des experts est nécessaire pour établir la correction et la nouveauté, et préviennent que les évaluateurs IA peuvent partager les mêmes erreurs . L’accord entre juges automatisés ne doit donc pas être confondu avec une preuve qu’un problème est réellement résolu.

L’article note aussi que les 82 questions sont inégalement réparties entre sous-domaines, en partie parce que le critère de vérifiabilité favorise certains types de mathématiques et une physique théorique très mathématisée . Les auteurs appellent à de futures versions avec des dates limites de littérature explicites, des références humaines, une couverture élargie à d’autres sciences et des répétitions sous budgets communs .

Ces limites ne sont pas secondaires. Elles définissent le statut actuel du benchmark. OpenProblemBench doit être lu comme un nouvel instrument pour étudier le comportement de recherche des systèmes d’IA, et non comme une liste certifiée de découvertes produites par machine.

Ce que cela change

OpenProblemBench illustre le déplacement de l’évaluation de l’IA: de la restitution de connaissances et des problèmes de concours vers l’analyse de capacités à la frontière de la recherche. Sa contribution centrale n’est pas seulement le jeu de 82 problèmes, mais le modèle d’évaluation: noter les solutions complètes, qualifier les progrès partiels, diagnostiquer les suraffirmations et comparer la façon dont plusieurs systèmes abordent la même question non résolue.

Si le benchmark résiste à l’examen d’experts, il pourrait aider à distinguer les modèles qui donnent seulement l’impression de faire de la recherche de ceux qui produisent de véritables avancées vérifiables. Il pourrait aussi, tout aussi utilement, montrer où l’IA échoue: confusion entre indice fini et preuve générale, oubli de cas exceptionnels, erreurs partagées entre implémentations, ou présentation excessive de conclusions conditionnelles.

Pour l’instant, le résultat principal est à la fois prudent et significatif. OpenProblemBench rapporte que des systèmes d’IA actuels peuvent parfois produire un progrès jugé sur des problèmes ouverts de mathématiques et de physique théorique, avec GPT-6-Astra en tête des configurations testées, mais que les résolutions complètes restent rares et exigent une validation indépendante . Ce n’est pas la fin de la science humaine. C’est une manière plus précise de mesurer jusqu’où l’IA s’en rapproche.

Sources des dernières 72 heures

  1. [1][2610.11118] OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences8 oct. 2026, 04:43
  2. [2]OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences8 oct. 2026, 02:00
  3. [3]OpenProblemBench: Benchmarking AI on Open Problem… - arXiv8 oct. 2026, 02:00

Article généré par IA à partir d’une recherche web récente, puis conservé comme instantané éditorial daté.