Article complet du Daily Podcast
Les agents Appier fabriquent leurs propres outils
Avec une recherche acceptée à NeurIPS, Appier pousse l’IA agentique au-delà du simple appel d’API : ses agents apprennent à créer, vérifier, réutiliser et partager leurs propres outils. La promesse est forte pour les entreprises, mais le vrai test sera opérationnel : ces outils auto-générés devront rester sûrs, lisibles, gouvernables et réutilisables.

Ce qui vient d’être annoncé
Appier a annoncé l’acceptation à NeurIPS de son article “Joint Optimization of Tool Creation and Use for Large Language Model Agents”, qui présente SMITH, pour Schema-grounded Multi-task Iterative Tool Honing . L’idée centrale est que les agents ne doivent pas seulement utiliser des outils préparés à l’avance par des ingénieurs: ils doivent apprendre à en fabriquer, à les tester, à conserver ceux qui généralisent et à les réutiliser dans d’autres tâches .
Le cadre SMITH est décrit par Appier comme une méthode d’apprentissage par renforcement qui entraîne dans une même boucle la création et l’utilisation d’outils . C’est ce couplage qui fait l’intérêt de la recherche. Beaucoup de systèmes agentiques savent déjà choisir entre une fonction, une API, un moteur de recherche, une calculatrice ou un connecteur interne. Appier défend une étape supplémentaire: transformer des raisonnements répétés en outils appelables et partageables.
Le média taïwanais Economic Daily a présenté cette avancée comme le passage d’agents qui “utilisent” des outils à des agents capables de les créer et de les optimiser de manière autonome . La publication japonaise d’Appier insiste également sur le même problème: il ne suffit pas qu’un modèle sache générer un outil, il faut qu’il sache ensuite l’exploiter correctement dans une tâche réelle .
Pourquoi SMITH est important
Le problème pratique est connu dans les entreprises: les agents dépendent fortement des intégrations construites par des humains. Dès qu’un flux métier change, qu’une source de données évolue ou qu’une règle opérationnelle est modifiée, l’équipe technique doit souvent adapter ou reconstruire les outils disponibles. Appier souligne explicitement cette limite: de nombreux systèmes reposent encore sur des API ou des outils fixes développés à l’avance, qui peuvent devoir être refaits lorsque les données, les tâches ou les besoins métier changent .
SMITH cherche à réduire cette dépendance. Le modèle apprend une procédure à partir de quelques exemples, la formalise comme un outil, puis doit prouver que cet outil fonctionne sur des problèmes plus difficiles et non vus pendant l’apprentissage. Appier indique que la phase de construction part de quatre exemples simples, puis que l’outil généré est testé sur seize nouvelles questions plus difficiles; seuls les outils qui réussissent sont conservés dans un réservoir partagé .
Cette logique est importante parce qu’elle transforme la création d’outils en pipeline de validation, et non en simple démonstration de génération de code. Le système ne récompense pas seulement la production d’une fonction plausible; il cherche à retenir les outils qui résistent à un test de généralisation.
Le terme “schema-grounded” est tout aussi essentiel. Pendant la phase d’utilisation, le modèle ne voit pas le code sous-jacent: il voit la description de l’outil et la spécification de ses paramètres . Si la description est ambiguë, si les paramètres sont mal conçus ou si l’outil échoue à l’exécution, l’échec devient un signal d’apprentissage . Autrement dit, l’agent doit apprendre à produire non seulement du code fonctionnel, mais une interface qu’un autre agent peut comprendre et appeler correctement.
Les résultats mis en avant
Appier affirme qu’un modèle d’environ 4 milliards de paramètres entraîné avec SMITH a surpassé les autres méthodes évaluées sur des tâches inédites de création d’outils, y compris une base de comparaison où un modèle d’environ 30 milliards de paramètres créait des outils à la volée . Economic Daily a également relevé ce point, en soulignant que la création efficace d’outils ne dépend pas nécessairement d’un modèle toujours plus grand .
Le gain d’efficacité annoncé est lui aussi notable. Selon Appier, SMITH fait passer la sortie moyenne de 3 206 tokens avec un raisonnement classique étape par étape à environ 100 tokens, car une partie du raisonnement répétitif est convertie en outil réutilisable . La publication chinoise d’Appier met en avant la même réduction, présentée comme un moyen de baisser le coût d’inférence tout en maintenant les performances de tâche .
La recherche avance aussi que les outils produits par un petit modèle entraîné peuvent être utilisés par des modèles de tailles différentes. Appier indique que des outils créés par le petit modèle restent utiles lorsqu’ils sont appelés par un modèle léger d’environ 350 millions de paramètres, et qu’ils peuvent aussi améliorer les performances de modèles plus grands . Pour les systèmes multi-agents, c’est un signal important: tous les agents d’un flux de travail n’ont pas besoin d’être les plus puissants ni les plus coûteux si des compétences validées peuvent circuler entre eux.
Du benchmark au flux métier
La lecture business est assez directe: Appier veut rendre l’IA agentique cumulative. Aujourd’hui, beaucoup de travail effectué par les agents est éphémère. Le modèle raisonne, produit une réponse, puis la méthode intermédiaire disparaît. SMITH propose un autre schéma: lorsqu’un raisonnement fonctionne, il peut être compressé en compétence exécutable, conservée, inspectée, réutilisée et améliorée.
Appier applique cette logique à des opérations d’entreprise comme la conversion d’indicateurs financiers, le traitement de données, l’interrogation de rapports, la vérification de règles ou le routage de cas de service client . Dans la publicité et le marketing, l’entreprise imagine des agents travaillant sur les données clients, la personnalisation, le service et l’achat média, capables de partager des outils vérifiés et des règles métier cohérentes . Cette orientation s’inscrit dans le positionnement d’Appier comme société d’IA native centrée sur l’AdTech et la MarTech, avec des solutions de publicité, de personnalisation et de données .
L’intérêt commercial est évident. Si un agent peut apprendre une procédure métier à partir de quelques exemples et la transformer en outil réutilisable, les équipes peuvent réduire une partie du travail répétitif d’intégration. Plutôt que de demander au modèle de refaire le même raisonnement à chaque cas similaire, le système appelle un outil déjà validé. En théorie, c’est plus rapide, moins cher et plus facile à surveiller.
Le vrai test: sécurité et gouvernance
Le risque est tout aussi évident: un outil auto-généré reste du logiciel. Il peut contenir des bugs, des hypothèses implicites, des paramètres ambigus ou des effets de bord dangereux. Appier reconnaît indirectement ces risques en insistant sur les descriptions d’outils, les spécifications de paramètres, les échecs d’exécution et la validation avant l’entrée dans la bibliothèque partagée . C’est un bon vocabulaire de recherche, mais le passage en production demandera beaucoup plus.
La question pour les entreprises n’est pas seulement de savoir si un agent peut écrire une fonction Python astucieuse. Il faut savoir si l’outil obtenu peut être limité par permissions, journalisé, relu, versionné et révoqué. Un outil qui transforme un tableau n’a pas le même niveau de risque qu’un outil qui modifie des données client, déclenche une campagne publicitaire, dépense un budget ou écrit dans un CRM. Dès que les outils générés deviennent une infrastructure réutilisable, ils doivent être gouvernés comme des intégrations écrites par des humains.
L’interprétabilité sera déterminante. La contrainte de SMITH, qui oblige le modèle utilisateur à s’appuyer sur la description et les paramètres plutôt que sur le code, peut encourager des interfaces plus claires . Mais une entreprise voudra aussi savoir ce que fait le code, d’où il vient, quels exemples l’ont inspiré, quels tests il a réussis, quel agent l’a modifié et quand il peut être supprimé. Sans cela, une bibliothèque d’outils risque de devenir un tiroir rempli de scripts fragiles.
Le signal de fond
L’acceptation à NeurIPS doit être lue comme un signal de recherche, pas comme l’annonce d’un produit d’entreprise finalisé. Mais elle arrive au bon endroit dans l’évolution des agents. Le goulot d’étranglement se déplace: la question n’est plus seulement “le modèle peut-il appeler un outil?”, mais “le système peut-il acquérir de nouvelles capacités sans multiplier les risques opérationnels?”
Si les résultats de SMITH se confirment hors des tâches contrôlées, les agents de prochaine génération ressembleront moins à des chatbots avec plug-ins qu’à des apprentis capables de transformer le travail répété en procédures partagées. Cela peut rendre les systèmes agentiques plus adaptables, notamment lorsque les processus sont mal documentés ou nouveaux. Cela obligera aussi les entreprises à encadrer la création d’outils elle-même: sandboxing, approbations humaines, analyse de dépendances, provenance, permissions granulaires et retour arrière.
Pour l’instant, Appier montre clairement la direction: les agents entrent en mode fabrication. La version utile n’est pas un agent qui écrit du code au hasard dès qu’il bloque. C’est un agent qui fabrique des outils, prouve qu’ils fonctionnent, explique comment les appeler, les partage avec prudence et élimine les mauvais. C’est là que l’autonomie devient commercialement intéressante, et que le menu des permissions devient le vrai produit.
Sources des dernières 72 heures
- [1]Appier Research Accepted at NeurIPS: AI Agents Learn Not Only to Use Tools, but to Build Their Own30 sept. 2026, 15:06
- [2]Appier Research Accepted at NeurIPS: AI Agents Learn Not Only to Use Tools, but to Build Their Own30 sept. 2026, 02:00
- [3]Appier SMITH 登 NeurIPS:AI Agent 能自主打造與優化工具29 sept. 2026, 11:54
- [4]Appierの研究論文がNeurIPSに採択AIエージェントはツールを「使う」だけでなく「自ら作る」段階へ30 sept. 2026, 05:43
Article généré par IA à partir d’une recherche web récente, puis conservé comme instantané éditorial daté.

Commentaires
Sois le premier à commenter.