Tech • IA • Robotique • Jeu

VIDÉO
ENFR

Article complet — noté 10/10

PAC-MAN : contrôle perceptif pour des humanoïdes sûrs au dodgeball

PAC-MAN passe du statut de prépublication spectaculaire à celui de sujet discuté dans la communauté robotique : pendant la semaine d’IROS 2026 à Pittsburgh, le travail du laboratoire AMBER de Caltech a été présenté comme un cadre de sûreté pour un humanoïde Unitree G1 capable d’éviter des balles avec sa perception embarquée, des fonctions barrières de contrôle et de l’apprentissage par renforcement.

Se connecter pour suivre
Généré le 30 septembre 2026 à 06:071960 motsSource originale — ArXiv - Artificial Intelligence

Une démonstration de dodgeball, mais surtout une question de sûreté

La partie visible de PAC-MAN est simple: un robot humanoïde voit une balle arriver et l’esquive. La partie importante est plus technique, et c’est elle qui explique pourquoi le projet circule cette semaine dans les discussions liées à IROS 2026. PAC-MAN n’est pas seulement une démonstration amusante; c’est une tentative de faire dépendre les réflexes rapides d’un humanoïde de la perception imparfaite dont dispose réellement un robot déployé .

Lors de la Robotics Research Night organisée à Pittsburgh le lundi 28 septembre, PAC-MAN figurait au programme comme une présentation éclair de Lizhi « Gary » Yang, de Caltech. Le projet y était décrit comme une combinaison de perception embarquée, d’apprentissage par renforcement et de fonctions barrières de contrôle destinée à apprendre à un humanoïde à éviter des objets entrants tout en gardant l’équilibre . Cette formulation est essentielle, car beaucoup de contrôleurs humanoïdes paraissent très performants en simulation ou avec des informations privilégiées. PAC-MAN défend une proposition plus précise: apprendre l’évitement à partir d’une représentation de profondeur compacte, masquée par segmentation, fournie par une caméra RGB-D montée sur la tête du robot .

Les discussions publiques récentes mettent aussi en avant le résultat matériel annoncé: un Unitree G1 aurait évité 19 lancers manuels sur 20, soit 95 %, sans chute, dans un déploiement zero-shot depuis la simulation . Autrement dit, la politique n’aurait pas été ajustée sur le robot physique avant cette série d’essais. La nuance est majeure. Si un robot ne réussit qu’après de nombreuses corrections dans le monde réel, la méthode reste liée à un laboratoire particulier. Si elle se transfère directement, elle devient un schéma de contrôle potentiellement réutilisable.

Les briques de PAC-MAN

Le cadre réunit trois éléments souvent étudiés séparément: l’apprentissage par renforcement, les fonctions barrières de contrôle et la perception. L’apprentissage par renforcement fournit la politique qui transforme la proprioception du robot et les observations visuelles dérivées de la profondeur en mouvements d’évitement. Les fonctions barrières de contrôle, ou CBF, apportent la structure de sûreté: elles encodent des marges entre la balle entrante et les segments du corps du robot, au lieu de récompenser seulement l’éloignement du torse ou du bassin .

Cette différence entre sûreté du torse et sûreté du corps entier est au cœur du sujet. Un humanoïde peut « esquiver » avec son bassin tout en laissant une main, un coude, un tibia ou une épaule être touché. Les descriptions publiques de PAC-MAN insistent sur le fait que la méthode protège chaque lien corporel, et pas seulement le centre de masse ou le pelvis . Ce choix rend la tâche plus réaliste et plus difficile, car le contrôleur doit raisonner sur tout un corps articulé sous contrainte de temps.

La troisième brique est la perception. Le robot déployé ne reçoit pas l’état exact de la balle sous forme de variable privilégiée. Il s’appuie sur l’information de profondeur d’une caméra RGB-D portée sur la tête, après qu’un modèle de segmentation a isolé la balle et compressé l’observation en une petite image de profondeur ne contenant que la balle . Un résumé technique récent décrit cette représentation comme un flux de profondeur ZED segmenté par EfficientTAM et ramené à une grille de 16 par 9 . L’intérêt n’est pas la richesse visuelle de cette résolution. L’intérêt est qu’une représentation minuscule mais ciblée peut suffire si l’entraînement aligne dès le départ perception et contrôle.

Pourquoi les fonctions barrières comptent

Les CBF sont un outil classique du contrôle critique pour la sûreté: elles définissent une frontière autour des états dangereux. Dans l’usage le plus courant, elles servent de filtre de sûreté à l’exécution. Le contrôleur appris propose une action, puis un superviseur mathématique la modifie si elle risque de violer une contrainte. PAC-MAN utilise cette idée autrement dans sa version déployable. Les résumés publics de cette semaine décrivent la version matérielle principale comme utilisant l’information CBF pour façonner la récompense pendant l’entraînement, et non comme un filtre actif en ligne pendant le déploiement .

Ce déplacement est subtil, mais important. Un filtre d’exécution peut offrir une garantie plus forte, mais il exige une estimation assez précise de l’état au moment de l’action. Dans une tâche de dodgeball, la perception de la balle est partielle, retardée et parfois occultée. Si le filtre dépend de la position et de la vitesse exactes de la balle, il peut être utile comme plafond de performance en simulation, mais pas comme système embarqué réaliste. Les discussions actuelles autour de PAC-MAN soulignent précisément que la limite principale n’est pas seulement la théorie du contrôle, mais la perception disponible .

PAC-MAN distingue donc une stratégie légère et déployable, appelée Link-CBF, et une stratégie plus forte, appelée Joint-CBF. La version Link-CBF utilise une barrière de dégagement pour chaque lien du corps et place cette information dans la récompense d’entraînement; elle apprend ainsi à la politique à éviter les contacts sans exiger d’application en ligne de la contrainte . La version Joint-CBF peut imposer une contrainte plus forte dans l’espace articulaire, mais les résumés publics indiquent qu’elle dépend de l’état privilégié de la balle et sert donc surtout de référence ou de borne supérieure en simulation .

Le développement récent pendant la semaine IROS

Le développement frais n’est pas une nouvelle version de l’article scientifique; c’est l’entrée du sujet dans une discussion communautaire en direct autour d’IROS 2026. La page de la Robotics Research Night de Pittsburgh liste PAC-MAN comme deuxième présentation éclair et le présente comme un travail sur les réactions rapides du corps entier, où perception et sûreté doivent être conçues ensemble . La même page rappelle le problème général: les politiques apprises par renforcement peuvent être impressionnantes, mais devenir dangereuses face aux perturbations ou aux observations imparfaites .

Un message LinkedIn de Junfan Zhu, l’un des hôtes de l’événement, a également annoncé la session du 28 septembre en présentant PAC-MAN comme une combinaison d’apprentissage par renforcement perceptif et de fonctions barrières de contrôle pour la sûreté des humanoïdes . Le message reprenait le résultat matériel central: Unitree G1, 19 esquives réussies sur 20 et zéro chute dans des expériences réelles . Cette répétition entre la page de l’événement et les annonces sociales est instructive: la communauté robotique ne retient pas seulement qu’un humanoïde a évité une balle, mais qu’il l’a fait avec perception embarquée et sans chute.

Un autre message technique, publié par Léo Morillon, a expliqué le résultat à un public robotique plus large en définissant les notions de CBF, de filtre de sûreté à l’exécution, de façonnage de récompense, d’état privilégié et de transfert zero-shot de la simulation vers le réel . Ce commentaire met très clairement en lumière le compromis révélé par PAC-MAN: les outils de sûreté formelle deviennent beaucoup plus difficiles à déployer lorsque leurs hypothèses sur l’information d’état ne correspondent pas aux capteurs réels du robot .

Une sûreté consciente de la perception

L’idée la plus intéressante de PAC-MAN est que la sûreté et la perception ne peuvent pas être simplement assemblées à la fin. Un robot entraîné avec les coordonnées parfaites de la balle, puis déployé avec une caméra bruitée, risque d’apprendre une politique qui dépend d’informations absentes dans le monde réel. À l’inverse, un robot entraîné dès le début avec une profondeur masquée par segmentation peut apprendre ce qui est observable avec cette représentation, et ce qui ne l’est pas.

La description de l’événement indique que PAC-MAN utilise un modèle de segmentation pour isoler la balle dans l’image de profondeur, créant une représentation compacte proche de celle de l’entraînement . Ce choix vise à réduire l’écart simulation-réel: le contrôleur n’a pas besoin d’interpréter une scène visuelle complète et confuse si la pile de perception lui fournit le canal d’objet pertinent pour la tâche. Cela explique aussi l’esprit du nom PAC-MAN. Le système n’est pas une vision générale du monde; il se concentre sur la menace immédiate.

La tâche n’en devient pas simple pour autant. Une balle peut sortir du champ de la caméra. Le propre mouvement de l’humanoïde modifie la vue. La bonne esquive peut demander de s’accroupir, de se pencher, de faire un pas latéral ou de sauter sans tomber. Les descriptions publiques indiquent que le cadre utilise aussi un a priori de mouvement humain adversarial, destiné à encourager des gestes naturels d’évitement comme se baisser, se décaler, se pencher ou bondir . Cet a priori ne remplace pas l’objectif de sûreté; il régularise la manière dont le robot bouge pour accomplir la tâche.

Ce que prouve, et ne prouve pas, le chiffre de 95 %

Le chiffre de 19 sur 20 est impressionnant, surtout parce qu’il est rapporté sur matériel réel, avec perception embarquée et sans ajustement de la politique . Il faut toutefois le lire avec prudence. Il ne prouve pas que les humanoïdes sont désormais sûrs face à n’importe quel objet rapide dans n’importe quel environnement. Il montre que, dans la configuration de dodgeball rapportée, la combinaison d’une profondeur masquée par segmentation, d’un apprentissage par renforcement façonné par CBF et d’une régularisation par mouvements humains peut être transférée à un Unitree G1 assez bien pour éviter la plupart des balles lancées à la main sans tomber .

C’est un résultat plus étroit, mais significatif. La robotique progresse lorsque des démonstrations ciblées révèlent une structure réutilisable. Ici, cette structure est le couplage explicite entre ce que le robot peut percevoir et ce que le mécanisme de sûreté suppose. La comparaison entre le Link-CBF déployable, utilisé comme signal de récompense, et le Joint-CBF plus fort mais moins déployable, est précieuse parce qu’elle ne masque pas la différence entre la connaissance disponible en simulation et la perception embarquée .

Elle suggère aussi une règle pratique pour les systèmes d’apprentissage humanoïde: les termes de sûreté doivent être évalués non seulement selon leur puissance mathématique, mais selon la disponibilité réelle des informations qu’ils exigent au déploiement. Une contrainte élégante qui nécessite la vitesse exacte d’un objet peut être un plafond de référence, pas une fonction produit. Un signal d’entraînement plus souple, compatible avec les observations dérivées d’une caméra, peut être moins formel mais plus utile.

Pourquoi cela dépasse le dodgeball

Le dodgeball est une tâche de laboratoire, mais le problème sous-jacent concerne toute la robotique humanoïde. Les robots de service, d’entrepôt ou domestiques rencontreront des personnes en mouvement, des outils, des portes, des animaux et des objets inattendus. Un humanoïde capable de réagir avec tout son corps tout en gardant l’équilibre aborde un problème de sûreté différent de celui d’un robot à roues qui s’arrête simplement.

La page de l’événement du 28 septembre place PAC-MAN dans un contexte plus large de Physical AI, avec des discussions sur la manipulation, le transfert simulation-réel, l’apprentissage robotique et les modèles incarnés . Ce contexte compte: le domaine se demande de plus en plus si des comportements appris et impressionnants peuvent rester fiables lorsque la perception est imparfaite et que le monde bouge vite. La réponse de PAC-MAN n’est pas d’abandonner l’apprentissage, mais de lui donner une structure de sûreté compatible avec la réalité sensorielle du robot.

Pour l’instant, PAC-MAN doit être compris comme un résultat de recherche ciblé: un cadre CBF-RL conscient de la perception pour le dodgeball humanoïde, démontré sur Unitree G1 et mis en avant dans les discussions robotiques de la semaine IROS. Sa signification plus large tient à la leçon derrière l’esquive: le contrôle sûr des humanoïdes ne peut pas être séparé de ce que le robot peut réellement voir.

Sources des dernières 72 heures

  1. [1]🍾 IROS 2026 x Saturday Robotics x FAIR Plus — Robotics Research Night | Reading Club 31. Pittsburgh 9/2828 sept. 2026, 23:30
  2. [2]Léo Morillon - NEW RESEARCH: Humanoids are getting really good at dodgeball!29 sept. 2026, 18:00
  3. [3]Junfan Zhu - #iros2026 #robotics #physicalai #robotlearning #worldmodels #humanoidrobotics #vla #embodiedai #robotfoundationmodels29 sept. 2026, 02:00

Article généré par IA à partir d’une recherche web récente, puis conservé comme instantané éditorial daté.