Physical Artificial Intelligence newsPAI news
← Retour aux actualités
17 Septembre 2026Niveau : Essentiel

ActiveScale : quand les robots apprennent à bouger la tête avant de saisir

📑 Sommaire
💡 En 3 points clés
  • Des jetons de pose par image : chaque frame vidéo est annotée avec la position et l’orientation de la caméra, permettant au modèle de reconstruire une représentation cohérente de la scène malgré les changements de viewpoint.
  • Un module de prédiction de pose léger : ce composant associe les observations successives pour maintenir une compréhension stable de l’environnement, même quand la caméra se déplace.
  • Des vidéos egocentriques humaines (comme celles du projet Ego4D), où les humains ajustent leur regard avant de manipuler un objet.

Un problème de taille : les limites des caméras fixes

En robotique manipulatrice, les systèmes actuels s’appuient souvent sur des caméras fixes ou montées sur le poignet du robot. Si l’objet à saisir est partiellement caché ou situé en dehors du champ de vision, le robot échoue : il ne peut ni percevoir l’information manquante, ni adapter son action en conséquence. C’est un problème récurrent dans les environnements encombrés, où les occlusions sont fréquentes.

Les modèles Vision-Language-Action (VLA) — ces architectures qui unifient vision, langage et contrôle moteur — ne résolvent pas ce problème par défaut. Ils excellent pour interpréter une commande comme « prends la pomme sur la table », mais leur performance chute dès que la scène devient partiellement observable. La solution ? Leur donner la capacité de bouger activement leur point de vue avant d’agir.

ActiveScale : un cadre pour la perception active

Une équipe de recherche propose ActiveScale, un framework qui intègre trois innovations clés pour rendre les robots capables de perception active :

1. Un modèle VLA enrichi

Le système ajoute au modèle VLA classique deux mécanismes :

  • Des jetons de pose par image : chaque frame vidéo est annotée avec la position et l’orientation de la caméra, permettant au modèle de reconstruire une représentation cohérente de la scène malgré les changements de viewpoint.
  • Un module de prédiction de pose léger : ce composant associe les observations successives pour maintenir une compréhension stable de l’environnement, même quand la caméra se déplace.
  • 2. Un entraînement à grande échelle sur données humaines et robotiques

    Pour apprendre à gérer les mouvements naturels de caméra, les chercheurs ont utilisé 1 000 heures de données issues de deux sources :

  • Des vidéos egocentriques humaines (comme celles du projet Ego4D), où les humains ajustent leur regard avant de manipuler un objet.
  • Des démonstrations robotiques collectées via une nouvelle plateforme, l’AMP (Active-perception Mobile-manipulation Platform).
  • Ce mélange permet au modèle de s’adapter aux mouvements de caméra tout en conservant sa capacité à interpréter les commandes en langage naturel.

    3. Une plateforme robotique dédiée

    L’AMP est conçue pour supporter à la fois la perception active et la manipulation mobile. Elle permet de collecter des démonstrations où l’opérateur télécommande le robot pour coordonner les mouvements de la caméra et du bras, ce qui est crucial pour entraîner le modèle à gérer des tâches complexes.

    Des résultats concrets : moins d’échecs, plus de précision

    Les expériences menées avec ActiveScale montrent une amélioration significative des taux de réussite sur des tâches de manipulation active, notamment dans trois scénarios critiques :

  • Objets partiellement masqués : Le robot ajuste son point de vue pour révéler l’objet caché, augmentant le taux de succès de 20 à 30 points par rapport à une caméra fixe.
  • Objets hors champ : En combinant un mouvement de caméra et une rotation du poignet, le robot parvient à localiser et saisir des objets initialement invisibles, avec un gain de performance de plus de 60 % sur les tâches de type pick-and-place en environnement encombré.
  • Les ablations réalisées confirment l’importance de deux éléments :

  • La supervision explicite de la pose de la caméra : Sans cette information, le modèle peine à associer les observations entre elles.
  • L’entraînement sur données egocentriques humaines : Les mouvements naturels de tête et de regard des humains fournissent une base riche pour apprendre des stratégies de perception active.
  • Au-delà d’ActiveScale : d’autres approches explorent la même voie

    ActiveScale n’est pas la seule initiative à s’attaquer à la perception active. Plusieurs travaux récents proposent des solutions complémentaires :

  • SaPaVe : Ce framework introduit une stratégie d’apprentissage en deux étapes pour séparer l’apprentissage des mouvements de caméra de celui des actions de manipulation. Résultat : une meilleure généralisation, même avec des données limitées. Les benchmarks montrent un taux de réussite moyen de 74,83 % sur des tâches variées, contre 52,33 % pour une caméra fixe + poignet.
  • ActiveVLA : Cette méthode utilise une compréhension 3D de la scène pour synthétiser dynamiquement des points de vue optimaux. En projetant les entrées 3D sur des vues 2D multiples, le modèle identifie les régions critiques et ajuste la résolution pour affiner la perception. Les tests en simulation et en conditions réelles démontrent une précision accrue pour les tâches de manipulation fine.
  • CoMe-VLA : Ce modèle intègre une mémoire cognitive pour retenir les stratégies de perception active apprises lors d’expériences passées, réduisant ainsi le besoin de réexplorer des scènes déjà rencontrées.
  • Ce que cela change pour la robotique industrielle

    La perception active n’est pas qu’un sujet académique. Dans l’industrie, où les environnements sont souvent encombrés et les objets variés, cette capacité pourrait réduire les temps d’arrêt liés aux échecs de manipulation. Les robots équipés de caméras mobiles pourraient :

  • S’adapter à des configurations de pièces changeantes sans nécessiter de reprogrammation.
  • Réduire les coûts de maintenance en évitant les collisions dues à des erreurs de perception.
  • Améliorer la sécurité en limitant les interactions avec des objets mal perçus.
  • Prochaines étapes : vers la manipulation mobile

    Les auteurs d’ActiveScale soulignent que leur travail ouvre la voie à des systèmes encore plus avancés, où la perception active ne se limite pas au mouvement de la caméra, mais inclut aussi la navigation du robot. L’objectif ? Créer des agents capables de se déplacer, d’ajuster leur point de vue et de manipuler des objets dans des environnements dynamiques, comme un humain le ferait.

    En résumé

    ActiveScale et ses équivalents (SaPaVe, ActiveVLA, CoMe-VLA) marquent une étape importante pour les modèles VLA. En leur donnant la capacité de bouger activement leur point de vue, ces travaux permettent aux robots de mieux gérer les occlusions et les objets hors champ, deux problèmes majeurs en manipulation robotique. Les gains de performance sont mesurables, et les plateformes comme l’AMP fournissent une base solide pour collecter des données et entraîner ces systèmes.

    arxiv.org/abs/2609.18514

    arxiv.org/html/2603.12193

    openaccess.thecvf.com/content/CVPR2026/papers/Liu_ActiveVLA_Injecting_Active_Perception_into_Vision-Language-Action_Models_for_Precise_3D_CVPR_2026_paper.pdf

    lefilrobotique.fr/article/5502857-acte-ressent-agit-l-apprentissage-de-la-perception-active-a-partir-de-donnees-egocentriques-humaines-a-grande-echelle