Physical Artificial Intelligence newsPAI news
← Retour aux actualités
19 Septembre 2026Niveau : Essentiel

DITTO : quand l’exosquelette et la main robotique ne font qu’un pour maîtriser la téléopération bimanuelle

📑 Sommaire
💡 En 3 points clés
  • La téléopération classique : l’opérateur contrôle le robot via un exosquelette ou un gant, ce qui garantit une cohérence parfaite entre les commandes envoyées et les mouvements exécutés. Mais le retour d’effort est souvent absent ou limité, ce qui empêche l’opérateur de sentir les interactions fines avec l’environnement.
  • Les systèmes portables (in-the-wild) : des capteurs embarqués sur une main robotique portable capturent les mouvements naturels de l’opérateur, offrant une transparence des forces réaliste. En revanche, lors du déploiement, le robot ne reproduit pas fidèlement les mouvements capturés, car l’embodiment diffère entre la phase de collecte et celle d’exécution.
  • Collecte de données en conditions réelles : L’opérateur porte l’exosquelette et manipule directement la main robotique portable, capturant des mouvements naturels avec un retour d’effort transparent.

Le problème classique de la téléopération dexterous

Pour entraîner une main robotique à manipuler des objets avec précision, il faut des démonstrations riches en contacts. Deux approches dominent aujourd’hui :

  • La téléopération classique : l’opérateur contrôle le robot via un exosquelette ou un gant, ce qui garantit une cohérence parfaite entre les commandes envoyées et les mouvements exécutés. Mais le retour d’effort est souvent absent ou limité, ce qui empêche l’opérateur de sentir les interactions fines avec l’environnement.
  • Les systèmes portables (in-the-wild) : des capteurs embarqués sur une main robotique portable capturent les mouvements naturels de l’opérateur, offrant une transparence des forces réaliste. En revanche, lors du déploiement, le robot ne reproduit pas fidèlement les mouvements capturés, car l’embodiment diffère entre la phase de collecte et celle d’exécution.
  • Ce compromis entre cohérence des commandes et transparence des forces limite la qualité des démonstrations et, par ricochet, la performance des politiques d’apprentissage.

    DITTO : une architecture unifiée pour capturer et restituer

    DITTO résout ce dilemme en co-concevant un exosquelette motorisé et une main robotique à 7 degrés de liberté (DoF) de manière anatomiquement informée. L’idée centrale est simple : faire en sorte que l’exosquelette et la main robotique partagent la même cinématique, avec une mapping 1:1 des actionneurs entre les deux.

    Comment ça marche ?

    1. Conception anatomique : L’exosquelette épouse la géométrie de la main humaine, tandis que la main robotique est conçue pour reproduire cette cinématique. Les deux systèmes partagent les mêmes 17 coordonnées articulaires, incluant les articulations MCP, PIP, DIP pour les doigts et CMC, MCP, IP pour le pouce.

    2. Double usage :

  • Collecte de données en conditions réelles : L’opérateur porte l’exosquelette et manipule directement la main robotique portable, capturant des mouvements naturels avec un retour d’effort transparent.
  • Téléopération bilatérale : En phase de déploiement, l’exosquelette sert à contrôler la main robotique, cette fois fixée sur un bras robotique. Le retour d’effort est restitué à l’opérateur via l’exosquelette, lui permettant de sentir les contacts avec une précision articulaire.
  • 3. Transparence des forces : Grâce au mapping 1:1, les efforts mesurés au niveau des articulations de la main robotique sont directement retransmis à l’exosquelette. L’opérateur perçoit ainsi les interactions fines, comme la pression exercée sur un objet ou la résistance d’une surface.

    Résultats : des politiques d’apprentissage pour des tâches complexes

    Les auteurs démontrent les capacités de DITTO sur des tâches de manipulation riches en contacts, comme l’assemblage de pièces ou la manipulation d’objets fragiles. Les politiques d’apprentissage, entraînées sur les démonstrations capturées avec DITTO, atteignent des taux de succès élevés sur des benchmarks standards.

    Points clés des expérimentations :

  • Espace de travail : L’exosquelette couvre naturellement l’espace de mouvement entre l’index et le pouce, essentiel pour les tâches de préhension fine.
  • Généralisation : Les politiques entraînées sur DITTO généralisent à des poses initiales non vues lors de l’entraînement, grâce à la qualité des démonstrations capturées.
  • Robustesse : Le système gère des tâches multi-contacts, comme le soulèvement d’un objet avec plusieurs doigts ou le glissement contrôlé d’une pièce sur une surface.
  • Pourquoi c’est une avancée ?

    DITTO élimine le fossé entre collecte et déploiement en unifiant les deux phases dans une même architecture. Contrairement aux approches existantes, il n’y a plus besoin de retargeting ou de calibration complexe pour adapter les démonstrations à l’embodiment final. La cohérence des données et la transparence des forces sont garanties dès la phase de collecte, ce qui améliore directement la qualité des politiques d’apprentissage.

    Perspectives : vers des mains robotiques plus autonomes

    Cette approche ouvre la voie à des systèmes de téléopération où l’opérateur peut sentir et agir avec la même précision que s’il manipulait l’objet directement. À terme, cela pourrait réduire le besoin en démonstrations humaines coûteuses, en permettant aux robots d’apprendre des tâches complexes à partir de données capturées de manière plus naturelle et intuitive.

    Note : Les travaux sur DITTO s’inscrivent dans une tendance récente où les interfaces de téléopération intègrent de plus en plus de capteurs tactiles et de retours d’effort pour améliorer la fidélité des démonstrations. Plusieurs projets similaires, comme [RealDexUMI](https://arxiv.org/html/2606.06033) ou [SEED-UMI](https://arxiv.org/abs/2609.11753), explorent des solutions comparables, mais DITTO se distingue par son approche unifiée et son mapping 1:1 entre exosquelette et main robotique.