Physical Artificial Intelligence newsPAI news
← Retour aux actualités
11 Septembre 2026Niveau : Essentiel

Pourquoi le toucher est-il la prochaine frontière de la robotique ?

💡 En 3 points clés
  • Pression : combien de force appliquer pour saisir un objet fragile sans l’écraser ?
  • Texture : une surface lisse ou rugueuse influence la façon dont les doigts doivent s’adapter.
  • Déformation : un matériau souple (comme une éponge) ou rigide (comme du métal) nécessite des stratégies de préhension différentes.

Le problème : des mains robotiques maladroites malgré des yeux perçants

Les robots modernes, équipés de modèles Vision-Language-Action (VLA), excellent dans des tâches comme plier du linge ou ranger une pièce à partir d’instructions en langage naturel. Pourtant, dès qu’il s’agit de manipulations fines — insérer une clé dans une serrure, visser une ampoule ou retourner un œuf — leurs performances chutent brutalement. La raison ? Ces modèles reposent presque exclusivement sur la vision, un sens qui ne suffit pas pour percevoir les forces en jeu, les micro-glissements ou les déformations locales des objets.

Comme le souligne Trevor Darrell, professeur à l’Université de Californie à Berkeley : « La plupart des manipulations dextres peuvent être réalisées par un humain les yeux fermés. Comprendre la force, le glissement ou la prise précise n’est pas quelque chose que les capteurs visuels traditionnels peuvent faire correctement. »

Le toucher : un sens sous-exploité, mais crucial

Le toucher apporte des informations que la vision ne peut pas capturer :

  • Pression : combien de force appliquer pour saisir un objet fragile sans l’écraser ?
  • Texture : une surface lisse ou rugueuse influence la façon dont les doigts doivent s’adapter.
  • Déformation : un matériau souple (comme une éponge) ou rigide (comme du métal) nécessite des stratégies de préhension différentes.
  • Glissement : détecter un début de glissement permet d’ajuster instantanément la prise.
  • Pourtant, intégrer le toucher dans les modèles robotiques pose trois défis majeurs :

    1. Le manque de données : Contrairement aux datasets visuels ou textuels, les datasets tactiles sont rares et souvent spécifiques à un type de capteur ou de main robotique.

    2. La fréquence des signaux : Les capteurs tactiles génèrent des données à haute fréquence (des centaines de Hz), bien plus rapide que les modèles VLA, conçus pour traiter des images à quelques dizaines de Hz.

    3. L’hétérogénéité des capteurs : Une main robotique avec des doigts articulés ne produit pas les mêmes données qu’un gripper simple, et les capteurs tactiles varient (résistifs, capacitifs, caméras tactiles, etc.).

    Trois approches pour donner un sens au toucher

    1. VLA-Touch : ajouter le toucher sans tout réentraîner

    Une équipe de chercheurs (dont Darrell) a développé VLA-Touch, une méthode qui enrichit les modèles VLA existants avec des données tactiles sans tout réentraîner. Leur approche repose sur deux innovations :

  • Un pipeline modulaire : Un modèle de langage visuel (VLM) génère des instructions de manipulation à partir d’une image de la scène et d’un objectif textuel. Un contrôleur basé sur la diffusion affine ensuite ces instructions en temps réel en utilisant les données tactiles.
  • Un feedback tactile sémantique : Un modèle pré-entraîné sur des données tactiles et linguistiques traduit les signaux bruts des capteurs en descriptions exploitables (ex : « trop de pression sur la gauche »).
  • Résultats : Dans des expériences en conditions réelles, VLA-Touch améliore de 42 % le taux de succès pour la planification de tâches et de 40 % pour l’exécution précise, par rapport à des modèles VLA classiques. Par exemple, pour des tâches comme verser un liquide ou transférer un œuf, le système ajuste sa prise en fonction des feedbacks tactiles, même dans des scénarios visuellement ambigus (comme un objet partiellement caché).

    2. T-Rex : un modèle unifié pour la manipulation réactive

    L’équipe de Darrell a également conçu T-Rex, un modèle qui combine un expert haut niveau (pour la planification) et un expert bas niveau (pour le contrôle tactile en temps réel).

  • Architecture : Le modèle utilise un Mixture-of-Transformers (MoT) avec un encodeur tactile VQ-VAE spatio-temporel pour compresser les signaux tactiles haute fréquence en représentations compactes.
  • Données : Un dataset de 100 heures de démonstrations téléopérées, couvrant 200 objets du quotidien et 22 primitives motrices (saisir, tourner, essuyer, etc.).
  • Performance : Sur 12 tâches de manipulation contact-rich (comme visser une ampoule ou appliquer du dentifrice sur une brosse à dents), T-Rex atteint un taux de succès moyen de 65 %, soit près du double des meilleurs modèles VLA existants.
  • Clé du succès : La séparation des fréquences. L’expert haut niveau fonctionne à basse fréquence (pour la planification), tandis que l’expert tactile opère à 4 fois la vitesse, permettant des corrections en temps réel.

    3. HapTile et les datasets multi-capteurs

    Pour contourner le problème de l’hétérogénéité des capteurs, des chercheurs comme Chengbo Yuan (Tsinghua University) ont travaillé sur des datasets unifiés :

  • HapTile : Un dataset de manipulation visuotactile qui combine des données tactiles (capteurs au bout des doigts) et visuelles, avec des annotations pour les interactions physiques (ex : « contact détecté à la position X avec une force Y »).
  • Approche hardware-agnostique : Yuan a conçu un modèle capable de traiter des données tactiles issues de 21 types de capteurs différents, en les convertissant dans un format commun inspiré de la main humaine. Résultat : le modèle généralise mieux, même sur des robots qu’il n’a jamais vus lors de l’entraînement.
  • Performance : Sur des tâches comme retourner une carte ou saisir un objet fragile, le modèle atteint un taux de succès supérieur de 30 % à un baseline classique.

    Et demain ? Vers des robots qui « sentent » comme des humains

    Les avancées récentes montrent que le toucher est la prochaine étape logique pour la robotique physique. Plusieurs pistes sont explorées pour accélérer les progrès :

  • L’échelle des données : Des projets comme celui de Fudan University et son spin-off NeoteAI ont déjà collecté 30 000 heures de démonstrations synchronisées (vision + toucher), soit 10 fois plus que les datasets précédents. Leur modèle, entraîné sur ces données, améliore significativement les performances sur des tâches comme le vissage ou le pliage de vêtements.
  • L’inférence tactile à partir de la vision : Des chercheurs de l’Université de Californie du Sud ont développé un modèle capable de prédire les feedbacks tactiles à partir d’images. Par exemple, en observant une pince serrer un objet, le modèle peut estimer la pression exercée. Cette approche permet d’ajouter une « pseudo-sensation tactile » à des robots sans capteurs dédiés.
  • L’amplification des signaux inattendus : Long Cheng (Académie chinoise des sciences) propose une méthode où le modèle compare les prédictions tactiles (basées sur la vision) aux données réelles des capteurs. Les écarts sont amplifiés, permettant de détecter des anomalies (comme un glissement) et d’agir en conséquence. Sur 5 tâches contact-rich, cette approche atteint 62,8 % de succès, contre 28,2 % sans cette technique.
  • Les limites et les défis restants

    Malgré ces progrès, plusieurs obstacles persistent :

    1. La généralisation : Les modèles actuels restent souvent spécifiques à un type de main robotique ou de capteur. Les datasets multi-embodiments (comme ceux inspirés d’Open X-Embodiment) sont une piste, mais leur collecte reste coûteuse.

    2. L’interprétation des données tactiles : Contrairement aux pixels, les signaux tactiles sont sparse et intermittents. Les modèles ont tendance à les ignorer si ils ne sont pas explicitement intégrés dans l’architecture.

    3. Le coût de la collecte : Collecter 100 heures de démonstrations téléopérées prend des mois. Certains chercheurs estiment qu’il faudrait 100 000 heures de données variées (en conditions réelles, pas seulement en labo) pour débloquer des capacités véritablement dextres.

    En résumé : le toucher comme accélérateur de dexterité

    Les robots ne manquent plus de « vue » ou de « langage » — ils manquent de sensation. Les travaux récents prouvent que l’intégration du toucher, même partielle, peut :

  • Doubler les taux de succès sur des tâches de manipulation fine.
  • Réduire la dépendance aux données visuelles en complétant les informations manquantes.
  • Ouvrir la voie à des robots capables d’interagir avec des matériaux complexes (tissus, aliments mous, objets fragiles).
  • Comme le résume Shunlin Lu (CTO de NeoteAI) : « L’accès à des datasets tactiles larges et diversifiés améliore significativement les performances. Je pense que l’intelligence tactile est réellement la prochaine étape pour l’IA physique. »

    Hype-mètre : 4/5

    Les avancées sont tangibles (prototypes fonctionnels, améliorations mesurables), mais le passage à l’échelle industrielle dépendra de la capacité à standardiser les données et à réduire les coûts de collecte. Les premiers déploiements commerciaux (en logistique ou santé) pourraient émerger d’ici 2 à 3 ans.

    IEEE Spectrum

    Centre Robotics

    IEEE Xplore (VLA-Touch)

    arXiv (HapTile)

    arXiv (T-Rex)