Physical Artificial Intelligence newsPAI news
← Retour aux actualités
21 Septembre 2026Niveau : Essentiel

GaussianFactory : un moteur de données 3D pour entraîner des robots en un seul scan

📑 Sommaire
💡 En 3 points clés
  • Exemple concret : Si le scan montre une table avec une tasse et une assiette, le modèle 3DGS capture non seulement leur apparence visuelle, mais aussi leur volume 3D et leur position relative. Cette information est cruciale pour éviter les collisions lors de la planification de trajectoires.
  • Détail technique : La planification repose sur des contraintes de clarté minimale (minimum clearance) dérivées du champ de densité des gaussiens, garantissant que le robot ne touche pas les objets de manière accidentelle. Cette approche évite d’avoir à modéliser explicitement les forces de contact pendant cette phase.
  • Où entrent les dynamiques physiques ?

Un seul scan pour des milliers de démonstrations

Pour qu’un robot apprenne à manipuler des objets dans un environnement donné, il lui faut des démonstrations : des séquences de mouvements filmées où un opérateur humain montre comment saisir, déplacer ou lâcher un objet. Problème : collecter ces données est long, coûteux, et difficile à généraliser à des configurations légèrement différentes. Les méthodes existantes tentent de contourner ce goulot d’étranglement en utilisant des simulateurs physiques ou en augmentant artificiellement des images 2D, mais ces approches peinent à reproduire la fidélité visuelle et la diversité des scènes réelles.

GaussianFactory, développé par une équipe de recherche, propose une solution radicalement différente : un moteur de données qui génère des démonstrations synthétiques à partir d’un seul scan vidéo de la scène cible. Pas de simulateur, pas de collecte manuelle supplémentaire. Juste un scan 3DGS (3D Gaussian Splatting) et un algorithme qui exploite cette reconstruction pour planifier des trajectoires et des prises, avant de les rendre sous forme de vidéos photorealistes.

Comment ça marche ?

Le pipeline repose sur trois étapes clés, illustrées dans la Figure 1 du papier :

1. Reconstruction 3DGS de la scène

Le scan vidéo initial est transformé en un modèle 3DGS, une représentation où la scène est décrite par des millions de micro-gaussiens paramétrés par leur position, leur forme, leur opacité et leur apparence. Contrairement aux nuages de points ou aux maillages classiques, ce modèle permet un rendu photorealiste en temps réel depuis n’importe quel angle de vue, tout en offrant une représentation géométrique explicite exploitable par des algorithmes de planification.

Exemple concret : Si le scan montre une table avec une tasse et une assiette, le modèle 3DGS capture non seulement leur apparence visuelle, mais aussi leur volume 3D et leur position relative. Cette information est cruciale pour éviter les collisions lors de la planification de trajectoires.

2. Planification kinématique des tâches

GaussianFactory utilise cette reconstruction 3D pour simuler des tâches de manipulation (saisir la tasse, pousser l’assiette, etc.) en planifiant des trajectoires purement géométriques. L’algorithme échantillonne des combinaisons d’objets réalisables dans la scène (par exemple, "saisir la tasse posée sur l’assiette") et calcule les trajectoires de l’effecteur final (pince, pinceau, etc.) en évitant les obstacles.

Détail technique : La planification repose sur des contraintes de clarté minimale (minimum clearance) dérivées du champ de densité des gaussiens, garantissant que le robot ne touche pas les objets de manière accidentelle. Cette approche évite d’avoir à modéliser explicitement les forces de contact pendant cette phase.

3. Rendu photorealiste et intégration des dynamiques physiques

Une fois les trajectoires calculées, GaussianFactory les rend sous forme de vidéos en utilisant le modèle 3DGS. Ces vidéos servent de démonstrations pour entraîner un policy visuomotor (un modèle de contrôle qui prend en entrée des images et produit des commandes motrices).

Où entrent les dynamiques physiques ?

Seule la formation de la prise (comment le robot saisit l’objet) est modélisée via un modèle de contact appris (prétraîné sur un jeu de données d’interactions). Le reste de la trajectoire reste purement kinématique, ce qui simplifie considérablement le pipeline.

Résultats : 95 % de succès en simulation, 84 % sur robot réel

Pour valider leur approche, les auteurs ont testé GaussianFactory dans deux environnements :

  • En simulation : Un jumeau numérique d’un poste de travail industriel, où un robot UR10e doit manipuler des objets sur une table. Un diffusion policy (modèle de contrôle basé sur des diffusions) entraîné uniquement sur les démonstrations synthétiques de GaussianFactory atteint un taux de succès de 95,1 %.
  • En conditions réelles : Sur un vrai robot UR10e, dans un environnement similaire, le même modèle atteint 84,2 % de succès, avec des objets jamais vus pendant l’entraînement. Ces performances rivalisent avec des politiques entraînées sur des centaines de démonstrations réelles, tout en évitant la collecte fastidieuse de données.
  • Pourquoi c’est une avancée ?

    Les méthodes traditionnelles de génération de démonstrations synthétiques souffrent de plusieurs limites :

    LimiteApproche classiqueGaussianFactory
    Fidélité visuelleRendu 2D ou simulateur physique peu réalisteModèle 3DGS photorealiste en temps réel
    Diversité des scènesAugmentation 2D limitée ou dépendante du simulateurÉchantillonnage de combinaisons d’objets réalistes dans la scène 3D
    Coût de calculNécessite un simulateur physique lourdPlanification purement géométrique, puis rendu 3DGS
    GénéralisationDonnées limitées aux configurations du simulateurAdapté à des scènes réelles scannées

    Cas d’usage concret : Dans un entrepôt où les étagères et les colis changent quotidiennement, GaussianFactory permettrait de recanner la scène une fois par jour et de générer des démonstrations adaptées à cette configuration spécifique, sans avoir à réentraîner le robot à partir de zéro.

    Limites et perspectives

    Malgré ses performances, GaussianFactory présente encore des défis :

  • Scènes dynamiques : Le modèle 3DGS suppose une scène statique. Des objets en mouvement (comme un convoyeur) nécessiteraient une extension du pipeline.
  • Tâches complexes : Les tâches nécessitant un contrôle fin des forces (par exemple, visser une vis) ne sont pas encore prises en charge, car le modèle de contact actuel est limité.
  • Généralisation hors distribution : Les performances chutent si les objets ou l’éclairage diffèrent trop de ceux du scan initial.
  • Les auteurs suggèrent plusieurs pistes pour améliorer leur méthode :

  • Intégrer des modèles de contact plus sophistiqués pour gérer les tâches dynamiques.
  • Étendre le pipeline à des scènes partiellement dynamiques (par exemple, des objets mobiles mais prévisibles).
  • Combiner GaussianFactory avec des modèles de langage pour générer des démonstrations à partir de descriptions textuelles de tâches.
  • En résumé

    GaussianFactory démontre qu’il est possible de former un robot manipulateur en quelques minutes de scan vidéo, sans simulateur physique ni collecte manuelle de données. En exploitant la puissance des 3D Gaussian Splatting pour la reconstruction et la planification, cette méthode ouvre la voie à des systèmes de robotique industrielle plus rapides à déployer, plus adaptables et moins coûteux à entraîner.

    Source : [arxiv.org/abs/2609.21112](https://arxiv.org/abs/2609.21112)