Physical Artificial Intelligence newsPAI news
← Retour aux actualités
10 Septembre 2026Niveau : Essentiel

Skild AI et NVIDIA : un modèle robotique qui apprend en regardant une seule vidéo

📑 Sommaire
💡 En 3 points clés
  • Des simulations physiques (via NVIDIA Isaac™ Lab) pour générer des scénarios contrôlés et reproductibles.
  • Des vidéos publiques (YouTube, tutoriels, etc.) pour couvrir des tâches du monde réel. Ces données sont augmentées par NVIDIA Cosmos™, un outil de génération d’images et de vidéos par IA, afin d’enrichir la diversité des scènes.
  • Repoter une plante (10 minutes, 20+ étapes) : le modèle doit creuser la terre, ajuster la taille du trou, et verser de l’eau sans débordement.

Un robot qui comprend une vidéo comme un humain comprend un tutoriel

Imaginez un bras robotisé qui observe une vidéo de quelqu’un repotant une plante, puis reproduit l’intégralité de la séquence — creuser la terre, placer la plante, arroser — sans avoir jamais été entraîné sur cette tâche précise. C’est exactement ce que permet S1, le nouveau modèle de fondation robotique développé par Skild AI, en collaboration avec NVIDIA. Contrairement aux approches classiques où chaque nouvelle tâche nécessite des heures de collecte de données et de fine-tuning, S1 se contente d’une seule démonstration vidéo pour généraliser le comportement.

Comment ça marche : l’apprentissage par contexte (In-Context Learning)

Le cœur de l’innovation réside dans une technique appelée apprentissage par contexte (In-Context Learning, ICL). Ici, la tâche n’est pas décrite par des mots, mais par une vidéo qui sert de prompt visuel. Le modèle analyse cette séquence pour en extraire l’intention, les étapes clés et les interactions physiques, puis génère une trajectoire de mouvement adaptée à son propre corps — même si sa morphologie diffère de celle du démonstrateur.

Trois piliers techniques

1. Un modèle omni-corporel

Contrairement aux modèles spécialisés dans un type de robot, Skild Brain (l’architecture sous-jacente à S1) est conçu pour contrôler n’importe quel système mécanique. Il sépare la prise de décision haute ("que faire ?") de l’exécution basse ("comment bouger ?"), une approche inspirée de l’organisation du cerveau humain. Cette modularité permet à S1 de s’adapter à des robots aux actionneurs variés, des bras industriels aux mains humanoïdes.

2. Des données synthétiques et des vidéos du web

Pour pallier le manque de données réelles, Skild AI combine deux sources :

  • Des simulations physiques (via NVIDIA Isaac™ Lab) pour générer des scénarios contrôlés et reproductibles.
  • Des vidéos publiques (YouTube, tutoriels, etc.) pour couvrir des tâches du monde réel. Ces données sont augmentées par NVIDIA Cosmos™, un outil de génération d’images et de vidéos par IA, afin d’enrichir la diversité des scènes.
  • 3. Une scalabilité sans fine-tuning

    Les résultats montrent que S1 atteint 66 % de réussite sur des tâches jamais vues en entraînement, contre seulement 9 % pour un modèle VLA classique utilisant des prompts textuels, et ce avec le même volume de données (100 000 heures). Mieux encore, une seule démonstration vidéo équivaut à environ 380 exemples post-entraînés en termes de performance. Le modèle n’a besoin d’aucun ajustement de poids : il apprend à la volée en analysant le contexte.

    Des tâches qui défient les limites actuelles

    Skild AI a testé S1 sur des scénarios exigeants, comme :

  • Repoter une plante (10 minutes, 20+ étapes) : le modèle doit creuser la terre, ajuster la taille du trou, et verser de l’eau sans débordement.
  • Préparer un café filtre : presser un filtre dans un entonnoir, verser l’eau à la bonne vitesse, et éviter de renverser.
  • Retourner une crêpe : un geste précis où la coordination main-outil est critique.
  • Assemblage de kit : enchaîner des manipulations fines sans erreur.
  • Ces tâches, qui combinent longue durée (jusqu’à 10 minutes), composition de compétences (chaîner des actions) et novelty (tâches jamais vues), étaient jusqu’ici hors de portée des modèles robotiques standards.

    Pourquoi c’est un game-changer pour l’industrie ?

    Dans les usines ou les entrepôts, les processus évoluent constamment : nouveaux produits, réorganisation des lignes, ou maintenance imprévue. Traditionnellement, adapter un robot à ces changements implique :

    1. Des heures de téléopération pour collecter des données.

    2. Des semaines de fine-tuning pour entraîner le modèle.

    3. Des tests rigoureux pour valider la sécurité.

    Avec S1, le processus se réduit à :

  • Filmer une démonstration (quelques minutes).
  • Lancer le modèle sur le robot (quelques secondes).
  • Observer le résultat (et éventuellement corriger une erreur ponctuelle).
  • Skild AI rapporte que le temps entre la réception d’une nouvelle tâche et son exécution autonome est passé de heures/jours à quelques minutes dans leurs tests internes. Une réduction de deux ordres de grandeur qui pourrait accélérer massivement le déploiement de robots dans des environnements dynamiques.

    Les limites à garder en tête

    Malgré ces avancées, S1 n’est pas encore une solution universelle :

  • La robustesse reste perfectible : les erreurs (comme un mauvais dosage d’eau) nécessitent parfois une intervention humaine.
  • Les environnements très bruyants (usines avec vibrations, poussières) peuvent perturber la perception visuelle.
  • La généralisation a un coût : pour atteindre ces performances, le modèle a nécessité un entraînement sur des centaines de milliers d’heures de données, une infrastructure que seules des entreprises comme NVIDIA peuvent fournir.
  • Et demain ?

    Skild AI annonce déjà des déploiements pilotes en production dans les semaines à venir, avec des clients industriels non nommés. Leur objectif ? Prouver que S1 peut passer du laboratoire aux lignes de fabrication réelles. À plus long terme, l’entreprise explore l’intégration de retours haptiques (sens du toucher) pour améliorer encore la précision des manipulations.

    En résumé : une rupture dans la robotique industrielle

    S1 marque un tournant en montrant qu’un modèle robotique peut apprendre de manière autonome à partir d’une seule démonstration, sans fine-tuning. Cette capacité à s’adapter en temps réel aux changements de tâches réduit drastiquement les barrières à l’adoption de la robotique dans des environnements non structurés. Reste à voir si cette technologie tiendra ses promesses une fois confrontée à la complexité du monde réel — mais les premiers résultats sont prometteurs.

    Source : [skild.ai](https://skild.ai/blogs/s1), [nvidia.com](https://www.nvidia.com/en-us/case-studies/skild-ai/), [therobotreport.com](https://www.therobotreport.com/skild-ai-unveils-s1-flagship-robot-foundation-model/)