Skild AI pousse le self-play simulé à l’extrême : 140 ans de matchs virtuels pour un robot footballeur opérationnel


Skild AI a poussé l’idée du self-play — où un modèle s’entraîne en s’affrontant à des copies de lui-même — jusqu’à son paroxysme. Leur robot S1 a passé l’équivalent de 140 ans de matchs simulés dans l’environnement NVIDIA Isaac Sim, en se concentrant sur un objectif unique : marquer des buts. Aucune récompense personnalisée, aucun démonstration humaine, aucune instruction explicite sur la façon de se déplacer ou de contrôler le ballon. Le modèle a simplement appris à optimiser sa politique pour atteindre son but, en découvrant par lui-même les stratégies émergentes : dribbles, passes, déplacements et même des gestes défensifs comme le tacle.
Pour y parvenir, Skild a exploité la puissance de calcul des GPU modernes, capables de faire tourner des milliers d’environnements simulés en parallèle. Cette approche compresse des siècles d’expérience virtuelle en quelques semaines de temps réel. Le résultat ? Une politique de contrôle qui, une fois déployée sur un robot physique, permet à S1 de marcher, se relever, dribbler, protéger le ballon et même tacler — des compétences qui n’ont jamais été codées à la main.
Le vrai défi n’était pas seulement d’entraîner S1 en simulation, mais de faire en sorte que ses compétences se transfèrent directement dans le monde physique. Historiquement, les robots entraînés en simulation échouaient souvent une fois confrontés à la réalité : les frottements, les imprécisions des capteurs, ou les variations de lumière rendaient les politiques apprises inutilisables. Skild affirme avoir résolu ce problème en utilisant NVIDIA Isaac Sim et Isaac Lab, deux outils conçus pour minimiser l’écart entre simulation et réalité (sim-to-real gap).
Isaac Sim fournit un moteur physique réaliste et un pipeline de rendu qui reproduit les contraintes du monde réel, tandis qu’Isaac Lab permet d’entraîner des politiques de contrôle à grande échelle avec le moteur de physique Newton. Skild a également développé des solveurs de simulation accélérés par GPU pour modéliser avec précision les interactions entre le robot et son environnement, comme la prise d’objets ou les contacts entre surfaces.
L’une des particularités de S1 est sa capacité à apprendre de nouvelles tâches à partir d’une seule démonstration vidéo, sans réentraînement du modèle. Par exemple, si un opérateur filme une séquence de plantation de plantes, S1 peut reproduire la tâche en autonomie sur un robot physique en moins de 11 minutes, avec un taux de réussite d’environ 66 % par étape pour des tâches multi-étapes. À titre de comparaison, un système similaire atteint seulement 9 % de réussite dans les mêmes conditions.
Skild estime qu’une démonstration vidéo équivaut à environ 380 exemples d’entraînement manuel, ce qui représente entre 50 et 100 heures de travail pour un humain. Cette approche réduit considérablement le temps et les ressources nécessaires pour adapter le robot à de nouvelles tâches, tout en évitant le cycle classique de réentraînement pour chaque nouveau scénario.
Si les résultats sont impressionnants, plusieurs questions restent en suspens. D’abord, les 140 ans de simulation et les performances réelles en match n’ont pas été documentés dans des publications scientifiques officielles, ce qui rend difficile une évaluation indépendante. Ensuite, les tâches démontrées (plantation, préparation de café, assemblage) restent dans des environnements contrôlés, loin de la complexité d’un terrain de football en conditions réelles.
Néanmoins, cette démonstration illustre une tendance forte en robotique : l’abandon progressif des récompenses manuelles et des démonstrations humaines au profit de l’apprentissage par l’expérience et l’auto-supervision. Skild et NVIDIA travaillent désormais à étendre cette approche à des environnements industriels, où des robots pourraient apprendre de nouvelles tâches à partir de vidéos ou d’interactions en temps réel, sans nécessiter de reprogrammation coûteuse.