
Dans un salon de la baie de San Francisco qu’il n’a jamais vu, un robot Figure 03 contourne un lit pour reprendre un pli raté. Ailleurs, le modèle S1 de Skild AI regarde une seule vidéo d’une tâche inconnue et prétend pouvoir l’exécuter dans la foulée. Deux annonces à quelques jours d’écart, une même promesse : une machine qui se débrouille sans qu’on la réentraîne.
Cette promesse a un air de déjà-vu. En mai 2020, GPT-3 et ses 175 milliards de paramètres montraient qu’un grand modèle de langage (LLM, pour large language model) pouvait accomplir une tâche nouvelle à partir de quelques exemples glissés dans le prompt, sans toucher à ses poids. Trois ans plus tard, les entreprises qui l’avaient branché partout découvraient le revers : des réponses fausses, livrées avec aplomb. La robotique rejoue la séquence, avec une différence de taille. Quand un modèle incarné se trompe, son erreur a une masse.

Complétez votre site, carte par carte
J’ai conçu TresoRank pour détecter ce qui manque à votre visibilité SEO & GEO : contenus, enrichissements, maillage ou optimisations techniques. Chaque opportunité devient une carte à activer.
Analyser mon site gratuitement →Une vidéo d’un côté, trente maisons de l’autre
Skild AI présente S1 comme un modèle d’apprentissage en contexte (in-context learning : le modèle adapte son comportement à partir d’exemples fournis au moment de l’usage, sans modifier ses paramètres). D’après l’entreprise, une seule vidéo suffit pour qu’il enchaîne une tâche de dix minutes jamais vue, sans fine-tuning, donc sans nouvelle passe d’entraînement. Skild revendique au passage plus de 100 millions de dollars de revenus en 2026, signe que ses clients paient déjà pour autre chose que des démonstrations.
Figure a choisi l’épreuve inverse : pas de démonstration fournie, pas de données collectées sur place. Son modèle Helix 2.5, qui pilote tout le corps du Figure 03, de la marche au pliage du linge, a été lâché dans 30 maisons louées. Trois corvées au programme : ranger un salon jonché de 13 à 15 jouets, plier des serviettes, faire un lit, avec les meubles et le linge trouvés sur place. Bilan publié par Figure : 237 essais réussis sur 420, soit 56 %, et au moins un succès dans chacune des 30 maisons.
L’un apprend de ce qu’on lui montre. L’autre de ce qu’il a déjà vu.
Deux paris sur l’endroit où loge la généralisation
Figure attribue son résultat à Index, sa banque de vidéos de gestes humains, qui absorbe environ 35 minutes de nouvelle expérience humaine par seconde. L’expérience de contrôle est parlante. À données de tâche, architecture et réglages identiques, le même système privé de ce préentraînement plafonne à 9 % de réussite. Avec Index, il atteint les 56 % annoncés.
Le changement de méthode compte autant que le taux de réussite. Helix 02 partait d’un modèle vision-langage (VLM, un modèle qui relie images et texte) existant, emprunté au monde des LLM. Helix 2.5 a été entièrement préentraîné sur des données humaines, avec deux fois moins de données de tâche que son prédécesseur. Figure dit avoir engagé 3,5 milliards de dollars de calcul pour entraîner Helix. Autrement dit, la généralisation s’achète en amont, à coups de volume. Google DeepMind suit la voie que Figure vient de quitter : ses modèles Gemini Robotics greffent la compréhension du monde de Gemini sur la commande des gestes du robot.
Skild place le curseur ailleurs : la souplesse au moment de l’usage, une vidéo suffisant à orienter le robot. Figure promet la robustesse acquise, Skild l’adaptation instantanée. Les LLM ont pourtant montré que les deux ne s’opposent pas longtemps : l’apprentissage en contexte de GPT-3 n’existait que parce que le préentraînement avait été massif. La matière publiée par Skild ne dit pas sur quel volume de données S1 repose. Tant qu’on l’ignore, la promesse d’une vidéo unique reste impossible à situer face aux 420 essais de Figure.
Quand l’hallucination a des mains
Un LLM qui se trompe produit un paragraphe faux. Quelqu’un le relit, le corrige, ou le laisse passer ; dans tous les cas, l’erreur reste du texte. Un robot qui interprète mal une consigne exécute son erreur avant que quiconque ait pu la relire. La serviette est froissée, le jouet tombe, le vase glisse.
La notation de Figure a le mérite de la sévérité : une corvée est validée en entier ou comptée comme un échec, sans crédit partiel. Elle écrase pourtant une distinction décisive pour un futur acheteur. Parmi les 183 essais ratés, combien sont des lits mal bordés, et combien des objets déplacés, abîmés ou cassés ? Le bilan publié ne le dit pas. Brett Adcock, le patron de Figure, a diffusé près de quatre heures d’images brutes tournées dans ces maisons, sans couper tous les ratés au montage. C’est plus honnête qu’une démonstration léchée, mais une vidéo ne remplace pas une typologie des échecs.
Pour S1, la question se pose autrement. Apprendre d’une seule vidéo, c’est aussi pouvoir mal la lire une seule fois, puis répéter le mauvais geste avec assurance. Les LLM ont mis des années à se doter de mesures d’hallucination un tant soit peu comparables. La robotique incarnée n’a pas encore son équivalent pour la casse.
Des démonstrations qu’on regarde sans pouvoir les brancher
Aucun poids de modèle, aucune API (interface de programmation) ni aucun tarif n’ont été publiés pour Helix 2.5, et le Figure 03 n’est pas en vente libre. Les performances de S1, elles, reposent sur les déclarations de Skild, sans banc d’essai indépendant cité à ce stade. L’argent afflue pourtant : les financements de l’IA incarnée ont accéléré ces derniers trimestres, en particulier pour les logiciels de « cerveau » robotique et les humanoïdes, dans un secteur où la Chine domine en ventes, en matériel et en fabrication. Rien ne garantit encore que cette poussée tienne.
Si vous évaluez un robot pour un entrepôt, un magasin ou un service à domicile, le réflexe à prendre ressemble à celui qu’on a appris face aux benchmarks de LLM en 2023. Demandez combien d’environnements distincts ont été testés, si la notation accorde des points partiels, et surtout ce que recouvre un échec : une tâche laissée en plan ou un objet endommagé. Ces deux résultats coûtent rarement la même chose.
En 2023, nous avons appris à relire ce que la machine écrivait avant de le publier. Avec les humanoïdes, il faudra apprendre à observer ce qu’elle manipule avant de lui confier autre chose que des serviettes.
Sources
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 16 évaluations
Faire appel à mes services →