Reka Rho-1 réunit texte, vidéo et robots dans un seul réseau

Reka Rho-1 réunit texte, vidéo et robots dans un seul réseau

Comment un même réseau de neurones peut-il rédiger un paragraphe, prolonger une vidéo et commander un bras de robot ? Reka AI vient de publier en préversion de recherche un modèle qui répond sans détour : Rho-1, 19 milliards de paramètres, aucune pièce rapportée.

Un seul flux de tokens pour tout

Un modèle de langage découpe le texte en tokens, de petits fragments de mots, puis prédit le suivant, encore et encore. Rho-1 applique ce principe à tout le reste : le texte, les images, la vidéo et les actions de robot deviennent des tokens, rangés dans une seule fenêtre de contexte partagée.

Imaginez un interprète qui parlerait quatre langues dans la même conversation, sans jamais passer le téléphone à un collègue. L’architecture courante procède à l’inverse : un système distribue les tâches à des modèles spécialisés, l’un lit l’image, l’autre génère la vidéo, un troisième décide du geste. Ici, Reka AI précise qu’il n’y a ni appel d’outil ni modèle externe.

Le modèle génère de la vidéo en continu, en temps réel, et accepte de nouvelles consignes en cours de route, sans repartir de zéro. Pour un agent qui doit réagir à ce qui se passe sous ses yeux, l’écart avec un système qui rend sa copie puis attend est considérable.

Les mêmes poids pour voir et pour agir

Les poids (les paramètres appris) qui prédisent les images d’une caméra sont ceux qui pilotent les mouvements du robot. Pas un cerveau pour la vision et un autre pour la motricité : un seul, et c’est ce qui distingue ce modèle.

L’idée sous-jacente se devine. Prédire la prochaine image d’une scène et prédire la prochaine action d’un bras sont deux versions du même exercice : continuer une séquence. Reka AI en tire un réseau où la perception et le geste partagent la même représentation du monde. Cette lecture est la nôtre, mais elle explique pourquoi l’éditeur range Rho-1 dans la vague des world models, ces modèles qui cherchent à simuler ce qui va se passer plutôt qu’à seulement décrire ce qui s’est passé.

Des vidéos d’internet pour compenser le manque de données robot

Les données de commande de robots sont rares. Une vidéo de cuisine ou de bricolage, elle, se trouve par millions, mais elle ne contient aucune trace des ordres moteurs qui ont produit les gestes.

Reka AI a donc construit un modèle de dynamique inverse. Le principe : à partir de deux images successives, deviner l’action qui a fait passer de l’une à l’autre, comme on reconstituerait le geste d’une main en comparant une photo avant et une photo après. Appliqué à des vidéos ordinaires d’internet, il en extrait des signaux de contrôle, et transforme un stock immense d’images muettes en données d’entraînement pour la robotique.

Plutôt que d’attendre des milliers d’heures de téléopération, on exploite ce qui existe déjà, ce qui rend l’approche crédible.

320 H100 pendant trois mois : l’efficacité comme argument

Rho-1 a été entraîné sur 320 GPU (processeurs graphiques) Nvidia H100 pendant environ trois mois. Cela représente environ 690 000 heures de GPU. Le budget est sérieux, mais à la portée d’un laboratoire de taille moyenne, loin des campagnes d’entraînement qui mobilisent des clusters de dizaines de milliers de puces et que l’on cite d’habitude pour les plus gros modèles.

Plutôt que d’empiler les paramètres, Reka AI mise sur un réseau compact qui remplace plusieurs modèles spécialisés. Moins de briques à héberger, moins de latence entre elles, un seul objet à servir et à mettre à jour. L’éditeur n’est pas un inconnu du multimodal : en avril 2024, il avait lancé Reka Core, un modèle multimodal qui se mesurait sur les benchmarks à GPT-4, Claude 3 et Gemini Ultra.

Les preuves qui manquent encore

Rho-1 est une préversion de recherche, et les éléments disponibles ne donnent ni évaluation indépendante, ni mesure de la qualité du contrôle de robot, ni comparaison face à des modèles spécialisés. Un réseau unique implique des arbitrages : à 19 milliards de paramètres, chaque modalité dispose d’une part de la capacité totale, et rien ne dit encore ce que cela coûte en précision face à un modèle dédié à la vidéo ou à la robotique.

Pour le développeur qui construit des agents, la question se pose déjà. Si un seul jeu de poids suffit à voir, parler et agir, l’architecture habituelle faite d’un orchestrateur, d’outils et de modèles spécialisés perd une partie de sa raison d’être. Faudra-t-il encore assembler ces pièces le jour où un modèle compact les absorbe toutes ? Les prochains tests tiers de Rho-1 commenceront à répondre.

Sources

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 17 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *