Runway veut générer la vidéo pendant que vous la décrivez

Runway veut générer la vidéo pendant que vous la décrivez

L’essentiel

  • Runway a présenté ses travaux sur la génération vidéo en temps réel : l’utilisateur pilote un flux continu au lieu d’attendre un clip fini.
  • Le système s’appuie sur GWM-1, le modèle du monde maison dévoilé en décembre 2025, qui produit la vidéo image par image et accepte des commandes de caméra, de robot ou d’audio.
  • Google DeepMind annonce des mondes interactifs cohérents plusieurs minutes à 24 images par seconde en 720p avec Genie 3, dont Waymo dérive son simulateur de trafic routier.

Décrire une scène et la voir se dérouler pendant qu’on parle, sans rendu à attendre ni essai à relancer. Runway a détaillé ses travaux de recherche sur la génération vidéo en temps réel, où l’utilisateur pilote un flux continu au lieu de commander un clip.

L’entreprise part d’un constat d’usage : ses utilisateurs disent perdre l’essentiel de leur temps à générer puis à reprendre leurs vidéos. Sa réponse porte moins sur la qualité d’image que sur le délai avant la première image affichée. Une fois le flux lancé, chaque nouveau segment se calcule à partir de toutes les images déjà produites, qui lui servent de contexte : le modèle ne fabrique plus un clip, il entretient une scène.

Quand une petite erreur grossit d’image en image

Un modèle de langage se reprend au milieu d’une phrase. Un modèle vidéo, non : chaque image s’appuie sur la précédente, et le moindre défaut se propage jusqu’à déformer la scène entière. Runway désigne cette dérive comme le problème central des approches qui génèrent pas à pas, à la manière d’un modèle de langage.

Sa parade consiste à entraîner le modèle sur ses propres sorties plutôt que sur des séquences irréprochables, pour lui apprendre à rattraper ses écarts au lieu de les amplifier. La startup Decart avait suivi la même logique avec MirageLSD, en exposant délibérément son modèle à des images abîmées pendant l’entraînement. Chez Google DeepMind, la même bataille se compte en durée : Genie 3 tient plusieurs minutes avant que la scène ne décroche.

Quelques minutes de cohérence, c’est court pour un tournage. C’est déjà beaucoup pour un banc d’essai.

La facture se déplace de l’entraînement vers l’usage

Le temps réel déporte la charge de calcul de l’entraînement vers l’exécution, souligne Runway. Le modèle doit sortir chaque image assez vite pour tenir la cadence de lecture, sur du matériel partagé entre plusieurs sessions simultanées. La contrainte se joue désormais sur la tenue en charge du service autant que sur la taille du cluster d’entraînement.

L’entreprise en tire son critère de comparaison : le coût par sortie à qualité donnée, dont elle fait la variable qui décide quelles applications deviennent économiquement tenables. Un modèle deux fois plus rapide mobilise moins de GPU (processeurs graphiques), abaisse ce seuil et rend viables des usages qui, hier encore, ne payaient pas leur électricité.

Comparer deux modèles vidéo demande donc autre chose que la fidélité d’un plan de cinq secondes : le délai avant la première image, et le coût de la minute générée. Decart annonce moins de 40 millisecondes par image pour MirageLSD, à 24 images par seconde ; c’est à peu près le seul chiffre de ce genre rendu public par un éditeur.

Waymo simule l’éléphant sur la chaussée

Runway place les applications interactives en tête de ses débouchés de long terme : éducation, jeu, robotique, tout ce qui exige une image capable de réagir aussi vite que son spectateur. L’entreprise avait déjà dérivé GWM Robotics de son modèle du monde pour fabriquer des données d’entraînement synthétiques destinées aux robots. Plus récemment, elle a présenté Solaris, un système bâti sur Gen-4.5 qui génère des interfaces image par image et répond aux clics et aux saisies.

L’argument le plus solide vient pourtant de l’évaluation. Vérifier comment un robot ou un véhicule autonome se comporte suppose de lui présenter des situations rares, et de les produire à la demande. Waymo a construit son Waymo World Model sur Genie 3, adapté au trafic routier, pour simuler ce que sa flotte n’a jamais croisé : un éléphant sur la chaussée, une tornade, une route inondée, autant de situations qu’aucun circuit d’essai ne produit sur commande.

Une demi-heure de cohérence et le prix de l’heure GPU

Deux compteurs décideront, et aucun des deux ne concerne la beauté de l’image. La durée de cohérence d’abord : passer des quelques minutes actuelles à une demi-heure de simulation stable, physique comprise, change la nature de l’outil. Le coût horaire d’une session sur GPU partagé ensuite, qui détermine si une équipe de validation en lance mille en parallèle ou dix.

Au bon croisement de ces deux courbes, la simulation générative entre en 2027 dans les chaînes de validation des constructeurs, à côté des simulateurs déterministes existants et non à leur place. Les studios adopteront le temps réel plus tard : un rendu qu’on pilote au doigt ne remplace pas un plan qu’on verrouille, et la production audiovisuelle achète d’abord de la reproductibilité.

À l’inverse, si les démonstrations publiques d’ici au printemps 2027 restent des séquences de trente secondes cadrées par leurs auteurs, sans durée de cohérence annoncée ni coût par session, le temps réel n’aura été qu’une couche d’interface posée sur un générateur de clips. Ces chiffres-là, personne n’oblige ces entreprises à les publier : c’est bien ce qui rendra leur publication significative.

Mon avis

Les créatifs ne seront pas les premiers clients de cette technologie, ils en récupéreront les retombées. Le budget solvable est ailleurs : chez les constructeurs de robots et les exploitants de flottes autonomes, qui achètent aujourd’hui des kilomètres de test à prix d’or et signeront pour des heures de simulation à la place. J’attends un partenariat public entre un éditeur de modèle du monde et un constructeur automobile avant l’été 2027. Le risque symétrique me paraît sous-estimé : un comportement validé en simulation puis démenti sur la route ferait porter la responsabilité sur un modèle qui invente par construction.

Sources

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 16 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *