Rho-1 de Reka AI unifie le texte, la vidéo et le contrôle robotique dans un modèle de 19 milliards de paramètres

Rho-1 de Reka AI combine texte, images, vidéo et contrôle robotique dans un modèle de recherche de 19 milliards de paramètres, signalant une avancée vers des systèmes d’IA unifiés.

AI News

Reka AI a publié un aperçu de recherche de Rho-1, un modèle de 19 milliards de paramètres conçu pour traiter et générer du texte, des images, de la vidéo et des actions de contrôle robotique au sein d’un même réseau neuronal. Cette publication est importante car elle vise une architecture commune pour des capacités généralement réparties entre modèles de langage, systèmes de vision, générateurs vidéo et politiques robotiques.

Selon The Decoder, Rho-1 traite les différents médias et actions comme des tokens dans une fenêtre de contexte partagée, plutôt que de confier les tâches à des modèles distincts au moyen d’appels d’outils. Reka affirme que le système peut générer de la vidéo en continu et en temps réel, et répondre à de nouvelles instructions pendant le déroulement d’une scène, sans redémarrer la génération.

L’annonce place Reka AI parmi les chercheurs qui cherchent à déterminer si un seul modèle peut servir d’interface plus générale pour la perception, la génération et l’action. Il s’agit toutefois encore d’un aperçu de recherche, et les éléments disponibles ne permettent pas d’établir les performances de Rho-1 face aux principaux modèles commerciaux ou aux systèmes robotiques réels.

Un modèle pour la perception, la génération et l’action

La plupart des architectures d’IA utilisées en production répartissent le travail multimodal entre plusieurs composants. Un modèle de langage peut interpréter une demande, un modèle de vision examiner une image, un modèle vidéo générer des images et une politique distincte traduire les observations en mouvements physiques. Ces composants peuvent être reliés, mais chaque transfert ajoute de la complexité technique, de la latence et des points de défaillance potentiels.

Rho-1 vise à éviter cette organisation. Le modèle représenterait le texte, les images, la vidéo et les actions robotiques dans une séquence commune. En principe, un même contexte peut contenir une instruction, des observations visuelles, des images générées et des sorties d’action, ce qui permet au système de relier ce qu’il voit à ce qu’il doit faire.

Cette approche donne aussi à Rho-1 un lien direct entre prédiction visuelle et contrôle. The Decoder rapporte que les mêmes poids utilisés pour prédire les images des caméras pilotent également les mouvements du robot. Cela ne signifie pas que le modèle est prêt pour un déploiement généralisé dans des environnements physiques, mais cela reflète une orientation de recherche dans laquelle prédiction vidéo et planification d’action sont entraînées ensemble plutôt que considérées comme des problèmes distincts.

Comment Reka a entraîné Rho-1

Selon le récit de la publication par The Decoder, le modèle a été entraîné sur 320 GPU H100 pendant environ trois mois. Reka AI a également développé un modèle de dynamique inverse afin de répondre à un problème central de la robotique : les données de haute qualité pour le contrôle des robots sont rares par rapport aux vidéos ordinaires disponibles sur internet.

La dynamique inverse tente généralement d’inférer l’action qui a produit une modification observée dans une scène. Dans l’approche rapportée par Reka, cette capacité sert à extraire des signaux de contrôle possibles à partir de vidéos ne montrant pas de robots. Cela pourrait augmenter la quantité de données d’entraînement disponibles pour un système qui doit apprendre comment les actions modifient le monde, même si les vidéos internet n’offrent ni la même fiabilité, ni la même incarnation, ni le même niveau de détail des capteurs que les démonstrations recueillies avec un robot donné.

Le besoin de calcul indiqué est notable, car Rho-1 possède 19 milliards de paramètres, soit une taille sensiblement inférieure à celle de nombreux systèmes de pointe souvent évoqués sur le marché. Toutefois, 320 GPU H100 utilisés pendant trois mois représentent un investissement d’entraînement majeur. Ce chiffre doit donc être lu comme la description de l’exécution de recherche, et non comme la preuve que le modèle est peu coûteux à entraîner ou à exploiter dans tous les scénarios.

Les éléments à l’appui de l’annonce

Les informations les plus solides disponibles dans ce rapport proviennent de la couverture par The Decoder de l’aperçu de recherche de Reka AI. MarkTechPost a décrit séparément Rho-1 comme un modèle d’« omni-raisonnement » de 19 milliards de paramètres qui comprend et génère de la vidéo tout en produisant des actions robotiques, mais le contenu fourni par MarkTechPost ne comprend ni l’article complet ni de résultats de tests indépendants.

Les éléments disponibles ne fournissent pas de scores de référence, de conditions d’accès au modèle, de mesures de latence, d’évaluations de sécurité ni de démonstrations pouvant être évaluées indépendamment ici. Les affirmations concernant la génération vidéo en temps réel, les réponses adaptatives et le lien entre prédiction visuelle et mouvement robotique doivent donc être considérées comme des capacités rapportées par l’entreprise ou par les sources, plutôt que comme des résultats de performance établis.

Cette distinction est importante pour les développeurs et les acheteurs. Un modèle unifié peut réduire le besoin de maintenir plusieurs interfaces, mais il peut aussi rendre les défaillances plus difficiles à isoler. Un système produisant un langage fluide et une vidéo convaincante peut malgré tout prendre des décisions dangereuses ou physiquement incorrectes lorsqu’on lui demande de contrôler un équipement. Le statut d’aperçu de recherche de Rho-1 laisse ouvertes des questions concernant la fiabilité, la méthodologie d’évaluation et l’accès au modèle et à ses poids.

Reka AI a déjà travaillé sur des systèmes multimodaux. L’entreprise a lancé Reka Core en avril 2024, en le présentant comme un concurrent de GPT-4, Claude 3 et Gemini Ultra dans les évaluations de référence. Rho-1 prolonge cette orientation au-delà de la compréhension multimodale, vers la génération vidéo et l’action incarnée.

Pourquoi l’architecture compte pour les équipes d’IA

Pour les équipes produit, l’importance principale de Rho-1 est architecturale. Si un modèle peut conserver une représentation partagée du langage, du contenu visuel, des changements temporels et des actions, les développeurs pourraient concevoir des applications autour d’une seule surface d’inférence au lieu de coordonner plusieurs services spécialisés. Les cas d’usage possibles comprennent les assistants vidéo interactifs, les environnements de simulation, les agents visuels et les outils de recherche en robotique.

Le compromis est une concentration du risque. Les systèmes spécialisés peuvent être remplacés ou réglés indépendamment, tandis qu’un modèle unifié peut nécessiter un nouvel entraînement ou une évaluation plus large lorsqu’une modalité est moins performante. Un modèle fort en texte mais faible en raisonnement temporel pourrait, par exemple, produire des explications plausibles tout en échouant à suivre une scène physique en évolution.

Les entreprises qui envisagent ces systèmes devront également examiner l’infrastructure et la gouvernance. La génération vidéo continue peut entraîner d’importants besoins en bande passante et en stockage. Les sorties de contrôle robotique exigent des limites de sécurité strictes, une surveillance et une politique de repli capable de prendre le dessus sur le modèle. Dans les déploiements réglementés ou sensibles à la sécurité, la capacité à expliquer quelles observations visuelles ont conduit à une action peut compter autant que les performances générales du modèle dans les benchmarks.

Le débat de recherche plus large concerne les modèles du monde : des systèmes destinés à représenter la manière dont les environnements changent et dont les actions les affectent. Rho-1 s’inscrit dans cette démarche en combinant prédiction visuelle et génération d’actions, mais un flux unifié de tokens ne prouve pas à lui seul que le modèle possède une représentation physique fiable du monde. La planification sur un horizon long, les conditions inhabituelles et le transfert entre différents robots restent des tests difficiles.

Ce qu’il faudra surveiller

Le premier signal sera de voir si Reka AI publie des évaluations reproductibles de chaque capacité séparément et en combinaison. Des résultats utiles comprendraient la qualité et la cohérence temporelle de la vidéo, le suivi des instructions dans des scènes changeantes et les taux de réussite du contrôle robotique pour des tâches clairement définies.

L’accès sera un autre indicateur essentiel. Si Rho-1 devient disponible pour des chercheurs externes, des tests indépendants pourraient déterminer si son architecture unifiée offre des avantages pratiques par rapport à des pipelines construits à partir de modèles spécialisés. Les informations sur le matériel d’inférence, la longueur du contexte, la licence et la latence détermineront si le système est utile au-delà des démonstrations.

En robotique, le suivi le plus important sera constitué de preuves issues de matériel réel plutôt que de vidéos internet ou de simulations. Les chercheurs devront tester la sécurité, la récupération après des événements inattendus, les performances sur différents robots et l’effet d’entrées bruitées provenant des caméras et des capteurs.

Enfin, le marché observera si l’approche de Reka reste un aperçu de recherche ou devient une plateforme produit. La réponse montrera si les modèles omni peuvent passer d’une architecture séduisante à des outils fiables pour les agents d’IA, les applications vidéo et l’automatisation physique.

Point de vue de Creati.ai

Rho-1 constitue un signal de recherche important, car il présente la multimodalité comme un problème de modélisation partagé qui inclut l’action, et pas seulement le texte, les images et la vidéo. Cela pourrait simplifier certaines parties de la pile d’IA et faciliter la création de systèmes reliant perception et réponse.

Mais l’annonce ne prouve pas encore qu’un seul modèle soit supérieur à un ensemble de spécialistes soigneusement conçu. En attendant des évaluations indépendantes et des résultats sur de vrais robots, les développeurs devraient considérer Rho-1 comme une expérience architecturale au champ prometteur, et non comme un remplacement validé des systèmes multimodaux ou robotiques de production.

Publicités