Rho-1 de Reka AI unifica texto, vídeo y control robótico en un modelo de 19.000 millones de parámetros

Rho-1 de Reka AI combina texto, imágenes, vídeo y control robótico en un modelo de investigación de 19.000 millones de parámetros, lo que apunta a un avance hacia sistemas de IA unificados.

AI News

Reka AI ha publicado una vista previa de investigación de Rho-1, un modelo de 19.000 millones de parámetros diseñado para procesar y generar texto, imágenes, vídeo y acciones de control robótico dentro de una misma red neuronal. El lanzamiento es relevante porque busca una arquitectura común para capacidades que normalmente se dividen entre modelos de lenguaje, sistemas de visión, generadores de vídeo y políticas robóticas.

Según The Decoder, Rho-1 trata los distintos medios y acciones como tokens dentro de una ventana de contexto compartida, en lugar de delegar las tareas a modelos separados mediante llamadas a herramientas. Reka afirma que el sistema puede generar vídeo continuo en tiempo real y responder a nuevas instrucciones mientras una escena se desarrolla, sin reiniciar el proceso de generación.

El anuncio sitúa a Reka AI entre los investigadores que exploran si un único modelo puede servir como una interfaz más general para la percepción, la generación y la acción. Sin embargo, sigue siendo una vista previa de investigación, y las pruebas disponibles no establecen cómo funciona Rho-1 frente a los principales modelos comerciales o los sistemas robóticos del mundo real.

Un modelo para la percepción, la generación y la acción

La mayoría de las arquitecturas de IA en producción dividen el trabajo multimodal en componentes. Un modelo de lenguaje puede interpretar una solicitud, un modelo de visión puede examinar una imagen, un modelo de vídeo puede generar fotogramas y una política independiente puede traducir observaciones en movimientos físicos. Estos componentes pueden conectarse, pero cada traspaso añade complejidad de ingeniería, latencia y posibles puntos de fallo.

Rho-1 pretende evitar esa disposición. Según los informes, el modelo representa texto, imágenes, vídeo y acciones robóticas en una secuencia compartida. En principio, el mismo contexto puede contener una instrucción, observaciones visuales, fotogramas generados y salidas de acción, permitiendo al sistema conectar lo que ve con lo que debe hacer.

El enfoque también proporciona a Rho-1 una relación directa entre la predicción visual y el control. The Decoder informa de que los mismos pesos utilizados para predecir imágenes de cámara también impulsan los movimientos del robot. Esto no significa que el modelo esté listo para un despliegue amplio en entornos físicos, pero refleja una línea de investigación en la que la predicción de vídeo y la planificación de acciones se entrenan conjuntamente, en vez de tratarse como problemas independientes.

Cómo entrenó Reka a Rho-1

Según el relato de The Decoder sobre el lanzamiento, el modelo se entrenó durante aproximadamente tres meses en 320 GPU H100. Reka AI también desarrolló un modelo de dinámica inversa para abordar un problema central de la robótica: los datos de alta calidad para el control robótico son escasos en comparación con los vídeos corrientes de internet.

La dinámica inversa generalmente intenta inferir la acción que produjo un cambio observado en una escena. En el enfoque descrito por Reka, esta capacidad se utiliza para extraer posibles señales de control de vídeos que no muestran robots. Esto podría ampliar la cantidad de material de entrenamiento disponible para un sistema que debe aprender cómo las acciones afectan al mundo, aunque los vídeos de internet no ofrecen la misma fiabilidad, corporeidad ni detalle de sensores que las demostraciones recogidas con un robot específico.

El requisito computacional comunicado es notable porque Rho-1 tiene 19.000 millones de parámetros, una escala sustancialmente menor que la de muchos sistemas de frontera de los que se habla habitualmente en el mercado. Aun así, utilizar 320 GPU H100 durante tres meses representa una inversión de entrenamiento considerable. Por tanto, la cifra debe interpretarse como una descripción de la ejecución de investigación, no como evidencia de que el modelo sea barato de entrenar u operar en todos los escenarios de despliegue.

Evidencia detrás del anuncio

Los detalles más sólidos disponibles en este informe proceden de la cobertura de The Decoder sobre la vista previa de investigación de Reka AI. MarkTechPost describió por separado Rho-1 como un modelo de razonamiento omni de 19.000 millones de parámetros que entiende y genera vídeo mientras produce acciones robóticas, pero el material proporcionado por MarkTechPost no incluye el artículo completo ni resultados de pruebas independientes.

Las pruebas disponibles no proporcionan puntuaciones de referencia, condiciones de acceso al modelo, mediciones de latencia, evaluaciones de seguridad ni demostraciones que puedan evaluarse aquí de forma independiente. Por tanto, las afirmaciones sobre generación de vídeo en tiempo real, respuestas adaptativas y la relación entre la predicción visual y el movimiento robótico deben considerarse capacidades comunicadas por la empresa o por las fuentes, no conclusiones de rendimiento establecidas.

Esta distinción es importante para desarrolladores y compradores. Un modelo unificado puede reducir la necesidad de mantener múltiples interfaces, pero también puede dificultar el aislamiento de los fallos. Un sistema que produce lenguaje fluido y vídeo convincente puede tomar decisiones inseguras o físicamente incorrectas cuando se le pide controlar equipos. El estado de vista previa de investigación de Rho-1 deja abiertas preguntas sobre fiabilidad, metodología de evaluación y acceso al modelo y sus pesos.

Reka AI ya había trabajado en sistemas multimodales. La empresa lanzó Reka Core en abril de 2024 y lo presentó como competidor de GPT-4, Claude 3 y Gemini Ultra en evaluaciones de referencia. Rho-1 amplía esa dirección más allá de la comprensión multimodal hacia la generación de vídeo y la acción incorporada.

Por qué la arquitectura importa a los equipos de IA

Para los equipos de producto, la principal importancia de Rho-1 es arquitectónica. Si un modelo puede mantener una representación compartida del lenguaje, el contenido visual, los cambios temporales y las acciones, los desarrolladores podrían crear aplicaciones alrededor de una única superficie de inferencia en lugar de coordinar varios servicios especializados. Entre los posibles usos están los asistentes de vídeo interactivos, los entornos de simulación, los agentes visuales y las herramientas de investigación robótica.

La contrapartida es la concentración del riesgo. Los sistemas especializados pueden sustituirse o ajustarse de forma independiente, mientras que un modelo unificado puede requerir un nuevo entrenamiento o una evaluación más amplia cuando una modalidad rinde por debajo de lo esperado. Un modelo fuerte en texto pero débil en razonamiento temporal, por ejemplo, podría producir explicaciones plausibles y aun así no seguir una escena física cambiante.

Las empresas que consideren estos sistemas también deberán examinar la infraestructura y la gobernanza. La generación continua de vídeo puede crear grandes demandas de ancho de banda y almacenamiento. Las salidas de control robótico requieren límites de seguridad estrictos, supervisión y una política de respaldo capaz de anular al modelo. En implementaciones reguladas o sensibles para la seguridad, poder explicar qué evidencia visual condujo a una acción puede ser tan importante como el rendimiento general del modelo en las pruebas de referencia.

El debate de investigación más amplio gira en torno a los modelos del mundo: sistemas destinados a representar cómo cambian los entornos y cómo las acciones los afectan. Rho-1 encaja en esa agenda al combinar la predicción visual con la generación de acciones, pero un flujo unificado de tokens por sí solo no demuestra que el modelo tenga un modelo físico fiable del mundo. La planificación a largo plazo, las condiciones inusuales y la transferencia entre distintos robots siguen siendo pruebas difíciles.

Qué observar a continuación

La primera señal será si Reka AI publica evaluaciones reproducibles de cada capacidad por separado y en combinación. Los resultados útiles incluirían calidad y consistencia temporal del vídeo, seguimiento de instrucciones en escenas cambiantes y tasas de éxito del control robótico en tareas claramente definidas.

El acceso será otro indicador clave. Si Rho-1 queda disponible para investigadores externos, las pruebas independientes podrían aclarar si su arquitectura unificada ofrece ventajas prácticas frente a pipelines construidos con modelos especializados. Los detalles sobre el hardware de inferencia, la longitud del contexto, las licencias y la latencia determinarán si el sistema resulta útil más allá de las demostraciones.

En robótica, el seguimiento más importante será la evidencia obtenida con hardware real, no con vídeos de internet o resultados de simulación. Los investigadores tendrán que probar la seguridad, la recuperación ante acontecimientos inesperados, el rendimiento en distintas corporeidades y el efecto de las entradas ruidosas de cámaras y sensores.

Por último, el mercado observará si el enfoque de Reka sigue siendo una vista previa de investigación o se convierte en una plataforma de producto. La respuesta mostrará si los modelos omni pueden pasar de ser una arquitectura atractiva a convertirse en herramientas fiables para agentes de IA, aplicaciones de vídeo y automatización física.

Perspectiva de Creati.ai

Rho-1 es una señal de investigación significativa porque plantea la multimodalidad como un problema de modelado compartido que incluye la acción, no solo texto, imágenes y vídeo. Esto podría simplificar partes de la pila de IA y facilitar la creación de sistemas que conecten percepción y respuesta.

Pero el anuncio todavía no demuestra que un modelo sea mejor que una colección cuidadosamente diseñada de especialistas. Hasta que haya evaluaciones independientes y resultados con robots reales, los desarrolladores deberían considerar Rho-1 un experimento arquitectónico de alcance prometedor, no un sustituto validado de los sistemas multimodales o robóticos de producción.

Anuncios