Danijar Hafner está construyendo agentes de IA sigilosos que planifican para entornos desconocidos

Danijar Hafner está desarrollando agentes de modelo del mundo para robots que pueden predecir resultados y adaptarse a hogares, objetos y entornos desconocidos.

AI News

Una nueva startup dirigida por el exinvestigador de Google DeepMind Danijar Hafner está desarrollando agentes de IA diseñados para anticipar lo que puede ocurrir en entornos que no han visto antes, según un perfil publicado por MIT Technology Review. La empresa sigue en modo sigiloso, no ha revelado públicamente su nombre ni su producto, y opera desde una oficina de San Francisco escasamente amueblada que contiene robots humanoides.

El trabajo amplía la investigación de larga data de Hafner sobre agentes que aprenden dentro de entornos simulados antes de actuar en el mundo real. Su importancia inmediata no es un lanzamiento comercial, sino una dirección técnica: usar modelos internos de la realidad para permitir que los robots planifiquen con anticipación en lugar de depender principalmente del ensayo y error después del despliegue.

Una startup sigilosa construida en torno a modelos del mundo

Hafner dejó Google DeepMind para fundar la startup en otoño de 2025. Ha revelado pocos detalles operativos, incluido el nombre de la empresa, la financiación, los clientes previstos o el calendario de lanzamiento. MIT Technology Review informó que la oficina contiene robots humanoides procedentes de China, lo que sugiere que la robótica física es central en el trabajo actual de la empresa, aunque el informe no establece un producto específico ni un objetivo de despliegue.

La base técnica es el aprendizaje por refuerzo basado en modelos. En este enfoque, un agente aprende un modelo de su entorno y usa ese modelo para predecir las consecuencias de posibles acciones. En lugar de probar repetidamente cada acción en un entorno físico, el agente puede evaluar resultados imaginados y seleccionar un curso de acción basándose en esas predicciones.

Para un robot que opera en una casa, esto podría significar adaptarse a la distribución de la vivienda, la disposición de los muebles o una interrupción inesperada que no estaba presente en sus datos de entrenamiento. El concepto es especialmente relevante para los robots de servicio, donde los entornos son variables y los errores pueden dañar propiedades o crear riesgos de seguridad.

De mundos de juego a robots físicos

El historial de investigación de Hafner proporciona la evidencia pública más clara del enfoque. Su sistema PlaNet utilizó un modelo aprendido para apoyar la planificación hacia adelante. Trabajos posteriores sobre la familia de agentes Dreamer aplicaron la misma idea general a tareas cada vez más difíciles en entornos simulados.

Según MIT Technology Review, Dreamer 2 alcanzó un rendimiento a nivel humano en juegos de Atari 2600 usando un modelo del mundo, mientras que Dreamer 3 resolvió el desafío Minecraft Diamond al aprender a extraer el recurso del juego. Dreamer 4 supuestamente fue más allá al aprender de datos de partidas grabadas sin interactuar directamente con el juego durante el entrenamiento.

Estos resultados importan porque muestran cómo la planificación puede reducir la cantidad de interacción directa necesaria durante el aprendizaje. Sin embargo, el éxito en juegos no demuestra por sí solo un rendimiento fiable en hogares, fábricas, almacenes o espacios públicos. Los juegos ofrecen reglas definidas y objetivos medibles; el mundo físico es menos predecible, más difícil de simular con precisión y más grave cuando una acción falla.

El proyecto DayDreamer de Hafner representa el puente hacia la robótica. El proyecto utilizó el enfoque Dreamer para ayudar a los robots a operar en entornos desconocidos y responder a nuevas experiencias, incluso ser empujados. La startup parece estar persiguiendo una versión más ambiciosa de esa transición, con máquinas humanoides como plataforma física.

Qué muestran las pruebas — y qué no

La evidencia más sólida disponible es el historial de investigación publicado de Hafner y el relato de su entorno de laboratorio actual. Las afirmaciones sobre PlaNet, Dreamer y DayDreamer son informadas por MIT Technology Review en el contexto del trabajo previo de Hafner. Describen logros de investigación y demostraciones, no capacidades comerciales de la nueva startup verificadas de forma independiente.

Tampoco hay evidencia pública en el informe proporcionado de despliegues con clientes, contratos de producción, ingresos, certificaciones de seguridad o pruebas comparativas frente a otros sistemas robóticos. Timothy Lillicrap, excolega de Hafner en Google, lo elogió como un investigador excepcional, pero esa valoración es un respaldo individual y no una referencia de rendimiento.

La distinción es importante para compradores y desarrolladores. Un modelo que predice estados de juego o se adapta a un experimento robótico controlado todavía necesita demostrar que sus predicciones siguen siendo precisas cuando los sensores presentan ruido, los objetos se mueven inesperadamente y el coste de una mala decisión es alto. El estado sigiloso de la startup hace imposible evaluar esas preguntas hoy.

Por qué el enfoque importa para creadores y empresas

Si los sistemas de Hafner funcionan fuera de demostraciones estrictamente controladas, podrían abordar uno de los cuellos de botella centrales de la robótica: el coste y la dificultad de recopilar suficiente experiencia del mundo real. Entrenar robots mediante fallos físicos repetidos es lento, caro y potencialmente inseguro. Planificar dentro de un entorno aprendido podría reducir el número de pruebas físicas necesarias antes del despliegue.

Para los equipos de producto, la prueba práctica será si el agente puede transferir conocimiento entre escenarios sin reentrenamiento extensivo. Un operador de almacén, por ejemplo, necesitaría un robot capaz de gestionar distribuciones cambiantes y paquetes desconocidos. Un robot doméstico tendría que distinguir entre situaciones novedosas que son inofensivas y aquellas que requieren detenerse o pedir ayuda.

Eso genera requisitos adicionales más allá de la predicción. Las empresas necesitarán visibilidad sobre cómo se construyó el modelo del mundo, cómo se representa la incertidumbre y cuándo el robot vuelve a un comportamiento seguro. También necesitarán herramientas para evaluar eventos raros, actualizar el sistema tras el despliegue y separar la adaptación genuina de la improvisación insegura.

El trabajo también podría intensificar la competencia entre dos estrategias amplias en la IA encarnada: modelos más grandes entrenados con más demostraciones, y agentes más estructurados que aprenden a simular y planificar. Los dos enfoques no son mutuamente excluyentes, pero la investigación de Hafner plantea que una mejor predicción interna podría ser tan importante como más datos de entrenamiento.

Qué vigilar a continuación

La primera señal será si la startup se identifica y explica su producto inicial u objetivo de investigación. Inversores, socios y posibles clientes también buscarán pruebas de que los robots humanoides se están utilizando para algo más que la experimentación de laboratorio.

Las divulgaciones técnicas importarán más que las afirmaciones generales. Los detalles útiles incluirían los entornos utilizados para la evaluación, la cantidad de datos del mundo real necesarios, cómo cambia el rendimiento en entornos desconocidos y el comportamiento del sistema cuando sus predicciones son inciertas. Las pruebas independientes en manipulación, navegación, recuperación de caídas e interrupciones críticas para la seguridad proporcionarían pruebas más sólidas que los benchmarks de juegos por sí solos.

Por último, la elección del modelo de negocio aclarará su ambición. Una plataforma robótica, un sistema de control con licencia y un producto robótico totalmente integrado implicarían requisitos diferentes de fiabilidad del hardware, soporte de despliegue y economía empresarial.

Perspectiva de Creati.ai

La nueva iniciativa de Hafner es notable porque aborda una debilidad específica de los sistemas de IA actuales: la incapacidad de actuar de forma fiable cuando las condiciones difieren del entrenamiento. El uso de modelos del mundo y del aprendizaje por refuerzo basado en modelos ofrece una vía plausible hacia un comportamiento más deliberado, pero la brecha entre el logro virtual y la operación física fiable sigue siendo considerable.

Por ahora, se trata de una empresa impulsada por la investigación que merece seguimiento, no de un proveedor de robótica validado. La cuestión decisiva será si Hafner puede convertir la planificación predictiva en mejoras medibles en entornos reales: menos pruebas de entrenamiento, una recuperación más segura ante sorpresas y un rendimiento constante sin ingeniería personalizada para cada nueva ubicación.

Anuncios