Danijar Hafner développe des agents à modèle du monde pour des robots capables de prévoir les résultats et de s’adapter à des maisons, objets et environnements inconnus.

Une nouvelle startup dirigée par l’ancien chercheur de Google DeepMind Danijar Hafner développe des agents IA conçus pour anticiper ce qui pourrait se produire dans des environnements qu’ils n’ont jamais vus auparavant, selon un portrait publié par MIT Technology Review. L’entreprise reste en mode furtif, n’a pas divulgué publiquement son nom ni son produit, et opère depuis un bureau de San Francisco peu meublé contenant des robots humanoïdes.
Ce travail prolonge la recherche de longue date de Hafner sur des agents qui apprennent dans des environnements simulés avant d’agir dans le monde réel. Son importance immédiate n’est pas un lancement commercial, mais une orientation technique : utiliser des modèles internes de la réalité pour permettre aux robots d’anticiper et de planifier plutôt que de s’appuyer principalement sur l’essai-erreur après le déploiement.
Hafner a quitté Google DeepMind pour fonder la startup à l’automne 2025. Il a révélé peu de détails opérationnels, notamment le nom de l’entreprise, le financement, les clients visés ou le calendrier de lancement. MIT Technology Review a indiqué que le bureau contient des robots humanoïdes provenant de Chine, ce qui suggère que la robotique physique est au cœur du travail actuel de l’entreprise, bien que le rapport n’établisse pas de produit spécifique ni de cible de déploiement.
La base technique est l’apprentissage par renforcement fondé sur des modèles. Dans cette approche, un agent apprend un modèle de son environnement et l’utilise pour prédire les conséquences d’actions possibles. Au lieu de tester à plusieurs reprises chaque action dans un environnement physique, l’agent peut évaluer des résultats imaginés et choisir une conduite à partir de ces prédictions.
Pour un robot opérant dans une maison, cela pourrait signifier s’adapter à un plan d’aménagement, à la disposition des meubles ou à une interruption inattendue absente de ses données d’entraînement. Le concept est particulièrement pertinent pour les robots de service, où les environnements sont variables et où les erreurs peuvent endommager des biens ou créer des risques pour la sécurité.
Le parcours de recherche de Hafner fournit la preuve publique la plus claire de cette approche. Son système PlaNet utilisait un modèle appris pour soutenir la planification anticipée. Des travaux ultérieurs sur la famille d’agents Dreamer ont appliqué la même idée générale à des tâches de plus en plus difficiles dans des environnements simulés.
Selon MIT Technology Review, Dreamer 2 a atteint des performances de niveau humain sur les jeux Atari 2600 grâce à un modèle du monde, tandis que Dreamer 3 a résolu le défi Minecraft Diamond en apprenant à extraire la ressource du jeu. Dreamer 4 serait allé encore plus loin en apprenant à partir de données de parties enregistrées sans interagir directement avec le jeu pendant l’entraînement.
Ces résultats comptent car ils montrent comment la planification peut réduire la quantité d’interaction directe nécessaire pendant l’apprentissage. Toutefois, le succès dans les jeux ne démontre pas à lui seul des performances fiables dans des maisons, des usines, des entrepôts ou des espaces publics. Les jeux offrent des règles définies et des objectifs mesurables ; le monde physique est moins prévisible, plus difficile à simuler avec précision et plus lourd de conséquences lorsqu’une action échoue.
Le projet DayDreamer de Hafner représente le pont vers la robotique. Le projet a utilisé l’approche Dreamer pour aider des robots à fonctionner dans des environnements inconnus et à réagir à de nouvelles expériences, y compris le fait d’être renversés. La startup semble poursuivre une version plus ambitieuse de cette transition, avec des machines humanoïdes comme plateforme physique.
Les preuves les plus solides disponibles sont l’historique de recherche publié de Hafner et le récit de son environnement de laboratoire actuel. Les affirmations concernant PlaNet, Dreamer et DayDreamer sont rapportées par MIT Technology Review dans le contexte des travaux antérieurs de Hafner. Elles décrivent des résultats de recherche et des démonstrations, et non les capacités commerciales d’une nouvelle startup vérifiées indépendamment.
Il n’existe pas non plus, dans le reportage fourni, de preuve publique de déploiements clients, de contrats de production, de revenus, de certifications de sécurité ou de tests comparatifs par rapport à d’autres systèmes robotiques. Timothy Lillicrap, ancien collègue de Hafner chez Google, l’a décrit comme un chercheur exceptionnel, mais cette appréciation constitue une recommandation individuelle et non une mesure de performance.
La distinction est importante pour les acheteurs et les développeurs. Un modèle qui prédit des états de jeu ou s’adapte à une expérience robotique contrôlée doit encore prouver que ses prédictions restent exactes lorsque les capteurs sont bruités, que les objets bougent de façon inattendue et que le coût d’une mauvaise décision est élevé. Le statut furtif de la startup rend aujourd’hui impossible l’évaluation de ces questions.
Si les systèmes de Hafner fonctionnent en dehors de démonstrations strictement contrôlées, ils pourraient s’attaquer à l’un des principaux goulets d’étranglement de la robotique : le coût et la difficulté de recueillir suffisamment d’expérience du monde réel. Entraîner des robots par des échecs physiques répétés est lent, coûteux et potentiellement dangereux. Planifier dans un environnement appris pourrait réduire le nombre d’essais physiques nécessaires avant le déploiement.
Pour les équipes produit, le test pratique consistera à savoir si l’agent peut transférer ses connaissances entre des contextes différents sans réentraînement intensif. Un exploitant d’entrepôt, par exemple, aurait besoin d’un robot capable de gérer des configurations changeantes et des colis inconnus. Un robot domestique devrait distinguer les situations nouvelles mais inoffensives de celles qui exigent de s’arrêter ou de demander de l’aide.
Cela crée des exigences supplémentaires au-delà de la prédiction. Les entreprises auront besoin de visibilité sur la façon dont le modèle du monde a été construit, sur la manière dont l’incertitude est représentée et sur le moment où le robot revient à un comportement sûr. Elles auront aussi besoin d’outils pour évaluer les événements rares, mettre à jour le système après le déploiement et distinguer une adaptation authentique d’une improvisation dangereuse.
Ce travail pourrait également intensifier la concurrence entre deux grandes stratégies de l’IA incarnée : des modèles plus vastes entraînés sur davantage de démonstrations, et des agents plus structurés qui apprennent à simuler et à planifier. Les deux approches ne s’excluent pas mutuellement, mais la recherche de Hafner avance l’idée qu’une meilleure prédiction interne pourrait être aussi importante qu’un plus grand volume de données d’entraînement.
Le premier signal sera de savoir si la startup s’identifie et explique son produit initial ou son objectif de recherche. Les investisseurs, partenaires et clients potentiels chercheront aussi des preuves que les robots humanoïdes sont utilisés pour autre chose que des expérimentations de laboratoire.
Les communications techniques compteront davantage que les affirmations générales. Des détails utiles incluraient les environnements utilisés pour l’évaluation, la quantité de données réelles nécessaire, l’évolution des performances dans des contextes inconnus et le comportement du système lorsque ses prédictions sont incertaines. Des tests indépendants sur la manipulation, la navigation, la récupération après chute et les interruptions critiques pour la sécurité offriraient de meilleures preuves que de simples benchmarks de jeux.
Enfin, le choix du modèle économique clarifiera l’ambition de l’entreprise. Une plateforme robotique, un système de contrôle sous licence et un produit robotique verticalement intégré impliqueraient chacun des exigences différentes en matière de fiabilité matérielle, d’assistance au déploiement et d’économie d’entreprise.
La nouvelle entreprise de Hafner est remarquable parce qu’elle s’attaque à une faiblesse précise des systèmes d’IA actuels : l’incapacité à agir de manière fiable lorsque les conditions diffèrent de l’entraînement. L’utilisation de modèles du monde et de l’apprentissage par renforcement fondé sur des modèles offre une voie plausible vers un comportement plus réfléchi, mais l’écart entre la réussite virtuelle et un fonctionnement physique fiable reste important.
Pour l’instant, c’est une entreprise portée par la recherche qu’il faut suivre, et non un fournisseur de robotique validé. La question décisive sera de savoir si Hafner peut transformer la planification prédictive en gains mesurables dans des environnements réels — moins d’essais d’entraînement, une récupération plus sûre face aux imprévus et des performances constantes sans ingénierie sur mesure pour chaque nouveau lieu.