Danijar Hafner está construindo agentes de IA furtivos que planejam para ambientes desconhecidos

Danijar Hafner está desenvolvendo agentes de modelo de mundo para robôs que podem prever resultados e se adaptar a casas, objetos e ambientes desconhecidos.

AI News

Uma nova startup liderada pelo ex-pesquisador do Google DeepMind Danijar Hafner está desenvolvendo agentes de IA projetados para antecipar o que pode acontecer em ambientes que eles nunca viram antes, segundo um perfil publicado pela MIT Technology Review. A empresa continua em modo furtivo, não divulgou publicamente seu nome ou produto e opera a partir de um escritório de San Francisco com poucos móveis e contendo robôs humanoides.

O trabalho amplia a pesquisa de longa data de Hafner sobre agentes que aprendem dentro de ambientes simulados antes de agir no mundo real. Sua importância imediata não é um lançamento comercial, mas uma direção técnica: usar modelos internos da realidade para permitir que robôs planejem com antecedência em vez de depender principalmente de tentativa e erro após a implantação.

Uma startup furtiva construída em torno de modelos de mundo

Hafner deixou o Google DeepMind para fundar a startup no outono de 2025. Ele revelou poucos detalhes operacionais, incluindo o nome da empresa, financiamento, clientes planejados ou cronograma de lançamento. A MIT Technology Review informou que o escritório contém robôs humanoides vindos da China, sugerindo que a robótica física é central no trabalho atual da empresa, embora o relatório não estabeleça um produto específico ou alvo de implantação.

A base técnica é o aprendizado por reforço baseado em modelos. Nessa abordagem, um agente aprende um modelo do seu ambiente e usa esse modelo para prever as consequências de possíveis ações. Em vez de testar repetidamente cada ação em um ambiente físico, o agente pode avaliar resultados imaginados e selecionar um curso de ação com base nessas previsões.

Para um robô operando em uma casa, isso pode significar adaptar-se a uma planta baixa, à disposição dos móveis ou a uma interrupção inesperada que não estava presente nos dados de treinamento. O conceito é particularmente relevante para robôs de serviço, em que os ambientes variam e os erros podem danificar propriedades ou criar riscos de segurança.

De mundos de jogo a robôs físicos

O histórico de pesquisa de Hafner fornece a evidência pública mais clara para essa abordagem. Seu sistema PlaNet usava um modelo aprendido para apoiar o planejamento antecipatório. Trabalhos posteriores na família de agentes Dreamer aplicaram a mesma ideia geral a tarefas cada vez mais difíceis em ambientes simulados.

Segundo a MIT Technology Review, o Dreamer 2 alcançou desempenho de nível humano em jogos de Atari 2600 usando um modelo de mundo, enquanto o Dreamer 3 resolveu o desafio Minecraft Diamond ao aprender a minerar o recurso do jogo. O Dreamer 4 teria ido além ao aprender a partir de dados gravados de gameplay sem interagir diretamente com o jogo durante o treinamento.

Esses resultados importam porque mostram como o planejamento pode reduzir a quantidade de interação direta necessária durante o aprendizado. No entanto, o sucesso em jogos não demonstra por si só desempenho confiável em casas, fábricas, armazéns ou espaços públicos. Os jogos oferecem regras definidas e objetivos mensuráveis; o mundo físico é menos previsível, mais difícil de simular com precisão e mais consequente quando uma ação falha.

O projeto DayDreamer de Hafner representa a ponte para a robótica. O projeto usou a abordagem Dreamer para ajudar robôs a operar em ambientes desconhecidos e reagir a novas experiências, incluindo serem derrubados. A startup parece estar buscando uma versão mais ambiciosa dessa transição, com máquinas humanoides como plataforma física.

O que as evidências mostram — e o que não mostram

A evidência mais forte disponível é o histórico de pesquisa publicado de Hafner e o relato de seu ambiente atual de laboratório. As alegações sobre PlaNet, Dreamer e DayDreamer são relatadas pela MIT Technology Review no contexto do trabalho anterior de Hafner. Elas descrevem conquistas de pesquisa e demonstrações, não capacidades comerciais da nova startup verificadas independentemente.

Também não há evidência pública no relatório fornecido de implantações com clientes, contratos de produção, receita, certificações de segurança ou testes comparativos contra outros sistemas robóticos. Timothy Lillicrap, ex-colega de Hafner no Google, o elogiou como um pesquisador excepcional, mas essa avaliação é um endosso individual, não um benchmark de desempenho.

A distinção é importante para compradores e desenvolvedores. Um modelo que prevê estados de jogo ou se adapta a um experimento robótico controlado ainda precisa provar que suas previsões permanecem precisas quando os sensores estão ruidosos, os objetos se movem inesperadamente e o custo de uma decisão errada é alto. O status furtivo da startup torna essas questões impossíveis de avaliar hoje.

Por que a abordagem importa para construtores e empresas

Se os sistemas de Hafner funcionarem fora de demonstrações rigidamente controladas, eles poderão enfrentar um dos principais gargalos da robótica: o custo e a dificuldade de coletar experiência suficiente do mundo real. Treinar robôs por meio de falhas físicas repetidas é lento, caro e potencialmente inseguro. Planejar dentro de um ambiente aprendido pode reduzir o número de testes físicos necessários antes da implantação.

Para equipes de produto, o teste prático será se o agente consegue transferir conhecimento entre cenários sem retreinamento extensivo. Um operador de armazém, por exemplo, precisaria de um robô capaz de lidar com layouts variáveis e pacotes desconhecidos. Um robô doméstico teria de distinguir entre situações novas e inofensivas e aquelas que exigem parar ou pedir ajuda.

Isso cria requisitos adicionais além da previsão. As empresas precisarão ter visibilidade sobre como o modelo de mundo foi construído, como a incerteza é representada e quando o robô recua para um comportamento seguro. Também precisarão de ferramentas para avaliar eventos raros, atualizar o sistema após a implantação e separar adaptação genuína de improvisação insegura.

O trabalho também pode intensificar a competição entre duas estratégias amplas em IA incorporada: modelos maiores treinados com mais demonstrações e agentes mais estruturados que aprendem a simular e planejar. As duas abordagens não são mutuamente exclusivas, mas a pesquisa de Hafner apresenta o caso de que uma melhor previsão interna pode ser tão importante quanto mais dados de treinamento.

O que observar a seguir

O primeiro sinal será se a startup se identificar e explicar seu produto inicial ou objetivo de pesquisa. Investidores, parceiros e possíveis clientes também procurarão evidências de que os robôs humanoides estão sendo usados para mais do que experimentação em laboratório.

Divulgações técnicas importam mais do que alegações amplas. Detalhes úteis incluiriam os ambientes usados para avaliação, a quantidade de dados do mundo real necessária, como o desempenho muda em ambientes desconhecidos e o comportamento do sistema quando suas previsões são incertas. Testes independentes de manipulação, navegação, recuperação de quedas e interrupções críticas para a segurança forneceriam provas mais fortes do que benchmarks de jogos sozinhos.

Por fim, a escolha do modelo de negócios esclarecerá sua ambição. Uma plataforma de robótica, um sistema de controle licenciado e um produto robótico verticalmente integrado implicariam requisitos diferentes de confiabilidade de hardware, suporte à implantação e economia empresarial.

Perspectiva da Creati.ai

A nova empreitada de Hafner é notável porque ataca uma fraqueza específica dos sistemas de IA atuais: a incapacidade de agir de forma confiável quando as condições diferem do treinamento. O uso de modelos de mundo e aprendizado por reforço baseado em modelos oferece um caminho plausível para um comportamento mais deliberado, mas a lacuna entre conquista virtual e operação física confiável continua substancial.

Por enquanto, esta é uma empresa orientada por pesquisa para acompanhar, e não um fornecedor de robótica validado. A questão decisiva será se Hafner consegue transformar o planejamento preditivo em ganhos mensuráveis em ambientes reais — menos tentativas de treinamento, recuperação mais segura de surpresas e desempenho consistente sem engenharia personalizada para cada novo local.

Anúncios