LEGO-Anything mostra que agentes de programação podem criar cenas 3D editáveis a partir de fotos, mas LEGO-Bench expõe grandes lacunas em precisão e autoavaliação.

Os agentes de programação estão ficando melhores em transformar uma única fotografia em uma cena 3D editável, mas novas pesquisas sugerem que eles ainda não conseguem identificar com confiabilidade quando sua reconstrução está errada.
O projeto da University of Maryland e da AWS, chamado LEGO-Anything, pede que um agente escreva código Blender a partir de uma imagem, renderize o resultado, inspecione-o e revise o programa. Seu benchmark associado, LEGO-Bench, descobriu que a configuração mais forte testada alcançou 53,4% de precisão em cenas internas e 39,6% em cenas externas. Mais importante, a capacidade dos agentes de julgar se uma reconstrução era melhor que outra ficou próxima ou abaixo do acaso.
Essa combinação é importante para equipes de produto que desenvolvem ferramentas de design, simulação, robótica e computação espacial assistidas por IA. Um agente capaz de produzir uma cena utilizável é valioso, mas um agente que não reconhece erros geométricos pode tornar difíceis de confiar os fluxos iterativos sem verificações independentes.
LEGO-Anything trata a reconstrução de imagem para 3D como uma tarefa de programação, e não como uma única saída de um modelo generativo. O agente recebe uma imagem e escreve código para o Blender, a plataforma aberta de criação 3D. Depois, pode executar esse código, inspecionar a cena renderizada e fazer novas edições.
O resultado pretende ser mais útil do que uma imagem estática ou um recurso 3D opaco. Um programa pode expor objetos, geometria, disposição e posição da câmera. Os usuários podem inspecionar a cena, alterar elementos individuais ou consultá-la como parte de um fluxo de trabalho maior.
A abordagem também reflete uma direção prática para agentes de IA: gerar um artefato, executá-lo, avaliar o resultado e aperfeiçoar o código subjacente. Em princípio, esse ciclo deveria permitir que um agente corrigisse erros sem exigir um novo modelo para cada tipo de cena.
Mas uma única fotografia não revela a profundidade exata nem a geometria oculta. Por isso, os pesquisadores precisaram de uma forma controlada de medir a qualidade da reconstrução sem tornar as entradas obviamente sintéticas.
LEGO-Bench contém 208 imagens que representam 104 cenas internas e externas, construídas a partir de 443 ativos registrados. De acordo com a descrição da pesquisa divulgada pelo The Decoder, as imagens são renderizadas a partir de cenas de simulador criadas profissionalmente. Isso dá ao benchmark acesso à geometria real oculta, à profundidade e às atribuições de objetos, preservando uma aparência visual mais natural.
O benchmark avalia três dimensões. A validade verifica se o agente entregou um artefato de cena utilizável. A reconstrução mede a precisão da geometria visível. A aparência compara, em nível de pixel, uma submissão renderizada novamente com a imagem de referência.
As seis configurações GPT testadas geralmente produziram cenas funcionais. Sua qualidade, porém, variou muito. O líder informado, GPT-6 Astra, alcançou 53,4% em cenas internas e 39,6% em ambientes externos, enquanto configurações mais fracas ficaram em torno de 15%. Esses são resultados deste benchmark de pesquisa, não evidências de que o modelo terá o mesmo desempenho em fotografias reais arbitrárias.
A complexidade piorou o desempenho, e as cenas externas foram mais difíceis que as internas. Os pesquisadores também relataram que oferecer aos modelos um orçamento maior de raciocínio melhorou substancialmente os resultados. Em um subconjunto de escritórios, a pontuação do GPT-6 Astra subiu de 32,3% para 61,8% com um orçamento de raciocínio maior.
A falha mais reveladora apareceu na autoavaliação. Quando os agentes precisavam escolher qual de duas versões correspondia melhor à imagem original, seus julgamentos geométricos ficaram próximos ou abaixo de um cara ou coroa. Na prática, um agente poderia fazer uma edição prejudicial e não reconhecer que a cena havia ficado menos precisa.
Essa descoberta limita uma suposição comum sobre fluxos de trabalho agênticos: a de que a inspeção visual repetida levará automaticamente à convergência. A pesquisa indica que a iteração, sozinha, não é suficiente quando a avaliação interna do agente não é confiável.
Os pesquisadores responderam com LEGO-Plugin, uma extensão que não exige treinamento adicional do modelo. Ela ancora a cena inicial à imagem de referência, substitui o julgamento próprio não confiável do agente por medições concretas e protege avanços corretos contra regressões posteriores.
O plugin melhorou os seis modelos testados, segundo os resultados divulgados. Os maiores ganhos chegaram a 62,7% para agentes mais fracos, enquanto o modelo mais forte ganhou aproximadamente dois pontos percentuais. Essa diferença é importante: controles de avaliação e de fluxo de trabalho podem oferecer mais valor a sistemas fracos do que simplesmente aumentar a capacidade do modelo.
As cenas reconstruídas também foram testadas como entradas para tarefas padrão de visão computacional. A detecção de objetos teve o melhor desempenho, alcançando aproximadamente metade do desempenho do modelo especializado DINO. A segmentação e a estimativa de profundidade ficaram ainda mais atrás de sistemas especializados, incluindo SAM 3 e Depth Anything 3.
Essas comparações sugerem que programas de cenas executáveis já são utilizáveis como representações intermediárias, mas ainda não são substitutos confiáveis para modelos de visão específicos de cada tarefa. Uma cena pode ser válida o suficiente para edição ou inspeção e, ao mesmo tempo, imprecisa demais para medições posteriores.
Para os desenvolvedores, a lição imediata é separar a geração do artefato de sua verificação. Um agente de programação pode escrever uma cena Blender, mas sistemas de produção talvez precisem de restrições geométricas, pontuação baseada em imagens, verificações no nível dos objetos e proteções contra regressões. A revisão humana pode continuar necessária quando a cena alimentar processos de fabricação, arquitetura, robótica ou simulações sensíveis à segurança.
O trabalho também aponta para um dilema de implantação. Mais raciocínio pode melhorar a qualidade, mas aumentar a latência e o custo de inferência. Um plugin orientado por medições poderia oferecer uma maneira mais direcionada de melhorar os resultados do que simplesmente atribuir um orçamento maior de raciocínio a todas as tarefas.
Compradores empresariais devem tratar “3D editável a partir de uma foto” como uma capacidade com vários níveis de utilidade. Uma cena visualmente plausível pode apoiar visualização aproximada ou bloqueio de conteúdo. Ela não deve ser automaticamente tratada como um gêmeo digital preciso, um mapa de profundidade confiável ou um substituto de software especializado de reconstrução.
O mercado mais amplo já explora abordagens adjacentes. A Unity lançou plugins para Claude Code e Codex, enquanto o Atlas, da World Labs, segue uma abordagem baseada em modelos para reconstrução de cenas. O GenCeption, da Google DeepMind, usa um modelo de vídeo para estimativa de profundidade e segmentação. Esses sistemas não são diretamente comparáveis ao LEGO-Anything, mas mostram que a integração de software 3D, os modelos de mundo e os pipelines especializados de percepção estão evoluindo em paralelo.
O principal sinal será saber se o refinamento baseado em medições continua funcionando em fotografias reais, e não apenas em cenas de benchmark com ground truth oculto de simulador. Avaliações futuras também devem mostrar como o desempenho muda com oclusões, ângulos de câmera incomuns, superfícies refletivas, desordem e objetos ausentes da biblioteca de ativos do agente.
Os desenvolvedores devem observar benchmarks que relatem custo, latência, estabilidade das edições e desempenho em tarefas posteriores, além das pontuações de reconstrução. Também será importante saber se os agentes conseguem explicar quais partes de uma cena são incertas, em vez de devolver um único julgamento de confiança que esconda erros.
Outro teste importante é a integração em ferramentas de produção. Se sistemas como Blender, Unity, Claude Code ou Codex conseguirem combinar geração com verificações geométricas independentes, poderão ser úteis em fluxos supervisionados antes de receberem confiança para construir cenas de forma autônoma.
LEGO-Anything é menos uma demonstração de que os agentes resolveram a reconstrução 3D do que uma evidência de que a avaliação está se tornando o principal problema de engenharia. Produzir uma cena é apenas o primeiro passo; determinar se ela preserva a geometria correta é o que separa um protótipo criativo de uma ferramenta confiável.
A pesquisa também oferece um princípio prático de design para produtos de IA: não peça a um agente que seja o único juiz do próprio trabalho quando houver medições objetivas disponíveis. Para equipes que desenvolvem sistemas espaciais ou geradores de código, a verificação independente pode ser tão importante quanto o raciocínio visual do modelo subjacente.