LEGO-Anything demuestra que los agentes de programación pueden crear escenas 3D editables a partir de fotos, pero LEGO-Bench revela grandes carencias en precisión y autoevaluación.

Los agentes de programación están mejorando a la hora de convertir una sola fotografía en una escena 3D editable, pero una nueva investigación sugiere que todavía no pueden detectar de forma fiable cuándo su reconstrucción es incorrecta.
El proyecto de University of Maryland y AWS, llamado LEGO-Anything, pide a un agente que escriba código de Blender a partir de una imagen, renderice el resultado, lo inspeccione y revise el programa. Su benchmark asociado, LEGO-Bench, descubrió que la configuración probada más potente alcanzó una precisión del 53,4 % en escenas interiores y del 39,6 % en escenas exteriores. Más importante aún, la capacidad de los agentes para juzgar si una reconstrucción era mejor que otra quedó cerca del azar o por debajo.
Esta combinación es relevante para los equipos de producto que crean herramientas de diseño, simulación, robótica y computación espacial asistidas por IA. Un agente capaz de producir una escena utilizable es valioso, pero uno que no pueda reconocer errores geométricos puede hacer que los flujos iterativos sean difíciles de confiar sin comprobaciones independientes.
LEGO-Anything trata la reconstrucción de imagen a 3D como una tarea de programación, no como el resultado único de un modelo generativo. El agente recibe una imagen y escribe código para Blender, la plataforma abierta de creación 3D. Después puede ejecutar ese código, inspeccionar la escena renderizada y realizar nuevas ediciones.
El resultado pretende ser más útil que una imagen estática o un recurso 3D opaco. Un programa puede exponer los objetos, la geometría, la distribución y la posición de la cámara. Los usuarios pueden inspeccionar la escena, cambiar elementos individuales o consultarla como parte de un flujo de trabajo mayor.
El enfoque también refleja una dirección práctica para los agentes de IA: generar un artefacto, ejecutarlo, evaluar el resultado y perfeccionar el código subyacente. En teoría, ese ciclo debería permitir que un agente corrija errores sin requerir un modelo nuevo para cada tipo de escena.
Pero una sola fotografía no revela la profundidad exacta ni la geometría oculta. Por ello, los investigadores necesitaban una forma controlada de medir la calidad de la reconstrucción sin que las entradas parecieran obviamente sintéticas.
LEGO-Bench contiene 208 imágenes que representan 104 escenas interiores y exteriores, construidas a partir de 443 recursos registrados. Según la descripción de la investigación publicada por The Decoder, las imágenes se renderizan a partir de escenas de simulador creadas profesionalmente. Esto permite al benchmark acceder a la geometría real oculta, la profundidad y las asignaciones de objetos, al tiempo que conserva una apariencia visual más natural.
El benchmark evalúa tres dimensiones. La validez comprueba si el agente entregó un artefacto de escena utilizable. La reconstrucción mide la precisión de la geometría visible. La apariencia compara, a nivel de píxel, una versión renderizada de nuevo con la imagen de referencia.
Las seis configuraciones de GPT probadas produjeron, en general, escenas funcionales. Sin embargo, su calidad varió mucho. El líder informado, GPT-6 Astra, alcanzó un 53,4 % en escenas interiores y un 39,6 % en exteriores, mientras que las configuraciones más débiles rondaron el 15 %. Estos son resultados de este benchmark de investigación, no pruebas de que el modelo funcione al mismo nivel con fotografías arbitrarias del mundo real.
La complejidad empeoró el rendimiento, y las escenas exteriores fueron más difíciles que los interiores. Los investigadores también informaron que proporcionar a los modelos un presupuesto de razonamiento mayor mejoró sustancialmente los resultados. En un subconjunto de oficinas, la puntuación de GPT-6 Astra subió del 32,3 % al 61,8 % con un presupuesto de razonamiento superior.
El fallo más revelador apareció en la autoevaluación. Cuando los agentes tenían que elegir cuál de dos versiones coincidía mejor con la imagen original, sus juicios geométricos quedaron cerca de un lanzamiento de moneda o por debajo. En términos prácticos, un agente podría hacer una modificación perjudicial y no reconocer que la escena se había vuelto menos precisa.
Este hallazgo limita una suposición común sobre los flujos de trabajo agénticos: que la inspección visual repetida conducirá automáticamente a la convergencia. La investigación indica que la iteración por sí sola no basta cuando la evaluación interna del agente no es fiable.
Los investigadores respondieron con LEGO-Plugin, una extensión que no requiere entrenamiento adicional del modelo. Vincula la escena inicial a la imagen de referencia, sustituye el juicio propio poco fiable del agente por mediciones concretas y protege los avances correctos frente a regresiones posteriores.
Según los resultados publicados, el plugin mejoró los seis modelos probados. Las mayores ganancias alcanzaron el 62,7 % en los agentes más débiles, mientras que el modelo más potente ganó aproximadamente dos puntos porcentuales. Esta diferencia es importante: los controles de evaluación y del flujo de trabajo pueden aportar más valor a los sistemas débiles que limitarse a aumentar la capacidad del modelo.
Las escenas reconstruidas también se probaron como entradas para tareas estándar de visión por computador. La detección de objetos obtuvo el mejor resultado, con aproximadamente la mitad del rendimiento del modelo especializado DINO. La segmentación y la estimación de profundidad quedaron aún más atrás que sistemas especializados como SAM 3 y Depth Anything 3.
Estas comparaciones sugieren que los programas de escenas ejecutables ya son utilizables como representaciones intermedias, pero todavía no sustituyen de forma fiable a los modelos de visión específicos para cada tarea. Una escena puede ser suficientemente válida para editarla o inspeccionarla y, al mismo tiempo, demasiado imprecisa para mediciones posteriores.
Para los desarrolladores, la lección inmediata es separar la generación del artefacto de su verificación. Un agente de programación puede escribir una escena de Blender, pero los sistemas de producción quizá necesiten restricciones geométricas, puntuación basada en imágenes, comprobaciones a nivel de objeto y protecciones contra regresiones. La revisión humana puede seguir siendo necesaria cuando la escena se utiliza en fabricación, arquitectura, robótica o simulaciones sensibles a la seguridad.
El trabajo también apunta a una disyuntiva de despliegue. Un mayor razonamiento puede mejorar la calidad, pero aumentar la latencia y el coste de inferencia. Un plugin basado en mediciones podría ofrecer una forma más específica de mejorar los resultados que asignar simplemente un presupuesto de razonamiento mayor a cada tarea.
Los compradores empresariales deberían considerar “3D editable a partir de una foto” como una capacidad con varios niveles de utilidad. Una escena de aspecto plausible puede servir para visualización aproximada o bloqueo de contenido. No debería tratarse automáticamente como un gemelo digital preciso, un mapa de profundidad fiable o un sustituto del software especializado de reconstrucción.
El mercado más amplio ya explora enfoques relacionados. Unity ha lanzado plugins para Claude Code y Codex, mientras que Atlas, de World Labs, adopta una vía basada en modelos para la reconstrucción de escenas. GenCeption, de Google DeepMind, utiliza un modelo de vídeo para estimar profundidad y segmentar. Estos sistemas no son directamente comparables con LEGO-Anything, pero muestran que la integración de software 3D, los modelos del mundo y las canalizaciones especializadas de percepción avanzan en paralelo.
La señal clave será comprobar si el refinamiento basado en mediciones sigue funcionando con fotografías reales y no solo con escenas de benchmark que cuentan con una verdad de referencia oculta del simulador. Las evaluaciones futuras también deberían mostrar cómo cambia el rendimiento con oclusiones, ángulos de cámara inusuales, superficies reflectantes, desorden y objetos ausentes de la biblioteca de recursos del agente.
Los desarrolladores deberían prestar atención a los benchmarks que informen sobre coste, latencia, estabilidad de edición y rendimiento en tareas posteriores, además de las puntuaciones de reconstrucción. También será importante saber si los agentes pueden explicar qué partes de una escena son inciertas, en lugar de devolver un único nivel de confianza que oculte los errores.
Otra prueba importante es la integración en herramientas de producción. Si sistemas como Blender, Unity, Claude Code o Codex pueden combinar la generación con comprobaciones geométricas independientes, podrían resultar útiles para flujos supervisados antes de que se confíe en ellos para construir escenas de forma autónoma.
LEGO-Anything demuestra menos que los agentes hayan resuelto la reconstrucción 3D que el hecho de que la evaluación se está convirtiendo en el problema central de ingeniería. Producir una escena es solo el primer paso; determinar si conserva la geometría correcta es lo que separa un prototipo creativo de una herramienta fiable.
La investigación también ofrece un principio práctico de diseño para productos de IA: no pedir a un agente que sea el único juez de su propio trabajo cuando existen mediciones objetivas. Para los equipos que crean sistemas espaciales o generadores de código, la verificación independiente puede ser tan importante como el razonamiento visual del modelo subyacente.