LEGO-Anything montre que des agents de programmation peuvent créer des scènes 3D modifiables à partir de photos, tandis que LEGO-Bench révèle d’importantes lacunes en matière de précision et d’autoévaluation.

Les agents de programmation progressent dans la transformation d’une simple photographie en scène 3D modifiable, mais une nouvelle étude suggère qu’ils ne savent toujours pas déterminer de manière fiable quand leur reconstruction est erronée.
Le projet de University of Maryland et AWS, baptisé LEGO-Anything, demande à un agent d’écrire du code Blender à partir d’une image, de générer le rendu, de l’inspecter et de réviser le programme. Son benchmark associé, LEGO-Bench, a constaté que la configuration testée la plus performante atteignait 53,4 % de précision sur les scènes intérieures et 39,6 % sur les scènes extérieures. Plus important encore, la capacité des agents à juger si une reconstruction était meilleure qu’une autre se situait autour du hasard ou en dessous.
Cette combinaison est importante pour les équipes produit qui développent des outils de conception, de simulation, de robotique et d’informatique spatiale assistés par l’IA. Un agent capable de produire une scène exploitable est précieux, mais un agent incapable de reconnaître les erreurs géométriques peut rendre les flux de travail itératifs difficiles à fiabiliser sans contrôles indépendants.
LEGO-Anything traite la reconstruction d’une image en 3D comme une tâche de programmation plutôt que comme la sortie unique d’un modèle génératif. L’agent reçoit une image et écrit du code pour Blender, la plateforme ouverte de création 3D. Il peut ensuite exécuter ce code, inspecter la scène rendue et effectuer d’autres modifications.
Le résultat est censé être plus utile qu’une image statique ou qu’un actif 3D opaque. Un programme peut exposer les objets, la géométrie, la disposition et la position de la caméra. Les utilisateurs peuvent examiner la scène, modifier des éléments individuels ou l’interroger dans le cadre d’un flux de travail plus large.
Cette approche reflète également une orientation pratique pour les agents d’IA : générer un artefact, l’exécuter, évaluer le résultat et affiner le code sous-jacent. En principe, cette boucle devrait permettre à un agent de corriger ses erreurs sans nécessiter un nouveau modèle pour chaque type de scène.
Mais une seule photographie ne révèle ni la profondeur exacte ni la géométrie cachée. Les chercheurs avaient donc besoin d’une méthode contrôlée pour mesurer la qualité de la reconstruction sans rendre les entrées manifestement synthétiques.
LEGO-Bench contient 208 images représentant 104 scènes intérieures et extérieures, construites à partir de 443 actifs enregistrés. Selon la description de la recherche rapportée par The Decoder, les images sont rendues à partir de scènes de simulateur créées par des professionnels. Le benchmark peut ainsi accéder à la géométrie réelle cachée, à la profondeur et aux attributions d’objets, tout en conservant une apparence visuelle plus naturelle.
Le benchmark évalue trois dimensions. La validité vérifie que l’agent a fourni un artefact de scène exploitable. La reconstruction mesure la précision de la géométrie visible. L’apparence compare au niveau des pixels une soumission rendue à nouveau avec l’image de référence.
Les six configurations GPT testées ont généralement produit des scènes fonctionnelles. Leur qualité variait toutefois fortement. Le modèle en tête, GPT-6 Astra, a atteint 53,4 % sur les scènes intérieures et 39,6 % à l’extérieur, tandis que les configurations plus faibles se situaient autour de 15 %. Ces résultats sont ceux de ce benchmark de recherche et ne prouvent pas que le modèle fonctionnera au même niveau sur des photographies réelles quelconques.
La complexité dégradait les performances, et les scènes extérieures étaient plus difficiles que les scènes intérieures. Les chercheurs ont également indiqué qu’un budget de raisonnement plus important améliorait sensiblement les résultats. Sur un sous-ensemble de bureaux, le score de GPT-6 Astra est passé de 32,3 % à 61,8 % avec un budget de raisonnement supérieur.
L’échec le plus révélateur est apparu lors de l’autoévaluation. Lorsque les agents devaient choisir laquelle de deux versions correspondait le mieux à l’image originale, leurs jugements géométriques étaient proches d’un pile ou face, voire inférieurs. En pratique, un agent pourrait effectuer une modification dommageable sans reconnaître que la scène est devenue moins précise.
Cette constatation limite une hypothèse courante concernant les flux de travail agentiques : l’idée qu’une inspection visuelle répétée mènera automatiquement à la convergence. La recherche indique que l’itération seule ne suffit pas lorsque l’évaluation interne de l’agent n’est pas fiable.
Les chercheurs ont répondu avec LEGO-Plugin, une extension qui ne nécessite pas d’entraînement supplémentaire du modèle. Elle ancre la scène initiale dans l’image de référence, remplace le jugement personnel peu fiable de l’agent par des mesures concrètes et protège les progrès corrects contre les régressions ultérieures.
Selon les résultats rapportés, le plugin a amélioré les six modèles testés. Les gains les plus importants ont atteint 62,7 % pour les agents les plus faibles, tandis que le modèle le plus puissant a gagné environ deux points de pourcentage. Cette différence est importante : les contrôles d’évaluation et de flux de travail pourraient apporter davantage de valeur aux systèmes faibles qu’une simple augmentation des capacités du modèle.
Les scènes reconstruites ont également été testées comme entrées pour des tâches classiques de vision par ordinateur. La détection d’objets a obtenu les meilleurs résultats, atteignant environ la moitié des performances du modèle spécialisé DINO. La segmentation et l’estimation de profondeur restaient encore plus éloignées des systèmes spécialisés, notamment SAM 3 et Depth Anything 3.
Ces comparaisons suggèrent que les programmes de scènes exécutables sont déjà utilisables comme représentations intermédiaires, mais qu’ils ne remplacent pas encore de manière fiable les modèles de vision spécialisés par tâche. Une scène peut être suffisamment valide pour être modifiée ou inspectée tout en restant trop imprécise pour des mesures en aval.
Pour les développeurs, la leçon immédiate consiste à séparer la génération de l’artefact de sa vérification. Un agent de programmation peut écrire une scène Blender, mais les systèmes de production peuvent avoir besoin de contraintes géométriques, d’une évaluation basée sur l’image, de contrôles au niveau des objets et de protections contre les régressions. Une validation humaine peut rester nécessaire lorsque la scène alimente la fabrication, l’architecture, la robotique ou des simulations sensibles à la sécurité.
Le travail souligne également un compromis de déploiement. Davantage de raisonnement peut améliorer la qualité, mais aussi accroître la latence et le coût d’inférence. Un plugin fondé sur des mesures pourrait offrir une manière plus ciblée d’améliorer les résultats que l’attribution systématique d’un budget de raisonnement plus élevé à chaque tâche.
Les acheteurs professionnels devraient considérer la « 3D modifiable à partir d’une photo » comme une capacité présentant plusieurs niveaux d’utilité. Une scène d’apparence plausible peut servir à une visualisation approximative ou au blocage de contenu. Elle ne doit pas être automatiquement considérée comme un jumeau numérique précis, une carte de profondeur fiable ou un substitut aux logiciels spécialisés de reconstruction.
Le marché plus large explore déjà des approches voisines. Unity a publié des plugins pour Claude Code et Codex, tandis qu’Atlas, de World Labs, adopte une approche fondée sur un modèle pour la reconstruction de scènes. GenCeption de Google DeepMind utilise un modèle vidéo pour l’estimation de profondeur et la segmentation. Ces systèmes ne sont pas directement comparables à LEGO-Anything, mais ils montrent que l’intégration de logiciels 3D, les modèles du monde et les pipelines de perception spécialisés progressent en parallèle.
Le signal clé sera de déterminer si le raffinement fondé sur les mesures continue de fonctionner sur des photographies réelles, plutôt que seulement sur des scènes de benchmark dotées d’une vérité terrain cachée issue d’un simulateur. Les futures évaluations devront également montrer comment les performances évoluent avec l’occlusion, les angles de caméra inhabituels, les surfaces réfléchissantes, l’encombrement et les objets absents de la bibliothèque d’actifs de l’agent.
Les développeurs devraient surveiller les benchmarks qui indiquent les coûts, la latence, la stabilité des modifications et les performances sur les tâches en aval, en plus des scores de reconstruction. Il sera également important de savoir si les agents peuvent expliquer quelles parties d’une scène sont incertaines, plutôt que de fournir un unique niveau de confiance qui masque les erreurs.
Un autre test important est l’intégration aux outils de production. Si des systèmes tels que Blender, Unity, Claude Code ou Codex peuvent associer génération et contrôles géométriques indépendants, ils pourraient devenir utiles dans des flux supervisés avant qu’on leur fasse confiance pour construire des scènes de manière autonome.
LEGO-Anything montre moins que les agents ont résolu la reconstruction 3D qu’il ne prouve que l’évaluation devient le principal problème d’ingénierie. Produire une scène n’est que la première étape ; déterminer si elle conserve la bonne géométrie est ce qui distingue un prototype créatif d’un outil fiable.
Cette recherche propose également un principe de conception pratique pour les produits d’IA : ne pas demander à un agent d’être le seul juge de son propre travail lorsque des mesures objectives sont disponibles. Pour les équipes qui développent des systèmes spatiaux ou générateurs de code, la vérification indépendante peut compter autant que le raisonnement visuel du modèle sous-jacent.