LEGO-Anything показывает, что кодирующие агенты могут создавать редактируемые 3D-сцены по фотографиям, однако LEGO-Bench выявляет серьезные пробелы в точности и самооценке.

Кодирующие агенты все лучше превращают одну фотографию в редактируемую 3D-сцену, однако новое исследование показывает, что они по-прежнему не могут надежно определить, когда их реконструкция ошибочна.
Проект University of Maryland и AWS под названием LEGO-Anything предлагает агенту написать код Blender по изображению, отрендерить результат, проверить его и пересмотреть программу. Сопутствующий бенчмарк LEGO-Bench показал, что самая сильная протестированная конфигурация достигла точности 53,4% на интерьерных сценах и 39,6% на экстерьерных. Еще важнее то, что способность агентов определить, какая из двух реконструкций лучше, оказалась примерно на уровне случайного угадывания или ниже.
Такое сочетание важно для продуктовых команд, создающих инструменты для дизайна, симуляции, робототехники и пространственных вычислений с поддержкой ИИ. Агент, способный создать пригодную для использования сцену, ценен, но агент, который не распознает геометрические ошибки, может сделать итеративные процессы ненадежными без независимых проверок.
LEGO-Anything рассматривает реконструкцию из изображения в 3D как задачу программирования, а не как единичный результат генеративной модели. Агент получает одно изображение и пишет код для Blender — открытой платформы создания 3D-контента. Затем он может выполнить этот код, проверить отрендеренную сцену и внести дополнительные изменения.
Предполагается, что такой результат полезнее статического изображения или непрозрачного 3D-актива. Программа может раскрывать объекты, геометрию, компоновку и положение камеры. Пользователи могут исследовать сцену, менять отдельные элементы или запрашивать ее в рамках более крупного рабочего процесса.
Подход также отражает практическое направление развития ИИ-агентов: создать артефакт, выполнить его, оценить результат и усовершенствовать исходный код. Теоретически такой цикл должен позволить агенту исправлять ошибки без необходимости создавать новую модель для каждого типа сцены.
Но одна фотография не показывает точную глубину или скрытую геометрию. Поэтому исследователям требовался контролируемый способ измерять качество реконструкции, не делая входные данные очевидно синтетическими.
LEGO-Bench содержит 208 изображений, представляющих 104 интерьерные и экстерьерные сцены, созданные из 443 зарегистрированных ассетов. Согласно описанию исследования, опубликованному The Decoder, изображения рендерятся из профессионально созданных сцен симулятора. Это дает бенчмарку доступ к скрытой эталонной геометрии, глубине и назначениям объектов, сохраняя при этом более естественный внешний вид.
Бенчмарк оценивает три измерения. Валидность проверяет, предоставил ли агент пригодный для использования артефакт сцены. Реконструкция измеряет точность видимой геометрии. Внешний вид сравнивает повторно отрендеренный результат с эталонным изображением на уровне пикселей.
Все шесть протестированных конфигураций GPT в целом создавали рабочие сцены. Однако их качество сильно различалось. Сообщается, что лидер GPT-6 Astra достиг 53,4% на интерьерных сценах и 39,6% на открытом воздухе, тогда как более слабые конфигурации набрали около 15%. Это результаты данного исследовательского бенчмарка, а не доказательство того, что модель покажет такой же уровень на любых реальных фотографиях.
С ростом сложности производительность снижалась, а наружные сцены были сложнее интерьеров. Исследователи также сообщили, что увеличение бюджета рассуждений моделей существенно улучшает результаты. На подмножестве офисных сцен показатель GPT-6 Astra вырос с 32,3% до 61,8% при увеличении бюджета рассуждений.
Наиболее показательная ошибка обнаружилась при самооценке. Когда агентам нужно было выбрать, какая из двух версий лучше соответствует исходному изображению, их геометрические суждения были близки к подбрасыванию монеты или хуже. На практике агент мог внести вредное изменение и не заметить, что сцена стала менее точной.
Этот вывод ограничивает распространенное предположение об агентских рабочих процессах: будто повторная визуальная проверка автоматически приводит к сходимости. Исследование показывает, что одной итерации недостаточно, если внутренняя оценка агента ненадежна.
Исследователи предложили LEGO-Plugin — расширение, не требующее дополнительного обучения модели. Оно привязывает исходную сцену к эталонному изображению, заменяет ненадежную самооценку агента конкретными измерениями и защищает правильный прогресс от последующих регрессий.
Согласно опубликованным результатам, плагин улучшил все шесть протестированных моделей. Наибольший прирост достиг 62,7% у более слабых агентов, тогда как самая сильная модель прибавила примерно два процентных пункта. Это соотношение важно: инструменты оценки и управления рабочим процессом могут принести слабым системам больше пользы, чем простое наращивание возможностей модели.
Реконструированные сцены также проверялись как входные данные для стандартных задач компьютерного зрения. Лучше всего показало себя обнаружение объектов, достигнув примерно половины производительности специализированной модели DINO. Сегментация и оценка глубины отставали еще сильнее от специализированных систем, включая SAM 3 и Depth Anything 3.
Эти сравнения показывают, что исполняемые программы сцен уже можно использовать как промежуточные представления, однако они пока не являются надежной заменой специализированным моделям зрения для конкретных задач. Сцена может быть достаточно корректной для редактирования или проверки, но слишком неточной для последующих измерений.
Для разработчиков главный практический вывод заключается в необходимости разделять создание артефакта и его проверку. Кодирующий агент может написать сцену Blender, однако производственным системам могут понадобиться геометрические ограничения, оценка на основе изображений, проверки на уровне объектов и защита от регрессий. Человеческая проверка может оставаться необходимой, если сцена используется в производстве, архитектуре, робототехнике или чувствительной к безопасности симуляции.
Работа также показывает компромисс при развертывании. Большее количество рассуждений может повысить качество, но увеличить задержку и стоимость инференса. Плагин, ориентированный на измерения, может стать более целенаправленным способом улучшения результатов, чем простое выделение большего бюджета рассуждений для каждой задачи.
Корпоративным покупателям следует рассматривать «редактируемое 3D по фотографии» как возможность с несколькими уровнями полезности. Правдоподобно выглядящая сцена может поддерживать приблизительную визуализацию или блокинг контента. Но ее не следует автоматически считать точным цифровым двойником, надежной картой глубины или заменой специализированного программного обеспечения для реконструкции.
Более широкий рынок уже изучает смежные подходы. Unity выпустила плагины для Claude Code и Codex, а Atlas от World Labs использует модельный подход к реконструкции сцен. GenCeption от Google DeepMind применяет видеомодель для оценки глубины и сегментации. Эти системы нельзя напрямую сравнивать с LEGO-Anything, но они показывают, что интеграция 3D-софта, мировые модели и специализированные конвейеры восприятия развиваются параллельно.
Ключевым сигналом станет вопрос о том, продолжит ли измерительное уточнение работать на реальных фотографиях, а не только на бенчмарк-сценах со скрытой эталонной геометрией симулятора. Будущие оценки также должны показать, как меняется производительность при окклюзиях, необычных углах камеры, отражающих поверхностях, беспорядке и наличии объектов, отсутствующих в библиотеке ассетов агента.
Разработчикам следует обращать внимание на бенчмарки, которые наряду с оценками реконструкции сообщают о стоимости, задержке, стабильности редактирования и производительности в последующих задачах. Важно будет и то, могут ли агенты объяснить, какие части сцены неопределенны, вместо того чтобы выдавать единственную оценку уверенности, скрывающую ошибки.
Еще один важный тест — интеграция с производственными инструментами. Если такие системы, как Blender, Unity, Claude Code или Codex, смогут совмещать генерацию с независимыми геометрическими проверками, они могут стать полезными для контролируемых рабочих процессов еще до того, как им начнут доверять автономное создание сцен.
LEGO-Anything скорее свидетельствует не о том, что агенты решили задачу 3D-реконструкции, а о том, что оценка становится центральной инженерной проблемой. Создать сцену — лишь первый шаг; именно проверка того, сохраняет ли она правильную геометрию, отделяет творческий прототип от надежного инструмента.
Исследование также предлагает практический принцип проектирования ИИ-продуктов: не следует делать агента единственным судьей собственной работы, если доступны объективные измерения. Для команд, создающих пространственные или генерирующие код системы, независимая проверка может быть не менее важна, чем визуальное рассуждение базовой модели.