AI 에이전트는 사진을 3D 장면으로 바꿀 수 있지만, 아직 자신의 작업을 안정적으로 평가하지는 못한다

LEGO-Anything은 코딩 에이전트가 사진에서 편집 가능한 3D 장면을 만들 수 있음을 보여주지만, LEGO-Bench는 정확도와 자기평가에 큰 공백이 있음을 드러낸다.

AI News

코딩 에이전트는 한 장의 사진을 편집 가능한 3D 장면으로 변환하는 능력을 계속 높이고 있지만, 새로운 연구에 따르면 여전히 자신의 재구성이 잘못된 때를 안정적으로 판단하지 못한다.

University of Maryland와 AWS가 진행한 LEGO-Anything 프로젝트는 에이전트에게 이미지에서 Blender 코드를 작성하고, 결과를 렌더링해 살펴본 뒤 프로그램을 수정하도록 한다. 함께 제공된 벤치마크 LEGO-Bench에 따르면 가장 강력한 테스트 구성은 실내 장면에서 53.4%, 실외 장면에서 39.6%의 정확도를 기록했다. 더 중요한 점은 한 재구성이 다른 재구성보다 나은지를 판단하는 에이전트의 능력이 우연과 비슷하거나 그보다 낮았다는 것이다.

이 조합은 AI 지원 설계, 시뮬레이션, 로보틱스, 공간 컴퓨팅 도구를 구축하는 제품팀에 중요하다. 사용 가능한 장면을 만들 수 있는 에이전트는 가치가 있지만, 기하학적 오류를 인식하지 못하는 에이전트는 독립적인 검증 없이는 반복 작업 흐름을 신뢰하기 어렵게 만들 수 있다.

사진에서 실행 가능한 3D 코드로

LEGO-Anything은 이미지-3D 재구성을 단일 생성 모델의 출력이 아니라 프로그래밍 작업으로 취급한다. 에이전트는 이미지 한 장을 받고, 개방형 3D 제작 플랫폼인 Blender용 코드를 작성한다. 그런 다음 코드를 실행하고 렌더링된 장면을 살펴보며 추가로 수정할 수 있다.

그 결과물은 정적인 이미지나 불투명한 3D 자산보다 더 유용하도록 설계됐다. 프로그램은 객체, 기하학, 배치, 카메라 위치를 드러낼 수 있다. 사용자는 장면을 살펴보고 개별 요소를 바꾸거나 더 큰 작업 흐름의 일부로 장면에 질의할 수 있다.

이 접근법은 AI 에이전트의 실용적인 방향도 보여준다. 아티팩트를 생성하고, 실행하고, 결과를 평가하고, 기반 코드를 개선하는 방식이다. 원칙적으로 이 반복 과정은 장면 유형마다 새 모델을 요구하지 않고도 에이전트가 오류를 수정하도록 할 수 있다.

하지만 사진 한 장만으로는 정확한 깊이나 보이지 않는 기하학을 알 수 없다. 따라서 연구진은 입력이 명백히 합성처럼 보이지 않으면서도 재구성 품질을 측정할 수 있는 통제된 방법이 필요했다.

LEGO-Bench가 신뢰성 격차를 드러내다

LEGO-Bench에는 443개의 등록 자산으로 제작된 104개의 실내·실외 장면을 나타내는 이미지 208장이 포함된다. The Decoder가 전한 연구 설명에 따르면 이미지는 전문적으로 제작된 시뮬레이터 장면에서 렌더링된다. 이를 통해 벤치마크는 더 자연스러운 시각적 외관을 유지하면서 숨겨진 실제 기하학, 깊이, 객체 할당에 접근할 수 있다.

벤치마크는 세 가지 차원을 평가한다. 유효성은 에이전트가 사용 가능한 장면 아티팩트를 제공했는지 확인한다. 재구성은 보이는 기하학의 정확도를 측정한다. 외관은 제출물을 다시 렌더링한 결과와 참조 이미지를 픽셀 단위로 비교한다.

테스트된 6개 GPT 구성은 대체로 작동하는 장면을 만들었다. 그러나 품질 편차는 컸다. 보고된 선두 모델 GPT-6 Astra는 실내 장면에서 53.4%, 실외에서 39.6%를 기록했으며, 약한 구성은 15% 안팎에 머물렀다. 이 결과는 해당 연구의 벤치마크 결과이지, 모델이 임의의 실제 사진에서도 같은 수준으로 작동한다는 증거는 아니다.

복잡도가 높아지면 성능이 나빠졌고, 실외 장면은 실내보다 어려웠다. 연구진은 모델에 더 큰 추론 예산을 제공하면 결과가 크게 개선된다고도 보고했다. 사무실 하위 집합에서 GPT-6 Astra의 점수는 더 높은 추론 예산을 적용했을 때 32.3%에서 61.8%로 상승했다.

더 의미 있는 실패는 자기평가에서 나타났다. 에이전트가 두 버전 중 원본 이미지와 더 잘 맞는 것을 선택해야 했을 때, 기하학적 판단은 동전 던지기와 비슷하거나 그보다 낮았다. 실제로 에이전트가 손상을 유발하는 편집을 하고도 장면의 정확도가 떨어졌다는 사실을 알아차리지 못할 수 있다는 뜻이다.

이 결과는 에이전트 워크플로에 대한 일반적인 가정에 한계를 제시한다. 반복적인 시각 검사가 자동으로 수렴을 이끈다는 가정이다. 에이전트의 내부 평가가 신뢰할 수 없다면 반복만으로는 충분하지 않다고 연구는 말한다.

LEGO-Plugin은 직관을 측정으로 대체한다

연구진은 추가적인 모델 학습이 필요 없는 확장 기능 LEGO-Plugin으로 대응했다. 이 플러그인은 초기 장면을 참조 이미지에 맞추고, 신뢰하기 어려운 에이전트의 자기 판단을 구체적인 측정으로 대체하며, 올바른 진전이 이후의 퇴행으로 훼손되지 않도록 보호한다.

보고된 결과에 따르면 플러그인은 테스트한 6개 모델 모두를 개선했다. 가장 큰 향상은 약한 에이전트에서 62.7%에 이르렀고, 가장 강력한 모델은 약 2%포인트 향상됐다. 이 격차는 중요하다. 평가와 워크플로 제어가 단순히 모델 성능을 높이는 것보다 약한 시스템에 더 큰 가치를 제공할 수 있기 때문이다.

재구성된 장면은 표준 컴퓨터 비전 작업의 입력으로도 테스트됐다. 객체 탐지가 가장 우수해 전문 모델 DINO 성능의 약 절반에 도달했다. 세그멘테이션과 깊이 추정은 SAM 3 및 Depth Anything 3을 비롯한 전문 시스템보다 더 뒤처졌다.

이 비교는 실행 가능한 장면 프로그램이 이미 중간 표현으로 사용할 수 있지만, 작업별 비전 모델을 안정적으로 대체할 수준은 아직 아니라는 점을 시사한다. 장면은 편집하거나 살펴보기에는 충분히 유효하면서도 후속 측정에는 지나치게 부정확할 수 있다.

개발자와 기업 구매자에게 주는 의미

개발자에게 주는 즉각적인 교훈은 아티팩트 생성과 검증을 분리하라는 것이다. 코딩 에이전트는 Blender 장면을 작성할 수 있지만, 실제 운영 시스템에는 기하학적 제약, 이미지 기반 점수 산정, 객체 수준 점검, 퇴행 방지 장치가 필요할 수 있다. 장면이 제조, 건축, 로보틱스 또는 안전이 중요한 시뮬레이션에 사용된다면 사람의 검토가 계속 필요할 수 있다.

이 연구는 배포 과정의 절충점도 보여준다. 추론을 늘리면 품질은 좋아질 수 있지만 지연 시간과 추론 비용이 증가할 수 있다. 측정 중심 플러그인은 모든 작업에 더 큰 추론 예산을 배정하는 것보다 결과를 개선하는 더 집중적인 방법이 될 수 있다.

기업 구매자는 “사진에서 편집 가능한 3D”를 여러 단계의 유용성을 가진 기능으로 봐야 한다. 그럴듯해 보이는 장면은 대략적인 시각화나 콘텐츠 블로킹에 사용할 수 있다. 그러나 이를 정확한 디지털 트윈, 신뢰할 수 있는 깊이 맵, 전문 재구성 소프트웨어의 대체물로 자동 간주해서는 안 된다.

더 넓은 시장에서는 이미 인접한 접근법을 탐색하고 있다. Unity는 Claude Code와 Codex용 플러그인을 출시했고, World Labs의 Atlas는 모델 기반 방식으로 장면을 재구성한다. Google DeepMind의 GenCeption은 깊이 추정과 세그멘테이션에 비디오 모델을 사용한다. 이 시스템들은 LEGO-Anything과 직접 비교할 수는 없지만, 3D 소프트웨어 통합, 월드 모델, 전문 지각 파이프라인이 병렬적으로 발전하고 있음을 보여준다.

다음에 주목할 점

핵심 신호는 측정 기반 개선이 숨겨진 시뮬레이터 정답 데이터를 가진 벤치마크 장면뿐 아니라 실제 사진에서도 계속 작동하는지 여부다. 향후 평가에서는 가림, 이례적인 카메라 각도, 반사 표면, 복잡한 배경, 에이전트의 자산 라이브러리에 없는 객체가 성능에 미치는 영향도 보여줘야 한다.

개발자는 재구성 점수와 함께 비용, 지연 시간, 편집 안정성, 후속 작업 성능을 보고하는 벤치마크를 살펴봐야 한다. 에이전트가 오류를 감추는 단일 신뢰도 판단을 반환하는 대신 장면의 어느 부분이 불확실한지 설명할 수 있는지도 중요하다.

또 다른 중요한 시험은 실제 운영 도구에 통합하는 것이다. Blender, Unity, Claude Code, Codex 같은 시스템이 생성과 독립적인 기하학 검사를 결합할 수 있다면, 자율적인 장면 구축을 맡기기 전에 감독형 워크플로에 유용하게 사용될 수 있다.

Creati.ai의 관점

LEGO-Anything은 에이전트가 3D 재구성을 해결했다는 증명이라기보다, 평가가 핵심 엔지니어링 문제가 되고 있다는 증거에 가깝다. 장면을 만드는 것은 첫 단계일 뿐이다. 장면이 올바른 기하학을 보존하는지 판단하는 것이 창의적인 프로토타입과 신뢰할 수 있는 도구를 가른다.

이 연구는 AI 제품을 위한 실용적인 설계 원칙도 제시한다. 객관적인 측정이 가능하다면 에이전트에게 자신의 작업을 평가하는 유일한 심판이 되도록 하지 말라는 것이다. 공간 시스템이나 코드 생성 시스템을 구축하는 팀에게 독립적인 검증은 기반 모델의 시각적 추론만큼 중요할 수 있다.

광고