LEGO-Anything 顯示程式設計代理程式能從照片建立可編輯的 3D 場景,但 LEGO-Bench 揭示了準確度與自我評估方面的重大缺口。

程式設計代理程式將單張照片轉換成可編輯 3D 場景的能力越來越強,但最新研究顯示,它們仍無法可靠判斷自己的重建結果何時出錯。
University of Maryland 與 AWS 的專案 LEGO-Anything 要求代理程式根據影像撰寫 Blender 程式碼、算繪結果、檢查結果並修改程式。其配套基準測試 LEGO-Bench 發現,測試中最強的設定在室內場景達到 53.4% 的準確度,在戶外場景則為 39.6%。更重要的是,代理程式判斷某個重建結果是否優於另一個結果的能力,接近或低於隨機機率。
這種組合對打造 AI 輔助設計、模擬、機器人和空間運算工具的產品團隊十分重要。能產生可用場景的代理程式很有價值,但無法辨識幾何錯誤的代理程式,可能讓反覆修改的工作流程在沒有獨立檢查的情況下難以信任。
LEGO-Anything 將影像轉 3D 重建視為程式設計工作,而不是單一生成模型的輸出。代理程式接收一張影像,並為 Blender——這個開放式 3D 創作平台——撰寫程式碼。接著它可以執行程式碼、檢查算繪出的場景,並進一步編輯。
這項成果的目標是比靜態影像或不透明的 3D 資產更實用。程式可以呈現物件、幾何結構、布局和相機位置。使用者能檢查場景、變更個別元素,或將場景作為更大工作流程的一部分加以查詢。
這種方法也反映了 AI 代理程式的一個實際發展方向:產生一項成果、執行它、評估結果,再改進底層程式碼。理論上,這個循環應該讓代理程式不必為每種場景類型重新訓練模型,就能修正錯誤。
但單張照片無法揭示精確深度或隱藏幾何結構。因此研究人員需要一種受控方式來衡量重建品質,同時避免輸入看起來明顯是合成的。
LEGO-Bench 包含 208 張影像,代表由 443 個註冊資產建立的 104 個室內與戶外場景。根據 The Decoder 報導的研究說明,這些影像是從專業製作的模擬器場景算繪而成。這讓基準測試能取得隱藏的真實幾何結構、深度與物件指派,同時保留更自然的視覺外觀。
基準測試評估三個面向。有效性檢查代理程式是否交付了可用的場景成果。重建評量可見幾何結構的準確度。外觀則在像素層級比較重新算繪的提交結果與參考影像。
測試的六種 GPT 設定普遍都能產生可運作的場景,但品質差異很大。報告中的領先者 GPT-6 Astra 在室內場景達到 53.4%,戶外場景達到 39.6%,而較弱的設定約為 15%。這些是本研究基準測試的結果,並不代表模型在任意真實世界照片上都能達到相同水準。
複雜度提高會使表現變差,戶外場景也比室內場景更困難。研究人員還報告,提供模型更大的推理預算能大幅改善結果。在辦公室場景子集上,GPT-6 Astra 的分數在較高推理預算下由 32.3% 提升至 61.8%。
更具啟發性的失敗出現在自我評估上。當代理程式必須從兩個版本中選出與原始影像更相符的版本時,其幾何判斷接近擲硬幣,甚至低於擲硬幣的機率。實際上,代理程式可能做出有害的修改,卻無法察覺場景已變得不那麼準確。
這項發現限制了人們對代理程式工作流程的一項常見假設:反覆進行視覺檢查就會自動收斂。研究顯示,當代理程式的內部評估不可靠時,單靠反覆迭代並不足夠。
研究人員提出 LEGO-Plugin 這項擴充功能,它不需要額外的模型訓練。它會將初始場景錨定到參考影像,以具體測量取代代理程式不可靠的自我判斷,並保護正確的進展免受後續退化影響。
根據報告結果,這個外掛改善了測試的六個模型。較弱代理程式的最大提升達到 62.7%,而最強模型則提升約兩個百分點。這種差距很重要:評估與工作流程控制可能比單純提升模型能力,更能為較弱系統帶來價值。
研究人員也測試了將重建場景作為標準電腦視覺任務的輸入。物件偵測表現最好,達到專用模型 DINO 約一半的效能。分割與深度估計則進一步落後於包括 SAM 3 和 Depth Anything 3 在內的專用系統。
這些比較顯示,可執行的場景程式已經能作為中間表示使用,但還不是特定任務視覺模型的可靠替代品。場景可能已足夠有效,可以編輯或檢查,但對後續測量而言仍過於不準確。
對開發者而言,眼前的教訓是將成果產生與成果驗證分開。程式設計代理程式能撰寫 Blender 場景,但生產系統可能需要幾何限制、基於影像的評分、物件層級檢查,以及防止退化的安全機制。當場景供製造、建築、機器人或安全敏感的模擬使用時,人員審查可能仍不可或缺。
這項工作也指出部署上的取捨。更多推理可以提升品質,但可能增加延遲和推論成本。以測量為核心的外掛,可能比單純為每項任務配置更大的推理預算,更有針對性地改善結果。
企業買家應將「從照片建立可編輯 3D」視為具有多個實用層級的能力。看起來合理的場景可用於粗略視覺化或內容 blocking,但不應自動被視為精確的數位孿生、可靠的深度圖,或專用重建軟體的替代品。
更廣泛的市場已在探索相鄰方法。Unity 已發布 Claude Code 和 Codex 外掛;World Labs 的 Atlas 則採用以模型為基礎的場景重建方式。Google DeepMind 的 GenCeption 使用影片模型進行深度估計和分割。這些系統與 LEGO-Anything 並不能直接比較,但顯示 3D 軟體整合、世界模型和專用感知管線正在平行發展。
關鍵訊號在於,基於測量的改進是否能持續適用於真實照片,而不只是具備隱藏模擬器真實答案的基準場景。未來的評估也應說明,遮擋、不尋常的相機角度、反光表面、雜亂環境,以及代理程式資產庫中缺少的物件,會如何影響效能。
開發者應留意除了重建分數之外,也報告成本、延遲、編輯穩定性和下游任務表現的基準測試。代理程式能否解釋場景的哪些部分存在不確定性,也將十分重要;它不應只回傳一個掩蓋錯誤的單一信心判斷。
另一項重要測試是整合到生產工具中。如果 Blender、Unity、Claude Code 或 Codex 等系統能將生成與獨立的幾何檢查結合,它們或許能在獲得自主建立場景的信任之前,先用於受監督的工作流程。
LEGO-Anything 與其說證明代理程式已解決 3D 重建,不如說它證明評估正成為核心工程問題。產生場景只是第一步;判斷場景是否保留正確幾何結構,才是創意原型與可靠工具之間的分水嶺。
這項研究也為 AI 產品提供了一項實用設計原則:當客觀測量可用時,不要要求代理程式成為自己工作的唯一裁判。對於打造空間系統或程式碼生成系統的團隊而言,獨立驗證可能與底層模型的視覺推理同樣重要。