LEGO-Anything zeigt, dass Coding-Agenten bearbeitbare 3D-Szenen aus Fotos erstellen können, während LEGO-Bench erhebliche Lücken bei Genauigkeit und Selbsteinschätzung offenlegt.

Coding-Agenten werden immer besser darin, ein einzelnes Foto in eine bearbeitbare 3D-Szene zu verwandeln. Neue Forschung legt jedoch nahe, dass sie noch nicht zuverlässig erkennen können, wann ihre Rekonstruktion fehlerhaft ist.
Das Projekt der University of Maryland und von AWS namens LEGO-Anything fordert einen Agenten auf, anhand eines Bildes Blender-Code zu schreiben, das Ergebnis zu rendern, es zu überprüfen und das Programm zu überarbeiten. Der begleitende Benchmark LEGO-Bench ergab, dass die stärkste getestete Konfiguration bei Innenraumszenen eine Genauigkeit von 53,4 % und bei Außenszenen von 39,6 % erreichte. Noch wichtiger ist, dass die Fähigkeit der Agenten, zu beurteilen, ob eine Rekonstruktion besser als eine andere war, nahe am Zufallsniveau oder darunter lag.
Diese Kombination ist für Produktteams relevant, die KI-gestützte Werkzeuge für Design, Simulation, Robotik und räumliches Computing entwickeln. Ein Agent, der eine brauchbare Szene erzeugen kann, ist wertvoll. Ein Agent, der geometrische Fehler nicht erkennt, kann iterative Arbeitsabläufe jedoch ohne unabhängige Prüfungen schwer vertrauenswürdig machen.
LEGO-Anything behandelt die Rekonstruktion von Bild zu 3D eher als Programmieraufgabe denn als einmalige Ausgabe eines generativen Modells. Der Agent erhält ein Bild und schreibt Code für Blender, die vielseitige 3D-Erstellungsplattform. Anschließend kann er den Code ausführen, die gerenderte Szene prüfen und weitere Änderungen vornehmen.
Das Ergebnis soll nützlicher sein als ein statisches Bild oder ein undurchsichtiges 3D-Asset. Ein Programm kann Objekte, Geometrie, Anordnung und Kameraposition offenlegen. Nutzer können die Szene prüfen, einzelne Elemente verändern oder sie als Teil eines größeren Arbeitsablaufs abfragen.
Der Ansatz spiegelt außerdem eine praktische Richtung für KI-Agenten wider: ein Artefakt erzeugen, es ausführen, das Ergebnis bewerten und den zugrunde liegenden Code verfeinern. Im Prinzip sollte diese Schleife einem Agenten ermöglichen, Fehler zu korrigieren, ohne für jeden Szenentyp ein neues Modell zu benötigen.
Ein einzelnes Foto zeigt jedoch weder die exakte Tiefe noch die verborgene Geometrie. Die Forschenden benötigten daher eine kontrollierte Methode, um die Qualität der Rekonstruktion zu messen, ohne dass die Eingaben offensichtlich synthetisch wirken.
LEGO-Bench umfasst 208 Bilder, die 104 Innen- und Außenszenen repräsentieren und aus 443 registrierten Assets erstellt wurden. Laut der von The Decoder berichteten Forschungsbeschreibung werden die Bilder aus professionell erstellten Simulatorszenen gerendert. Dadurch kann der Benchmark auf verborgene Ground-Truth-Geometrie, Tiefe und Objektzuweisungen zugreifen und zugleich ein natürlicheres Erscheinungsbild bewahren.
Der Benchmark bewertet drei Dimensionen. Validität prüft, ob der Agent ein nutzbares Szenenartefakt geliefert hat. Rekonstruktion misst die Genauigkeit der sichtbaren Geometrie. Erscheinungsbild vergleicht ein erneut gerendertes Ergebnis auf Pixelebene mit dem Referenzbild.
Alle sechs getesteten GPT-Konfigurationen erzeugten im Allgemeinen funktionierende Szenen. Ihre Qualität schwankte jedoch stark. Der gemeldete Spitzenreiter GPT-6 Astra erreichte 53,4 % bei Innenraumszenen und 39,6 % im Außenbereich, während schwächere Konfigurationen etwa 15 % erzielten. Die Ergebnisse sind Befunde dieses Forschungsbenchmarks und kein Beleg dafür, dass das Modell bei beliebigen realen Fotografien dasselbe Niveau erreicht.
Mit zunehmender Komplexität verschlechterte sich die Leistung, und Außenszenen waren schwieriger als Innenräume. Die Forschenden berichteten außerdem, dass ein größeres Reasoning-Budget die Ergebnisse deutlich verbesserte. Bei einer Büro-Teilmenge stieg der Wert von GPT-6 Astra bei höherem Reasoning-Budget von 32,3 % auf 61,8 %.
Das aufschlussreichere Versagen zeigte sich bei der Selbstevaluation. Wenn Agenten auswählen mussten, welche von zwei Versionen besser zum Originalbild passte, lagen ihre geometrischen Beurteilungen nahe an einem Münzwurf oder darunter. Praktisch bedeutet das, dass ein Agent eine schädliche Änderung vornehmen und nicht erkennen könnte, dass die Szene dadurch ungenauer geworden ist.
Diese Erkenntnis begrenzt eine verbreitete Annahme über agentische Arbeitsabläufe: dass wiederholte visuelle Prüfung automatisch zu einer Konvergenz führt. Die Forschung zeigt, dass Iteration allein nicht ausreicht, wenn die interne Bewertung des Agenten unzuverlässig ist.
Die Forschenden reagierten mit LEGO-Plugin, einer Erweiterung, die kein zusätzliches Modelltraining erfordert. Sie verankert die Ausgangsszene am Referenzbild, ersetzt das unzuverlässige Selbsturteil des Agenten durch konkrete Messungen und schützt korrekte Fortschritte vor späteren Rückschritten.
Nach den berichteten Ergebnissen verbesserte das Plugin alle sechs getesteten Modelle. Die größten Zugewinne erreichten bei schwächeren Agenten 62,7 %, während das stärkste Modell ungefähr zwei Prozentpunkte hinzugewann. Diese Verteilung ist wichtig: Bewertungs- und Workflow-Kontrollen könnten schwächeren Systemen mehr bringen als eine bloße Steigerung der Modellfähigkeiten.
Die rekonstruierten Szenen wurden außerdem als Eingaben für standardmäßige Computer-Vision-Aufgaben getestet. Die Objekterkennung schnitt am besten ab und erreichte ungefähr die Hälfte der Leistung des spezialisierten Modells DINO. Segmentierung und Tiefenschätzung lagen noch weiter hinter spezialisierten Systemen wie SAM 3 und Depth Anything 3 zurück.
Diese Vergleiche legen nahe, dass ausführbare Szenenprogramme bereits als Zwischenrepräsentationen nutzbar sind, aber noch kein zuverlässiger Ersatz für aufgabenspezifische Visionsmodelle sind. Eine Szene kann ausreichend valide sein, um sie zu bearbeiten oder zu prüfen, und zugleich für nachgelagerte Messungen zu ungenau sein.
Für Entwickler lautet die unmittelbare Lehre, die Erstellung eines Artefakts von seiner Überprüfung zu trennen. Ein Coding-Agent kann eine Blender-Szene schreiben, doch Produktionssysteme benötigen möglicherweise geometrische Einschränkungen, bildbasierte Bewertungen, Prüfungen auf Objektebene und Schutzmechanismen gegen Rückschritte. Wenn die Szene in Fertigung, Architektur, Robotik oder sicherheitskritische Simulationen einfließt, kann menschliche Prüfung weiterhin erforderlich sein.
Die Arbeit weist außerdem auf einen Bereitstellungs-Trade-off hin. Mehr Reasoning kann die Qualität verbessern, aber Latenz und Inferenzkosten erhöhen. Ein messungsorientiertes Plugin könnte eine gezieltere Möglichkeit zur Ergebnisverbesserung bieten, als jeder Aufgabe einfach ein größeres Reasoning-Budget zuzuweisen.
Unternehmenskunden sollten „bearbeitbares 3D aus einem Foto“ als Fähigkeit mit mehreren Nützlichkeitsstufen betrachten. Eine plausibel aussehende Szene kann grobe Visualisierung oder Content-Blocking unterstützen. Sie sollte jedoch nicht automatisch als exakter digitaler Zwilling, verlässliche Tiefenkarte oder Ersatz für spezialisierte Rekonstruktionssoftware behandelt werden.
Der breitere Markt untersucht bereits verwandte Ansätze. Unity hat Plugins für Claude Code und Codex veröffentlicht, während World Labs’ Atlas einen modellbasierten Weg zur Szenenrekonstruktion verfolgt. Google DeepMinds GenCeption nutzt ein Videomodell für Tiefenschätzung und Segmentierung. Diese Systeme sind nicht direkt mit LEGO-Anything vergleichbar, zeigen aber, dass sich 3D-Softwareintegration, Weltmodelle und spezialisierte Wahrnehmungspipelines parallel entwickeln.
Das wichtigste Signal wird sein, ob messungsbasierte Verfeinerung auch bei echten Fotografien und nicht nur bei Benchmarkszenen mit verborgener Simulator-Ground-Truth funktioniert. Künftige Evaluationen sollten außerdem zeigen, wie sich die Leistung bei Verdeckungen, ungewöhnlichen Kamerawinkeln, reflektierenden Oberflächen, Unordnung und Objekten verändert, die in der Asset-Bibliothek eines Agenten fehlen.
Entwickler sollten Benchmarks beachten, die neben Rekonstruktionswerten auch Kosten, Latenz, Bearbeitungsstabilität und die Leistung bei nachgelagerten Aufgaben melden. Wichtig wird auch sein, ob Agenten erklären können, welche Teile einer Szene unsicher sind, statt ein einziges Vertrauensurteil zurückzugeben, das Fehler verdeckt.
Ein weiterer wichtiger Test ist die Integration in Produktionswerkzeuge. Wenn Systeme wie Blender, Unity, Claude Code oder Codex die Erzeugung mit unabhängigen geometrischen Prüfungen verbinden können, könnten sie für überwachte Arbeitsabläufe nützlich werden, bevor man ihnen die autonome Szenenkonstruktion anvertraut.
LEGO-Anything ist weniger ein Beleg dafür, dass Agenten die 3D-Rekonstruktion gelöst haben, als ein Hinweis darauf, dass Evaluation zum zentralen technischen Problem wird. Eine Szene zu erzeugen, ist nur der erste Schritt; entscheidend ist festzustellen, ob die Szene die richtige Geometrie bewahrt. Das unterscheidet einen kreativen Prototyp von einem zuverlässigen Werkzeug.
Die Forschung liefert außerdem ein praktisches Designprinzip für KI-Produkte: Ein Agent sollte nicht der alleinige Richter über seine eigene Arbeit sein, wenn objektive Messungen verfügbar sind. Für Teams, die räumliche oder codegenerierende Systeme entwickeln, kann unabhängige Überprüfung ebenso wichtig sein wie das visuelle Reasoning des zugrunde liegenden Modells.