Исследователи из Университета Мэриленда и AWS представили проект LEGO-Anything, в котором кодинг-агенты создают редактируемые 3D-сцены из одного фото, генерируя исполняемый код для Blender. Для оценки качества был создан бенчмарк LEGO-Bench, содержащий 208 изображений из 104 внутренних и внешних сцен, сгенерированных из симуляторов для получения точной эталонной геометрии. Лучший протестированный агент, GPT-6 Astra, достиг 53.4% точности на внутренних сценах и 39.6% на внешних, при этом модели демонстрируют слабую способность к самооценке и часто ухудшают результат в процессе доработки.
Для улучшения результатов авторы разработали расширение LEGO-Plugin, которое заменяет ненадежную самооценку на конкретные измерения и защищает уже выполненную работу от регрессивных правок. Этот плагин улучшил работу всех шести протестированных моделей, причем более слабые агенты показали наибольший прирост точности. Тесты также показали, что созданные сцены пока недостаточно точны для использования в качестве основы для стандартных задач компьютерного зрения, таких как сегментация и оценка глубины.