ИИ-агенты создают 3D-сцены по фото, но не умеют оценить результат
Система LEGO-Anything превращает одну фотографию в программу для Blender: ИИ-агент пишет код, запускает его, смотрит на получившуюся сцену и вносит правки. В результате объекты, их форма и расположение, а также положение камеры заданы явно — сцену можно редактировать и использовать для анализа изображения. 🤖
Что известно
Система LEGO-Anything превращает одну фотографию в программу для Blender: ИИ-агент пишет код, запускает его, смотрит на получившуюся сцену и вносит правки. В результате объекты, их форма и расположение, а также положение камеры заданы явно — сцену можно редактировать и использовать для анализа изображения. 🤖
Чтобы проверить качество таких реконструкций, исследователи создали LEGO-Bench — набор из 208 изображений 104 интерьеров и уличных сцен. Для каждой картинки известна точная 3D-сцена, поэтому можно измерить, насколько верны геометрия и внешний вид результата. Все шесть проверенных версий GPT почти всегда создавали рабочую сцену, но точность заметно различалась. Лучший результат показала GPT-6 Astra: 53,4% для интерьеров и 39,6% для уличных сцен. Чем сложнее изображение, тем труднее реконструкция.
Главная проблема — агенты плохо понимают, стали ли их правки улучшением. При сравнении двух вариантов их оценки геометрии оказывались почти случайными. Иногда модель даже портила удачную сцену: результат GPT-6 Astra в одном из примеров упал с 33,9% до 4,4%. Поэтому авторы разработали LEGO-Plugin: он заменяет ненадёжную самооценку измерениями и защищает уже достигнутый прогресс. Расширение улучшило результаты всех моделей, особенно слабых.
Восстановленные сцены уже можно применять для распознавания объектов, выделения областей изображения и оценки глубины, но пока они уступают специализированным моделям. Авторы считают, что рабочая 3D-сцена — ещё не точная копия реальности: нынешним агентам всё ещё трудно правильно восстановить геометрию и проверить себя. 💡