GPT-6 Astra выполнила 7 из 100 робототехнических заданий StationeryBench

В испытаниях с двумя роботами YAM Astra полностью завершила семь задач из ста и набрала медианный прогресс 46 баллов из 100. Сравнение с MolmoAct2 и оценка ещё не опубликованного REMAP дают ранние свидетельства, но не подтверждают общий уровень человеческой ловкости.

Испытания на пяти действиях с настольными предметами

В StationeryBench сравнили GPT-6 Astra от OpenAI и MolmoAct2 от Ai2 на пяти задачах с предметами на столе: например, снять колпачок с маркера, высыпать скрепки или передать линейку между двумя роботизированными руками. Обе модели управляли одинаковыми двухрукими роботами YAM в 200 испытаниях.

Результаты, приведённые The Decoder
МодельПолностью завершеноМедианный прогресс
GPT-6 Astra7 из 100 задач46 из 100
MolmoAct20 из 100 задач12 из 100

Результаты, видео и код авторы выложили в

репозитории StationeryBench

Бенчмарк пока не доказывает широкое превосходство

Исследователь Корнеллского университета и Google DeepMind Йоав Артци назвал результат «скачком» в пространственном мышлении. На другом, пока не опубликованном тесте REMAP, он оценил точность Astra как близкую к человеческой, но отметил, что в других сценариях модель всё ещё не достигает уровня людей.

Артци предположил, что сильный результат на трёхмерных задачах может быть связан с обучением на больших объёмах 3D-данных, например сцен Blender. Это гипотеза исследователя, а не раскрытое OpenAI описание обучающего набора. Сами 7 завершённых задач показывают ранний прогресс на конкретном наборе действий, не общую надёжность роботов в быту.

The Decoder — GPT-6 Astra appears to show a ‘step change’ in spatial reasoning based on early benchmarks