GPT-6 Astra выполнила 7 из 100 робототехнических заданий StationeryBench
В испытаниях с двумя роботами YAM Astra полностью завершила семь задач из ста и набрала медианный прогресс 46 баллов из 100. Сравнение с MolmoAct2 и оценка ещё не опубликованного REMAP дают ранние свидетельства, но не подтверждают общий уровень человеческой ловкости.
Испытания на пяти действиях с настольными предметами
В StationeryBench сравнили GPT-6 Astra от OpenAI и MolmoAct2 от Ai2 на пяти задачах с предметами на столе: например, снять колпачок с маркера, высыпать скрепки или передать линейку между двумя роботизированными руками. Обе модели управляли одинаковыми двухрукими роботами YAM в 200 испытаниях.
| Модель | Полностью завершено | Медианный прогресс |
|---|---|---|
| GPT-6 Astra | 7 из 100 задач | 46 из 100 |
| MolmoAct2 | 0 из 100 задач | 12 из 100 |
Результаты, видео и код авторы выложили в
Бенчмарк пока не доказывает широкое превосходство
Исследователь Корнеллского университета и Google DeepMind Йоав Артци назвал результат «скачком» в пространственном мышлении. На другом, пока не опубликованном тесте REMAP, он оценил точность Astra как близкую к человеческой, но отметил, что в других сценариях модель всё ещё не достигает уровня людей.
Артци предположил, что сильный результат на трёхмерных задачах может быть связан с обучением на больших объёмах 3D-данных, например сцен Blender. Это гипотеза исследователя, а не раскрытое OpenAI описание обучающего набора. Сами 7 завершённых задач показывают ранний прогресс на конкретном наборе действий, не общую надёжность роботов в быту.