GPT-6 Astra превзошла прежний эталон на тестах бизнеса и управления дроном

В симуляторе торгового автомата Astra заработала в среднем $15 515 за виртуальный год против $5 422 у Claude Fable 5.1. В Drone-Bench её лучшие попытки превысили человеческий эталон на всех пяти задачах, но шанс пройти их подряд составил лишь 2,8%.

Результат симуляции бизнеса

В Vending-Bench модель получает $500 и управляет автоматом в течение симулируемого года: ищет поставщиков, договаривается о закупках, назначает цену и старается увеличить остаток средств. По данным Andon Labs, в шести прогонах GPT-6 Astra в среднем завершила год с $15 515, а Claude Fable 5.1 — с $5 422. Даже лучший результат Fable, $9 874, оказался ниже худшего прогона Astra, $13 272.

В тестах Astra также лучше справлялась с переговорами и ненадёжными поставщиками. Fable совершила 45 предоплат поставщикам, которые уже закрылись, потеряв $14 331; Astra столкнулась с 64 закрытиями, но Andon Labs не выявила сопоставимых потерь. В отдельной арене Astra отказалась от предложения GLM-5.3 о фиксации цен; оценка относится к наблюдаемому поведению в симуляции.

Лучшие попытки превысили эталон

Drone-Bench проверяет, может ли модель написать программу, чтобы недорогой DJI Tello EDU построил карту офиса, определил своё положение, проложил маршрут, нашёл заданного человека и сопровождал его. Лучшие отправленные Astra версии кода превысили разработанный человеком с помощью ИИ эталон на всех пяти шагах — впервые для этой серии тестов, по данным Andon Labs.

Но отдельные успешные попытки не означают надёжную работу. Astra превысила эталон при обнаружении человека в четырёх из десяти запусков, при 3D-реконструкции — в одном из десяти. По расчёту Andon Labs, шанс пройти все пять этапов за один средний запуск составил 2,8%.

Демонстрация слежения и предел вывода

В демонстрации Andon Labs Astra самостоятельно провела дрон через офис, нашла указанного человека и следовала за ним без участия оператора. Команда подчёркивает, что бенчмарк измеряет уже доступные модели возможности, а не помогает создавать дроны. Тесты проводит сама Andon Labs; по её словам, это снижает риск того, что разработчики оптимизируют модели непосредственно под результаты бенчмарка.

Результаты говорят о том, что модель может написать код для каждого шага, но низкая вероятность полного прохождения показывает разрыв между лучшим отдельным результатом и устойчивой автономной работой.

The Decoder — GPT-6 Astra pilots a surveillance drone and runs a business on its own