ИИ-агенты выполняют больше задач, но решения остаются за людьми

Команда разработала Atria Dawn Preview — модель для исследовательских и инженерных задач с 744 млрд параметров и архитектурой «смесь экспертов».

Главное событие

Команда разработала Atria Dawn Preview — модель для исследовательских и инженерных задач с 744 млрд параметров и архитектурой «смесь экспертов». В тестах она показала лучший результат в пяти из 16 проверок, включая поиск в интернете и кибербезопасность, но не стала лидером в целом: например, уступила конкурентам в GDPval и SWE-Bench Pro.

Во время работы над проектом ИИ использовали в 96,5% задач. За четыре недели число действий агента на один запрос человека выросло в среднем по участникам с 11 до 28,5. Однако это не означает, что агенты стали самостоятельнее: после каждого решения человека они просто выполняли больше шагов.

Подробности

Из 455 выполненных с помощью ИИ задач 151, примерно треть, участники сочли невозможными без него — причём речь не о том, что ИИ ускорил привычную работу, а о задачах, за которые без него вообще не взялись бы. Такие ответы дали 27 из 56 участников.

При этом люди сохраняли контроль: в 85,5% случаев именно они выбирали методы и параметры, а ИИ принимал такие решения лишь в 9,2%. Чаще всего ИИ предлагал варианты, а человек выбирал из них — так происходило в 55,4% случаев. Цели и объём работы люди определяли в 93,4% случаев, а даже среди задач, невозможных без ИИ, сами задавали цель в 95,4%.

The Decoder