Команды ИИ-агентов тратят огромное количество токенов ради почти неизмеримого роста качества, показало исследование
По данным Vals AI, команды агентов на бенчмарке Vibe Code Bench дают почти никакого выигрыша по сравнению с одиночными агентами, а стоят в 1,8–5,1 раза дороже.

Что показало тестирование Vals AI
Компания Vals AI, которая занимается оценкой ИИ-моделей, протестировала GPT-6 Sol и Claude Opus 5.5 на бенчмарке Vibe Code Bench. Модели запускались как по одному агенту, так и в составе команд, при двух уровнях усилия на рассуждение: среднем и максимальном. Команды обходились в 1,8–5,1 раза дороже одиночных агентов.
Из четырёх сравнений команд с одиночными агентами статистически значимое улучшение оказалось только в одном случае: GPT-6 Sol при среднем уровне рассуждений набрала на 7,3 балла больше, чем одиночный агент. При максимальном уровне командная схема не дала ни GPT-6 Sol, ни Opus 5.5 реального преимущества. По мнению авторов исследования, дополнительная стоимость команд в большинстве случаев не оправдана, особенно когда модели уже работают на полной вычислительной мощности. Сами результаты опубликованы в блоге Vals AI.
Данные Anthropic по Opus 5.5
Похожую картину показали и собственные тесты Anthropic с Claude Opus 5.5, описанные в системной документации модели. По этим данным, при росте числа агентов прирост качества уменьшался. Большие команды быстрее достигали заданного уровня результата, но переход от 10 агентов к 100 лишь немного поднял оценки спустя 24 часа. В отдельных тестах ProgramBench ускорение работы шло вместе с более высоким расходом токенов.
| Задача | 1 агент | 10 агентов | 30 агентов | 100 агентов |
|---|---|---|---|---|
| Knowledge base | 0.53 | 0.70 | 0.71 | 0.74 |
| Lean Theorem Proving | 0.39 | 0.66 | 0.66 | 0.68 |
Модель Fable 5.1 показала более сильный рост качества на задаче Lean Theorem Proving при числе агентов больше десяти, но во всех тестах оставалась ниже Opus 5.5. На задаче Knowledge base её результат при переходе с 30 до 100 агентов немного снизился.
Скорость растёт, качество почти нет
Исследователь OpenAI Ноам Браун в подкасте Dwarkesh Podcast сказал, что многоагентные системы в основном дают выигрыш в скорости, а не в качестве. По его словам, четыре агента решали задачи вдвое быстрее, но и стоили вдвое дороже. При 16 агентах закономерность сохранялась, но эффективность немного падала.
Браун также отметил, что многое зависит от типа задачи. Веб-исследования и математика хорошо распараллеливаются, а написание романа — нет. По его словам, запуск 10 000 агентов для написания романа был бы так же бессмысленен, как привлечение 10 000 человек к его написанию. Он признал, что работа с очень большим числом агентов по-прежнему мало изучена, потому что расходы на это слишком высоки.
Разработчик OpenAI Эрик Провенчер незадолго до этого предупреждал против использования роёв агентов по той же причине. По его мнению, такие системы, скорее всего, тратят деньги впустую, потому что координация между агентами ломается. Он назвал это «налогом на координацию» (coordination tax).
Источники
Продолжить чтение
В ленте материалов: 1