SoL-Pi сокращает расход токенов кодового агента почти вдвое за счёт изменений harness

Исследователи Nvidia оптимизировали управляющий слой кодовых агентов и проверили четыре механизма на EdgeBench. Экономная конфигурация использовала на 49% меньше токенов, сохранив 93,7% результата Pi.

Четыре механизма убирают повторную работу

  • Action Fusion объединяет два последовательных действия, например изменение кода и тест, чтобы убрать отдельный вызов модели.
  • Online Context Compact сокращает накопившийся контекст после этапов планирования.
  • ObservationPack архивирует длинные результаты инструментов и подставляет краткое резюме.
  • Evidence-Preserving Reducer передаёт большие журналы ошибок более дешёвой модели и автоматически проверяет, не пропущены ли важные сведения.

На 51 задаче EdgeBench вариант со всеми четырьмя механизмами использовал на 49% меньше токенов, набрав 93,7% результата исходного harness Pi. Версия, ориентированная на качество и использующая сильнейший одиночный механизм, превзошла Pi на 5,3% и тоже сэкономила токены. В зависимости от конфигурации расход снизился на 44,7–49%.

Экономия зависит от модели и набора задач

Авторы оценили экономию в $8,75–13,50 за час относительно штатных harness Codex и Claude Code и в $4,36–5,71 относительно Pi, используя текущие API-тарифы. При переносе механизмов на Opus 5 без изменений система сохранила 94,3% результата Pi при похожей экономии, но срабатывала реже: оптимизацию изначально проводили только на трассах GPT-5.6 Sol.

Исследование также напоминает о риске переобучения автоматических оптимизаций: улучшение на знакомых задачах может не переноситься на новые. Поэтому показатели SoL-Pi относятся к описанным средам и конфигурациям, а не гарантируют такую же экономию для любого агента.

Nvidia's SoL-Pi system cuts coding agent token usage nearly in half by optimizing the harness