SoL-Pi сокращает расход токенов кодового агента почти вдвое за счёт изменений harness
Исследователи Nvidia оптимизировали управляющий слой кодовых агентов и проверили четыре механизма на EdgeBench. Экономная конфигурация использовала на 49% меньше токенов, сохранив 93,7% результата Pi.
Система меняет управление агентом, а не саму модель
Исследователи Nvidia представили SoL-Pi — систему, которая анализирует журналы работы кодового агента, предлагает изменения управляющего слоя и проверяет их в подготовленных средах. Harness определяет, какие состояния видит агент, как он вызывает инструменты и обрабатывает обратную связь. Обычно разработчикам приходится вручную искать повторяющиеся ошибки в длинных трассах.
В эксперименте система исследовала 152 направления на 535 исполняемых средах, включая 495 задач из пар GitHub issue—pull request и 40 синтетических тестов. Для снижения риска подгонки к бенчмарку авторы отделили поиск от финальной оценки: 11 из 51 задачи EdgeBench использовались для разовой проверки, остальные 40 оставили для итогового тестирования.
Четыре механизма убирают повторную работу
- Action Fusion объединяет два последовательных действия, например изменение кода и тест, чтобы убрать отдельный вызов модели.
- Online Context Compact сокращает накопившийся контекст после этапов планирования.
- ObservationPack архивирует длинные результаты инструментов и подставляет краткое резюме.
- Evidence-Preserving Reducer передаёт большие журналы ошибок более дешёвой модели и автоматически проверяет, не пропущены ли важные сведения.
На 51 задаче EdgeBench вариант со всеми четырьмя механизмами использовал на 49% меньше токенов, набрав 93,7% результата исходного harness Pi. Версия, ориентированная на качество и использующая сильнейший одиночный механизм, превзошла Pi на 5,3% и тоже сэкономила токены. В зависимости от конфигурации расход снизился на 44,7–49%.
Экономия зависит от модели и набора задач
Авторы оценили экономию в $8,75–13,50 за час относительно штатных harness Codex и Claude Code и в $4,36–5,71 относительно Pi, используя текущие API-тарифы. При переносе механизмов на Opus 5 без изменений система сохранила 94,3% результата Pi при похожей экономии, но срабатывала реже: оптимизацию изначально проводили только на трассах GPT-5.6 Sol.
Исследование также напоминает о риске переобучения автоматических оптимизаций: улучшение на знакомых задачах может не переноситься на новые. Поэтому показатели SoL-Pi относятся к описанным средам и конфигурациям, а не гарантируют такую же экономию для любого агента.