MIT и Sakana AI придумали, как дешевле отбирать улучшения для ИИ-агентов, пишущих код

Новый подход SIFT использует отдельную языковую модель как судью: она сравнивает версии агента и помогает выбрать перспективные до запуска дорогих проверок. Сначала каждую новую версию быстро проверяют на четырёх задачах, чтобы отсеять сломанные. Затем судья сравнивает её с другими агентами по коду, не видя заданий и результатов тестов.

Что известно

Новый подход SIFT использует отдельную языковую модель как судью: она сравнивает версии агента и помогает выбрать перспективные до запуска дорогих проверок. Сначала каждую новую версию быстро проверяют на четырёх задачах, чтобы отсеять сломанные. Затем судья сравнивает её с другими агентами по коду, не видя заданий и результатов тестов.

Проверки, сравнение и создание новых изменений идут параллельно: агенту не нужно ждать завершения полного теста, чтобы начать следующую попытку. В тесте Polyglot версия SIFT с моделью o3-mini набрала 35,1% точности — против 30,7% у Darwin Gödel Machine и 29,8% у SIFT без судьи. Один запуск занял менее пяти часов реального времени, потребовал 42 часа вычислений на процессорах и около $150 на использование API.

Судья помогает замечать то, чего не видно по небольшому тесту. Например, на TerminalBench выбранная судьёй версия в итоге показала 36,7% точности на полном тесте, тогда как агент с лучшим результатом на предварительной проверке — 28,1%. Судья заметил проблемы в коде: новый проверяющий инструмент был отключён по умолчанию, а изменённая оболочка команд могла работать нестабильно.

SIFT пока проверяли только на агентах для программирования. Авторы считают, что похожий подход может пригодиться и другим самоулучшающимся системам, если для них есть понятные задачи и способ измерить результат. 🚀

Первоисточник