SIFT сокращает стоимость оценки самоулучшающихся кодовых агентов

SIFT от MIT и Sakana AI использует LLM-судью для предварительного сравнения вариантов кодового агента. В одном прогоне система набрала 35,1% на Polyglot менее чем за пять часов при затратах около $150.

Полная проверка каждого изменения обходится дорого

Разработчики могут улучшать кодового агента, меняя инструкции, инструменты и обработку ошибок. Но каждый вариант нужно проверить; широкий поиск может занимать тысячи CPU-часов и стоить тысячи долларов. Фреймворк Recursive Self-Improvement via Fast Tree Search (SIFT) от исследователей MIT и Sakana AI использует отдельную языковую модель для сравнения вариантов до запуска дорогих полных тестов.

После создания версии SIFT сначала проверяет её на четырёх задачах, чтобы отсеять сломанные варианты. Затем LLM-судья сравнивает её попарно с высоко оценёнными агентами в архиве — до десяти сравнений на кандидата. Новые изменения могут готовиться, пока предыдущие ещё проходят оценку.

Быстрые сравнения служат предварительным фильтром

По разбору затрат в исследовании, предложение одного патча стоит около 12 центов, сравнение LLM-судьёй — около 4,4 цента, а оценка агента на 50 задачах Polyglot обходится примерно в $6 и занимает 2,6 CPU-часа. SIFT использует дешёвую обратную связь, чтобы выбирать кандидатов для более дорогого прогона.

В одном запуске система набрала 35,1%

Исследователи сообщают, что один запуск SIFT достиг 35,1% точности на бенчмарке Polyglot менее чем за пять часов, использовав 42 CPU-часа и около $150 кредитов API. VentureBeat описывает этот результат как экспериментальный ориентир для команд, настраивающих harness на чётко определённых задачах. Один прогон не устанавливает, что система будет столь же эффективна на других наборах или конфигурациях.

New MIT and Sakana AI framework uses an LLM judge to cut evaluation costs for self-improving coding agents | VentureBeat