DarwinX подняла результат браузерного агента Salesforce с 43,5% до 93%

Фреймворк Salesforce меняет инструкции, инструменты и процессы агента, не переобучая модель. Авторы сообщают о росте результатов на четырёх тестах, но подчёркивают необходимость повторных запусков и проверок на регрессии.

Улучшать оболочку агента без изменения модели

DarwinX — фреймворк Salesforce AI Research и Agentforce для изменения harness: промптов, инструментов, навыков и логики рабочего процесса вокруг языковой модели. Метод не меняет веса модели. В четырёх проверенных бенчмарках исследователи сообщили об улучшении результатов; в WebArena-Infinity показатель вырос с 43,5% до 93%, а в SWE-bench Verified — на 3,4 процентного пункта.

Ветки конкурируют и проходят проверку

Обычный цикл самосовершенствования меняет один текущий вариант агента. Так ранняя полезная правка может закрепить путь, который позже перестанет улучшаться; изменение под одну задачу способно ухудшить другие. DarwinX сохраняет несколько вариантов параллельно, оставляет удачные решения и допускает дальнейшее развитие только после проверки, что новая возможность не разрушила прежние.

Система разделяет быстрый первичный отбор и более точное подтверждение: перспективный вариант повторно тестируют на задачах, которые раньше решались. Это важно, поскольку один и тот же агент может случайно пройти тест в одном прогоне и провалить его в другом. Авторы говорят о необходимости regression tests и дополнительного вычислительного бюджета.

Подходит не каждому агенту

Исследователи рекомендуют эволюционный поиск для длительных задач с проверяемым результатом и большой поверхностью поведения — например, для браузерной работы или программирования. Для простого процесса, который превращает известный вход в фиксированный API-вызов, дополнительную популяцию вариантов обычно не оправдана.

Публикация VentureBeat сообщает, что результаты выросли на всех четырёх исследованных тестах, от 3,4 пункта в SWE-bench Verified до 49,5 пункта в WebArena-Infinity. Это результаты ограниченных бенчмарков, а не гарантия улучшения любого корпоративного агента.

VentureBeat — Salesforce researchers took an AI agent from finishing 43.5% of browser tasks to 93% without touching the model