EnvHarness меняет тренировочные среды под слабые места ИИ-агента

Фреймворк сохраняет исходный симулятор и проверяющий, но меняет стартовые условия и доступные действия. В пяти бенчмарках улучшение на отложенных задачах доходило до 9 пунктов; для диагностики среда должна безопасно сбрасываться.

Адаптация тренировок без замены исходного симулятора

Google Cloud AI Research и академические партнёры представили EnvHarness — открытый фреймворк, который помогает приспосабливать тренировочные среды к слабым местам агента. Он располагается над уже существующим симулятором и может менять начальную точку, доступные наблюдения и действия, а также длительность задачи. Исходная среда и её проверяющий результат остаются на месте.

В пяти бенчмарках по разработке программ, навигации в интернете, офисной работе и задачам с физическим телом агенты улучшили результаты на отложенных задачах максимум на 9 пунктов. В программировании некоторые агенты выполняли задания за меньшее число шагов, чем при обучении в исходной среде.

Подход требует дешёвого и безопасного сброса среды

EnvHarness запускает несколько проб агента, чтобы найти затруднение, предложить изменение среды и проверить, что задача по-прежнему разрешима. Это создаёт вычислительные расходы, хотя может быть дешевле постоянного создания новых тренировочных симуляторов. Подход подходит для цифровых песочниц, которые можно быстро вернуть в исходное состояние.

Google выпустила код, настройки экспериментов и RL-реализацию на GitHub под лицензией Apache 2.0. Авторы описывают систему как усилитель качественных сред с надёжными проверяющими, а не их замену.

VentureBeat — Google's open source EnvHarness lets AI agents train against environments that evolve with them