EnvHarness меняет тренировочные среды под слабые места ИИ-агента
Фреймворк сохраняет исходный симулятор и проверяющий, но меняет стартовые условия и доступные действия. В пяти бенчмарках улучшение на отложенных задачах доходило до 9 пунктов; для диагностики среда должна безопасно сбрасываться.
Адаптация тренировок без замены исходного симулятора
Google Cloud AI Research и академические партнёры представили EnvHarness — открытый фреймворк, который помогает приспосабливать тренировочные среды к слабым местам агента. Он располагается над уже существующим симулятором и может менять начальную точку, доступные наблюдения и действия, а также длительность задачи. Исходная среда и её проверяющий результат остаются на месте.
В пяти бенчмарках по разработке программ, навигации в интернете, офисной работе и задачам с физическим телом агенты улучшили результаты на отложенных задачах максимум на 9 пунктов. В программировании некоторые агенты выполняли задания за меньшее число шагов, чем при обучении в исходной среде.
Подход требует дешёвого и безопасного сброса среды
EnvHarness запускает несколько проб агента, чтобы найти затруднение, предложить изменение среды и проверить, что задача по-прежнему разрешима. Это создаёт вычислительные расходы, хотя может быть дешевле постоянного создания новых тренировочных симуляторов. Подход подходит для цифровых песочниц, которые можно быстро вернуть в исходное состояние.
Google выпустила код, настройки экспериментов и RL-реализацию на GitHub под лицензией Apache 2.0. Авторы описывают систему как усилитель качественных сред с надёжными проверяющими, а не их замену.