Google нашла способ не дать самообучающимся ИИ-агентам заучивать тесты
Исследователи Google разработали метод RRSI, который помогает ИИ-агентам улучшать работу на новых задачах, а не подгоняться под знакомые тесты. Он меняет не саму модель, а её «обвязку» — набор правил и инструментов, который задаёт, как агент выполняет задачи, исправляет ошибки и выдаёт результат.
Что известно
Исследователи Google разработали метод RRSI, который помогает ИИ-агентам улучшать работу на новых задачах, а не подгоняться под знакомые тесты. Он меняет не саму модель, а её «обвязку» — набор правил и инструментов, который задаёт, как агент выполняет задачи, исправляет ошибки и выдаёт результат.
Обычно автоматическая настройка такой обвязки повышает баллы на тренировочных заданиях, но агент начинает их заучивать и хуже справляется с незнакомыми. RRSI ограничивает число изменений: сначала разрешает крупные переделки, затем — только небольшие. Проверяющий механизм отбрасывает правки, заточенные под конкретные тесты, а дополнительные вычислительные затраты допускает лишь при измеримом улучшении. Неудачные идеи не повторяются, бесполезные компоненты удаляются. 💡
Метод проверили на восьми тестах по программированию, офисным задачам и инженерному проектированию; модель Claude Opus 4.8 при этом не меняли. RRSI улучшил результат на тренировочных задачах максимум на 14,1 пункта, а на пяти ранее незнакомых тестах — до 4,7 пункта. На новых тестах он не уступил исходной обвязке ни в одном случае и расходовал примерно на 30% меньше токенов, чем вариант без ограничений.
Обвязка для программирования, настроенная с Gemini 3.5 Flash, также повысила результат более слабой Gemini 3.1 Flash Lite с 11,2 до 14,6 пункта — без изменений самой модели. Впрочем, исследование охватывает только системы с неизменными моделями: что будет, если менять и их параметры, авторы не проверяли.