WikiSkill сохраняет ошибки агентов в базе знаний и превращает опыт в новые навыки
WikiSkill сохраняет историю действий агента в структурированной вики и использует её для создания навыков. В пяти бенчмарках авторы сообщили о преимуществе в 3,3–12 процентных пунктов над конкурирующими методами.
Система сохраняет и полезные, и отвергнутые решения
WikiSkill — разработка Google Research и Virginia Tech для создания повторно используемых навыков из успешных и неудачных попыток агента. Авторы отмечают, что существующие системы могут забывать диагностику ошибки или отклонённое исправление и снова тратить ресурсы на те же неудачные решения.
Вместо этого WikiSkill хранит полный набор трасс, формирует структурированную вики с повторяющимися сбоями и удачными подходами, а затем использует накопленные записи для генерации процедурного файла навыка. Каждый навык связан с наблюдениями, которые привели к его созданию или изменению.
Опыт проходит через три уровня
- Raw Layer хранит неизменённые трассы: действия, вызовы инструментов, результаты и финальные ответы.
- Wiki Layer содержит страницы повторяющихся ошибок и стратегий, журнал эволюции и сведения о том, помогли ли изменения навыка.
- Skill Layer включает короткие инструкции, доступные агенту во время выполнения задачи.
Каждый цикл включает выполнение учебных задач, обновление вики на основе примеров, предложение навыка и проверку на отдельном наборе. Изменение сохраняют, только если оно улучшает лучший достигнутый результат на валидации. В примере ALFWorld сначала отклонили слишком общий навык, а после сохранения причины отказа система предложила более конкретное правило против повторения цикла действий.
Прирост проверили на пяти бенчмарках
Исследователи тестировали математические рассуждения, поиск в интернете, работу с таблицами, ответы по длинным документам и интерактивные бытовые задачи на моделях Qwen, Gemma и Gemini. По их результатам, WikiSkill получила наивысший средний балл для каждой проверенной модели; преимущество над сильнейшим конкурирующим методом составило 3,3–12 процентных пунктов.
Команда также сообщила, что прирост в семействе Qwen увеличивался вместе с размером модели и что навыки иногда переносились между моделями. Это результаты экспериментов авторов исследования, не доказательство такого же улучшения в любой рабочей среде.