CLM-8B ускоряет выбор действий ИИ-агента, сравнивая состояние и варианты
Stanford и Nvidia представили CLM-8B для выбора действий агента через сопоставление состояния и вариантов. В тестах модель работала до девяти раз быстрее Jev, но уступила по точности в части задач.
Модель сопоставляет контекст и доступные действия
Многие агенты используют языковую модель, чтобы выбрать один вариант из фиксированного набора инструментов или оценить несколько возможных ответов. Исследователи Stanford и Nvidia разработали Contrastive Language Models (CLM), чтобы выполнять такие ограниченные решения без генерации последовательности токенов.
CLM кодирует состояние задачи и возможные действия в общем пространстве представлений, а затем выбирает наиболее близкую пару. Во время обучения правильные сочетания сближаются, а неверные отдаляются. Если набор действий повторяется, модель может заранее сохранить их представления и не пересчитывать их для каждого запроса.
Ускорение сопровождается уступками в отдельных тестах
В zero-shot испытаниях на управлении компьютером, играх и вызове инструментов CLM-8B работала до девяти раз быстрее модели Jev от TypeSafe. Авторы сообщили о равной успешности на двух игровых задачах, но на BFCL v4 показатель CLM составил 95,2% против 99,2% у Jev, а в WikiRacing она завершила 26 из 30 задач против 30 из 30 у конкурента.
Самые большие ускорения появлялись там, где действия можно переиспользовать между многими состояниями или выбирать из большого набора. Поэтому результат зависит от характера задачи и размера повторяемого списка вариантов; максимальное ускорение не означает одинакового преимущества по всем тестам.
CLM обучали на парах состояний и действий
Обучение проходило в три этапа: около 60 млн пар вопрос—ответ для общего семантического сопоставления, около 30 млн синтетических сложных негативных примеров и примерно миллион траекторий агентов. Выпущенная CLM-8B использует замороженную основу Qwen3-8B и отдельные проекционные компоненты для состояний и действий.
Авторы приводят пример внутреннего IT-агента с 50 утверждёнными действиями: кэширование вариантов может уменьшить повторную обработку. Это пример возможного применения, а не опубликованный корпоративный результат.