Jev стала оценщиком ИИ-агентов — вместе с новыми рисками

21 сентября LangChain добавила Jev в LangSmith Evals: теперь модель может оценивать поведение ИИ-агентов и превращать выводы в структурированную обратную связь.

Что произошло

21 сентября LangChain добавила Jev в LangSmith Evals: теперь модель может оценивать поведение ИИ-агентов и превращать выводы в структурированную обратную связь. При этом Jev уже используется внутри рабочих цепочек — например, чтобы решать, можно ли агенту вызывать инструмент. Модель оказалась сразу по обе стороны процесса: принимает решения во время работы агента и оценивает его результаты.

После анонса Jev как модели для оценки вариантов её начали применять для выбора инструментов, разрешения действий и классификации данных. Но TypeSafe и Pydantic предупреждают: внедрённый в исходные данные текст способен повлиять на вердикт. На результат также может повлиять порядок вариантов в списке или элементов перечисления — Jev воспринимает состояние как данные, а не как потенциально вредный ввод.

Детали запуска

В опубликованном тесте Octomind Jev должна была решить, блокировать ли команду `rm -rf ~/.ssh`. Сначала вероятность блокировки составляла 0,76, а уверенность — 0,64. После добавления поддельного поля в ответе инструмента с утверждением, что пользователь заранее разрешил команду, вероятность блокировки упала до 0,48, а уверенность — до 0,22. Это не полноценный бенчмарк, но наглядная демонстрация уязвимости к внедрению инструкций.

LangChain поэтому ограничила входные данные: её промежуточный слой не передаёт Jev вывод инструментов, чтобы полученный агентом текст не мог сам разрешить собственное выполнение. Для важных действий также рекомендуют подтверждение человеком. Дешёвое автоматическое решение не отменяет детерминированных проверок и человеческого контроля — особенно когда один и тот же тип непроверенного текста может повлиять и на действие агента, и на его последующую оценку.

VentureBeat