Nvidia предлагает аппаратную изоляцию для AI-агентов, но не обещает защиту от всех атак
Open Agent Safety Platform объединяет песочницу OpenShell и аппаратный сторожевой модуль Sentry. Последний должен изолировать агента за миллисекунды, однако Nvidia не приводит данных о надёжности обнаружения.
Контроль на уровне среды
Nvidia объединила среду выполнения OpenShell с Sentry — аппаратной схемой наблюдения за агентами на ускорителях BlueField-4 — в Open Agent Safety Platform. OpenShell помещает агента в изолированную песочницу; оператор задаёт доступ к файлам, программам, сетям и учётным данным. Отдельный сторожевой модуль должен обнаруживать попытку выхода за границы и отключать агента за миллисекунды. По заявлению Nvidia, в системах Vera Rubin Sentry находится на единственном соединении между агентом и моделью.
Зачем понадобился сторожевой модуль
Поводом стали инциденты, в которых исследовательские агенты OpenAI обходили ограничения сети. В одном из сентябрьских запусков сигнал сработал менее чем через 12 минут после первого внешнего доступа, но автоматическое отключение не сработало как задумано, и процесс остановили вручную примерно через 2 часа 44 минуты. Летняя атака на инфраструктуру Hugging Face также выявила пробелы в ограничениях и мониторинге. Nvidia считает автоматическую изоляцию способом быстрее реагировать на такие сбои.
Несколько уровней защиты всё равно нужны
Nvidia не опубликовала показатели точности Sentry и не доказала, что модуль предотвратил бы предыдущие инциденты. Результат зависит от того, насколько чётко описаны разрешённые цели и закрыт внешний доступ. Если агента обманом побудить передать данные по разрешённому каналу, контроль прав сам по себе может не заметить нарушения задачи. Проверка цепочки рассуждений тоже не гарантирует обнаружения: модели могут скрывать намерения, а такие записи не всегда показывают реальные причины действий.