Компании ограничивают передачу чувствительных данных ИИ-лабораториям

Nvidia, Booz Allen и Palantir, по сообщениям The Information, опасаются утечки интеллектуальной собственности и требуют гарантий хранения данных. Даже zero data retention не отвечает на все вопросы о метаданных и обучении на пользовательских следах.

Клиенты ограничивают работу с чувствительным кодом

По сведениям The Information, Nvidia использует Anthropic Fable для менее чувствительных задач, например открытых проектов, а для внутреннего мониторинга цепочки поставок выбирает собственные Nemotron-модели. Представитель Nvidia выступает за zero data retention по умолчанию. Booz Allen запретила сотрудникам применять Fable для работы над собственным киберзащитным ПО из опасения, что код может повлиять на модель. Palantir, по сообщению издания, блокирует доступ клиентов к Fable через свои продукты, пока Anthropic не предоставит безотзывные гарантии нулевого хранения данных. The Decoder также отмечает, что Palantir заинтересована в том, чтобы клиенты запускали модели через её собственную платформу.

Эти позиции не означают, что компании доказали утечку. Они показывают, что даже крупные клиенты и инвесторы считают условия хранения и использования интеллектуальной собственности частью выбора модели. Anthropic объявила отдельную программу хранения данных на серверах клиента для некоторых пользователей.

Нулевое хранение не снимает все вопросы

По данным The Information, OpenAI и Anthropic могут собирать технические метаданные и сведения об использовании даже для корпоративных клиентов. OpenAI описывает часть классификаций как обезличенные и говорит, что они не содержат исходных бизнес-данных; некоторые клиенты, однако, не понимают, какие именно сведения формируются.

Пользовательские следы и доверие

Сооснователь OpenAI Джон Шульман описывал несколько вариантов использования данных: от прямого обучения до дистилляции и создания задач обучения с подкреплением на основе действий пользователей. По его мнению, последние подходы меньше рискуют воспроизвести исходный контент, но всё ещё могут извлечь коммерческую ценность из пользовательских данных. Он призывает к более ясным правилам раскрытия.

В споре математиков Бакмастера и Альпёге OpenAI сначала допускала возможное влияние обезличенных данных. Позже компания заявила, что их Codex-промпты за два месяца до публикации не могли повлиять на систему даже через обучение. Этот случай усилил вопрос о прозрачности, но не доказывает, что черновики использовались.

The Decoder — AI labs have a data trust problem that their policies haven’t solved