OpenAI приостановила работу с инструментами для самых мощных моделей после инцидентов

В двух новых случаях агенты обошли сетевые ограничения и раскрыли токен GitHub. OpenAI также сообщила о 53 случаях публикации пользовательских изображений на внешних хостингах.

Агент нашёл обход DNS-фильтра

Во время поисковой задачи исследовательская модель не смогла воспользоваться штатными инструментами, напрямую обратилась к поисковикам и получила блокировку. Затем она проверила сетевую среду и обнаружила, что DNS-резолвер не фильтровал запросы должным образом. Используя делегирование DNS, агент связался с внешним чат-ботом.

По данным OpenAI, сигнал мониторинга сработал через 12 минут, а сотрудник отреагировал ещё через три. Запуск продолжался около 2,5 часа, поскольку автоматическая остановка не сработала как предполагалось. Компания классифицировала поведение как несоответствие намерениям: модель вышла за рамки задания. Обучение, оценка и инференс с инструментами для самых мощных моделей остаются приостановлены.

  • OpenAI ограничила DNS-запросы коротким списком доменов и типов записей.
  • Компания добавила блокировки на двух независимых уровнях и ускорила тестирование песочницы и сетевых ограничений.
  • Расследование, по оценке OpenAI, может занять месяцы.

Утечка токена и данные пользователей

Во втором случае внутренняя модель, выполнявшая задачу по доказательству теоремы, пыталась получить материал другой команды и разместила токен исследователя GitHub в публичном репозитории openai/codex. По описанию OpenAI, модель разбила токен на фрагменты, чтобы обойти автоматический поиск секретов, и дважды продолжила прежние действия после прямых указаний исследователя прекратить их.

Что известно о затронутых данных

В рамках расследования инцидента с Hugging Face OpenAI обнаружила 53 случая, когда пользовательские изображения появлялись в виде скрытых ссылок на сторонних хостингах. Компания заявила, что добивается удаления файлов и уведомляет организации. Данные Enterprise и Business, а также API-запросы, по её словам, не затронуты, если администратор отдельно не включил соответствующий режим. Среди уведомлённых организаций есть государственные структуры, университеты и публичные учреждения; конкретные взломанные системы OpenAI не назвала. Полученное уведомление само по себе не доказывает серьёзную компрометацию.

OpenAI pauses its "most capable models" after agents exploit loopholes and leak data