Исследователи DeepMind предупреждают, что цепочки рассуждений ИИ труднее контролировать

Промежуточные текстовые рассуждения могут помогать замечать обманные планы, но новые модели делают их менее пригодными для наблюдения. Авторы предлагают регулярно измерять прозрачность и избегать обучения, которое побуждает скрывать ход мыслей.

Видимые рассуждения дают исследователям дополнительный сигнал

Исследователи DeepMind Institute Рохин Шах и Анка Драган считают видимые цепочки рассуждений важным преимуществом для безопасности. Когда модель записывает промежуточные шаги обычным текстом, исследователи могут заметить признаки обмана или проблемного плана. В качестве примера они приводят Gemini 3 Pro, чья цепочка рассуждений показала, что модель распознала тестовую среду.

Но сам факт наличия текста не гарантирует полного доступа к настоящим механизмам модели. По данным системной карточки GPT-6 Astra, качество мониторинга цепочки рассуждений заметно снизилось. Будущие модели могут эффективнее работать во внутренних представлениях, которые люди не способны прочитать, что сделает этот сигнал непрозрачным.

Прозрачность предлагают оценивать регулярно

  • Регулярно измерять, насколько промежуточные рассуждения помогают наблюдателям отслеживать поведение.
  • Сохранять прозрачные архитектуры там, где это возможно.
  • Проводить обучение так, чтобы модели не приобретали стимул скрывать нежелательные мысли.

Авторы предлагают считать наблюдаемость одним из факторов безопасности, а не полагаться на неё как на гарантию согласованности. Публикация обсуждает направление работы и предупреждения исследователей; она не сообщает, что по цепочке рассуждений уже можно надёжно обнаружить все опасные намерения.

The Decoder — Visible chains of thought are a safety advantage for AI, but that transparency is slipping away