OpenAI сообщает о росте работы ИИ-агентов и предупреждает об ограничениях контроля

Компания заявляет, что достигла этапа «автоматизированного научного стажёра», а к середине августа агенты выполняли эквивалент 3,1 рабочего дня на каждый день исследователя. OpenAI предупреждает: метрики использования не равны научному прогрессу.

Заявленный этап автоматизации

OpenAI сообщает, что достигла цели, поставленной осенью 2025 года: система выполняет чётко заданные исследовательские задачи под руководством человека, включая задачи на несколько дней работы опытного исследователя. Компания называет это «автоматизированным исследовательским стажёром», но не публикует подробную проверку результата и ссылается на собственные измерения.

Следующая цель компании — создать полностью автоматизированного ИИ-исследователя к марту 2028 года. Пока, по описанию OpenAI, люди задают направления, оценивают результаты и решают, когда масштабировать, приостанавливать или развёртывать системы.

Сколько работают агенты

По данным компании, медианный исследователь расходует на API-вывод агентов более $600 в день; показатель для 90-го процентиля превышает $7 000. Медианный объём вывода токенов на одного исследователя вырос в 124 раза с декабря 2025 года. С июня суммарное время работы агентов превысило рабочие часы людей, а к середине августа на один человеческий рабочий день приходилось 3,1 дня работы агентов.

Это не означает сопоставимого роста научной производительности. OpenAI отмечает, что такие показатели легко собирать, но их связь с прогрессом исследований неясна. В коротких задачах до 15 минут системы обходились без вмешательства в 86% случаев. Среди успешно выполненных задач длительностью четыре-восемь человеческих часов более половины потребовали хотя бы одного шага человека.

Возможности и пределы контроля

Агенты чаще помогают писать исследовательский и инфраструктурный код, отвечать на технические вопросы и наблюдать за обучением. Высокоуровневое планирование занимает небольшую долю их работы. Компания также сообщает о снижении числа обращений за внутренней технической помощью.

Главный научный сотрудник OpenAI Якуб Пахоцки предупреждает, что мониторинг цепочек рассуждений становится менее надёжным: словесное объяснение модели всё хуже отражает её взаимодействие с инструментами. Он призывает к обязательным стандартам и независимому контролю масштабирования ИИ. Эти метрики и выводы представлены самой OpenAI.

The Decoder — OpenAI reports AI “research interns” and warns about its own pace at the same time