Anthropic оценила долю задач, где Claude «ведёт» работу, в 26%

По внутренней шкале компании четверть рабочего времени её исследовательских команд приходится на задачи уровня, где Claude действует без постоянных подсказок, но человек всё ещё задаёт цель и решает, выпускать ли результат. Оценку делал сам Claude.

«Ведёт» не означает полной автономии

Anthropic оценивает автоматизацию работы по шкале Epoch AI от AL0 — без ИИ — до AL5, полностью автономной работы. В августе 2026 года 26% трудозатрат попадали в AL4, где ИИ «ведёт» задачу, против менее 1% в феврале. Более 90% достигали хотя бы AL3. При этом Claude не достиг уровня AL5 ни в одной задаче.

Пример AL4 от Anthropic: инженер передаёт Claude описание ошибки, а модель анализирует её, предлагает исправление и тестирует его, но человек всё ещё ставит задачу и решает, выпускать ли результат. «Доля» рассчитана по времени сотрудников, потраченному на действия, отнесённые к уровню автоматизации; она не показывает долю решений или влияние Claude на исследовательское направление.

Самооценка и расхождения

Данные из Slack и внутренних документов собирали агенты, а уровень автоматизации назначала другая модель Claude. Anthropic признаёт, что оценщик может допускать похожие ошибки. Когда сотрудники оценивали собственные рабочие области, совпадение двух людей было примерно в трети случаев; оценка Claude совпала с человеческой в 59%. В 97% случаев расхождение было не более одного уровня, но переход от AL3 к AL4 как раз и меняет интерпретацию с «сотрудничает» на «ведёт».

Мониторинг и вычисления на безопасность

На внутренней платформе Anthropic, по её данным, одновременно работают около 30 000 агентов. Монитор в реальном времени проверяет каждое действие; в августе он заблокировал 0,002% из более чем миллиарда решений. Второй монитор еженедельно выделяет около 100 000 журналов, из которых примерно 50 передают людям. Система работает лишь несколько месяцев, и Anthropic не уверена, что выявляет все типы поведения.

Как компания считает работу по безопасности

За одну неделю июля около 6% вычислительных ресурсов исследований ИИ пришлось на безопасность. Anthropic поясняет, что многие работы по безопасности требуют времени исследователей, но мало вычислений; кроме того, компания не считает безопасностью проекты, одинаково продвигающие возможности и защиту. Само определение границы субъективно, поэтому эти показатели показывают выбранную Anthropic методику, а не полную меру всех усилий отрасли.

The Decoder — Anthropic wants you to know Claude leads a quarter of its research, but “lead” doesn’t mean what you think