Anthropic объяснила, из чего складывается цена задачи в Claude Code
Anthropic показывает, почему цена задачи зависит не только от тарифа за токен: каждый новый ход повторно отправляет часть контекста, кэширование снижает стоимость чтения, а рассуждения тарифицируются как выходные токены.
Стоимость зависит от числа ходов и типа токенов
Anthropic предлагает считать не миллионы токенов, а завершённые задачи. В Claude Code модель читает контекст, вызывает инструмент, получает результат и повторяет цикл. Каждый новый ход снова передаёт предыдущую переписку, поэтому длинный процесс может обработать намного больше токенов, чем максимальный размер контекста за один момент.
В примере компании задача начинается с 20 тысяч токенов контекста и постепенно достигает 120 тысяч. При 40 ходах средний запрос отправляет около 70 тысяч токенов — суммарно 2,8 млн входных токенов. Если 90% приходится на чтение из кэша, Anthropic оценивает входную часть примерно в $1,62; при 25 ходах она снижается до $1,02.
Кэш важен для длинных сессий: те же 2,8 млн входных токенов при отсутствии кэширования стоят в примере $11,20, при доле чтения из кэша 90% — $1,62, а при 96% — около $0,99. Выходные токены, включая скрытые рассуждения, дороже: в примере 60 тысяч таких токенов стоят $1,20.
Пример основан на тарифах и допущениях компании
Для расчётов использованы опубликованные API-цены Opus 5.5: $4 за миллион входных токенов, $20 за миллион выходных и $0,20 за миллион чтений из кэша. Anthropic указывает, что примеры не учитывают запись в кэш, а объёмы токенов являются иллюстрацией, а не гарантированным счётом типовой задачи.
Компания пишет, что все тарифные позиции Opus 5.5 на 20% ниже Opus 5, а чтение из кэша — на 60% дешевле. На подписках Pro, Max и Team, по её словам, снижение цены позволяет лимитам покрывать примерно на четверть больше работы. Эти оценки относятся к тарифам Anthropic и конкретным допущениям её калькулятора.
Практический совет компании — сократить ненужные повторные ходы, заранее собирать контекст и давать модели возможность проверять результат тестом, сборкой или запросом к endpoint. Меньшая модель, меньший уровень рассуждений и более короткий контекст тоже могут снизить расходы, но, предупреждает Anthropic, повторная попытка из-за неудачной задачи способна съесть эту экономию.