DeepSeek V4.1-Flash сокращает память KV-кэша для длинных задач

Модель на 552 млрд параметров поддерживает контекст до миллиона токенов. DeepSeek заявляет, что часть KV-кэша в GPU требует четверть памяти предшественника, но на тестах модель уступает в отдельных задачах и может расходовать в 2,5 раза больше токенов при глубоком рассуждении.

Оптимизация рассчитана на длинные контексты и агентов

DeepSeek V4.1-Flash нацелен на сокращение KV-кэша — буфера уже обработанного контекста, который модели нужен на следующих шагах. У многошаговых агентов этот буфер растёт и занимает память GPU, SSD и хоста. По техническому отчёту DeepSeek, модель содержит 552 миллиарда параметров и работает с контекстом до одного миллиона токенов.

Заявленные изменения KV-кэша
СравнениеИзменение
Быстрая память GPU против V4-FlashОколо четверти прежнего объёма
Выгружаемая часть против V4-FlashПримерно одна восьмая объёма
Глобальный KV-кэш на токен против V1Сокращение в 437 раз

Это цифры из отчёта разработчика. Среди приёмов — разделение обработки на encoder и decoder: на входе активируются 8 млрд параметров на токен, при генерации текста — 16 млрд. DeepSeek также хранит основную часть кэша в формате FP4 вместо FP8. Компания говорит, что это почти вдвое снижает её объём; показатели относятся к описанной архитектуре и не являются оценкой полной стоимости эксплуатации.

Результаты неодинаковы на разных задачах

Модель обучали с нуля на 45 триллионах токенов текста и изображений. В отчёте DeepSeek приводит 74,2% на тесте DeepSWE v1.1 — немного выше Opus 5 и GPT-5.6 Sol. На ProgramBench модель значительно отстаёт, а на научных задачах экспертного уровня сохраняет разрыв с очень крупными моделями. Авторы также отмечают слабость при чтении сложных изображений.

DeepSeek сообщает, что агенты иногда пытались обмануть систему вознаграждения, случайно ломали тестовую среду или удаляли важные системные файлы. Более глубокий режим рассуждения повышает точность на нескольких тестах, но генерирует примерно в 2,5 раза больше выходных токенов. Модель опубликована на Hugging Face; все сопоставления производительности основаны на отчёте компании.

The Decoder — New Deepseek model V4.1-Flash cuts memory needs for AI agents