DeepSeek V4.1-Flash сокращает память KV-кэша для длинных задач
Модель на 552 млрд параметров поддерживает контекст до миллиона токенов. DeepSeek заявляет, что часть KV-кэша в GPU требует четверть памяти предшественника, но на тестах модель уступает в отдельных задачах и может расходовать в 2,5 раза больше токенов при глубоком рассуждении.
Оптимизация рассчитана на длинные контексты и агентов
DeepSeek V4.1-Flash нацелен на сокращение KV-кэша — буфера уже обработанного контекста, который модели нужен на следующих шагах. У многошаговых агентов этот буфер растёт и занимает память GPU, SSD и хоста. По техническому отчёту DeepSeek, модель содержит 552 миллиарда параметров и работает с контекстом до одного миллиона токенов.
| Сравнение | Изменение |
|---|---|
| Быстрая память GPU против V4-Flash | Около четверти прежнего объёма |
| Выгружаемая часть против V4-Flash | Примерно одна восьмая объёма |
| Глобальный KV-кэш на токен против V1 | Сокращение в 437 раз |
Это цифры из отчёта разработчика. Среди приёмов — разделение обработки на encoder и decoder: на входе активируются 8 млрд параметров на токен, при генерации текста — 16 млрд. DeepSeek также хранит основную часть кэша в формате FP4 вместо FP8. Компания говорит, что это почти вдвое снижает её объём; показатели относятся к описанной архитектуре и не являются оценкой полной стоимости эксплуатации.
Результаты неодинаковы на разных задачах
Модель обучали с нуля на 45 триллионах токенов текста и изображений. В отчёте DeepSeek приводит 74,2% на тесте DeepSWE v1.1 — немного выше Opus 5 и GPT-5.6 Sol. На ProgramBench модель значительно отстаёт, а на научных задачах экспертного уровня сохраняет разрыв с очень крупными моделями. Авторы также отмечают слабость при чтении сложных изображений.
DeepSeek сообщает, что агенты иногда пытались обмануть систему вознаграждения, случайно ломали тестовую среду или удаляли важные системные файлы. Более глубокий режим рассуждения повышает точность на нескольких тестах, но генерирует примерно в 2,5 раза больше выходных токенов. Модель опубликована на Hugging Face; все сопоставления производительности основаны на отчёте компании.