DeepSeek показала способ снизить потребление HBM памяти для контекста, не урезая размер самой модели. V4.1 Flash требует лишь четверть объёма памяти для KV-кэша по сравнению с V4 Flash. Это касается именно памяти для контекста, а не всех весов модели. Для сервисов с множеством одновременных пользователей разница критична.

Основа V4.1 Flash содержит 552 млрд параметров, дополнительный слой Engram добавляет 196 млрд. На Hugging Face полный набор составляет около 763 млрд параметров со вспомогательными компонентами. При этом модель активирует примерно 8 млрд параметров при обработке входных данных и 16 млрд при генерации ответа, поэтому вычислительная нагрузка растёт не пропорционально размеру.

Главную экономию даёт архитектура Causal Encoder-Decoder. Двадцать слоёв энкодера обрабатывают входные данные, затем двадцать слоёв декодера используют общий KV-кэш из итогового состояния энкодера вместо создания отдельных полных копий на каждом уровне. DeepSeek указывает размер глобального KV-кэша 890 байт на токен, где хранится состояние уже обработанного контекста.

Compressed Sparse Attention 2 переиспользует данные внимания между слоями, а KV-кэш хранится в формате FP4. Постоянный кэш, передаваемый на накопители, сократился примерно до одной восьмой от V4 Flash. Этот подход развивает направление, которое DeepSeek начала в V4, там также сокращали затраты памяти на длинный контекст.

Дефицит HBM памяти обостряется по мере развития ИИ-инфраструктуры. Чем меньше памяти занимает контекст каждого пользователя, тем больше одновременных сессий можно обслуживать на одних ускорителях. DeepSeek оценивает выигрыш по KV-кэшу в четыре раза относительно V4 Flash и в 437 раз относительно первого поколения.

V4.1 Flash поддерживает контекст до миллиона токенов и работает с текстом и изображениями. Модель доступна через API и опубликована с открытыми весами под лицензией MIT. V4 Flash снята с API, а с 14 сентября запросы к V4 Pro временно перенаправляются на V4.1 Flash до выпуска V4.1 Pro. Новая архитектура позволит масштабировать модель дальше.