📖标题:DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
🌐来源:arXiv, 2609.19969v1
🛎️文章简介
🔸研究问题:随着长周期智能体应用的普及,模型在处理超长上下文时面临巨大的计算、存储和带宽瓶颈,特别是KV缓存占用了大量显存和硬盘空间,导致部署成本高昂,如何极致压缩KV缓存以降低成本?
🔸主要贡献:论文推出了DeepSeek-V4.1-Flash模型,通过架构创新和缓存压缩技术,将运行时KV缓存占用降低至前代的四分之一,持久化缓存占用降低至八分之一,同时保持了更强的性能。
📝重点思路
🔸采用因果编码器-解码器(CED)架构,将Transformer分为上下两部分。预填充阶段仅计算前半部分编码器,后半部分解码器的全局KV直接从编码器输出投影得到,使预填充激活参数量减半,大幅降低输入密集型任务的计算成本。
🔸引入压缩稀疏注意力2(CSA2),通过跨层复用全局KV缓存和索引,结合分层稀疏索引器,减少重复存储和计算。不同层根据模式(全量、重索引、复用)共享缓存,显著缩小显存中的KV footprint。
🔸使用FP4精度存储全局KV缓存,在几乎不损失精度的前提下,进一步将缓存体积减半。同时引入SWA有界回放技术,不再将滑动窗口注意力缓存持久化到硬盘,而是通过重放少量token近似恢复状态,极大减少硬盘存储压力。
🔸优化训练与推理基础设施,包括单遍mHC减少内存流量、Engram条件记忆模块增强能力、DSpark投机解码加速生成,以及针对多模态数据的高效并行训练策略。
🔎分析总结
🔸实验显示,DeepSeek-V4.1-Flash在每个token上的全局KV缓存占用仅为890字节,约为DeepSeek-V4-Flash的四分之一,持久化缓存占用约为其八分之一,显著缓解了硬件资源压力。
🔸尽管激活参数量更