DeepSeek‑V4.1‑Flash:突破 KV 缓存压缩的极限.docx

DeepSeek‑V4.1‑Flash:突破 KV 缓存压缩的极限.docx

关注机智流洞察AI前沿

DeepSeek-V4.1-Flash:突破KV缓存压缩的极限

DeepSeek-AI

research@

摘要

长时程智能体的广泛应用使得模型工作负载越来越偏向输入密集型。尽管先前的工作已经大幅降低了长上下文计算的成本,但预填充仍然计算开销巨大,且庞大的KV缓存持续对HBM和SSD容量以及数据传输带宽造成压力。这些计算、存储和带宽需求共同构成了进一步降低部署成本的主要瓶颈。为应对这一挑战,我们推出了DeepSeek-V4.1-Flash,这是一个拥有5520亿骨干参数、支持最长一百万词元上下文的多模态混合专家模型(

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档