DeepSeek-V4:百万 Token 上下文推理优化.docx

DeepSeek-V4:百万 Token 上下文推理优化.docx

DeepSeek-V4

百万Token上下文推理优化SGLang的系统设计与实现

YuhaoYang·SGLang/RadixArk

DeepSeek-V4:模型规模与两项架构变化

1.6T

总参数

49B

每Token激活

384/6

路由专家/每Token激活

1M

Token上下文

V4-Flash:284B总参数,单Token激活13B

MoE路由专家权重与CSAIndexer的QK路径采用FP4

mHC

残差状态扩展为四路,并通过受约束映射完成混合与写回

混合注意力

每层使用SWA,并选择CSA

文档评论(0)

1亿VIP精品文档

相关文档