摩尔线程 MTT S5000 Prefill-as-a-Service 技术白皮书.pptxVIP

  • 1
  • 0
  • 约2.08万字
  • 约 10页
  • 2026-09-02 发布于河北
  • 举报

摩尔线程 MTT S5000 Prefill-as-a-Service 技术白皮书.pptx

MTTS5000

Prefill-as-a-Service

技术白皮书

发布日期:2026年8月

[1]

大模型推理服务正从短上下文、单请求的简单形态,演进为

以Agent、AICoding与长文档分析为代表的超高并发、长上下文在线系统。在此背景下,Prefill(预填充)与Decode(解码)两个阶段在计算特性与硬件资源诉求上的根本差异日趋凸显:Prefill为计算密集型负载,受浮点算力约束;Decode为访存密集型负载,受显存带宽约束。在传统同构混部架构中,两者共享同一GPU、同一显存、同一调度域,由此引发双重困境——长Prefill挤占调度窗口导致尾延迟(P99/ITL)离散化恶化,而同构扩容因两类负载资源诉求相背离而只会加剧错配。

本文首先论证了PrefillasaService[1]计算池统计口径与同构资

源池双向浪费的结构性成因,据此提出基于Prefill-Decode分离(PD分离)的架构演进路径,并以MTTS5000作为PrefillasaService算力池、GPUA*作为Decode生成池,构建了异构PD分离方案。该方案基于SGLang主线的PD分离与分页KVCache机制,并通过Mooncake框架实现跨节点传输;在KV页大小、布局与精度完全对齐的

文档评论(0)

1亿VIP精品文档

相关文档