- 1
- 0
- 约2.08万字
- 约 10页
- 2026-09-02 发布于河北
- 举报
MTTS5000
Prefill-as-a-Service
技术白皮书
发布日期:2026年8月
[1]
大模型推理服务正从短上下文、单请求的简单形态,演进为
以Agent、AICoding与长文档分析为代表的超高并发、长上下文在线系统。在此背景下,Prefill(预填充)与Decode(解码)两个阶段在计算特性与硬件资源诉求上的根本差异日趋凸显:Prefill为计算密集型负载,受浮点算力约束;Decode为访存密集型负载,受显存带宽约束。在传统同构混部架构中,两者共享同一GPU、同一显存、同一调度域,由此引发双重困境——长Prefill挤占调度窗口导致尾延迟(P99/ITL)离散化恶化,而同构扩容因两类负载资源诉求相背离而只会加剧错配。
本文首先论证了PrefillasaService[1]计算池统计口径与同构资
源池双向浪费的结构性成因,据此提出基于Prefill-Decode分离(PD分离)的架构演进路径,并以MTTS5000作为PrefillasaService算力池、GPUA*作为Decode生成池,构建了异构PD分离方案。该方案基于SGLang主线的PD分离与分页KVCache机制,并通过Mooncake框架实现跨节点传输;在KV页大小、布局与精度完全对齐的
您可能关注的文档
- 抖音【年度面孔2025】人物IP项目方案.pptx
- 抖音【行业IP】内容直播综艺《姐系宇宙》招商方案.pptx
- 中国企业出海生态环境法律合规问题研究报告(四)——赞比亚篇.pptx
- 中国智能网联汽车国际化机遇与挑战——网联化出海思考.pptx
- 2026国民技术AI基础设施系列白皮书第一卷-具身智能机器人全栈芯片应用方案 MCU、安全芯片与无线射频芯片解决方案.docx
- 2026年跨境进口保健品市场分析报告.docx
- 2026年零售消费者五图解读.docx
- 2026年滋补产业蓝皮书 -电商数据分析&增长归因&品牌商策略.docx
- AI从工具走向工作:企业HR必须关注的五个变化.docx
- AI来抢饭碗了?——广告营销行业受冲击实录×创意人突围指南.docx
原创力文档

文档评论(0)