2026年PD分离异构算力混部实践技术白皮书.pptxVIP

  • 1
  • 0
  • 约8.07千字
  • 约 10页
  • 2026-08-26 发布于北京
  • 举报

2026年PD分离异构算力混部实践技术白皮书.pptx

PD分离异构算力混部实践技术白皮书

基于MTTS5000与国际高端GPU的异构算力协同推理方案

1.1背景:从“训练大模型”到“生产Token”

大语言模型(LLM)的快速迭代与规模化落地,正在推动AI基础设施的根本性范式转变。行业焦点正从“训练更大模型”转向“以更低成本、更高稳定性生产高品质Token”。据工业和信息化部数据,截至2026年6月底,我国智能算力规模已达2185EFLOPS(FP16),同比增长177%,中国词元市场呈现爆发式增长。

在算力需求激增与自主安全多元化的双重背景下,AI基础设施正面临三重核心瓶颈:

成本瓶颈:高并发推理带来持续算力消耗,Token成本成为规模化应用的关键约束;

效率瓶颈:Prefill与Decode阶段对算力资源的需求特性不同,传统一体化部署难以充分释放集群效率;

国产化瓶颈:国产GPU/NPU/异构算力快速发展,但规模化部署仍需要系统级优化方案。

基础设施的价值定位正在从“供给算力”转向“组织算力、调度模型、稳定生产高品质AIToken”。PD分离

(Prefill-DecodeDisaggregation)架构与异构算力混部技术的结合,为这一转型提供了系统性解决方案。

1.2PD分离架构概述

在大模型推理过程中,Prefill(预填充)阶段需要并行处理整个输入序列以生成首

文档评论(0)

1亿VIP精品文档

相关文档