DeepSeek技术优化对产业链影响分析.pdfVIP

  • 0
  • 0
  • 约4.44千字
  • 约 5页
  • 2026-09-07 发布于北京
  • 举报

DeepSeek会:影响

Q:DeepSeek和普通的AIGC有什么区别?

A:DeepSeek也属于生成式AI,有几个不同:

第一个是把成本拉低,是l的1/11,用先进技术把推理速度降低,模

型架构和大部分不一样,用细颗粒度MoE,先进模型基本都是邓氏架构,细

颗粒度不是首创,阿里也在往这个方向走,这个架构在推理的时候只激活部分

参数,在推理机制上引入LLA,市场上有几种,多头注意力等,需要每个参

数都参与计算,而DeepSeek只激活低参数,降低成本;

第二个是训练方法,传统方法是FP32和FP16的混合精度,DeepSeek用FP8

参数,比较敏感的组件还是FP16,分布式混合精度是目前做的比较少的,

训练方法里面也有工程优化,之前时延导致GPU利用率不是很高,DeepSeek

用流水线并行,高效利用通信网络,提升速率;

第三是编程上面也有很大不一样,此前用CUDA,DeepSeek用PTX,PTX本

身是CUDA的一部分,用更细颗粒度来调度底层单元,将硬件调度细化,是传

统方法用的比较少的;

第四是AIInfra,通常集群是三层网络,DeepSeek是两层,通信库降低PCIE

文档评论(0)

1亿VIP精品文档

相关文档