再谈ARM为何受益GPU与CPU协同.docxVIP

  • 0
  • 0
  • 约1.06万字
  • 约 18页
  • 2026-08-12 发布于湖南
  • 举报

证券研究报告1

计算机行业动态报告

再谈ARM为何受益GPU与CPU协同

2026年07月30日

随着生成式AI大规模部署,传统依赖GPU/TPU/NPU集群的推理方案面临高成本、高能耗等挑战。AmpereAI推理优化框架(AIO)专为AmpereOne云原生处理器设计,通过与AmpereOne平台的深度协同优化,在SLM和MoE模型推理场景中实现低成本与高能效的双重突破。Fedimoss官网测试数据显示,AmpereOne192核ARMCPU在Llama-3.2-1B上tg吞吐量达4242.553tokens/s,在Qwen3-30B-A3B(MoE)上达769.691tokens/s,验证了ARMCPU在SLM和MoE模型推理场景中的可行性与效率。落地案例中,某加密货币服务提供商部署该方案后营销文章生成周期从2天缩短至60分钟。

跨环境异构推理:从架构趋势到工程落地。AgenticAI工作负载呈推理-调用-决策交替执行模式,GPU利用率间歇化,而高核心密度ARMCPU可承担请求路由、Prompt预处理、工具编排、代码执行调度、KVCache管理及部分Decode任务。FedimossAITH

文档评论(0)

1亿VIP精品文档

相关文档