基于脉动阵列的Transformer注意力加速器设计与内存优化.docxVIP

  • 1
  • 0
  • 约1.44万字
  • 约 21页
  • 2026-07-29 发布于甘肃
  • 举报

基于脉动阵列的Transformer注意力加速器设计与内存优化.docx

PAGE2

基于脉动阵列的Transformer注意力加速器设计与内存优化

摘要

随着深度学习技术的飞速发展,Transformer模型在自然语言处理和计算机视觉领域取得了前所未有的成功。然而,Transformer核心的注意力机制具有极高的计算复杂度和内存访问带宽需求,这导致其在边缘端设备部署时面临严重的“内存墙”瓶颈与能效危机。本课题旨在设计一款基于脉动阵列的Transformer注意力加速器,并通过优化数据流显著减少内存访问次数。

本论文从需求分析出发,明确了加速器在吞吐量、功耗及面积上的设计指标。在总体设计阶段,构建了包含控制单元、脉动计算阵列、片上存储与DMA模块的顶层架构。详细设计阶段深入剖析了脉动阵列的映射策略与Softmax算子的流水线化实现,并提出了针对矩阵乘加的数据重排与双缓冲机制。系统实现阶段采用Chisel语言构建硬件电路,并通过仿真验证功能正确性。测试阶段表明,该加速器在保证数值精度的前提下,内存访问带宽需求降低了约40%,能效比显著提升。

本设计的核心创新点在于提出了一种面向注意力机制QKV矩阵计算的脉动阵列数据流优化方案,通过权值固定与输入预取相结合的策略,最大化了数据复用,为边缘端AI芯片的设计提供了有价值的工程参考。

第一章绪论

1.1研究背景

近年来,以大规模语言模型为代表的人工智能技术引发了新一轮的科技革命。作为这些模型的基础架构,T

文档评论(0)

1亿VIP精品文档

相关文档