CN119558398A 一种提升大语言模型批量推理效率的处理方法 (北京大学).docxVIP

  • 2
  • 0
  • 约1.02万字
  • 约 15页
  • 2026-05-14 发布于山西
  • 举报

CN119558398A 一种提升大语言模型批量推理效率的处理方法 (北京大学).docx

(19)国家知识产权局

(12)发明专利申请

(10)申请公布号CN119558398A

(43)申请公布日2025.03.04

(21)申请号202411401959.6

(22)申请日2024.10.09

(71)申请人北京大学

地址100871北京市海淀区颐和园路5号北

京大学

(72)发明人丛培壮杨仝陈齐治

(74)专利代理机构北京君尚知识产权代理有限

公司11200

专利代理师司立彬

(51)Int.Cl.

G06N5/04(2023.01)

G06F9/50(2006.01)

权利要求书2页说明书5页附图1页

(54)发明名称

一种提升大语言模型批量推理效率的处理

方法

(57)摘要

CN119558398A本发明公开了一种提升大语言模型批量推理效率的处理方法,其步骤包括:1)利用大语言模型对所有待处理的推理任务执行预填充处理,得到每一推理任务的序列中各词元的键向量和值向量以及一词元并缓存到任务池中;2)首轮迭代计算时,将从任务池所选n个推理任务对应的最新单个词元T组成张量TB、对应的键值向量组成张量KVB、各注意力掩码向量组成张量AB;将TB、KVB和AB输入大语言模型推理计算更新TB、AB和KVB用于下一轮迭代计算;3)当一推理任务迭代结束后,将该推理任务在各次迭代输出的词元进行拼接得到该推理任务的推理

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档