大模型基础及应用教材 课点-26-27大模型原理.pptx

大模型基础及应用教材 课点-26-27大模型原理.pptx

第7章大模型原理汇报人:程显毅

目录CONTENTSTransformer基础架构01编码器与解码器02注意力机制详解03Transformer特性04大模型构建05知识蒸馏06知识增强07大模型应用策略08

目录CONTENTS思维链与微调09RAG与微调选择10

Transformer基础架构01

自注意力机制核心123多头注意力结构多头注意力通过将查询、键值和数值矩阵均等拆分,使每个注意力头独立学习不同语义信息,从而捕捉更丰富全面的特征。层次化的关注机制低层次关注词级信息,高层次关注句子级别信息,这种层次化的关注机制使得模型能够捕捉到不同层次的语义信息,提升翻译的准确性和流畅性。并行

文档评论(0)

1亿VIP精品文档

相关文档