- 0
- 0
- 约1.15万字
- 约 15页
- 2026-09-18 发布于山东
- 举报
第一章
简答题:
1、什么是大模型?
答:大模型是指具有数千万甚至数亿参数的深度学习模型。大模型的原理基于深度学习,它利用大量的数据和计算资源来训练具有大量参数的神经网络模型。通过不断地调整模型参数,使得模型能够在各种任务中取得最佳表现。通常所说大模型中“大”的特点体现在:参数数量庞大、训练数据量大、计算资源需求高等。很多先进的模型由于拥有很“大”的特点,使得模型参数越来越多,泛化性能越来越好,在各种专门的领域输出的结果也越来越准确。
简要介绍一下Transform结构。
答:当前流行的大模型的网络架构其实并没有很多新的技术,还是一直沿用当前NLP领域最热门最有效的架构——Transformer结构,如图1.1所示。相比于传统的循环神经网络(RNN)和长短时记忆网络(LSTM),Transformer具有独特的注意力机制(Attention),这相当于给模型加强理解力,对更重要的词能给予更多关注。同时该机制具有更好的并行性和扩展性,能够处理更长的序列,立马成为NLP领域具有奠基性能力的模型,在各类文本相关的序列任务中取得不错的效果。
图1.1Transformer模型架构
根据这种网络架构的变形,主流的框架可以分为Encoder-Decoder、Encoder-Only和Decoder-Only,如下。
1)Encoder-Only,仅包含编码器部分,主要适用于不需要生成序列的任
您可能关注的文档
最近下载
- 2025年光伏电站无人机清洗技术与应用.pptx VIP
- (正式版)G-B 5768.3-2009 道路交通标志和标线 第3部分:道路交通标线.docx VIP
- 竞选学习委员ppt.pptx VIP
- 2026—2027年面向超高层建筑玻璃幕墙清洗的无人机-机器人协同作业系统解决高空作业高风险难题获物业管理与清洁服务巨头收购整合.pptx VIP
- 特种设备档案表格模板.docx VIP
- 15041-毛概简答汇总.pdf VIP
- 床旁超声指导新生儿经外周静脉置入中心静脉穿刺术临床实践指南(2026).pptx VIP
- 《日本小姑娘,你在哪里?(姚远方)》资料链接.pdf VIP
- 特异体质学生人身安全责任书.docx VIP
- DZ_T 0433-2023 矿产地质勘查规范 玉石.pdf VIP
原创力文档

文档评论(0)