- 1
- 0
- 约1.76千字
- 约 5页
- 2026-09-25 发布于山东
- 举报
大模型知识点汇总
模块一:大模型概述
1.定义与分类
1.1定义:大模型是指具有大规模参数和复杂结构的机器学习模型,通常用于处理复杂的任务,如自然语言处理、图像识别等。
1.2分类:根据应用领域,大模型可以分为自然语言处理模型(如Transformer、BERT)、计算机视觉模型(如CNN、RNN)等。
2.发展历程
2.1早期阶段:以传统的机器学习模型为主,如支持向量机(SVM)、决策树等。
2.2中期阶段:深度学习模型的兴起,如卷积神经网络(CNN)、循环神经网络(RNN)等。
2.3近期阶段:Transformer模型的提出,如BERT、GPT等,标志着大模型进入新的发展阶段。
3.核心技术
3.1参数优化:使用梯度下降等优化算法,如Adam、SGD等,进行参数更新。
3.2正则化技术:如L1、L2正则化,Dropout等,防止过拟合。
3.3模型结构:如Transformer的多头注意力机制,CNN的卷积操作等。
模块二:自然语言处理模型
1.Transformer模型
1.1结构:由编码器和解码器组成,编码器用于提取输入特征,解码器用于生成输出。
1.2注意力机制:自注意力机制和交叉注意力机制,用于捕捉输入序列中的长距离依赖关系。
1.3应用:如BERT、GPT等,广泛应用
原创力文档

文档评论(0)