大模型技术与应用习题及答案.docxVIP

  • 0
  • 0
  • 约1.15万字
  • 约 15页
  • 2026-09-18 发布于山东
  • 举报

第一章

简答题:

1、什么是大模型?

答:大模型是指具有数千万甚至数亿参数的深度学习模型。大模型的原理基于深度学习,它利用大量的数据和计算资源来训练具有大量参数的神经网络模型。通过不断地调整模型参数,使得模型能够在各种任务中取得最佳表现。通常所说大模型中“大”的特点体现在:参数数量庞大、训练数据量大、计算资源需求高等。很多先进的模型由于拥有很“大”的特点,使得模型参数越来越多,泛化性能越来越好,在各种专门的领域输出的结果也越来越准确。

简要介绍一下Transform结构。

答:当前流行的大模型的网络架构其实并没有很多新的技术,还是一直沿用当前NLP领域最热门最有效的架构——Transformer结构,如图1.1所示。相比于传统的循环神经网络(RNN)和长短时记忆网络(LSTM),Transformer具有独特的注意力机制(Attention),这相当于给模型加强理解力,对更重要的词能给予更多关注。同时该机制具有更好的并行性和扩展性,能够处理更长的序列,立马成为NLP领域具有奠基性能力的模型,在各类文本相关的序列任务中取得不错的效果。

图1.1Transformer模型架构

根据这种网络架构的变形,主流的框架可以分为Encoder-Decoder、Encoder-Only和Decoder-Only,如下。

1)Encoder-Only,仅包含编码器部分,主要适用于不需要生成序列的任

文档评论(0)

1亿VIP精品文档

相关文档