基于LoRALLaMA2二次预训练方法及应用.pdfVIP

  • 1
  • 0
  • 约4.55万字
  • 约 60页
  • 2026-04-08 发布于北京
  • 举报

基于LoRA的L2二次预训练

一、为什么需要对L2做基于LoRA的二次预训练?

加入中文训练语料进行L2的二次预训练,这样模型就可以增加支持中文输出的能力。

二、基于LoaMA2二次预训练是什么?

在保持预训练模型权重不变的情况下,通过添加额外的网络层并仅

训练这些新增的网络层参数,实现大模型的高效微调(PEFT)。

三、基于LoRA的L2二次预训练的思想?

思想:基于对模型本征维度(intrinsicdimension)的理解。“本

征维度”是指模型中真正有用的、能够影响模型输出的参数数量。

Aghajanyan研究发现,预训练模型的内在维度实际上非常小,即只

有一小部分参数对模型输出有显著影响。也就是说,存在一个极低维

度的参数,微调它和在全参数空间中微调能起到相同的效果。L

ORA假设模型在任务适配过程中权重的变化量是低秩(lowrank)

W=W0+ΔW,ΔW=BA。参数更新范围:只训练新增的网络层参数。

基于lora的l

文档评论(0)

1亿VIP精品文档

相关文档