- 2
- 0
- 约4.6千字
- 约 6页
- 2026-08-25 发布于河北
- 举报
?QLoRA?的深度原理拆解与实操笔记
第一部分:核心原理(为什么24G显存能跑70B模型)
QLoRA(QuantizedLow-RankAdaptation)的核心贡献在于在保持LoRA效果的同时,通过极致量化将基座模型的显存占用压到极限。它主要有三大技术创新:
1.4-bitNormalFloat(NF4)量化
原理:不同于传统的INT4或FP4,NF4是针对正态分布(高斯分布)权重专门设计的信息论最优数据类型。预训练模型的权重通常服从正态分布,NF4能保证在4-bit精度下,每个bin(区间)拥有相等的期望值,从而将量化误差降到最低。
效果:相比FP16,直接将模型权重体积缩小约?75%。
2.双重量化(DoubleQuantization)
痛点:量化过程中会产生额外的量化常数(如缩放因子absmax)。如果这些常数用FP32存储,当模型很大时(如70B),这部分显存占用也不可忽视(约几GB)。
原理:QLoRA对这些量化常数再进行一次量化(即二次量化)。
效果:在几乎不增加额外推理开销的情况下,额外节省约?0.37%?的显存(虽小但在显存紧张时是关键)。
3.分页优化器(PagedOptimizers)
原理:利用NVIDIA统一内存的分页功能,当GPU显存不足时,自动将优化器状态(如Adam
原创力文档

文档评论(0)