QLoRA 由 Dettmers 等人在 2023 年提出,它在 LoRA 的基础上,将冻结的基础模型权重量化为 4 位精度存储,使原本需要多卡的大模型可在单张 GPU 上完成微调。
QLoRA 引入了 4 位 NormalFloat(NF4)数据类型,这是一种针对正态分布权重信息论最优的编码方式,相比常规整型量化在存储效率上更优。
QLoRA 还采用双重量化(对量化常数再次量化)与分页优化器(利用统一内存在显存紧张时卸载优化器状态)等技术,进一步压低显存占用。原始论文表明,QLoRA 可在单张 48GB GPU 上微调 65B 参数模型,且性能接近 16 位全量微调。