LoRA 在常规精度(如 FP16/BF16)下训练低秩分支,基础模型仍以完整精度加载;QLoRA 则进一步将冻结的基础模型量化到 4 位,在此基础上训练 LoRA 分支。
QLoRA 通过 4 位量化显著降低了基础模型的显存占用,使大模型微调的硬件门槛进一步下降,可在消费级 GPU 上完成原本难以承载的大模型适配。
当显存充足、追求训练速度时,标准 LoRA 更为直接;当显存受限、需要在有限硬件上微调大模型时,QLoRA 是更可行的选择,其质量损失通常较小。