全参数微调会更新模型的全部参数,而 LoRA 仅训练注入的低秩分支,原始权重保持冻结。这是二者最根本的差异。
全参数微调需要为每个任务保存完整的模型副本,存储与显存开销巨大;LoRA 只需保存极小的适配权重,资源占用大幅下降。
原始论文在 RoBERTa、DeBERTa、GPT-2、GPT-3 等模型上的实验表明,LoRA 在可训练参数更少、训练吞吐更高的前提下,模型质量与全参数微调相当甚至更优,且无额外推理延迟。