相比全参数微调,LoRA 可显著减少可训练参数与显存占用。以 GPT-3 175B 为例,原始论文指出 LoRA 可将可训练参数减少约一万倍、GPU 显存需求减少约三倍,使大模型微调的硬件门槛大幅下降。
可训练参数减少意味着更快的训练吞吐,研究者可以在相同时间内完成更多实验迭代,降低大模型适配的时间成本。
与 Adapter 等会引入串行计算层的微调方法不同,LoRA 可与原权重合并,推理时不增加任何额外开销,部署友好。
每个任务的 LoRA 权重体积极小,可 alongside 单一基础模型存储大量适配版本,任务切换时只需替换或合并对应的小权重文件。