LoRA 建立在"模型微调时的权重更新具有低内在秩"这一假设之上。研究发现,预训练大模型的权重更新矩阵虽然维度很高,但其携带的有效信息可以用一个远小于原始维度的低秩子空间来近似表达,因此无需更新全部参数即可完成适配。
在微调过程中,预训练模型的所有原始权重被完全冻结,不参与梯度更新。这样做保留了模型在大规模数据上学到的通用知识,避免因小数据集全量更新而导致的灾难性遗忘,也免去了为每个下游任务保存一份完整模型副本的开销。
对于原始权重矩阵 W,LoRA 不直接学习更新量 ΔW,而是将其分解为两个小矩阵的乘积,即 ΔW = B·A,其中 A 与 B 的秩 r 远小于原始维度。训练时只优化 A 和 B,可训练参数量因此下降数个数量级。