Transformer 的自注意力机制包含查询(Q)、键(K)、值(V)和输出(O)等投影矩阵。LoRA 在这些投影层旁并联低秩分支,对注意力的计算过程进行轻量级适配。
原始 LoRA 论文中,在 GPT 等模型上效果最佳的配置是仅适配 Q 和 V 投影矩阵。这一设置以极少的参数获得了与全参数微调相当的效果,是实践中最常用的起点配置。
LoRA 分支并联在原有权重之外,不修改原始 Transformer 结构,也不引入额外的串行计算层,因此推理时可与原权重合并,不增加前向传播延迟。