由于 ΔW = B·A 与原权重 W 具有相同的矩阵形状,训练完成后可直接将二者相加,得到新的权重 W' = W + B·A,形成一个与原模型结构完全一致的常规权重矩阵。
合并后的模型是一个普通权重矩阵,前向传播时不再需要额外的低秩分支计算,因此推理速度与原始模型完全相同,不引入任何额外延迟。
在合并之前,LoRA 权重也可作为独立的小文件保存与加载。这使得同一基础模型可搭配多个不同的 LoRA 权重,通过切换或组合实现快速的任务切换与多概念融合。