在训练开始时,矩阵 A 通常采用随机高斯分布初始化,为优化提供非零的初始梯度方向,使低秩分支能够从第一步开始参与学习。
矩阵 B 一般初始化为全零。这样在训练初始时刻,ΔW = B·A 恒为零,模型行为与原始预训练模型完全一致,保证训练从一个稳定的起点平滑出发,不会因随机扰动破坏预训练权重。
结合缩放系数后,初始时低秩分支对输出的贡献为零,随着训练进行逐步学习有效更新,有助于稳定收敛过程。