实践中可选择适配注意力层的 Q、K、V、O 投影,以及前馈网络(MLP)中的线性层。原始论文以适配 Q、V 为默认推荐,多数场景下已足够有效。
对于需要更强拟合能力的任务,可扩展到全部注意力投影乃至 MLP 层,以换取更好的效果,但可训练参数也会相应增加。目标模块的选择需在效果与效率之间权衡。
不同模型架构的层命名与组织方式不同,配置目标模块时需对应到实际模型中的线性层名称,确保低秩分支正确挂载到预期位置。