由于可训练参数远少于全参数微调,LoRA 通常可以采用比全参数微调更高的学习率,以便在较少的参数空间中快速收敛。
学习率需与秩 r、缩放因子 alpha 协同考虑。调整秩或缩放比例时,往往需要同步调整学习率,以维持训练稳定性。
实践中常配合学习率调度器(如常数调度、带预热的调度等)与优化器(如 AdamW)使用,通过预热与衰减策略提升收敛的稳定性与最终效果。