首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >LoRA(低秩适配) >如何选择 LoRA 的目标模块(target modules)?

如何选择 LoRA 的目标模块(target modules)?

词条归属:LoRA(低秩适配)

1. 常见目标模块

实践中可选择适配注意力层的 Q、K、V、O 投影,以及前馈网络(MLP)中的线性层。原始论文以适配 Q、V 为默认推荐,多数场景下已足够有效。

2. 按任务调整

对于需要更强拟合能力的任务,可扩展到全部注意力投影乃至 MLP 层,以换取更好的效果,但可训练参数也会相应增加。目标模块的选择需在效果与效率之间权衡。

3. 结合具体模型

不同模型架构的层命名与组织方式不同,配置目标模块时需对应到实际模型中的线性层名称,确保低秩分支正确挂载到预期位置。

相关文章
LoRA微调中目标模块的优化选择
作者:Rushil Anirudh, Anjie Fang, Bhoomit Vasani | 2026年3月19日 | 11分钟阅读
用户11764306
2026-05-06
3390
【LLM训练系列02】如何找到一个大模型Lora的target_modules
致Great
2024-11-23
6490
构建AI智能体:深入浅出LoRA:低成本高效微调大模型的原理与实践
在我们的印象中,我们曾比喻大模型为一位学识渊博、通晓古今的大学者,他读过亿万本书,知识储备深不可测。但是,如果我们先想让他成为我们公司的法律顾问,或者帮我们写中医养生文案,他可能会显得博而不专。如果直接让他去背法律条文或中医典籍,做一个全参数微调,这就像让这位大学者为了一个新专业,把他过去学过的所有知识都重新梳理、更新一遍,这个过程不仅耗时耗力,也需要巨大的算力和时间,而且成本极高,甚至可能因为学习新知识而干扰到他原有的广博学识,形成灾难性遗忘。
未闻花名
2026-01-04
4.8K2
机器学习|从0开始大模型之模型LoRA训练
继续《从0开发大模型》系列文章,上一篇用全量数据做微调,训练时间太长,参数比较大,但是有一种高效的微调方式LoRA。
用户1904552
2025-02-27
9580
掌握高效调参:深入解析LoRA如何用1%资源实现90%的微调效果
大型语言模型(LLM)的微调是提升模型性能的关键步骤,但传统全参数微调需要海量计算资源,动辄消耗数百GB显存和数天训练时间,成为AI开发者的主要瓶颈。本文将深入解析Low-Rank Adaptation(LoRA)技术,揭示其如何仅用1%的资源和时间,实现接近90%的全微调效果。通过实战案例,我将分享上周在微调GPT-3模型时应用LoRA的经历,包括踩坑教训和优化技巧。文章涵盖LoRA的核心原理、发展历程、应用场景,并提供保姆级代码教程和性能对比数据。读者将获得可落地的调参方法、高效资源管理策略,并思考AI微调的未来趋势。无论你是数据科学家还是AI工程师,本文都将助你突破资源限制,提升模型迭代效率。
摘星.
2026-02-15
5820
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券