首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >LoRA(低秩适配) >LoRA 如何应用到预训练模型的注意力层?

LoRA 如何应用到预训练模型的注意力层?

词条归属:LoRA(低秩适配)

1. 作用于注意力投影

Transformer 的自注意力机制包含查询(Q)、键(K)、值(V)和输出(O)等投影矩阵。LoRA 在这些投影层旁并联低秩分支,对注意力的计算过程进行轻量级适配。

2. 原始论文的典型配置

原始 LoRA 论文中,在 GPT 等模型上效果最佳的配置是仅适配 Q 和 V 投影矩阵。这一设置以极少的参数获得了与全参数微调相当的效果,是实践中最常用的起点配置。

3. 不改变模型结构

LoRA 分支并联在原有权重之外,不修改原始 Transformer 结构,也不引入额外的串行计算层,因此推理时可与原权重合并,不增加前向传播延迟。

相关文章
【预训练模型】预训练语言模型的前世今生之风起云涌
欢迎大家来到我们预训练语言模型的专题系列分享,本篇推送是该专题的第二篇!预训练语言模型已经成为了NLP研究中一个非常火热的话题,优秀的模型包括BERT,GPT2等都在学术研究、工业领域、算法比赛中大放光彩。
zenRRan
2020-03-05
2K0
LoRA: 大模型快速训练的秘诀
LoRA的提出在上述PEFT方法之后,来自微软的研究者认为,现有的Adapter Tuning和Prefix Tuning这两种方法均有缺点:
Steve Wang
2023-10-12
1.4K0
2021年如何科学的“微调”预训练模型?
笔者刚刚入门NLP的时候,其实还和朋友们调侃过“attention is all you need"这么绝对的标题也敢发出来?当然似乎后来还有一个paper是“cnn is all you need”?但2021年,我再看深度学习领域,无论是自然语言处理、音频信号处理、图像处理、推荐系统,似乎都看到attention混得风生水起,只不过更多时候看到的是它的另一个代号:Transformer。
AI部落联盟
2021-04-23
2.3K0
ICLR2022 | 基于对抗自注意力机制的预训练语言模型
每天给你送来NLP技术干货! ---- ©作者 | 曾伟豪 单位 | 北京邮电大学 研究方向 | 对话摘要生成 排版 | PaperWeekly 论文名称: Adversarial Self-Attention For Language Understanding 论文来源: ICLR 2022 论文链接: https://arxiv.org/pdf/2206.12608.pdf Introduction 本文提出了 Adversarial Self-Attention 机制(ASA),利用对抗训练重
zenRRan
2022-07-12
8480
聊聊预训练模型的微调
翻译自:Fine-tuning a model with the Trainer API
Ryan_OVO
2023-10-19
1.8K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券