首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >LoRA(低秩适配) >QLoRA 是如何结合量化技术的?

QLoRA 是如何结合量化技术的?

词条归属:LoRA(低秩适配)

1. 量化基础模型

QLoRA 由 Dettmers 等人在 2023 年提出,它在 LoRA 的基础上,将冻结的基础模型权重量化为 4 位精度存储,使原本需要多卡的大模型可在单张 GPU 上完成微调。

2. NF4 数据类型

QLoRA 引入了 4 位 NormalFloat(NF4)数据类型,这是一种针对正态分布权重信息论最优的编码方式,相比常规整型量化在存储效率上更优。

3. 配套内存优化

QLoRA 还采用双重量化(对量化常数再次量化)与分页优化器(利用统一内存在显存紧张时卸载优化器状态)等技术,进一步压低显存占用。原始论文表明,QLoRA 可在单张 48GB GPU 上微调 65B 参数模型,且性能接近 16 位全量微调。

相关文章
LLM 大模型学习必知必会系列(六):量化技术解析、QLoRA技术、量化库介绍使用(AutoGPTQ、AutoAWQ)
模型的推理过程是一个复杂函数的计算过程,这个计算一般以矩阵乘法为主,也就是涉及到了并行计算。一般来说,单核CPU可以进行的计算种类更多,速度更快,但一般都是单条计算;而显卡能进行的都是基础的并行计算,做矩阵乘法再好不过。如果把所有的矩阵都加载到显卡上,就会导致显卡显存的占用大量增加,尤其是LLM模型大小从7b、14b、34b到几百b不等,占用显存的大小就是惊人的数字,如何在减少运算量和显存占用的条件下,做到推理效果不下降太多呢?在这里需要引入浮点数和定点数的概念。
汀丶人工智能
2024-05-26
5.7K0
LLM微调技术:从LoRA到QLoRA的演进
作者:HOS(安全风信子) 日期:2025-12-30 来源:GitHub 摘要: 本文深入探讨了2025年大语言模型(LLM)微调技术的最新进展,从经典的全参数微调到高效的参数高效微调技术,重点分析了LoRA及其衍生技术的演进历程。通过分析GitHub上最新的开源项目和研究成果,本文系统梳理了各种微调技术的原理、实现和应用,并提供了完整的实践指南和性能评估
安全风信子
2026-01-01
1.9K0
掌握量化技术是视频压缩的关键
视频编码利用信号的信息冗余来降低数据率。无损编码依赖于:差分预测编码、变换、熵编码。有损编码通过添加量化过程来进一步提高压缩效率。
用户1324186
2022-02-18
3.5K0
《重新定义高效微调:QLoRA 4位量化的颠覆式创新解析》
在深入了解QLoRA之前,我们先回顾一下传统大模型微调面临的严峻挑战。传统的大模型微调,随着模型规模的不断扩大,参数量呈指数级增长,这使得模型在内存需求和计算资源上的消耗变得极为庞大。以常见的大型语言模型为例,其参数存储和处理需要大量的内存空间,普通的计算设备根本无法满足这样的高要求。在微调过程中,频繁出现的内存不足错误,导致训练进程被迫中断;而漫长的计算时间,不仅耗费大量的人力、物力,还使得研究和开发的周期大幅延长。这些问题严重制约了大模型的进一步优化和应用,也成为了人工智能领域发展的一大障碍。
程序员阿伟
2025-05-31
5870
Python量化交易:结合爬虫与TA-Lib技术指标分析
引言量化交易(Quantitative Trading)是利用数学模型和计算机程序进行金融投资决策的方法。Python凭借其丰富的数据分析和机器学习库,已成为量化交易的主流工具之一。本文将介绍如何结合网络爬虫获取股票数据,并使用TA-Lib(Technical Analysis Library)计算技术指标,构建一个简易的量化交易分析系统。核心内容:使用爬虫获取股票数据(yfinance + requests)TA-Lib技术指标计算(MACD、RSI、布林带等)策略回测与可视化(Backtrader + Matplotlib)1. 数据获取:爬取股票数据1.1 使用yfinance获取历史数据yfinance是Yahoo Finance的Python接口,可方便获取股票历史数据。
小白学大数据
2025-08-19
1.6K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券