Appearance
参数高效微调(PEFT)与 LoRA:给大模型"轻装换装"
更新: 7/13/2026 字数: 0 字 时长: 0 分钟
想让一个大模型学会某项专门本领——比如变成你公司的专属客服——传统做法既贵又慢。而 PEFT 和它最出名的成员 LoRA,就是让这件事变得又快又省的"轻量化改造术"。下面我们从传统做法的痛点讲起,一步步说清楚。
一、先看痛点:传统"全量微调"为什么让人头疼?
我们先认识一个概念:
全量微调(Full Fine-tuning)的大白话: 把一个已经训练好的大模型,从头到尾所有的参数都重新调整一遍,来教它新本领。
参数是什么? 你可以把它理解成模型内部的"旋钮"——一个大模型内部有几十亿甚至上千亿个这样的旋钮,正是它们的具体数值,决定了模型的能力。
全量微调,就相当于把这几十上百亿个旋钮全部重新拧一遍。这带来三个实实在在的麻烦:
痛点一:太烧钱、太吃硬件。 同时调整这么多参数,需要极其昂贵的显卡和海量算力,普通团队甚至个人根本玩不起。
痛点二:太慢、太占空间。 训练过程漫长,而且每训练出一个新本领,就得完整保存一份几十上百 GB 的大模型。你想让它学 5 项本领,就得存 5 个巨无霸,硬盘和成本都吃不消。
痛点三:容易"学了新的忘了旧的"。 把所有旋钮都大改,模型原本掌握的通用能力可能被破坏——业内叫灾难性遗忘,就像为了学新技能把老本行都忘了。

打个比方:全量微调就像为了换个装修风格,把整栋房子大拆大建、水电全部重做——工程浩大、花钱如流水。可我们真正想要的,往往只是"换个风格"而已,何必动这么大干戈?
二、PEFT 登场:只动一小部分,就能办成事
针对上面的痛点,一类聪明的方法应运而生:
PEFT(Parameter-Efficient Fine-Tuning,参数高效微调)的大白话: 微调时,把原来大模型的绝大部分参数"冻结"住不动,只训练极少一部分新增的参数,就能让模型学会新本领。
这里的关键动作是**"冻结"——就是把大部分旋钮锁死、不许动**,只留一小撮可以调。
PEFT 解决的核心问题,正是全量微调的三大痛点:
- 要调的参数从"几十上百亿"降到"很小一撮",算力和显卡门槛大幅降低,普通显卡也能训;
- 训练出的新本领只是一个几 MB 到几百 MB 的小文件,不用再存整个巨无霸模型;
- 原模型被冻结、原封不动,几乎不会"学了新的忘了旧的"。
回到装修的比方:PEFT 就是不动房子主体结构,只换几件家具、贴张壁纸,就把风格换了——省钱、省时、还不伤根基。
注意: PEFT 是一大类方法的统称,里面有好几种具体做法。而其中最有名、用得最广的,就是接下来要重点讲的 LoRA。
三、重点拆解 LoRA:给大模型"插个小插件"

LoRA 的原理:不改原件,只加"外挂小补丁"
LoRA(Low-Rank Adaptation,低秩适配) 的名字有点吓人,但思路特别巧妙,我们用大白话拆开:
第一步:把原模型整个冻结。 那几十上百亿个旋钮,一个都不动。
第二步:在旁边挂一个小小的"补丁"。 LoRA 不去改原来的旋钮,而是在模型旁边额外加装一个非常小的附加模块,训练时只调这个小模块。
第三步:用的时候,把"原模型 + 小补丁"的效果叠加起来,模型就表现出了新本领。
为什么这个补丁能这么小?(低秩的通俗解释) 研究发现,让模型学会一项新本领所需要的"改动量",其实没那么复杂,可以用两个很"瘦小"的模块相乘来近似表达。于是 LoRA 不用一个庞大的补丁,而是用两个小巧的模块来代替,参数量一下子就降到原来的很小一部分(常常不到 1%)。你不必纠结数学细节,只需记住:它找到了一种用极少参数就能表达"新本领改动"的取巧办法。
一句话原理:原模型锁死不动,只训练一个轻巧的外挂补丁。
LoRA 的优势
- 训练成本极低: 只训练那一小撮参数,普通显卡就能跑,训练也快。
- 产出文件超小: 一个 LoRA 补丁通常只有几 MB 到几百 MB,方便存储和分享。
- 可以"即插即换": 这是 LoRA 最迷人的特点。原模型是共用的"主机",不同本领就是不同的"插件"——想让模型写作,插上写作补丁;想让它翻译,换上翻译补丁。一台"主机"配多个"插件",随时切换,无需重存多个大模型。
- 几乎不损伤原能力: 原模型被冻结,通用能力得以保留,不易灾难性遗忘。
LoRA 的常见应用
- 打造专属风格/角色: 让模型模仿特定的写作口吻、扮演某个人设。
- 垂直领域定制: 用行业资料训一个 LoRA 补丁,让通用模型秒变法律、医疗、客服等领域助手。
- AI 绘画风格化: 在图像生成领域,LoRA 被大量用来让模型学会特定画风或特定人物形象——这也是很多人最早接触 LoRA 的场景。
- 多任务灵活切换: 一个基础模型 + 一堆小补丁,低成本支撑多种业务。
四、三者关系与差异对比
先理清从属关系:
- 全量微调和 PEFT 是两条并列的技术路线(大改 vs 小改);
- LoRA 是 PEFT 这一大类下最主流的一种具体方法(PEFT 是"类别",LoRA 是其中的"明星成员")。
再看直观对比:
| 对比项 | 全量微调 | PEFT / LoRA |
|---|---|---|
| 调整范围 | 全部参数(几十上百亿全拧一遍) | 冻结绝大部分,只训练极少参数 |
| 硬件成本 | 极高,需顶级显卡 | 低,普通显卡可跑 |
| 训练速度 | 慢 | 快 |
| 产出大小 | 每个本领存一整个大模型(几十上百 GB) | 每个本领一个小补丁(几 MB~几百 MB) |
| 多任务 | 每个任务存一份大模型,成本高 | 一个主模型 + 多个小补丁,即插即换 |
| 遗忘风险 | 较高,易破坏原能力 | 低,原模型冻结保留 |
| 效果 | 上限最高,最彻底 | 绝大多数场景已足够好,接近全量微调 |
如果说全量微调是"为了换风格把整栋房子推倒重装",那么 PEFT 就是"只换家具软装"的省钱思路,而 LoRA 则是这套思路里最好用的那件工具——给冻结不动的大模型插上一个轻巧的小补丁,就能低成本、快速地让它学会新本领,还能随时即插即换。