Appearance
大模型的"入职培训":微调与对齐,以及 SFT、RLHF、DPO 到底是什么
更新: 7/13/2026 字数: 0 字 时长: 0 分钟
一个刚训练完的大模型,就像一个知识渊博却"不太会说话"的应届毕业生——脑子里装满了东西,但你问它问题,它可能答非所问、口无遮拦、甚至一本正经地胡说。要把它调教成一个靠谱、贴心、懂规矩的"好员工",就得靠微调和对齐。下面我们用大白话把这套"入职培训"讲清楚。
一、先搞懂:微调和对齐是什么关系?

我们先认识两个概念,用"招人"来打比方:
大模型一开始经历的是预训练——相当于让它读遍海量书籍资料,成为一个知识渊博的大学生。但这个大学生有个问题:知识多归多,却不懂怎么好好回答问题、不懂人情世故、也不知道什么话该说什么话不该说。
于是就需要两件事:
微调(Fine-tuning): 大白话就是"岗前专项培训"。在已经博学的模型基础上,用一批更有针对性的资料再教它一轮,让它学会某种具体本领或说话方式。就像大学生入职后,公司再给他做专门培训。
对齐(Alignment): 大白话就是"让它的言行符合人类期望"。具体说,就是让模型的回答变得有用、诚实、无害——听得懂人话、不瞎编、不说危险或冒犯的内容。就像培训新人时,不光教业务,还要教他懂礼貌、守规矩、站在客户角度想问题。
两者的关系: 对齐是目标(我们想要一个听话又靠谱的模型),微调是达成这个目标的主要手段(通过再培训来实现)。接下来要讲的 SFT、RLHF、DPO,就是三种具体的"培训方法"。
二、三类主流培训技术,逐个讲清

1. SFT:照着"标准答案"手把手教
全称: 监督微调(Supervised Fine-Tuning)。别被名字唬住,"监督"在这里就是"有标准答案带着学"的意思。
核心作用: 教会模型"面对某类问题,应该怎么回答"。
基本逻辑: 人类事先准备一大批高质量的"问题—标准答案"范例,比如「问:帮我写封请假邮件 → 答:(一封写得体面得当的邮件)」。然后让模型一条条照着学,模仿这些优秀范本的回答方式。
生活类比: 就像师傅带徒弟,拿着一本写满标准答案的范本,手把手地说"这种问题,你就该这么答"。徒弟照着模仿,慢慢就学会了得体的应对方式。
典型特点:
- 简单直接、见效快,是几乎所有大模型对齐的第一步;
- 但它有个天花板——模型只会模仿给定的答案,学不到"什么是更好的答案"。因为范本只告诉它"这样是对的",却没告诉它"这个答案比那个答案好在哪"。这就引出了下面的技术。
2. RLHF:让人类当"评委",边打分边改进
全称: 基于人类反馈的强化学习(Reinforcement Learning from Human Feedback)。
核心作用: 让模型学会人类的偏好——不只是"答对",而是答得"更让人满意"。
基本逻辑: 分两步——
先训练一个"评委": 让模型对同一个问题生成好几个不同回答,人类来给这些回答排序(哪个最好、哪个最差)。用这些人类的打分,训练出一个专门的打分模型(评委),它学会了模仿人类的口味。
让模型在评委指导下反复练习: 之后模型每写一个回答,"评委"就打个分,分高就鼓励、分低就纠正。模型为了拿高分,不断调整自己,越答越合人类心意。
强化学习的大白话: 一种"试错 + 奖惩"的学习方式——做得好就给奖励,做得差就受惩罚,靠着不断追求奖励来学好。就像训练宠物,做对了给零食。
生活类比: 学生每次回答后,老师都给打个分、给个反馈;学生为了得高分,不断琢磨老师喜欢什么样的答案,越改越好。
典型特点:
- 效果好、上限高,能让模型的回答质量和"分寸感"大幅提升,是 ChatGPT 等产品成功的关键;
- 但流程复杂、成本高:要请大量人来打分,还要额外训练一个评委模型,训练过程也不太稳定,容易出岔子。
3. DPO:跳过评委,直接学"好坏对比"
全称: 直接偏好优化(Direct Preference Optimization)。
核心作用: 和 RLHF 目标一样——让模型学会人类偏好——但用更简单的方式实现。
基本逻辑: DPO 的聪明之处在于省掉了"训练评委"这一步。它直接拿来成对的数据:「同一个问题,这个回答好、那个回答差」,然后直接告诉模型:"多向好的靠拢,远离差的。"一步到位,不用中间的打分模型,也不用复杂的强化学习流程。
生活类比: 不请评委了,直接把两份答案摆在学生面前:"这份好,那份差,你自己体会差在哪,照着好的学。"简单粗暴又有效。
典型特点:
- 简单、稳定、省成本,是近年非常流行的新方法,效果能媲美 RLHF,却省去了大量麻烦;
- 依然高度依赖高质量的"好坏对比"数据——如果人类标注的好坏本身不靠谱,模型也学不好。
三、极简差异对比表
| 技术 | 大白话 | 怎么学 | 特点 | 需要什么数据 |
|---|---|---|---|---|
| SFT | 照标准答案模仿 | 看"问题—标准答案"范本直接学 | 简单快、是第一步;但学不到"更好" | 大量"问题+优质答案"范例 |
| RLHF | 评委打分反复改进 | 先训人类偏好"评委",再让模型追求高分 | 效果好、上限高;但复杂、贵、不稳定 | 人类对多个回答的排序打分 |
| DPO | 直接学好坏对比 | 跳过评委,直接向"好答案"靠拢 | 简单稳定省成本,效果接近 RLHF | 成对的"好答案 vs 差答案" |
一般的实际流程是: 先用 SFT 打好基础(学会好好说话),再用 RLHF 或 DPO 精修(学会说得让人满意)。如今 DPO 因为简单高效,正越来越多地替代传统的 RLHF。
如果把大模型比作一个博学却青涩的应届生,那么微调与对齐就是它的"入职培训"——SFT 是照着范本手把手教,RLHF 是请评委打分逐步打磨,DPO 则是直接给它看好坏对比让它自己领悟,三种方法殊途同归,都是为了把它培养成一个有用、诚实又靠谱的"好员工"。