人工智能通识读本
第一篇:什么是AI

模型后训练与微调🧗 硬核

上一章我们了解了 AI 的基本学习原理,知道大模型要经过"预训练→微调→对齐"三步才能炼成。但那只是一个粗略的框架。实际上,从预训练结束到模型上线,中间还有一整套精密的"后训练"工艺——它决定了模型是"只会续写文本的机器"还是"能对话、会推理、守规矩的助手"。这一章,我们走进大模型训练的"精装修"车间,看看后训练和微调到底做了什么。

🗂️ 读前小抄:本章会遇到的英文缩写
这一章是全书英文缩写最密集的地方。不用背——读到哪个词卡住了,翻回这张表看一眼就行。抓住主干"SFT → RLHF/DPO → GRPO",其余都是枝叶。
  • RL强化学习 训小狗:做对了给零食,做错了不给
  • SFT监督微调 给模型做示范题,让它照着学
  • RLHF人类反馈强化学习 请人类当评委打分,模型越写越讨人喜欢
  • PPO近端策略优化 RLHF 用的那套算法,要同时养四个模型,费显存
  • DPO直接偏好优化 不另请评委,直接告诉模型"这个回答比那个好"
  • PEFT参数高效微调 装修不动承重墙,只换软装
  • LoRA低秩适配 不重做整张卷子,只在空白处贴便利贴改答案
  • QLoRA量化低秩适配 先把卷子印小一号再贴便利贴,一张显卡就够
  • GRPO组相对策略优化 不请裁判,让模型自己跟自己的好几个答案比,谁好留谁
  • RLVR可验证奖励强化学习 答案对不对机器一验便知,不用人来评
  • RLAIFAI 反馈强化学习 让 AI 当评委给 AI 打分,省人工
  • 价值模型Value Model 估"这一步以后能得多少分"的参谋,GRPO 把它裁掉了
😌
先给你吃颗定心丸

本章出现的缩写多,但它们讲的其实是同一件事的不同做法:怎么把一个"读了很多书却不会说人话"的模型,调教成"能好好跟你对话"的助手。你只要记住这条主线,哪怕一个缩写都没记住,也不影响读后面任何一章

一、为什么需要后训练?——从"毛坯房"到"精装修"

上一章讲过,预训练阶段模型"读"完了互联网上海量文本,学会了语言的规律和海量知识。但预训练出来的模型(叫基座模型,Base Model)有一个大问题:它只会"续写",不会"对话"

你问它"中国的首都是哪里?",它可能不回答,而是接着写"日本的首都是哪里?美国的首都是哪里?……"——因为在预训练数据里,这种问答列表的格式很常见,它只是在"续写"它认为最可能出现的下一个词。它像一个读了一座图书馆、满腹经纶,却完全不懂社交礼仪的人——什么场合该说什么话,一概不知。

基座模型(预训练后)

  • 只会"续写"文本,不会"回答"问题
  • 有知识,但不知道何时用、怎么用
  • 没有安全意识,可能输出有害内容
  • 不会遵循指令,不懂对话格式
  • 类比:毛坯房——结构在,但没法住人

对话模型(后训练后)

  • 能理解指令,按用户要求回答
  • 知道什么该说、什么不该说
  • 具备安全意识,拒绝有害请求
  • 遵循对话格式,有问有答
  • 类比:精装修——能直接拎包入住

把基座模型变成可用的对话模型,这一整套加工过程就叫后训练(Post-Training)。它包括监督微调、偏好对齐、安全训练等多个环节,是大模型从"毛坯"变"精装"的关键阶段。

基座模型 预训练完成 只会续写 不懂对话 监督微调 SFT 学会听指令 学会对话 偏好对齐 RLHF/DPO 学会判断 好坏 安全训练 红队测试 安全护栏 合规对齐 毛坯 简装 精装 交付
图:后训练的四步流水线——从基座模型到可交付的对话模型
💡
一句话理解后训练

预训练给模型"知识",后训练给模型"技能"和"品格"。没有后训练,模型只是一座"知识的废墟";有了后训练,它才变成一个"有教养的助手"。

二、监督微调(SFT):学会"听人话"

后训练的第一步,几乎总是监督微调(Supervised Fine-Tuning,简称 SFT)——简单说就是给模型做示范题,让它照着学。它的目标很明确:教模型按指令行事——你问,它就答;你让它写诗,它就写诗;你让它翻译,它就翻译。

怎么做

研究者准备一大批"指令—回答"的范例数据(通常几万到几十万条),每一条长这样:

用户:请用一句话解释什么是黑洞。
助手:黑洞是引力极强的天体,连光都无法逃逸。

把这些范例"喂"给基座模型,让它学习:遇到这种问法,应该这样回答,而不是自顾自地续写。训练方式和预训练一样——还是"猜下一个词"并调权重,只不过这次喂的不是海量网页文本,而是精心准备的对话范例。

数据质量 > 数据数量

2025-2026年的研究揭示了一个反直觉的结论:200条人工精选的高质量样本,微调效果优于2000条噪声数据。这就像教一个聪明学生——几道精选好题比刷一千道烂题管用得多。数据质量成为 SFT 的第一优先级。

📌
SFT 的关键实践

只算回答部分的损失:训练时,用户指令部分不参与误差计算,只有"助手回答"部分才调整权重。否则模型会学着"模仿用户提问",而不是"生成回答"。

按奖励模型评分选模型:SFT 训练多个轮次后,验证集上的损失很早就开始上升(过拟合),但模型的实际对话质量仍在提升。因此不再用"验证损失"来选模型,而是用奖励模型打分——损失说"别练了",奖励说"继续练",后者更准。

SFT 的局限

SFT 教会了模型"怎么回答",但没法教它"什么是好的回答"。比如同一个问题"怎么写一首诗",模型可能写出十种不同的回答,SFT 只能告诉它"这样写",没法告诉它"这种写法比那种更好"。要教模型区分好坏、追求更优,就需要下一阶段——偏好对齐。

三、基于人类反馈的强化学习(RLHF)

RLHF(Reinforcement Learning from Human Feedback)是 OpenAI 在 InstructGPT(2022年)中确立的经典方法,ChatGPT 能一炮而红,RLHF 功不可没。它的核心思想是:请人类当评委打分,模型越写越讨人喜欢——用人类的"偏好"来训练模型,让模型学会生成人类更喜欢的回答。

三步流程

1️⃣
训练奖励模型
让模型对同一问题生成多个回答,人类标注员给这些回答排名(A比B好,B比C好)。用这些排名数据训练一个"奖励模型"——它学会给任何回答打分,好回答高分,差回答低分。
2️⃣
强化学习优化
用奖励模型的分数作为"奖励信号",通过强化学习算法(通常是PPO)来优化模型。模型不断生成回答,奖励模型打分,模型根据分数调整策略——就像训练小狗,做对了给零食,做错了不给。
3️⃣
迭代精炼
将强化学习后的模型再次生成回答,再次收集人类反馈,再次训练奖励模型和优化策略。多轮迭代后,模型的回答质量稳步提升,越来越符合人类偏好。
SFT模型 生成多个回答 人类标注 给回答排名 奖励模型 学会打分 PPO 强化学习优化 模型生成回答 → 奖励模型打分 → 调整策略 对齐后的模型 更符合人类偏好 迭代循环
图:RLHF 的三步流程——从人类标注到奖励模型到强化学习优化

RLHF 的优势与挑战

方面 说明
优势 能教模型"区分好坏",而不只是"模仿范例";生成的回答更自然、更有用
挑战一 工程极其复杂:需同时维护4个模型(策略模型、参考模型、奖励模型、价值模型),显存占用巨大
挑战二 PPO 训练不稳定:超参数极度敏感,容易出现训练崩溃或奖励黑客
挑战三 人类标注成本高:需要大量专业标注员,且标注质量参差不齐
⚠️
"奖励黑客"是什么

模型可能学会钻奖励模型的空子——它发现某些特殊格式或措辞能骗到高分,于是疯狂堆砌这些"高分技巧",实际回答质量反而下降。就像一个学生发现了阅卷老师的评分规律,专门写"看起来像满分"的答案,实际内容空洞。这是 RLHF 最棘手的问题之一。

四、直接偏好优化(DPO):让对齐更简单

RLHF 虽然效果好,但工程复杂度太高。2023年,斯坦福大学的研究者提出了DPO(Direct Preference Optimization,直接偏好优化)一句话:不用另请评委,直接告诉模型"这个回答比那个好",用数学推导把 RLHF 的强化学习目标转化为等价的监督学习问题——不需要训练奖励模型,不需要 PPO,直接用偏好数据训练模型。这一突破极大地降低了对齐的门槛。

🎈 打个比方

RLHF 像请一位美食评委常驻厨房:厨师每炒一盘菜,评委尝一口打个分,厨师照着分数改。评委要请、要养、还可能吃腻了打分飘忽。

DPO 则是直接把两盘菜端到厨师面前:"这盘比那盘好吃,你自己体会。"省掉了评委这个环节,厨师照样能进步——而且再也不用担心评委的口味跑偏。

DPO 的核心思想

DPO 的妙处在于一个数学发现:RLHF 想要优化的目标,其实可以等价转化为一个分类问题。给定一对回答(一个好的、一个差的),DPO 直接让模型增大"好回答"的概率、降低"差回答"的概率——就像做选择题,告诉模型"选这个、不选那个"。

RLHF(传统)

  • 需要训练奖励模型
  • 需要 PPO 强化学习
  • 同时维护 4 个模型
  • 训练不稳定,超参敏感
  • 工程复杂度高

DPO(简化)

  • 不需要奖励模型
  • 转化为监督学习
  • 只需 2 个模型(当前+参考)
  • 训练稳定可控
  • 工程复杂度大幅降低

DPO 家族:百花齐放

DPO 的成功催生了一系列变体,每种都在特定方面做出改进:

方法 核心创新 适用场景
DPO 将偏好对齐转化为二元分类 通用对齐,当前主流
ORPO SFT 和偏好学习合并为单阶段,无需参考模型 流程极简,省 20% 显存
KTO 只需"好/坏"标注,无需成对比较 标注成本低
SimPO 无参考模型,用模型自身概率构建隐式奖励 完全单模型训练
IPO 用平方损失替代对数损失,更鲁棒 对抗噪声标注

截至2026年,DPO 及其变体已成为开源社区最主流的对齐方法。HuggingFace 的 TRL 库、魔搭社区的 ms-swift 框架都原生集成了这些算法,开发者只需几行配置即可使用。

💡
RLHF 还是 DPO?

并非二选一。2026年的实践趋向组合使用:先用 DPO 完成基础偏好对齐(稳定、高效),再用 RLHF/PPO 做精细调优(上限更高)。闭源大厂(OpenAI、Anthropic)倾向 RLHF 追求极致效果;开源社区倾向 DPO 追求性价比。两者各有千秋,选哪种取决于你的算力、数据和目标。

五、参数高效微调(PEFT):四两拨千斤

前面讲的后训练方法,都需要更新模型全部参数(全量微调)。但大模型参数动辄几百亿、几千亿,全量微调需要海量显存——微调一个 70B 模型可能需要超过 1TB 显存,相当于十几张顶级显卡。这对绝大多数团队来说根本玩不起。

参数高效微调(Parameter-Efficient Fine-Tuning,简称 PEFT)的核心思路是:冻住模型绝大部分参数不动,只训练极少量新增参数,就能达到接近甚至匹敌全量微调的效果。这就像装修房子时不动承重墙和管线,只换软装——省时省力,效果还好。

LoRA:最流行的微调方法

LoRA(Low-Rank Adaptation,低秩适配)一句话:不重做整张卷子,只在空白处贴便利贴改答案是 2022 年提出的方法,到 2026 年已成为大模型微调的默认标准方案。它的原理非常优雅:

🎈 打个比方

想象一本几千页的百科全书,你要把它改成"儿童版"。全量微调的做法是把整本书重新排版重印——费纸费钱费时间。

LoRA 的做法是:原书一个字不动,只在需要改的地方贴上便利贴,写上新说法。读的时候,原文加便利贴一起看,效果跟重印一本差不多,可你只花了几十张便利贴的成本。

更妙的是:便利贴可以整套撕下来换一套——贴"法律版"便利贴它就是法律助手,换"心理版"便利贴它就是心理咨询师,而那本厚厚的原书始终只有一本。

模型微调时,权重的变化量其实是一个"低秩"矩阵——也就是说,虽然矩阵很大,但有效信息集中在一个低维空间里。既然如此,没必要更新整个大矩阵,只需用两个小矩阵的乘积来近似这个变化量:

原始权重:W₀(巨大,冻住不动)
变化量:  ΔW ≈ B × A(两个小矩阵,只训练它们)
最终权重:W = W₀ + B × A

其中 B 是 d×r 的矩阵,A 是 r×k 的矩阵,r 远小于 d 和 k

看不懂这几行公式完全没关系。你只需记住那张便利贴:原书不动,改动写在小纸片上——这就是 LoRA 的全部秘密。

举个例子:一个 7B 模型,全量微调要更新 70 亿个参数;用 LoRA(秩 r=8),只需训练约 400 万个参数——仅占 0.06%,显存从 84GB 降到 16GB,一张消费级显卡就能跑。

W₀(冻结) d × k 如 4096×4096 🔒 不训练 + B d × r 训练 × A r × k 训练 = ΔW = B×A d × k 极少量参数 ≈16M+ ≈400万 r 很小(如 8),B 和 A 参数仅占 0.06%,冻住 W₀ 只训练 B 和 A → 显存从 84GB 降到 16GB
图:LoRA 原理——W₀ + B × A = 新权重,只训练两个小矩阵 B 和 A,W₀ 冻住不动

QLoRA:一张卡微调大模型

QLoRA 在 LoRA 基础上更进一步:把冻住的基础模型从 16 位量化到 4 位(NF4 格式),只让 LoRA 的参数保持 16 位精度训练。这样 65B 模型的微调显存从 130GB 降到 33GB——单张 48GB 显卡就能微调 650 亿参数的模型

模型大小 全量微调(16位) LoRA(16位) QLoRA(4位) 推荐显卡
表中的 RTX 4070 Ti / 4090 是英伟达面向个人玩家的游戏显卡型号(就是很多同学装机时想要的那种"高端显卡");GB 指显存容量,相当于显卡自己的"内存",模型越大越吃显存。
7B-8B ~112GB ~16GB ~8GB RTX 4070 Ti 12GB
13B ~200GB ~28GB ~14GB RTX 4090 24GB
70B ~1TB+ ~140GB ~46GB A100 80GB

PEFT 家族全景

除了 LoRA 和 QLoRA,PEFT 还有多种技术路线:

🔧
DoRA(2024)
将权重分解为"幅度"和"方向"分别微调,在低秩设置下性能显著优于 LoRA(MMLU 提升 1-2 分),且内存效率不变。2026年追求极致效果时的首选。
VeRA
共享随机矩阵 + 只训练缩放向量,参数量不到 0.01%,极轻量,适合在边缘设备部署多任务模型。
🎛️
Adapter
在 Transformer 层之间插入小型可训练模块,参数量 0.1%-5%。历史悠久,效果稳定。
📝
Prompt Tuning
不改动模型任何参数,只在输入前面加一段可学习的"软提示"向量。参数最少(<0.01%),但效果相对有限。
🎯
AdaLoRA
动态分配秩(rank),把参数预算集中到关键层。效果达到全量微调的 94%-98%。
💡
IA³
只对激活值做缩放,参数量不到 0.01%。极简但有效,适合资源极度受限的场景。
💡
LoRA 热加载:一键切换"人格"

LoRA 的一个巨大优势:基座模型不变,只切换 LoRA 适配器,就能让同一个模型扮演不同角色。比如一个 7B 基座模型,加载"法律咨询"LoRA 就是法律助手,切换到"心理健康"LoRA 就是心理咨询师——切换只需几秒,无需重新加载整个模型。这让一份基座模型服务多个垂直场景成为现实。

六、推理模型的后训练:GRPO 与可验证奖励

2025年1月,DeepSeek 发布了 R1 模型,震动了整个 AI 界。R1 展示了一种全新的后训练范式:不依赖人类标注,纯靠强化学习,让模型自己"学会"推理。这背后的关键技术是 GRPO 和 RLVR。

GRPO:砍掉价值模型的强化学习

传统 PPO 需要四个模型,其中一个叫价值模型(Value Model,也叫 Critic)相当于一位参谋,专门估算"照现在这么走,最后大概能得多少分"。这个价值模型和主模型一样大,白白多占一份显存。DeepSeek 提出的 GRPO(Group Relative Policy Optimization,组相对策略优化)一句话:不请裁判,让模型自己跟自己的好几个答案比,谁好留谁做了一个巧妙的简化:

对同一个问题,让模型生成一组(比如 8 个)回答,用这组回答内部的相对排名来代替价值模型——8 个回答里排前面的就是"好",排后面的就是"差",不需要额外请一个"裁判"来打分。价值模型被砍掉了,显存直接减半。

🎈 打个比方

体育课跑 800 米。PPO 的办法是请一位教练站在旁边,掐表判断"你这个配速最后能跑进几分几秒"——教练要请、要发工资。

GRPO 的办法是:让同一个人连跑八趟,八趟里跑得最快的那几趟就是"好样本",最慢的就是"差样本"。不需要教练,自己跟自己比就行。省下的那份工资,就是省下的那一半显存。

PPO(传统)

  • 4个模型:策略 + 参考 + 奖励 + 价值
  • 价值模型估计"状态好坏"
  • 显存占用大
  • 训练流程复杂

GRPO(DeepSeek)

  • 2-3个模型:策略 + 参考(+奖励)
  • 组内相对排名代替价值模型
  • 显存减半
  • 训练流程大幅简化

RLVR:用"验证器"代替"人类偏好"

RLVR(Reinforcement Learning from Verifiable Rewards,可验证奖励强化学习)一句话:答案对不对机器一验便知,压根不用请人来评是推理模型浪潮的真正引擎。它的核心思想极为朴素:

数学题的答案对就是对、错就是错,代码能跑通就是能跑通、跑不通就是跑不通——这种可以自动验证的奖励,比人类的主观偏好更精确、更廉价、更可扩展

RLVR 不需要训练奖励模型,不需要人类标注偏好,只需要一个验证器(Verifier):

  • 数学题:对比最终答案是否匹配标准答案
  • 编程题:运行代码,看是否通过单元测试
  • 逻辑题:用规则检查推理步骤是否自洽

答对了给固定奖励(比如 +10 分),答错了给 0 分。就这么简单。模型为了拿到更多奖励,会自动探索更优的推理路径。

DeepSeek-R1 的训练流程

DeepSeek-R1 的训练是一个多阶段迭代流程,展示了 2025-2026 年最前沿的后训练实践:

阶段 做什么 关键技术
① 冷启动 SFT 用少量高质量推理数据做 SFT,给模型一个推理的"起步姿势" SFT
② 推理 RL 用可验证奖励做强化学习,模型自主探索推理策略 GRPO + RLVR
③ 拒绝采样 让 RL 后的模型生成大量推理过程,筛出高质量的作为新训练数据 拒绝采样
④ 二次 SFT 用筛选出的高质量数据(含推理和非推理任务)再做 SFT SFT
⑤ 最终 RL 结合可验证奖励和偏好奖励,做最后一轮强化学习 GRPO + 偏好奖励
📖
"顿悟时刻"——推理能力的涌现

DeepSeek-R1-Zero(纯 RL 路径,无 SFT)在训练过程中展现了一个惊人现象:模型在强化学习的某一刻,突然自发地学会了"自我反思"——它会写出"等等,让我重新想想……"这样的句子,然后纠正自己的推理错误。研究者把这种现象称为"顿悟时刻"(Aha Moment)。这不是人教的,是模型在追求更高奖励的过程中自己摸索出来的策略。这一发现证明了:纯强化学习可以让模型涌现出未被显式训练的能力。

R1 的成功引发了整个行业的跟进。2025-2026年,几乎所有大厂商都推出了自己的"推理模型"——OpenAI 的 o3、Google 的 Gemini 2.5 Thinking、Kimi K3 等——它们背后都采用了类似的 RLVR + GRPO 后训练范式。这标志着后训练从"对齐人类偏好"进入了"激发推理能力"的新阶段。

七、安全对齐与红队测试

后训练不只关乎"能力",更关乎"安全"。一个能力强大但不安全的模型,比一个能力弱但安全的模型危险得多。安全对齐是后训练中不可妥协的一环。

安全威胁全景

威胁类型 描述 危险等级
越狱攻击 通过角色扮演、编码、多语言等手段绕过安全限制,诱导模型输出有害内容 极高
Prompt 注入 在用户输入或网页内容中隐藏恶意指令,劫持模型行为(对 AI Agent 尤其危险) 极高
数据泄露 通过精心构造的提问,诱导模型泄露训练数据中的隐私信息或系统提示词
模型窃取 通过大量 API 调用"克隆"模型能力,侵犯知识产权 中-高

红队测试:以攻为守

红队测试(Red Teaming)是让一群安全研究员("红队")想方设法攻击自己的模型,在它被发布之前找到所有漏洞。这就像银行请人来"抢"自己,抢到了就补上漏洞,抢不到说明安保过硬。

2026年的红队测试已发展为一套成熟的工程体系:

  1. 自动化扫描:用工具(如 Garak、PyRIT)自动生成数万条攻击 prompt,覆盖已知攻击模式
  2. 人工深度测试:安全专家手动构造复杂攻击链,模拟真实威胁场景
  3. 红蓝对抗:红队攻击、蓝队防御,反复博弈提升模型韧性
  4. 修复与复测:发现漏洞后通过安全训练修补,然后再次测试验证

三层安全工程架构

2026年,业界已从"靠 Prompt 防御"进化到纵深防御体系

Layer 3: 形式化验证 数学证明 · TLA+ / Dafny / LLM-Verified Guardrails Layer 2: 运行时护栏 确定性拦截 · NeMo Guardrails / Guardrails AI / Rebuff Layer 1: 自动化红队测试 持续攻防 · Giskard / PyRIT / Artisan
图:三层安全工程架构——从持续攻防到运行时拦截到数学证明的纵深防御
⚠️
法规要求

欧盟《AI Act》已于2024年8月生效,通用AI模型义务自2025年8月起适用,高风险AI系统合规要求分阶段至2026年8月全面落实,高风险系统需开展红队测试等评估。中国也要求生成内容安全测试题库不少于2000题、拒答类不少于500题,覆盖 31 类风险,且每次大版本迭代需重新安全评估。安全对齐不再是"可选项",而是法律合规的强制要求

八、2026年后训练全景:模块化技术栈

经过前面的讲解,我们可以把 2026 年的后训练技术栈完整地拼出来了。现代大模型的后训练已经不是一个线性的流水线,而是一个模块化、可组合的技术栈

环节 目标 主流方法 类比
SFT 学会指令遵循和对话格式 高质量数据微调 教毛坯房"基本礼仪"
偏好对齐 学会区分好坏、追求更优 DPO / RLHF / KTO 培养"审美品味"
推理增强 激发推理和思考能力 GRPO + RLVR 训练"逻辑思维"
安全对齐 拒绝有害请求、符合价值观 安全SFT + 红队测试 建立"道德底线"
领域适配 适配特定行业或任务 LoRA / QLoRA / DoRA 按需"专业培训"

六大趋势

  1. 纯 RL 路径崛起:DeepSeek-R1 证明纯强化学习可涌现推理能力,训练成本仅 29.4 万美元(vs OpenAI o1 据称超 1 亿美元),"算法创新可替代算力堆砌"
  2. 可验证奖励替代神经 RM:规则验证器简单可靠,适用于数学/代码等确定性任务,避免了奖励黑客问题
  3. 自我改进成为主流:RLAIF 和模型自评判大幅降低标注成本,12B 模型可自我对齐达到接近 GPT-4V 的水平
  4. 迭代式 RL 替代单次训练:多轮"SFT→RL→拒绝采样→SFT→RL"循环成为标准做法
  5. 参数高效微调普及化:LoRA/QLoRA 让个人和中小企业也能微调大模型,AI 微调从"大厂专利"变成"人人可参与"
  6. 安全工程强制化:从"靠 Prompt 防御"进化到"形式化验证 + 运行时护栏 + 持续红队"的纵深防御体系
💡
关键时间线

2022.03 InstructGPT 确立 RLHF 三阶段流程
2022.12 Anthropic 提出 Constitutional AI(RLAIF 奠基)
2023.05 DPO 提出,绕过奖励模型的对齐新范式
2024.02 DeepSeek 提出 GRPO,砍掉价值模型
2024.11 Tülu 3 正式提出 RLVR 概念
2025.01 DeepSeek-R1 发布,纯 RL 涌现推理能力
2026 后训练进入模块化技术栈时代,安全工程强制化

九、本章术语速查

术语 一句话解释
后训练 预训练之后的所有训练环节,把基座模型变成可用的对话模型
Prompt 提示词,用户输入给模型的指令或问题,决定了模型回答的方向和质量
基座模型 预训练完成、未经后训练的模型,只会续写不会对话
SFT 监督微调,用指令-回答范例教模型按指令行事
RLHF 基于人类反馈的强化学习,用人类偏好训练模型追求更好的回答
奖励模型 学会给回答打分的模型,在 RLHF 中充当"裁判"
PPO RLHF 中使用的强化学习算法,需维护四个模型
DPO 直接偏好优化,把 RLHF 转化为监督学习,无需奖励模型
PEFT 参数高效微调,冻住大部分参数只训练少量新增参数
LoRA 用两个小矩阵乘积近似权重变化,参数量仅 0.06%
QLoRA 在 LoRA 基础上将基座模型量化到 4 位,单卡可微调大模型
GRPO 组相对策略优化,砍掉价值模型用组内排名代替,显存减半
RLVR 基于可验证奖励的强化学习,用规则验证器代替人类偏好
RLAIF 基于 AI 反馈的强化学习,用模型代替人类做标注
红队测试 让安全专家故意"攻击"自己的模型,上线前找出漏洞,就像银行请人来"抢"自己以检验安保
安全护栏 给模型装上"刹车系统",在运行时实时拦截有害请求和危险输出
合规对齐 让模型的行为符合法律法规和伦理要求,比如不生成违法内容、不泄露隐私
拒绝采样 让模型生成多个回答,用奖励模型筛选最好的,再做 SFT
奖励黑客 模型找到评分系统的漏洞,用取巧方式骗取高分而非真正做好任务
鲁棒性 系统抗干扰的能力,遇到异常数据或意外情况不容易崩溃
强化学习(RL) 让模型通过试错和奖励来学习的方法,就像训小狗:做对了给零食,做错了不给
价值模型 RLHF中估计"当前状态有多好"的模型,像评委给选手打分;GRPO把它砍掉了
策略 模型在每一步选择什么行动的规则,就像下棋时每步怎么走的策略
KTO DPO的变体,只需"好/坏"标注无需成对比较,标注成本更低
DoRA LoRA的升级版,将权重分解为"幅度"和"方向"分别微调,效果更好
InstructGPT OpenAI在2022年发布的模型,首次确立RLHF三阶段流程,是ChatGPT的前身
RTX 4090 / 4070 Ti 英伟达面向个人玩家的高端游戏显卡型号,也常被个人开发者拿来微调小模型
显存 显卡自带的内存,模型必须先装进显存才能训练或运行;显存不够,再好的算法也跑不起来
全量微调 把模型的每一个参数都重新训练一遍,效果好但极其费显存费钱,与 PEFT/LoRA 相对

本章小结

🎯
三句话记住本章

后训练 = 把"毛坯房"变"精装修":SFT 教基本礼仪,偏好对齐培养品味,安全训练建立底线。

微调技术的演进 = 从重到轻:从全量微调到 LoRA/QLoRA 参数高效微调,从 RLHF 四模型到 DPO 两模型到 GRPO 无价值模型——越来越轻、越来越快、越来越省。

推理模型 = 后训练的新前沿:GRPO + RLVR 让纯强化学习涌现推理能力,安全工程走向纵深防御体系。

  1. 预训练产出"基座模型",只会续写不会对话;后训练负责把它变成可用的对话助手。
  2. SFT(监督微调)教模型按指令回答;RLHF 用人类偏好训练模型追求更好的回答;DPO 把这一过程简化为监督学习。
  3. PEFT(参数高效微调)冻住绝大部分参数,只训练极少量新增参数。LoRA 仅训练 0.06% 的参数,QLoRA 把基座量化到 4 位,单卡可微调大模型。
  4. GRPO + RLVR 开创了推理模型的后训练新范式:砍掉价值模型用组内排名代替,用可验证奖励代替人类偏好,纯强化学习即可涌现推理能力。
  5. 安全对齐是后训练不可妥协的一环:红队测试以攻为守,三层安全工程架构从持续攻防到运行时护栏到形式化验证。

搞懂了后训练和微调,你就理解了从"原始模型"到"可用产品"之间的关键鸿沟是如何被填平的。但训练好的模型离"好用"还有一步之遥——它还需要一整套"脚手架"系统才能在生产环境可靠运行。下一章,我们就走进 AI 脚手架与系统工程的世界,看看 MCP、Skills、Harness、RAG 这些从 AI 延伸出来的系统组件,是如何把一个"会说话的大脑"变成一个"能干活的助手"的。

"预训练决定了模型的智力上限,后训练决定了它能多大程度接近这个上限——而后训练的工程水平,才是真正拉开产品差距的地方。"