AI是如何"学习"的🌱 轻松
上一章我们了解了什么是人工智能,但一直没回答一个最核心的问题:AI 到底是怎么"学习"的?这一章,我们从"机器学习"的根本思想讲起,一路走到深度学习和 Transformer,把 AI 学习的奥秘拆解清楚。放心,不需要高深的数学,跟着例子走就行。
- Pre-training预训练 把整座图书馆从头读到尾的自学,读完就懂了语言的规律
- Attention注意力机制 写作文时眼睛在全文找相关句子,而不是只盯着上一个词
- Transformer变换器架构 靠"注意力"这项本事造出来的整台机器,今天几乎所有大模型都用它
- AlphaGo阿尔法围棋 2016 年击败世界围棋冠军李世石的 AI,强化学习的成名之作
- Overfitting过拟合 死记硬背,原题满分,换个数字就废
- Backpropagation反向传播 卷子发下来,从错题倒推是哪一步算错的,然后改
一、机器学习的核心思想
要理解 AI 怎么学习,先得理解一个根本性的转变:从"人写规则"到"机器学规律"。这个转变,是机器学习和传统编程最本质的区别。
传统编程:人当老师,机器当执行者
在传统编程里,人是那个最聪明的角色。程序员把解决问题的规则一条条写成代码,机器只是老老实实地执行。比如判断一封邮件是不是垃圾邮件,程序员可能这样写:
如果 邮件标题含"中奖" → 标记为垃圾邮件
如果 邮件正文含"免费领" → 标记为垃圾邮件
如果 发件人不在通讯录 → 标记为可疑
……(写几百条规则)
问题来了:垃圾邮件发送者也在"进化",他们会把"中奖"改成"中將""中奖⓵",会换各种花样绕过你的规则。你写规则的速度,永远追不上骗子变花样的速度。规则越写越多、越写越乱,最后成了一团乱麻。
机器学习:让机器自己当学生
机器学习换了个思路:别让人写规则了,让机器自己从例子里归纳规则。还是垃圾邮件的例子,这次你这么做:
- 准备几万封邮件,其中人已经标好了哪些是垃圾邮件、哪些是正常邮件;
- 把这些邮件连同标签一起"喂"给机器;
- 机器自己分析:垃圾邮件通常有哪些特征?正常邮件通常有哪些特征?
- 它归纳出一套人类可能都说不清的判断规律;
- 遇到一封新邮件,它用学到的规律来判断。
神奇的是,机器归纳出的规律往往比人写的规则更全面——它可能发现"邮件里感叹号超过 5 个、且发送时间是凌晨 3 点"这种人类压根想不到的组合特征。而且,只要喂新的例子,它就能持续更新规律,自动适应骗子的新花样。
传统编程
- 输入:数据 + 规则
- 输出:答案
- 人负责想规则,机器负责执行
- 规则写死,难以适应变化
机器学习
- 输入:数据 + 答案
- 输出:规则
- 机器自己归纳规则
- 喂新数据就能持续进化
传统编程是"人给规则,机器算答案";机器学习是"人给答案,机器学规则"。角色的反转,正是 AI 能够"越用越聪明"的根源。
二、三种学习方式
机器学习并不是铁板一块,根据"喂答案"的方式不同,可以分为三大类。我们用三个生活化的比喻来理解它们。
三种方式怎么选
| 学习方式 | 数据特点 | 典型场景 | 生活中的类比 |
|---|---|---|---|
| 监督学习 | 有标签(有答案) | 图片分类、垃圾邮件识别、房价预测 | 老师批改作业 |
| 无监督学习 | 无标签(无答案) | 新闻聚类、用户分群、异常检测 | 自己整理书架 |
| 强化学习 | 有奖励/惩罚 | 下棋、游戏、机器人控制、自动驾驶 | 训练小狗 |
现实中介于三者之间的还有半监督学习(少量有标签 + 大量无标签)和自监督学习(数据自己给自己出题,比如把一句话挖个空让模型猜)。今天的大语言模型,主要用的就是自监督学习——它"读"了互联网上海量文本,靠"猜下一个词"自己学会了语言。
三、深度学习:模仿大脑
机器学习里有一个特别强大的分支,叫深度学习。它是今天 AI 大爆发的头号功臣,ChatGPT、AlphaGo、人脸识别,背后都有它的身影。深度学习的核心,是模仿人类大脑的结构,搭建一个"神经网络"。
神经网络长什么样
一个神经网络由三层组成:
- 输入层:负责接收原始信息,比如一张图片的像素、一段文字的词;
- 隐藏层:负责一层层地提取和组合特征,是"思考"的核心;
- 输出层:给出最终结果,比如"这是猫"还是"这是狗"。
所谓"深度",指的就是隐藏层有很多层。层数越深,网络能提取的特征就越抽象、越复杂。下面这张图展示了一个简单的神经网络结构:
"权重":神经网络的记忆
图里那些圆圈叫"神经元",神经元之间的连线都带有一个数字,叫权重。权重表示一条连接的"重要程度"——权重越大,说明上游神经元对下游的影响越强。
你可以把权重理解为 AI 的"记忆"。所谓"学习",本质上就是不断调整成千上万个权重,直到网络能给出正确的输出。一个像 ChatGPT 这样的大模型,权重数量高达数千亿个——这就是它"聪明"的物质基础。
打个比方:神经网络像一张巨大的捕鱼网,权重就是网上每个结的松紧。学习的过程,就是不断调整这些结,让网能精准地"捕"到正确的答案,同时"漏"掉错误的。
四、训练是怎样进行的
知道了结构,那这些权重具体是怎么被"调"出来的呢?这个过程叫训练,它是一个不断循环的"试错—纠错"过程。完整地走一遍,大概是这样的:
- 输入数据:把一批带标签的数据(比如标好"猫/狗"的图片)送进网络。
- 网络预测:数据经过一层层神经元的计算,网络给出一个预测,比如"这张图 70% 是猫、30% 是狗"。
- 计算误差:把预测结果和标准答案对比,算出"错了多少"。比如答案是猫,但网络只给了 70% 的把握,那就有 30% 的误差。
- 调整参数:根据误差,反向传播(Backpropagation)算法会从输出层往回,一层层计算每个权重"该为误差负多少责任",然后微调每个权重,让下次预测更准。
- 重复循环:用成千上万批数据,把上面四步重复几百万、几千万次,误差越来越小,网络越来越准。
整个过程就像一个学生疯狂刷题:做题→对答案→发现错在哪→改正思路→再做下一题……循环往复,直到几乎不再出错。只不过,AI 刷题的速度是人类的千万倍。
这是深度学习里最核心的算法之一,名字听起来唬人,原理其实朴素:从结果倒推责任。预测错了,就倒回去看是哪些权重"出了力",把它们往正确的方向微调一点点。一次只调一点点,但调几百万次后,整张网络的权重就调整到了最佳状态。正是这个算法让深度学习真正"可训练"。
训练 vs 推理
这里要区分两个常被混淆的词:
- 训练(Training):调权重的过程,极其耗费算力和时间,可能要几万张显卡跑几个月,花费上千万美元。
- 推理(Inference):训练好之后,用定型的网络去处理新任务,比如你向 ChatGPT 提一个问题、它回答你,这就是推理,速度很快。
打个比方:训练是"培养一个学生",推理是"让这个学生去考试"。培养很难很贵,但一旦培养好,让他考试就轻松了。
五、Transformer:当今AI的基石
讲了这么多,你可能会问:今天最火的 ChatGPT、DeepSeek、通义千问,它们用的到底是哪种技术?答案是一个名字听起来很酷、原理却很优雅的东西——Transformer。
"注意力机制":统揽全局
Transformer 的灵魂是一个叫注意力机制(Attention)的东西——就像你写作文时,眼睛在全文里找相关的句子,而不是只盯着上一个词。要理解它,先看一个例子。读这句话:
"苹果公司今年发布了新手机,而果园里的苹果也熟了。"
同样是"苹果"两个字,第一个指公司,第二个指水果。你是怎么瞬间区分的?因为你在读第二个"苹果"时,注意到了后面的"果园""熟了"这些词,从而判断它指水果。这种"根据上下文判断每个词的重点"的能力,就是注意力机制。
Transformer 让 AI 学会了统揽全局:它不再像老方法那样一个词一个词地死板处理,而是同时"看"整段话,自动判断哪些词和哪些词关系最密切。这让它特别擅长理解语言——能抓住长句子的逻辑、能记住一篇文章的前后呼应、能写出连贯的长文。
2017 年 Google 提出 Transformer 后,它几乎"统一"了整个 AI 界。原因有三:第一,它理解上下文的能力远超以往方法;第二,它特别适合并行计算,能充分利用 GPU 的算力,训练速度极快;第三,它极其通用——不仅能处理文字,稍加改造还能处理图像、声音、甚至蛋白质结构。今天几乎所有大模型,底层都是 Transformer。
从 Transformer 到大语言模型
有了 Transformer,科学家做了一件大胆的事:让一个超大的 Transformer 网络"读"完互联网上几乎所有的公开文本,让它玩"猜下一个词"的游戏(自监督学习)。读完之后,这个网络竟然学会了语言的规律、知识、甚至一定的推理能力——这就是大语言模型(LLM),ChatGPT 就是它的代表作。
换句话说,Transformer 是"引擎",海量文本是"燃料",算力是"道路",三者结合,才跑出了今天大语言模型这辆"快车"。这正好呼应了第一章讲的三大基石。
六、过拟合与泛化:为什么会"死记硬背"
训练 AI 时会遇到一个让人头疼的问题:过拟合。理解它,你就能明白为什么 AI 有时会"学傻了"。
什么是过拟合
想象一个学生复习考试:他不做题、不理解,而是把整本练习册的答案一字不差地背下来。考试时如果出的是练习册上的原题,他满分;可一旦题目稍稍换个数字、换个说法,他就懵了——因为他没有真正理解,只是死记硬背。
AI 也会犯同样的毛病。如果训练数据太少、或者网络太复杂,AI 可能不学规律,而是把训练数据原样"背"下来。结果就是:训练时准确率高得吓人,一到没见过的新数据上就原形毕露、错误百出。这就叫过拟合。
过拟合(死记硬背)
- 训练集上表现极好
- 新数据上一塌糊涂
- 只记住了具体例子,没学到规律
- 就像只会做原题的"背题机器"
泛化好(举一反三)
- 训练集上表现不错
- 新数据上同样出色
- 学到了真正的规律
- 就像真正理解了知识的好学生
AI 研究者的一大核心工作,就是和过拟合作斗争,让模型"举一反三"而不是"死记硬背"。常用的办法包括:用更多样的数据、限制网络复杂度、提前停止训练等等。我们追求的目标有个专门的名字——泛化,也就是在没见过的新情况上依然表现良好的能力。
你可能会问:大模型参数几千亿,岂不是更容易"背书"?奇妙的是,当数据量足够大、足够多样时,"背下所有数据"反而比"学出规律"更难,于是模型被迫去学规律——这就是为什么大模型泛化能力反而更强。当然,前提是数据要足够多、足够好。
七、大模型是怎样炼成的
讲了原理,我们来看一个最热的实例:像 ChatGPT 这样的大语言模型,到底是怎样一步步"炼"出来的?大致分三个阶段。
第一阶段:预训练——"读遍全网"
预训练Pre-training,把整座图书馆从头读到尾的自学是大模型的第一课。研究者先准备海量的文本(网页、书籍、论文、对话……动辄几万亿个词),让一个超大的 Transformer 网络玩"猜下一个词"的游戏。给它一句话的前半段,让它猜下一个词最可能是什么,猜错就调整权重。这样反复几万亿遍,模型就学会了语言的规律、积累了海量知识。这一步极其烧钱,可能要几万张显卡跑几个月。
第二阶段:指令微调——"学会听话"
预训练后的模型虽然"满腹经纶",但不太会"听人话"——你问它问题,它可能接着往下写一段无关的话,而不是回答你。于是研究者准备一批"问题—回答"的范例,教它按指令行事:你问,它就答;你让它写诗,它就写诗。这一步让模型从"会说话"变成"会对话"。
第三阶段:对齐——"学好规矩"
最后,还要教模型什么该说、什么不该说。比如不能教人做危险的事、不能带有歧视、不能胡编乱造。研究者用人类的反馈来"打分",让模型学会符合人类价值观的回答方式。这一步叫"对齐",是让 AI 变得安全、可靠的关键。
| 阶段 | 做什么 | 类比 | 耗费 |
|---|---|---|---|
| 预训练 | 读海量文本,猜下一个词 | 读完整个图书馆 | 极大 |
| 指令微调 | 学会按指令回答 | 学会听人话 | 中等 |
| 对齐 | 符合人类价值观 | 学好规矩礼貌 | 较小但关键 |
三步走完,一个会聊天、有知识、守规矩的大模型就"炼"成了。今天你能用的 ChatGPT、DeepSeek、通义千问,背后都是这个流程。预训练给它"知识",微调给它"技能",对齐给它"品格"——三者缺一不可。
大模型的"聪明",本质是见多识广 + 模式匹配。它读过的人类文本比任何一个人一辈子能读的都多得多,所以它能接上各种话题。但它并没有真正"理解"——它只是擅长预测"接下来最可能说什么"。这既是它的强大之处,也是它偶尔"一本正经胡说"的根源。
"AI 的学习,和人类的学习形似而神不似:都是'从经验中归纳',但 AI 靠的是海量数据加暴力计算,人靠的却是少量例子加真正的理解。"——认识到这层异同,你才既会用 AI,又不被它误导。
八、本章术语速查
这一章概念比较密集,把关键术语集中复习一遍,加深印象。
| 术语 | 一句话解释 |
|---|---|
| 机器学习 | 让机器从数据中自己学规律,而不是人写规则 |
| 监督学习 | 数据带标签,像老师批改作业 |
| 无监督学习 | 数据无标签,自己发现结构,像整理书架 |
| 强化学习 | 试错学习,做对奖励做错惩罚,像训练小狗 |
| 神经网络 | 模仿大脑的多层计算结构,由神经元和权重组成 |
| 深度学习 | 隐藏层很多的神经网络 |
| 权重 | 神经元间连接的强度,学习的本质就是调权重 |
| 反向传播 | 从误差倒推责任、调整权重的核心算法 |
| 训练 / 推理 | 训练是调参数(培养),推理是用模型(考试) |
| Transformer | 靠注意力机制统揽全局,当今大模型的底层架构 |
| 过拟合 / 泛化 | 过拟合是死记硬背,泛化是举一反三 |
| 注意力机制 | AI写作文时在全文找相关句子的能力,Transformer就是靠这个"会找重点"的本事撑起来的 |
| 预训练 | 模型训练的第一阶段,让模型"读遍全网"学习语言的规律和知识 |
| AlphaGo | 谷歌DeepMind开发的围棋AI,2016年击败世界冠军李世石,是强化学习的经典案例 |
这一章是全书最"硬核"的部分,一次没全看懂很正常。建议你结合后面的章节一起读——看到这些原理是怎么变成你每天用的功能的,抽象的概念就会变得具体可感。
本章小结
机器学习 = 用数据代替规则:人给答案,机器自己学规律,这是 AI 与传统编程最本质的区别。
深度学习 = 用多层神经网络处理复杂信息:靠调整成千上万的"权重"来学习,Transformer 是其中最强大的引擎。
大模型三步炼成:预训练给"知识",指令微调给"技能",对齐给"品格",三者缺一不可。
- 机器学习的核心是从数据中学习规律,区别于传统编程的"人写规则"。
- 三种学习方式:监督学习(有答案)、无监督学习(无答案)、强化学习(有奖惩)。
- 深度学习用多层神经网络模仿大脑,"深度"指隐藏层多,学习本质是调整权重。
- 训练是"输入→预测→算误差→反向传播调参→重复"的循环;要区分训练和推理。
- Transformer 靠"注意力机制"统揽全局,是当今几乎所有大模型的底层技术。
搞懂了 AI 怎么学习,你可能会好奇:预训练出来的模型就能直接用了吗?并不是。从"会续写文本"到"能对话、会推理、守规矩",中间还有一整套精密的"后训练"工艺。下一章,我们就走进大模型训练的"精装修"车间,看看后训练和微调到底做了什么。
"机器学习不是魔法,它只是把人类'从经验中学习'的能力,交给了算得快、记得多、不嫌累的机器。"——理解了这一点,你就理解了 AI 最朴素的本质。