人工智能通识读本
第二篇:AI的发展历史

AI神经网络发展史 🧗 硬核

上一节我们追溯了AI硬件从CPU到GPU再到专用芯片的进化历程。这些芯片上运行的,正是神经网络——现代AI的"大脑"。从ChatGPT到AlphaGo,背后都是它。但这个"大脑"的诞生之路并不平坦,它经历过被捧上天的辉煌,也遭受过被学术界抛弃的冷遇。三次崛起、两次衰落,这是一部关于坚持与反转的传奇。

🗂️读前小抄:本章会遇到的英文缩写与黑话
这一章名字多、缩写多。先花一分钟记住下面这些"身份证",后面就不会晕了。它们都是神经网络家族的成员。
CNN卷积神经网络专门看图片、认物体的"眼睛" RNN循环神经网络处理有先后顺序的句子、语音 LSTM长短期记忆网络RNN的升级版,记性更好 GRU门控循环单元LSTM的简化版 ResNet残差网络靠"残差连接"把网络做到上百层 Transformer变换器架构靠注意力机制,今天所有大模型的根 Self-Attention自注意力让每个词都能"看见"所有词 Seq2Seq序列到序列编码器-解码器,常用于翻译 BERT双向预训练模型Google出品,双向理解语言 GPT生成式预训练模型OpenAI出品,从左到右生成文字 MoE混合专家模型每次只叫几个"专家"干活 RLHF人类反馈强化学习让AI从"能说话"变"说对话" GAN生成对抗网络"造假钞"和"验钞机"互相较劲 VAE变分自编码器另一种"生成"模型
神经元 / 感知机 一切的起点 · 1943 分支一 · 看懂图像(视觉) 分支二 · 处理序列(语言/语音) 分支三 · 生成与创作 CNN 卷积神经网络 1989 · 让AI看清图片 ResNet 残差网络 2015 · 网络做到152层 RNN 循环神经网络 1986 · 记得前后文 LSTM 长短期记忆 1997 · 三个门控记性好 Transformer 变换器 2017 · 注意力机制,大模型之母 GAN 生成对抗网络 2014 · 造假钞 vs 验钞机 VAE 变分自编码器 2013 · 学会"画"相似的东西 扩散模型 Diffusion 2020 · 从噪声里"长"出图像
图17-1 神经网络家族图谱:从最基础的神经元,长出三条主干——看图像的、处理序列的、生成创作的。

如果要评选AI历史上最曲折、最戏剧性的技术路线,神经网络毫无疑问会高居榜首。它诞生于1943年,比"人工智能"这个词还早13年;它经历过1950年代的狂热追捧,也遭受过1970年代的学术放逐;它在1980年代靠反向传播重获新生,又在1990年代被SVM抢尽风头;直到2012年AlexNet横空出世,它才真正君临天下。而今天,从你手机里的语音助手到ChatGPT的对话能力,背后全是神经网络。

这一节,我们就来讲述这部"三次崛起、两次衰落"的传奇——看看神经网络是怎么从一个数学公式,长成今天改变世界的"AI大脑"的。

一、神经元的数学模型:从生物到数学(1943)

生物神经元是怎么工作的

要理解人工神经网络,先得看看它的灵感来源——生物神经元。你的大脑里大约有860亿个神经元,每个神经元由三部分组成:树突(接收信号)、细胞体(处理信号)和轴突(发送信号)。

神经元之间通过突触连接。一个神经元接收来自其他神经元的电信号,有的信号是"兴奋性"的(促使它放电),有的是"抑制性"的(阻止它放电)。当所有输入信号的总和超过某个阈值时,神经元就会"放电"——沿轴突发出一个电脉冲,传递给下一个神经元。这就是大脑处理信息的基本方式。

奇妙的是,这个过程极其简单——单个神经元能做的事非常有限——但860亿个神经元连接起来,就产生了意识、记忆、推理、创造。"简单单元的大量连接产生复杂智能"——这个洞察正是人工神经网络的核心哲学

MP模型:第一个神经元的数学模型

1943年,神经生理学家沃伦·麦卡洛克(Warren McCulloch)和数学家沃尔特·皮茨(Walter Pitts)合作发表了一篇论文,提出了MP模型——历史上第一个用数学公式描述神经元的模型。

他们把生物神经元抽象成了极其简洁的数学:神经元有多个输入,每个输入乘以一个权重(模拟突触的强弱),全部加起来,如果总和超过阈值就输出1(放电),否则输出0(不放电)。就这么简单。

用"投票表决"来比喻再合适不过:想象一个委员会要表决一项提案,每个委员的话语权(权重)不同——老大的票可能值5票,新人只值1票。所有票加起来,如果超过半数(阈值),提案就通过(输出1);否则就否决(输出0)。MP模型就是这样一个"加权投票器"。

麦卡洛克和皮茨还证明了一件了不起的事:用足够多这样的神经元互相连接,可以表达任意复杂的逻辑运算——与、或、非、异或,什么都能算。这是历史上第一次有人证明"神经网络"可以用严格的数学来描述和计算,它为整个连接主义路线奠定了第一块基石

📌
为什么重要

MP模型第一次把"生物神经元"变成了"数学神经元"。它证明了神经网络可以用数学描述和计算,开启了"用数学模拟大脑"的研究方向。没有MP模型,就没有后来的感知机、反向传播、深度学习——整个神经网络的故事都从这一步开始。

二、感知机时代:第一次辉煌(1958—1969)

感知机:第一个能"学习"的神经网络

MP模型虽然优雅,但有一个致命缺陷——它的权重是固定的,不能学习。你必须手动设定每个输入的权重,这在实际问题中几乎不可能。1958年,康奈尔大学的弗兰克·罗森布拉特(Frank Rosenblatt)改变了这一切——他发明了感知机(Perceptron),第一个能从数据中自动学习的神经网络。

感知机和MP模型的结构类似,但关键区别在于:感知机的权重不是人设定的,而是通过训练自动调整的。你可以把它想象成一台"调天平"——一开始天平是歪的(权重是随机的),每次预测错了,就根据错误方向调整一下砝码(调整权重)。经过反复训练,天平逐渐平衡,感知机就学会了正确分类。

具体来说,感知机的训练过程是这样的:给它看一个样本,让它预测"这是A类还是B类"。如果预测对了,什么都不改;如果预测错了,就调整权重,让下次预测更接近正确答案。就这么简单的规则,罗森布拉特证明了:如果数据确实是线性可分的(能用一条直线分开),感知机一定能学会。这是AI历史上第一个有数学收敛保证的学习算法,"机器学习"从此不再只是概念,而是可实现的工程

感知机能做什么

感知机能学会简单的分类任务:区分三角形和圆形、识别简单的几何图形、分辨左右。罗森布拉特还建造了一台名为Mark I Perceptron的硬件——这可以算是世界上第一台"神经网络计算机"。它由400个光电管组成,能"看"20×20像素的图像并学会分类。

当时的媒体为之疯狂。1958年《纽约时报》写道:"海军今天公布了一台即将诞生的电子计算机的雏形,它将能够行走、说话、看见、书写、自我复制,并意识到自己的存在。"这种描述在今天看来荒谬至极,但在当时却点燃了公众对AI的巨大热情。

从客观角度看,感知机的意义不在于它当时能做什么(它只能做很简单的分类),而在于它第一次证明了"机器可以从经验中学习"这个概念是可行的。在感知机之前,AI更多是"人设定规则,机器执行";感知机之后,"机器自己学规则"成为了一条新的可能路径。

1943
MP模型
麦卡洛克和皮茨提出第一个神经元的数学模型,证明神经网络可计算任意逻辑。
1958
感知机诞生
罗森布拉特发明第一个能学习的神经网络,并建造Mark I Perceptron硬件。
1958
《纽约时报》报道
媒体宣称感知机"即将能走能说能看",引发公众对AI的巨大期待。
1960s初
感知机研究热潮
全美多个实验室投入感知机研究,连接主义成为AI最热门的方向。
📌
为什么重要

感知机是第一个能从数据中"学习"的神经网络。它把"机器学习"从概念变成了可实现、有数学保证的算法。Mark I Perceptron是第一台神经网络硬件,证明了这套理论可以落地。感知机时代的狂热虽然后来被证明过度乐观,但它播下的种子最终在几十年后长成了参天大树。

三、感知机之争与第一次寒冬(1969—1986)

《Perceptrons》:一本书改变命运

1969年,MIT的马文·明斯基(Marvin Minsky)和西摩·帕珀特(Seymour Papert)出版了一本书——《Perceptrons》。这本书从数学上严格分析了感知机的能力边界,指出了一个致命问题:单层感知机无法解决XOR(异或)问题

XOR问题:一条直线的困境

XOR(异或)是一种简单的逻辑运算:两个输入不同时输出1,相同时输出0。如果你把四种输入情况画在平面上——(0,0)和(1,1)是一种颜色(输出0),(0,1)和(1,0)是另一种颜色(输出1)——你会发现:同色的点在对角线上,你无法用一条直线把两种颜色分开

想象一个正方形的四个角:左上和右下是红点,右上和左下是蓝点。你拿一把直尺试图画一条线把红色和蓝色分开——怎么画都不行。因为红色点在对角线上,任何一条直线都会把同色点分到两侧。单层感知机只能画"一条直线",所以它对XOR问题完全无能为力。

明斯基和帕珀特其实也指出,多层感知机理论上可以解决这个问题——只要在中间加一层"隐藏层",用两条线就能把对角点围住。但问题在于:当时没有任何有效方法来训练多层感知机——你不知道隐藏层的权重该怎么调整。"有理论可行但无训练方法"——这让多层网络在当时只是一个美好的设想

影响:漫长的寒冬

《Perceptrons》出版后,影响是灾难性的。虽然书中也讨论了多层网络的可能性,但舆论的解读是"神经网络走不通"。研究经费被大幅削减,年轻学者不敢选择神经网络方向(怕毕不了业),整个连接主义研究几乎停滞。这就是AI历史上著名的"第一次AI寒冬"中针对神经网络的部分。

这场寒冬持续了近17年——从1969年到1986年。在这段时间里,符号主义和统计方法占据了主流,神经网络几乎成了"学术禁区"。

⚠️
客观分析:明斯基的批评并非完全正确

明斯基和帕珀特的数学分析是正确的——单层感知机确实解不了XOR。但问题在于当时的舆论过度解读了这个结论,把"单层的局限"等同于"整个神经网络路线的失败"。事实上,书中也讨论了多层网络的可能性,只是当时缺乏训练方法。这场舆论风暴导致连接主义被长期边缘化,许多有潜力的研究方向被搁置了十几年。历史提醒我们:对一种方法局限性的批评要放在正确的尺度上理解,不能以偏概全。

寒冬中的坚持者

在几乎所有人都放弃神经网络的那些年里,有一小群人选择了坚守。其中最执着的是杰弗里·辛顿(Geoffrey Hinton)。他在1970年代开始研究神经网络,当时这是一个"不被看好的冷门方向"——没有经费、没有同行、学术会议不接收相关论文。

但辛顿坚信:大脑就是靠神经元工作的,模拟大脑的神经网络一定是对的路线,只是我们还缺一些关键的技术。正是这种近乎固执的信念,支撑他熬过了漫长的寒冬,最终迎来了神经网络的伟大复兴。辛顿后来被称为"深度学习之父",并在2024年获得诺贝尔物理学奖——这是对他半个世纪坚持的最好回报。神经网络的故事里,最动人的不是技术,而是那些在无人喝彩时依然相信的人

四、反向传播:神经网络的第二春(1986)

反向传播算法

1986年,大卫·鲁梅尔哈特(David Rumelhart)、杰弗里·辛顿和罗纳德·威廉姆斯(Ronald Williams)发表了关于反向传播算法(Backpropagation)的论文。这个算法解决了困扰神经网络近20年的核心难题——如何训练多层网络

反向传播的核心思想可以用"工厂质检追溯"来理解。想象一条生产线:原材料经过一道道工序,最终产出成品。质检员发现成品有缺陷(输出误差),现在要追查是哪道工序出了问题。他从最后一道工序开始往回追:成品差了多少,最后一道工序该承担多少责任?再往前一道,又该承担多少?一层层追溯,直到找到原材料环节。每道工序根据自己的"责任大小"做相应调整。下次生产时,同样的错误就不会再犯。

反向传播算法做的就是这个过程:从输出端的误差出发,利用微积分中的链式法则,一层层往回计算每个权重对误差的"贡献",然后据此调整权重。通过反复的"前向计算-误差评估-反向传播-权重调整",多层神经网络就能逐渐学会复杂的映射关系。

链式法则:让多层训练成为可能

反向传播的数学基础是微积分中的链式法则。多层神经网络本质上是一个复合函数——输入经过第一层变换,结果传给第二层再变换,一层层嵌套下去。链式法则告诉我们怎么计算复合函数的导数:把每一层的导数"链式"相乘即可。

这听起来只是微积分课本上的基础内容,但它的意义是革命性的。有了链式法则,无论网络有多少层,你都能精确算出每个参数该怎么调整。反向传播把"训练多层网络"从"理论上可行"变成了"工程上可实现"——这是神经网络从寒冬中复苏的关键一步

深读可选 · 跳过不影响后文:想看一眼真正的数学长什么样?一个神经元做的事可以写成:z = w₁·x₁ + w₂·x₂ + … + wₙ·xₙ + b,再过一道"激活函数"得到输出。反向传播就是反复用链式法则求 ∂(误差)/∂wᵢ,也就是"每个权重该为误差负多少责任",然后朝减小误差的方向微调它。看不懂这些符号完全没关系——记住"从结果倒推、逐层追责"这个画面就够了。

意义与局限

反向传播的发表让神经网络重新被学术界接受。1980年代末到1990年代初,神经网络研究迎来了第二春——人们开始用多层网络做语音识别、字符识别、自动驾驶原型等各种任务。

但好景不长,局限很快显现:当时的算力和数据量远远不够。网络只能做到1-2层隐藏层,再深就训不动(梯度消失问题);数据集也只有几百几千个样本,远不足以发挥神经网络的潜力。相比之下,SVM等统计学习方法在小数据上表现更好、理论更完善、调参更简单,于是研究者又纷纷转向SVM。神经网络在1990年代末再次被边缘化——这是它的第二次低谷。

📌
为什么重要

反向传播算法解决了多层神经网络"怎么训练"这个困扰了学界近20年的核心难题。它用链式法则把误差从输出层逐层传回,让任意深度的网络都能被有效训练。虽然受限于当时的算力和数据,网络只能做得很浅,但反向传播为后来深度学习的爆发打下了不可或缺的方法论基础。

五、卷积神经网络:让AI"看"懂世界(1989—2015)

生物视觉的启发

卷积神经网络(CNN)的故事要从一个生物学实验说起。1959年,神经科学家大卫·休伯尔(David Hubel)和托尔斯滕·威塞尔(Torsten Wiesel)在猫的视觉皮层做实验时发现了一个惊人的事实:视觉皮层中的神经元是"局部感受"的——每个神经元只对视野中一小块区域的特定特征(如某个方向的边缘)有反应,而不是看整幅画面。

更妙的是,这些神经元是分层组织的:第一层检测简单的边缘和线条,第二层把边缘组合成形状,更深的层把形状组合成物体。大脑的视觉系统就像一个层层递进的"特征提取流水线"——从简单到复杂,逐步构建出对世界的理解。

这个发现启发了AI研究者:如果让神经网络也模仿这种"局部感受+分层处理"的结构,也许就能让AI"看"懂图像。卷积神经网络正是这一洞察的工程化实现——它不是凭空设计的,而是从大脑那里"偷师"来的

LeNet:第一个卷积神经网络

1989年,法国研究者杨立昆(Yann LeCun)在贝尔实验室设计了LeNet——世界上第一个卷积神经网络,用来识别美国邮政的手写邮编。LeNet能以高准确率读取信封上的手写数字,并实际部署到了邮政系统中使用。

LeNet的核心操作是卷积。想象你拿着一个小放大镜(卷积核)在一张大照片上从左到右、从上到下滑动。每到一个位置,放大镜就提取这个小块的某种特征——比如边缘、纹理、色块。滑完整张照片,你就得到了一张"特征图",记录了图像中每个位置的特征信息。第一层卷积提取简单边缘,第二层把边缘组合成形状,第三层把形状组合成部件——和大脑视觉皮层的分层结构一模一样。

另一个关键操作是池化(Pooling)。它的作用是"缩小照片看轮廓"——把特征图分成小块,每块只保留最大的值(最大池化)。这既减少了计算量,又让特征对位置变化更鲁棒(猫在图片左上角和右下角都还是猫)。卷积+池化的组合让神经网络第一次能高效处理图像,这是AI视觉能力的起点

🔍 比喻:卷积 = 拿放大镜扫照片
卷积核就像一个小小的放大镜,在整张照片上从左到右、从上到下滑动。每停在一个位置,它就"扫"出那一小块区域的特征——是边缘?是色块?还是纹理?滑完整张图,就得到一张"特征图"。第一层放大镜看线条,第二层把线条拼成形状,第三层把形状拼成部件——和我们用眼睛一层层认东西一模一样。

AlexNet:深度学习的"独立宣言"

虽然LeNet在手写数字上成功了,但CNN在更复杂的自然图像上一直表现不佳——因为网络不够深、数据不够多、算力不够强。这一切在2012年被彻底改变。

2012年,Alex Krizhevsky在辛顿的指导下设计了AlexNet,参加ImageNet图像识别大赛。ImageNet有120万张训练图片、1000个分类,难度极高。AlexNet使用了8层深度网络(5层卷积+3层全连接),并首次用GPU(图形处理器,擅长并行计算,是训练AI的主力芯片)来训练——这是关键突破,GPU的并行计算能力让训练深层网络成为可能。

结果震惊了所有人:AlexNet的Top-5错误率是15.3%,而第二名用传统方法的错误率是26.2%——差距超过10个百分点,这在竞赛中是碾压性的优势。AlexNet被视为"深度学习的独立宣言"——它向全世界宣告:神经网络时代回来了,而且这次不一样

VGG与ResNet:越来越深

AlexNet之后,CNN越做越深。2014年牛津大学的VGG网络做到了19层,证明了"深度很重要"——网络越深,能提取的特征越抽象、越强大。但再往深做就遇到了梯度消失问题——网络训不动了。

2015年,微软研究院的何恺明提出了ResNet(残差网络),用一个简单却天才的想法打破了深度瓶颈:残差连接。他在网络中加了一条"旁路",让输入可以跳过某些层直接加到输出上。这就像在拥堵的主路旁边修了一条高速公路——信息可以直接通过旁路传递,不必挤在层层叠叠的网络中。

🛗 比喻:残差连接 = 拥堵大楼里的直达电梯
普通深层网络像一栋50层还没电梯的大楼,信息要从1楼爬到50楼,每层都挤、都损耗,爬到顶已经气喘吁吁(这就是"梯度消失")。残差连接就是在大楼外侧加了一部直达电梯:信息可以从任意一层直接"跳"到后面任意一层,不用层层爬。有了电梯,盖100层、150层都不怕,信息照样顺畅到达。

残差连接让梯度也能沿旁路顺畅传播,解决了梯度消失问题。ResNet做到了152层——是AlexNet的19倍——而错误率反而更低。此后甚至出现了上千层的网络。ResNet是深度学习历史上最重要的架构创新之一,何恺明也因此成为AI领域最具影响力的研究者之一

🔬
LeNet (1989)
第一个卷积神经网络,识别手写邮编。从生物视觉"偷师"局部感受+分层处理。
🚀
AlexNet (2012)
深度学习的"独立宣言"。用GPU训练8层CNN,ImageNet错误率暴降10个百分点。
📏
VGG (2014)
19层网络,证明"深度很重要"。更深的网络能提取更抽象的特征。
🌉
ResNet (2015)
残差连接打破深度瓶颈,网络做到152层。像在拥堵主路旁修高速公路。

六、循环神经网络:让AI"记"住序列(1986—2017)

RNN的直觉:处理有时间顺序的数据

CNN擅长处理图像(空间数据),但世界上还有大量数据是序列——文字是一串词,语音是一串音,股票是一串价格,DNA是一串碱基。这些数据的特点是:当前时刻的信息和之前的信息有关。处理这类数据,需要一种能"记住"历史的网络——这就是循环神经网络(RNN)。

RNN的工作方式可以用"读书"来比喻。你读一本书时,每读到一个新词,你不是从零开始理解它,而是结合之前读过的内容来理解。RNN也一样:它在每个时刻接收一个新输入,同时结合上一步的"记忆"(隐藏状态),产生当前时刻的输出和新的记忆。信息就这样一步步传递下去,网络就"记住"了序列的历史。

这种结构让RNN天生适合处理变长序列——无论句子有3个词还是300个词,RNN都能处理。在2010年代,RNN是自然语言处理和语音识别的主力架构。RNN让AI从"看单张图片"进化到"读一段文字、听一段语音",这是AI能力的重要扩展

RNN的问题:长期记忆丢失

但RNN有一个致命弱点:长期依赖问题。由于梯度在时间步上一步步传递,时间越长,梯度越容易消失(或爆炸)。这就像"传话游戏"——传了十个人之后,最初的信息已经面目全非了。

实际表现就是:RNN能记住最近的几个词,但"忘记"很久以前的词。比如"The cat, which was already fed by my mother yesterday, was hungry"中,"hungry"指的是"cat",但中间隔了很多词,RNN可能记不住"cat"了。这个问题严重限制了RNN处理长文本的能力。

LSTM:三个"水龙头"解决问题

1997年,塞普·霍赫赖特(Sepp Hochreiter)和于尔根·施密德胡伯(Jürgen Schmidhuber)提出了LSTM(Long Short-Term Memory,长短期记忆网络),用一套精巧的"门控机制"解决了长期依赖问题。

LSTM的核心是三个"门"——你可以把它们想象成三个"水龙头":遗忘门决定把旧记忆中的哪些信息倒掉(关掉水龙头放水),输入门决定把新信息中的哪些存进来(打开水龙头注水),输出门决定从当前记忆中输出什么(调节出水口)。通过这三个门的精细控制,LSTM可以选择性地记住重要信息、遗忘无用信息,从而在很长的序列中保持关键记忆。

🖍️ 比喻:LSTM = 带荧光笔和橡皮的笔记本
读长文章时,你会用荧光笔划重点(输入门:把重要的写进笔记),用橡皮擦掉过时的内容(遗忘门:把没用的忘掉),最后只把笔记里最该说的部分写进答案(输出门)。LSTM的三个"门"就是这三支笔:该记的记,该忘的忘,该说的说。所以它能记住几百步之前的关键信息,不会像普通RNN那样"读到后面忘了前面"。

LSTM让RNN真正能处理长序列了——它可以记住几百步之前的信息。在2010年代,LSTM是语音识别(如Siri)和机器翻译的主力技术。2014年提出的GRU是LSTM的简化版,把三个门简化成两个,效果相当但计算更高效。

Seq2Seq:编码器-解码器

2014年,谷歌提出了Seq2Seq(Sequence to Sequence)架构——用两个RNN(一个"编码器"读入源句子,一个"解码器"生成目标句子)来做机器翻译。这大大提升了翻译质量,让机器翻译从"能看懂"变成了"接近人类水平"。

但RNN有一个根本性局限:必须逐步计算,无法并行。因为第t步的计算依赖第t-1步的结果,你不能跳着算。这让RNN的训练速度极慢,尤其在大规模数据和长文本上。这个局限最终导致了RNN被Transformer取代——但RNN开创的"序列建模"思路,被Transformer继承和发扬了

七、注意力机制与Transformer:改变一切的论文(2014—2017)

注意力机制的诞生

2014年,注意力机制被引入Seq2Seq翻译模型中。在传统的Seq2Seq中,编码器把整个源句子压缩成一个固定长度的向量,解码器只能基于这个向量来翻译——不管句子多长都压缩成一团,信息损失很大。

注意力机制的思路是:翻译每个词时,不要只看那个压缩向量,而是"回看"源句的所有词,重点关注和当前翻译最相关的部分。比如翻译"The cat sat on the mat"中的"猫"时,重点关注"cat"这个词;翻译"坐"时,重点关注"sat"。这就像人翻译时,目光在原文和译文之间来回扫视,每次聚焦在不同部分。

注意力机制让AI学会了"划重点"——不是一视同仁地看所有信息,而是根据当前需要动态分配注意力。这个看似简单的改进,后来成了改变AI历史的关键。

Self-Attention:让每个词都"看见"所有词

2017年的关键创新是自注意力(Self-Attention)。在注意力机制中,是"解码器看编码器"(两个不同序列之间);而在Self-Attention中,是"序列看自己"——同一个序列中的每个位置都和其他所有位置计算关联。

想象一个会议室里坐着十个人讨论问题。在传统RNN中,每个人只能听到旁边一个人说话,信息要一个一个传——传到最后一个人时,最早的信息可能已经失真了。但在Self-Attention中,每个人都能直接看到在场所有人,任何人之间的信息交流只需一步——无论隔了多远。

这完美解决了RNN的长距离依赖问题。在句子"The animal that was running in the forest was tired"中,"tired"可以直接和"animal"建立关联,不管中间隔了多少个词。Self-Attention让AI真正理解了语言中词语之间的长距离关系,这是语言理解能力飞跃的基础

"Attention is All You Need":Transformer诞生

2017年6月,Google的8人研究团队发表了论文《Attention is All You Need》,提出了Transformer架构。这篇论文的核心主张大胆到近乎傲慢:完全抛弃RNN的循环结构,只用注意力机制。

这个决定为什么重要?因为RNN的根本瓶颈是"必须逐步计算"——第t步依赖第t-1步,无法并行。Transformer完全去掉了循环结构,所有词同时处理,能充分利用GPU的并行能力。训练速度一下子提升了几十倍,这让在超大规模数据上训练超大模型成为可能。

RNN / LSTM

  • 逐步计算,无法并行
  • 训练慢,难以扩展到大数据
  • 长距离信息容易丢失
  • 适合短序列、小规模任务
  • 内存开销与序列长度成线性

Transformer

  • 全并行计算,训练快
  • 易于扩展到超大规模
  • Self-Attention一步捕捉长距离依赖
  • 适合超长序列和大规模训练
  • 计算复杂度O(n²),需优化

多头注意力:多角度看问题

Transformer还有一个重要创新——多头注意力(Multi-Head Attention)。它不是只做一次注意力计算,而是同时做多次(多个"头"),每个头关注不同方面的信息。

这就像多个人从不同角度读同一段话:一个人关注语法结构,一个人关注语义关系,一个人关注情感色彩,一个人关注实体名称。每个人的"视角"不同,最后把所有人的理解综合起来,就得到了对这段话更全面的理解。多头注意力让Transformer能同时捕捉多种不同类型的语言关系,大大增强了模型的表达能力。

Transformer后来成为了所有大模型的基础架构——GPT、BERT、Claude、Gemini、LLaMA,无一例外。2017年的那篇论文,至今已被引用超过十万次,是AI历史上影响最大的论文之一。"Attention is All You Need"不仅仅是一篇论文的标题,更是一个新时代的宣言

Transformer之于AI,就像晶体管之于电子学——一个简洁、通用、可扩展的基础组件,重塑了整个领域的格局。

八、预训练革命:从BERT到GPT(2018—2022)

预训练的直觉

Transformer出现后,一个被称为预训练(Pre-training)的范式开始兴起。它的思路可以比喻为"先读万卷书,再考科举"。

在预训练之前,如果你想让AI做情感分析(判断评论是好评还是差评),你就得收集大量标注好的评论数据,从零开始训练一个模型。换一个任务(比如摘要生成),又得从头来过。每个任务都要专门的标注数据和专门的模型——费时费力。

预训练的思路完全不同:先让AI"广泛阅读"海量无标注文本(整个互联网的网页、书籍、论文),学会语言的通用规律;然后再针对具体任务做少量"专项训练"(微调)。这就像一个人先读了万卷书打下扎实基础,再花几个月准备科举考试——基础好了,什么考试都能快速上手。预训练让AI从"一个任务一个模型"变成了"一个基础模型适配无数任务",这是大模型范式的核心

BERT:双向理解语言

2018年10月,Google发布了BERT(Bidirectional Encoder Representations from Transformers)。BERT的核心创新是"双向"——它同时从左到右和从右到左看文本,因此能全面理解每个词在上下文中的含义。

BERT的训练方式很巧妙:随机遮住句子中的一些词,让模型根据上下文猜被遮住的词是什么。比如"今天天气真[MASK],我们去公园吧"——模型需要根据上下文猜出"好"或"晴"之类的词。这个简单的任务迫使模型真正理解语言,而不是死记硬背。BERT在11项NLP任务上刷新了纪录,证明了预训练的巨大威力。

GPT系列:从小到大的进化

与BERT几乎同时,OpenAI开始了GPT(Generative Pre-trained Transformer)系列的探索。和BERT不同,GPT是"单向"的——从左到右预测下一个词。虽然双向理解在分析类任务上更强,但单向预测在生成类任务上更有优势——因为生成本身就是"从左到右逐词产生"的过程。

GPT系列验证了Scaling Law:模型越大,能力越强。GPT-1(2018)有1.17亿参数,效果一般;GPT-2(2019)有15亿参数,开始展现出令人惊讶的文本生成能力;GPT-3(2020)暴增到1750亿参数,突然"涌现"出写代码、做算术、写文章等多种能力——这些能力没有人专门训练过。GPT-3是"涌现能力"最著名的案例,它让全世界意识到:把模型做到足够大,质变就会发生

ChatGPT:RLHF让GPT"说人话"

2022年11月,OpenAI发布了ChatGPT。从技术角度看,ChatGPT底层是GPT-3.5——模型架构和GPT-3差别不大。真正让它"引爆全球"的关键技术是RLHF(Reinforcement Learning from Human Feedback)。

原始的GPT模型虽然能力强,但输出质量不稳定——可能啰嗦、可能有害、可能答非所问。RLHF的做法是:先让人类给AI的回答打分,训练一个"奖励模型"来模拟人类偏好;然后用强化学习优化GPT,让它倾向于生成高分回答。经过RLHF训练后,GPT从"能说话"变成了"说对话"——回答更准确、更有用、更符合人类期望。

ChatGPT上线5天用户破百万,2个月月活过亿,成为史上增长最快的消费级应用。它让全世界第一次直观感受到AI的强大,也标志着大模型时代正式到来。从BERT到GPT到ChatGPT,预训练+Transformer+RLHF构成了现代大模型的"标准配方"

2018.06
GPT-1
OpenAI发布第一代GPT,1.17亿参数,验证"预训练+微调"范式可行。
2018.10
BERT
Google发布双向预训练模型,在11项NLP任务上刷新纪录,证明预训练威力。
2019.02
GPT-2
15亿参数,文本生成能力令人惊讶。OpenAI最初因"太危险"而分阶段发布。
2020.05
GPT-3
1750亿参数,涌现出写代码、做算术等未专门训练的能力。Scaling Law被验证。
2022.11
ChatGPT
RLHF让GPT-3.5学会"说人话",5天用户破百万,引爆全球AI浪潮。

九、大模型架构演进:从稠密到稀疏(2022—2026)

MoE:混合专家模型

随着模型越做越大,一个新问题浮现了:稠密模型(Dense Model)的所有参数在每次推理时都要参与计算,成本太高。GPT-4据估计有上万亿参数,每次回答都要动用全部参数,算力和能耗惊人。

MoE(Mixture of Experts,混合专家模型)提供了一个巧妙的解决方案。它的思路是"多个专家各管一摊":模型内部有多个"专家网络"(比如8个或64个),每次推理时,一个"路由器"根据输入内容,只选择最合适的几个专家来处理,其他专家"休息"。

这就像一家大医院:虽然全科医生、心脏科、神经科、骨科的医生都有,但一个病人来了,不需要所有医生都来看——根据症状分诊到对应科室就行。MoE让模型的总参数量很大(知识容量大),但每次推理只激活一小部分参数(计算成本低)。DeepSeek V3就是用MoE架构,以约1/10的激活参数实现了接近GPT-4的性能,大大降低了推理成本

稀疏激活:效率革命

MoE代表的"稀疏激活"思路正在改变大模型的格局。传统稠密模型中,参数量和计算量是1:1的关系——参数翻倍,计算也翻倍。但稀疏模型打破了这个关系——你可以有万亿参数,但每次只激活几百亿。这意味着模型能记住更多知识(大参数量),但运行成本可控(小激活量)。

这种"大存储、小计算"的模式非常高效,正在成为2024—2026年大模型的主流架构。GPT-4、Mixtral、DeepSeek V3等顶级模型都采用了MoE或类似的稀疏架构。稀疏激活让大模型从"越大越贵"变成了"大而精"——这是大模型走向普及的关键一步

多模态架构:从"只读文字"到"能看能听"

另一个重要趋势是多模态——让大模型不只处理文字,还能处理图像、音频、视频。GPT-4o能看图片、听语音、看视频并实时对话;Gemini原生支持图文音视频混合输入。

多模态架构的核心挑战是:如何让不同模态的数据(文字是离散的词,图像是连续的像素,音频是时间序列)在同一套Transformer架构中统一处理?答案是模态编码器——把图像用视觉编码器转成向量序列,把音频用音频编码器转成向量序列,然后统统喂给Transformer处理。不同模态的数据在向量空间中"对齐",模型就能跨模态理解——看到猫的图片能说出"猫"这个词,听到"猫"的发音能想到猫的样子。

线性注意力与高效Transformer

标准Self-Attention有一个致命的计算复杂度问题:O(n²)——序列长度翻倍,计算量变四倍。这意味着处理一篇10万字的长文,计算量是1000字短文的10000倍。这让Transformer处理超长文本变得极其昂贵。

研究者们提出了多种高效注意力方案来解决这个问题:线性注意力把O(n²)降到O(n);稀疏注意力只计算重要的关联对,忽略不重要的;滑动窗口注意力只关注局部窗口。这些方法让Transformer能处理几十万甚至上百万token的超长上下文。高效注意力是大模型从"短对话"走向"长文档理解"的关键技术

2022
Switch Transformer / GShard
Google将MoE引入大规模语言模型,验证"稀疏激活"在大模型上的可行性。
2023
Mixtral 8x7B
Mistral发布开源MoE模型,8个专家共467亿参数,每次激活约129亿,性能媲美闭源模型。
2024
DeepSeek V3
6710亿总参数,每次仅激活约370亿,以极低成本实现GPT-4级性能,引发行业震动。
2024—2026
多模态大模型
GPT-4o、Gemini、Claude等全面支持图文音视频多模态,AI从"只读文字"进化到"能看能听能说"。
2025—2026
高效注意力与超长上下文
线性注意力、稀疏注意力等技术成熟,大模型支持百万级token上下文,长文档理解成为标配。

十、神经网络的未来方向

神经网络已经走过了80多年的历程,从MP模型到Transformer再到MoE大模型,但它远没有到达终点。以下几个方向可能是下一个十年的关键。

神经符号融合

神经网络擅长感知和学习(识别图像、理解语言),但不擅长严格推理(数学证明、逻辑推导)。而符号逻辑恰恰相反——擅长精确推理,但不擅长从数据中学习。神经符号融合(Neuro-Symbolic)试图把两者结合:用神经网络做感知和模式识别,用符号引擎做推理和验证。

想象一个AI医生:神经网络负责看X光片、分析症状(感知),符号引擎负责根据医学指南做诊断推理(推理)。两者配合,既有直觉又有逻辑。这个方向被许多研究者视为通向通用人工智能(AGI)的必经之路。

脉冲神经网络(SNN)

目前的神经网络都是"连续值"的——输入输出都是实数。但真实大脑的神经元是"脉冲"的——要么放电(发一个脉冲),要么不放电,是离散的事件。脉冲神经网络(Spiking Neural Network)更忠实地模拟生物神经元的工作方式。

SNN的潜在优势是能效极高——因为脉冲是稀疏的(大部分时间不放电),理论上能耗可以比传统神经网络低几个数量级。这非常契合"边缘计算"的需求——让AI在手机、传感器等低功耗设备上运行。但SNN的训练算法还不够成熟,目前仍处于研究早期。

世界模型

当前的大语言模型本质上是在做"文字接龙"——预测下一个词。但人类智能不只是语言——我们有对物理世界的直觉理解:知道球会滚下坡、玻璃会碎、水会流。世界模型(World Model)试图让AI建立对物理世界运行规律的内部表示,不仅能"说",还能"理解"世界是怎么运作的。

特斯拉的自动驾驶、LeCun提出的JEPA架构、各种具身智能研究,都在朝这个方向努力。如果成功,AI将不再只是"语言大师",而是真正"理解"世界的智能体。

💡
展望未来

神经网络的下一个突破,可能来自我们今天还看不到的方向——就像2017年没有人预料到Transformer会改变一切。但有一点是确定的:从MP模型到今天,神经网络的故事始终围绕一个核心信念——"简单单元的大量连接产生智能"。这个信念在80年里被反复质疑、反复验证,最终改变了世界。未来的AI无论长什么样,大概率依然建立在这个信念之上。

十一、本章术语速查

术语 一句话解释
MP模型第一个神经元的数学模型,像"加权投票器",证明神经网络可用数学描述
感知机第一个能学习的神经网络,通过调整权重画线分开两类数据
XOR问题对角线上的点无法用一条直线分开,单层感知机的"死穴",导致第一次寒冬
反向传播从输出端误差往回追责调整权重,像工厂质检追溯——从成品缺陷追溯到每道工序
卷积用小窗口在图片上滑动提取局部特征,像拿放大镜扫描照片
残差连接在网络中修一条"高速公路"让信息跳过某些层直接传递,解决梯度消失,网络做到上百层
LSTM长短期记忆网络,用三个"门"(遗忘门、输入门、输出门)控制记忆的保留和遗忘
Transformer完全用注意力机制、抛弃循环结构的架构,并行友好、捕捉长距离依赖、可扩展性强
Self-Attention序列中每个位置都和其他所有位置计算关联,像开会时每个人都能看到所有人
预训练先"广泛阅读"海量文本打基础,再"专项微调"做任务,像先读万卷书再考科举
BERT双向预训练模型,同时从左右两个方向理解文本,遮词猜词训练法
GPT单向预训练模型,从左到右预测下一个词,擅长生成,越做越大越强(Scaling Law)
RLHF用人类反馈训练AI"说人话",先学人类偏好,再用强化学习优化
MoE混合专家模型,多个专家各管一摊,每次只激活最合适的几个,像大医院分诊
多模态让AI不只处理文字,还能处理图像、音频、视频,不同模态在向量空间中"对齐"
RNN(循环神经网络)擅长处理序列数据的网络,像读长文时记得前面说过啥
LeNet1998年诞生的第一个实用CNN,用来识别手写数字
VGG2014年的经典CNN,特点是层数很深、结构简洁
Seq2Seq编码器-解码器结构,把输入编码成向量再解码成输出,常用于翻译
SNN(脉冲神经网络)模仿大脑神经元放电方式的网络,更接近生物大脑的工作方式
CNN(卷积神经网络)识图专家,通过"滑动窗口"提取图像中的特征,看照片找猫就靠它
GRULSTM的简化版,把三个门减成两个,效果相当但更省算力
多头注意力同时做多次注意力计算,像几个人从不同角度读同一段话,理解更全面
稀疏激活MoE等架构只激活一小部分参数,总参数量大但算得少,又大又省
Scaling Law"规模定律":模型越大、数据越多、算力越足,能力往往越强
涌现能力模型大到一定程度突然"冒出"没专门训练过的能力,如GPT-3会写代码
梯度消失误差信号一层层传回去时越来越小,导致深层网络训不动,残差连接来解救

本章小结

🎯
三句话记住本章

神经网络三次崛起、两次衰落,是一部关于坚持与反转的传奇——从1943年MP模型到2017年Transformer,"简单单元的大量连接产生智能"的信念被反复验证。

反向传播解决了多层网络训练难题,残差连接打破了深度瓶颈,Transformer用注意力机制取代循环结构——每一次突破都让AI前进一大步

MoE稀疏激活大幅降低成本,多模态让AI"能看能听",大模型从"越大越贵"走向"大而精",下一个突破可能就在神经符号融合或世界模型中。

  1. MP模型(1943):第一个神经元的数学模型,用"加权投票"模拟神经元,证明神经网络可用数学描述。一切故事的起点。
  2. 感知机(1958):第一个能学习的神经网络,证明了"机器学习"可行。Mark I Perceptron是第一台神经网络硬件。媒体过度乐观埋下隐患。
  3. 第一次寒冬(1969—1986):明斯基指出感知机解不了XOR,神经网络被边缘化近17年。辛顿等人在寒冬中坚持,为复兴埋下种子。
  4. 反向传播(1986):用链式法则解决多层网络训练难题,神经网络第二春。但受限于算力和数据,只能做浅层网络,再次被SVM等方法超越。
  5. 卷积神经网络(1989—2015):从生物视觉"偷师",LeNet识别邮编,AlexNet用GPU横扫ImageNet(2012),ResNet残差连接做到152层。CNN让AI"看"懂世界。
  6. 循环神经网络(1986—2017):RNN处理序列数据,LSTM用三个"门"解决长期记忆问题,Seq2Seq革新机器翻译。但无法并行的局限导致被Transformer取代。
  7. Transformer(2017):完全用注意力机制,抛弃循环结构。并行计算友好、能捕捉长距离依赖、可扩展性强,成为所有大模型的基础架构。
  8. 预训练革命(2018—2022):BERT双向理解语言,GPT系列验证Scaling Law,ChatGPT用RLHF让AI"说人话",引爆全球AI浪潮。
  9. 大模型架构演进(2022—2026):MoE稀疏激活大幅降低成本,DeepSeek V3以1/10参数实现GPT-4级性能;多模态让AI"能看能听";高效注意力支持百万级上下文。
  10. 未来方向:神经符号融合(学习+推理)、脉冲神经网络(更低功耗)、世界模型(理解物理世界)——下一代突破可能就在其中。

神经网络的传奇讲完了。从MP模型到Transformer,从感知机到ChatGPT——这些技术最终都要变成人们日常使用的产品。下一章,我们将走进AI产品的演化,看看从1966年ELIZA到2025年AI Agent,AI产品是如何从"玩具"变成"工具"再变成"同事"的。

"简单单元的大量连接产生智能"——这个80年前写下的信念,经历了两次寒冬、三次崛起,最终改变了世界。神经网络的故事告诉我们:正确的理论不一定立刻被接受,但只要有人坚持,时间会给出答案。