中国与AI发展史 🌱 轻松
上一节我们看到了互联网技术与开源运动如何为AI的爆发铺好土壤。讲AI的历史,不能只讲欧美——从几千年前中国的数理思想,到今天华人科学家撑起AI半壁江山,中国人和中国文化与AI的渊源,远比大多数人想象的更深。这一节,我们从思想根源、科学家贡献、产业发展三个维度,讲述中国与AI的不解之缘。
一、思想远源:八卦与二进制的千年回响
现代计算机的根基是二进制——只用0和1两个符号,就能表示一切信息。文字、图片、音乐、视频,在计算机内部统统变成0和1的排列组合。没有二进制,就没有现代计算机,也就没有今天的AI。而二进制的思想源头之一,可以追溯到几千年前的中国古代《易经》。
《易经》用两个最基本的符号来描述世界:阴爻(- -)和阳爻(—)。这两个符号通过不同的排列组合,演化出八卦(三个爻一组),再进一步组合成六十四卦(六个爻一组),用来描述万事万物的变化规律。如果你把阳爻看作1、阴爻看作0,那么八卦正好对应000到111的八个二进制数——从0到7。六十四卦则对应0到63的二进制数。这本质上就是一套二进制系统。
莱布尼茨与伏羲八卦
1703年,德国数学家莱布尼茨(Gottfried Wilhelm Leibniz)发表了二进制算术的论文。在此之前,他与在中国传教的法国耶稣会传教士白晋(Joachim Bouvet)保持着密切通信。白晋向莱布尼茨寄来了中国伏羲先天八卦图,莱布尼茨惊讶地发现:八卦的排列顺序与二进制完全吻合。他在论文中专门探讨了二进制与"古代中国伏羲图"的关系。
莱布尼茨这篇论文的全名是:《关于仅用0与1两个符号的二进制算术的说明,并附其应用以及据此解释古代中国伏羲图的探讨》。注意论文标题的后半部分——他明确将二进制与中国伏羲八卦联系在一起。莱布尼茨惊叹于中国人在数千年前就已掌握了二进制的思想,对中国文化推崇备至。这篇论文被记入了《法国科学院学报》,成为东西方数理思想交流的一段佳话。没有二进制,就没有现代计算机;而二进制的思想源头之一,就在中国。
算盘与机械化算法
除了《易经》,中国古代还有其他与计算相关的智慧遗产。中国的算盘被认为是最早的机械计算工具之一——用珠子在档杆上的位置来表示数字,通过拨珠来完成加减乘除。它体现了一个朴素但深刻的理念:用机械代替脑力来执行计算,这与后来计算机的核心思想一脉相承。
中国古代数学中还有丰富的机械化算法思想。比如解线性方程组的"消元法"(高斯消元法的雏形),其步骤就非常"程序化"——按固定规则一步步操作,就能得到结果。这种"用一套明确的步骤自动求解问题"的思路,与今天AI中"用算法自动处理数据"的精神,有着深层的精神共鸣。
需要客观指出:八卦与二进制的关联,是中国古代数理思想对世界的一次重要启发,但不能简单地由此推出"AI起源于中国"。现代AI是全球众多科学家——从图灵到辛顿、从麦卡锡到李飞飞——共同创造的成果,是全人类智慧的结晶。我们尊重历史、为祖先的智慧感到自豪,同时也要脚踏实地做出今天的贡献。真正的文化自信,不是躺在过去的功劳簿上,而是把先人的智慧转化为今天的创造力。
二、华人科学家:AI发展的中坚力量
如果说古代中国的贡献是思想启发,那现代华人科学家则是实打实地撑起了AI的半壁江山。从数据集到算法、从框架到芯片,华人科学家的贡献贯穿了AI发展的每一个关键环节。这不是夸张的赞美,而是有数据和事实支撑的判断。
更令人震撼的是数据。据美国智库MacroPolo和保尔森基金会的追踪研究:
- 美国顶尖AI研究者中,超过38%本科毕业于中国高校——这个比例甚至高于美国本土的37%;
- 2025年NeurIPS(AI领域顶级会议)论文作者本科毕业院校前十名中,有9所是中国高校;
- 在OpenAI、Meta、Google、xAI等美国AI巨头的核心技术团队中,华人占比普遍在35%—64%之间。
这些数据说明了一个事实:华人不只是AI的"参与者",而是AI核心技术突破的主力贡献者。从数据(李飞飞的ImageNet)到算法(何恺明的ResNet),从工具(贾扬清的Caffe)到算力(黄仁勋的NVIDIA),从教育(吴恩达的Coursera)到应用(杨植麟的Kimi),华人科学家的贡献覆盖了AI生态的每一个关键层。
第一,扎实的数理功底:中国基础教育重视数学训练,奥数金牌选手中约30%后来进入了AI领域,为AI研究提供了顶尖的数学人才储备。第二,强工程落地能力:华人研究者在分布式训练、系统优化、大规模工程化等"苦活累活"中表现出色——华人团队主导的稀疏激活架构和混合精度训练,使DeepSeek V3以1/10成本实现GPT-4级性能。第三,学术传承效应:李飞飞、何恺明等前辈持续提携后辈,形成了"老带新"的良性循环,让华人AI人才越来越多、越来越强。
三、中国AI产业的发展脉络
起步与追赶(1980s—2010s)
上世纪80年代,中国开始了AI研究。清华大学张钹院士等先驱在条件艰苦的情况下奠定了中国AI研究的学术基础。那时的中国AI,与世界前沿有较大差距——算力有限、数据匮乏、国际交流不多,但种子已经种下。
真正的转折发生在2010年代。互联网爆发带来了海量中文数据,一批顶尖华人学者归国或与国内开展密切合作,国内的AI论文数量和质量快速上升。语音识别(科大讯飞)和计算机视觉(商汤、旷视)率先突围——这两个领域恰好是深度学习最早取得突破的方向,中国企业抓住了机遇。
清华大学张钹院士等先驱开展AI研究,奠定学术基础。条件艰苦但方向明确。
MSRA在北京成立,后来培养了大批顶尖AI人才,被誉为中国AI的"黄埔军校"。很多日后影响全球AI的华人科学家,都曾在MSRA工作或实习。
科大讯飞在语音识别领域崛起,商汤、旷视在计算机视觉领域崭露头角。中国AI在感知智能方向实现了从跟跑到并跑。
AlphaGo战胜李世石,中国社会对AI的热情被彻底点燃。政策、资本、人才大量涌入,AI成为最热门的赛道。
应用爆发(2016—2022)
AlphaGo之后,中国社会对AI的热情被彻底点燃。政策层面将AI上升为国家战略,资本疯狂涌入,大批人才从互联网行业转战AI。AI在安防、金融、教育、零售、医疗等领域遍地开花——你可能已经在小区门口见过人脸识别闸机,在银行用过智能客服,在电商App上体验过智能推荐,这些都是这一波AI应用落地的成果。
微软亚洲研究院(MSRA)在中国AI发展中扮演了特殊角色。它被誉为中国AI的"黄埔军校"——很多后来影响中国乃至全球AI格局的人物,如何恺明、孙剑、贾扬清等,都曾在MSRA工作或实习。MSRA不仅产出研究成果,更重要的是培养了一大批AI人才,这些人后来散布到各大公司和研究机构,成为中国AI的中坚力量。
这一阶段,中国AI的优势逐渐清晰:应用落地快、数据规模大、场景丰富。一个新技术出来,中国团队能迅速在千行百业里试出来、跑起来。这种"接地气"的落地速度,是中国AI最独特的竞争力。
大模型时代与全面崛起(2023—2025)
ChatGPT引爆大模型浪潮后,中国迅速跟上。一批国产大模型如雨后春笋般涌现:百度文心、阿里通义千问、智谱源自清华的AI创业公司GLM、月之暗面一家2023年成立的北京AI创业公司Kimi、DeepSeek深度求索公司出品,2025年开源R1震动全球、字节豆包、腾讯混元、华为盘古、科大讯飞星火、商汤日日新、MiniMax由前商汤副总裁闫俊杰创立、阶跃星辰由前微软全球副总裁姜大昕创立……形成了"百模大战"的壮观局面。据不完全统计,截至2025年底,中国已发布大模型超过1500个,占全球总数的近40%。
为帮助读者形成清晰认知,下面按厂商逐一介绍截至2025年12月31日各家的最新模型版本、类型、用途及开源情况。
| 厂商 | 旗舰模型 | 类型 | 开源 | 核心优势 |
|---|---|---|---|---|
| 深度求索 | DeepSeek-V3.2 / R1 | 通用+推理 | ✅ MIT | 极致性价比,代码数学顶尖 |
| 阿里巴巴 | 通义千问 Qwen3 | 通用+多模态 | ✅ Apache 2.0 | 开源生态最完善,全尺寸覆盖 |
| 百度 | 文心 ERNIE 4.5 | 通用+多模态 | ✅ Apache 2.0 | 知识增强,中文理解领先 |
| 智谱AI | GLM-4.5 | 通用+智能体 | ✅ MIT | Agent能力突出,学术背景 |
| 月之暗面 | Kimi K2 | 通用+长文本 | ❌ 闭源 | 超长上下文,文档理解之王 |
| 字节跳动 | 豆包 Doubao 1.6 | 通用+多模态 | ❌ 闭源 | 用户量最大,C端体验最佳 |
| 腾讯 | 混元 Hunyuan | 通用+多模态 | ✅ 部分 | 社交生态集成,3D/视频生成 |
| 华为 | 盘古 Pangu 5.5 | 工业+通用 | ✅ 部分 | 全栈国产化,昇腾芯片适配 |
| 科大讯飞 | 星火 Spark V4.5 | 通用+语音 | ❌ 闭源 | 语音交互最强,教育深耕 |
| 商汤科技 | 日日新 SenseNova V6 | 多模态 | ❌ 闭源 | 计算机视觉领先,多模态融合 |
| MiniMax | M2.5 | 通用+多模态 | ❌ 闭源 | 高性价比,情感陪伴特色 |
| 阶跃星辰 | Step-3 | 多模态 | ✅ 部分 | 原生多模态推理 |
各家模型详细介绍
1. DeepSeek(深度求索)——国产开源标杆,性价比之王
深度求索由量化投资机构幻方量化孵化,创始人梁文锋。2024年12月发布DeepSeek-V3(671B参数,激活37B,MoE架构),2025年1月发布推理模型DeepSeek-R1,引发全球"DeepSeek时刻"。R1在数学、代码、自然语言推理上比肩OpenAI o1,训练成本仅约557.6万美元。5月更新R1-0528版本,编程能力达到国际一线水平。8月发布V3.1,首创混合推理架构(一个模型同时支持思考与非思考模式)。9月发布V3.2-Exp,引入稀疏Attention架构降低推理消耗。12月正式发布V3.2和V3.2-Speciale(长思考增强版)。此外还有垂直模型:DeepSeek-Coder(代码专用)、DeepSeek-Math(数学专用)、DeepSeek-VL(多模态视觉理解)。全部开源(MIT许可),允许免费商用,API价格仅为GPT-4o的约1/12,是全球最具性价比的开源大模型体系。
2. 通义千问 Qwen(阿里巴巴)——开源生态最完善,全尺寸覆盖
阿里云/通义实验室出品,2023年首次发布。2025年迭代至Qwen3系列,覆盖从0.6B到110B+的全尺寸参数,支持119种语言。旗舰版Qwen3-Max在多项国际评测中与GPT-4o、Claude性能接近;Qwen3-Coder在编程榜单上与DeepSeek并列第一。多模态方面有Qwen-VL(视觉理解)、Qwen-Audio(语音)、Qwen-Omni(全模态实时交互)。视频生成模型万相Wan2.1/2.2在电商场景转化率提升显著。全系列开源(Apache 2.0),在HuggingFace趋势榜上阿里一家就贡献了18个上榜模型,全球下载量超10亿次,是海外影响力最大的中国开源模型。依托阿里云服务超10万家企业,日均调用量破百亿次。
3. 文心一言 ERNIE(百度)——知识增强,中文理解领先
百度2019年启动文心大模型研发,是国内最早的大模型体系。2023年3月发布文心一言,2023年10月迭代至ERNIE 4.0。2025年3月发布ERNIE 4.5和深度思考模型ERNIE X1,4月发布4.5 Turbo。6月30日,百度正式开源ERNIE 4.5全系列——一次性开放10款模型(从0.3B端侧到424B旗舰),采用Apache 2.0协议,覆盖预训练基座、指令微调、深度思考、多模态四大类。旗舰ERNIE-4.5-300B-A47B在28项基准测试中22项超越DeepSeek-V3。9月发布ERNIE X1.1,11月开源多模态模型ERNIE-4.5-VL-28B-A3B-Thinking(仅3B激活参数,性能媲美顶级模型)。文心日均调用量超15亿次,深度对接百度搜索知识库,在中文语义理解、知识问答、公文写作等场景优势明显,已与65%央企达成合作。
4. 智谱GLM(智谱AI)——清华背景,Agent能力突出
智谱AI源自清华大学知识工程实验室,是国内最早做大模型的创业公司之一。基于自研GLM(General Language Model)架构,2024年7月发布GLM-4.5开源模型(MIT许可),专为智能体(Agent)应用打造。2025年持续迭代GLM-4-Plus(闭源旗舰)、GLM-4-Flash(免费API)、GLM-4-Long(长文本)。其AutoGLM系列能自主执行超过50步的复杂跨应用任务,是国内Agent能力的标杆。在编程榜单上,GLM跻身全球前列。2025年初,智谱在港交所挂牌上市,成为"全球大模型第一股"。智谱坚持"摸高+筑路"双线战略:既做顶尖闭源模型,也积极开源让所有人方便使用。
5. Kimi(月之暗面)——超长上下文,文档理解之王
月之暗面(Moonshot AI)由清华大学杨植麟创立,2023年推出Kimi智能助手。2025年发布Kimi K2模型(约1万亿总参数,320亿激活,MoE架构),采用自研Linear架构,推理速度提升6倍。K2支持200万字无损上下文——是全球上下文窗口最长的大模型之一。在论文阅读、合同审核、长报告分析等场景中表现出碾压式效率。Kimi在苹果中美应用商店曾登顶下载榜。2025年下半年,Kimi K2.5版本进一步提升编程和视觉理解能力。闭源,通过App和API提供服务,基础版免费,Pro版45元/月。
6. 豆包 Doubao(字节跳动)——用户量最大,C端体验最佳
字节跳动旗下大模型产品,底层为自研Seed大模型。2025年迭代至豆包1.5/1.6系列,采用稀疏MoE架构,以200亿参数实现接近1400亿稠密模型的性能,综合成本仅为国际主流模型的1/50。支持图像生成、视频生成、数据分析、编程、翻译、音乐生成、AI播客、PPT生成等多种功能。闭源,但API定价极低,编程模型成本比行业平均水平低62.7%。依托抖音、今日头条等超级APP,豆包月活用户超3亿(截至2025年底),是全球用户量最大的AI原生应用之一。火山引擎企业级Agent平台日均Token调用量突破180万亿。字节还推出了视频生成模型Seedance和即梦AI创作平台。
7. 混元 Hunyuan(腾讯)——社交生态集成,3D/视频生成
腾讯全链路自研的万亿参数大模型,采用MoE架构。2024年11月开源混元Large(389B参数,52B激活),是当时开源领域参数规模最大的MoE模型。2025年6月开源混合推理模型Hunyuan-A13B(80B总参数,13B激活),支持单张中低端GPU运行。同时开源了混元3D 2.1(工业级3D生成大模型)和混元视频生成大模型(130亿参数,当时最大的视频开源模型)。闭源方面有混元Turbo S(秒级响应)、混元T1(深度思考)。混元深度集成微信、QQ、腾讯会议等亿级产品,支持256K上下文。腾讯云TI平台支持混元、DeepSeek、Llama等多模型一键调用,已落地零售、医疗、教育等20余个行业。部分开源。
8. 盘古 Pangu(华为)——全栈国产化,工业场景之王
华为盘古大模型主打"不做诗只做事",聚焦工业、气象、矿山、政务等B端场景。2025年6月发布盘古5.5,其中718B参数Ultra MoE架构跻身知识推理第一梯队,创新自适应快慢思考融合技术使推理效率提升8倍。同月,华为首次开源盘古大模型体系,含70亿参数稠密模型与720亿参数MoE模型,配套昇腾推理技术体系。盘古大模型最大的差异化优势是全栈国产化——从昇腾NPU芯片到MindSpore框架再到模型,软硬完全自主可控。在宝武钢铁的应用中,通过生产数据实时建模将冷轧板厚度误差控制在±0.8微米,年增收益超15亿元。部分开源(2025年6月起)。
9. 星火 Spark(科大讯飞)——语音交互最强,教育深耕
科大讯飞出品的认知智能大模型,2025年迭代至星火V4.0 Turbo / V4.5,支持202种方言识别,语音转写准确率达98.5%。在语音交互和中英文混合识别方面处于行业标杆地位。聚焦教育、医疗、政务等垂直领域,智慧课堂应用使学生重复错误率下降37%。提供本地化部署版本,支持Windows、Linux、Android及国产操作系统,面向隐私敏感和无网场景。闭源,但提供Lite版永久免费API,APP下载量超2亿。
10. 日日新 SenseNova(商汤科技)——计算机视觉领先,多模态融合
商汤科技旗下大模型,2025年迭代至SenseNova V6/V6.5,采用MoE架构实现文本、图像、音频、视频的原生统一处理,纯文本推理对标GPT-4.5。在SuperCLUE评测中,V6多模态能力超越GPT-4o和Gemini 2.5 Flash,性价比提升5倍。商汤在计算机视觉领域深耕多年,图像理解、视觉问答能力突出,其万象平台提供包括DeepSeek在内的几百种开源大模型一键部署服务。闭源。
11. MiniMax(稀宇科技)——高性价比,情感陪伴特色
MiniMax由前商汤副总裁闫俊杰创立,主打多模态与对话能力。2025年推出M2.5版本,以高性价比和高效推理著称。旗下"海螺AI"产品在情感陪伴和角色扮演场景对年轻用户吸引力强。支持1M上下文,编程能力在国产模型中位居前列。提供企业级应用与开发者集成。闭源,但API价格极低。
12. 阶跃星辰 Step——原生多模态推理
由前微软全球副总裁姜大昕创立,2025年发布Step-3系列,在原生多模态推理方面表现突出,在MMMU等榜单达到SOTA水平。开源部分模型(Apache 2.0协议),支持国产芯片高效推理。聚焦多模态和搜索场景。
除了以上十二家主力厂商,中国大模型生态中还有百川智能(Baichuan系列,开源)、零一万物(Yi系列,李开复创立,开源)、昆仑万维天工(Skywork,AI搜索)、上海AI实验室书生(Intern系列,学术开源)、小米MiMo(端侧开源)等众多参与者,共同构成了"百模大战"的壮观局面。
截至2025年底,国产大模型已形成清晰的竞争梯队:第一梯队(综合性能与国际顶尖模型接近)——DeepSeek V3/R1、通义千问Qwen3-Max、豆包Doubao 1.6,在SuperCLUE评测中位居国内前三。第二梯队(各有专长)——Kimi K2(长文本之王)、智谱GLM-4.5(Agent标杆)、文心ERNIE 4.5(中文知识增强)、混元Hunyuan(社交+3D+视频)、盘古Pangu 5.5(工业国产化)。特色梯队——星火(语音教育)、日日新(视觉多模态)、MiniMax(情感陪伴)、阶跃星辰(原生多模态)。中美AI综合实力分差已从2023年的22.02分收窄至2025年的17.95分,差距持续缩小。
前瞻到了2026年,几个标志性进展格外亮眼:
- 首个全国产10万卡AI超集群投用,全部采用国产昇腾芯片,意味着中国在算力自主上迈出关键一步;
- 国产大模型全球下载量突破100亿次,影响力辐射海外,不再只是"国内用";
- 智源研究院发布全球首个通用世界基座模型"悟界·Physis-v0.1",让AI开始理解物理世界的运行规律;
- 中国成为全球AI专利最大拥有国,占比达60%,生成式AI专利是美国的6倍;
- 中国AI行业保持30%以上高增长,成为经济新引擎;
- 人工智能法立法进程提速,AI治理从讨论走向落地。
中国AI的竞争力,不只在于技术本身,更在于丰富的应用场景 + 海量数据 + 强大的工程能力 + 完整的产业链。一个新模型出来,中国团队能快速在千行百业里试出来、跑起来,这种"接地气"的落地速度,是独特的优势。DeepSeek的成功就是明证:用更少的算力做更好的模型,靠的不是运气,而是极致的工程优化能力。中国AI正在从"跟跑"走向"并跑",并在部分领域开始"领跑"。
四、中国AI政策与战略
中国是全球最早将AI上升为国家战略的大国之一。2017年,国务院发布《新一代人工智能发展规划》,提出了著名的"三步走"战略:2020年AI总体技术和应用与世界先进水平同步,2025年AI基础理论实现重大突破,2030年AI理论、技术与应用总体达到世界领先水平。
此后,AI被纳入"新基建"重点领域,"东数西算"工程启动——把东部的数据计算需求引导到西部资源丰富的地区,既解决了算力分布问题,又利用了西部的可再生能源。这一系列政策构成了中国AI发展的顶层设计。
在AI治理方面,中国也走在前列。从《算法推荐管理规定》到《生成式AI服务管理办法》,中国率先对AI应用进行系统性的法律规范,试图在促进创新和防范风险之间找到平衡。
| 年份 | 政策/事件 | 意义 |
|---|---|---|
| 2017 | 《新一代人工智能发展规划》 | AI上升为国家战略,提出"三步走"目标 |
| 2020 | AI纳入"新基建" | AI基础设施成为国家重点投资方向 |
| 2022 | "东数西算"工程全面启动 | 优化算力资源配置,构建全国一体化算力网络 |
| 2023 | 《生成式AI服务管理办法》 | 全球首批针对生成式AI的监管法规之一 |
| 2025—2026 | 前瞻人工智能法立法进程提速 | 从部门规章走向综合性法律,AI治理体系日趋完善 |
政策的影响是双向的。一方面,国家战略层面的重视带来了大量资源投入——资金、土地、人才政策都向AI倾斜,加速了产业发展。另一方面,监管法规的完善也在塑造AI发展的边界——既要让AI创新跑得快,也要防止它跑偏。中国的做法是"边发展边规范",这与其他国家的路径有所不同。效果如何,还需要时间检验,但不可否认的是,政策在中国AI的快速崛起中扮演了重要角色。
五、中国AI教育体系
AI竞争归根到底是人才竞争。中国在AI人才培养上的投入力度,在全球范围内都是罕见的。
2019年,教育部批准首批35所高校设立人工智能本科专业,标志着AI正式成为中国高等教育的一级学科方向。此后几年,开设AI专业的高校数量快速增长,目前已超过500所。中国每年AI相关专业的毕业生数量全球第一——这为中国AI产业提供了源源不断的人才供给。
在线教育同样功不可没。吴恩达在Coursera上的机器学习课程,影响了全球数百万学习者;台湾大学李宏毅教授的深度学习课程,以通俗易懂的中文讲解和幽默风格,成为华语世界最受欢迎的AI课程之一。这些在线课程打破了地域限制,让任何有网络的人都能学到最前沿的AI知识。
在基础教育层面,编程教育正在走进中小学。Scratch、Python等编程工具被引入课堂,一些学校开设了AI启蒙课程,让孩子们从小就接触计算思维。人才的竞争从大学延伸到了中小学——今天的编程课,可能就是明天的AI科学家。
六、中国AI开源贡献
开源是AI发展的重要驱动力。在开源领域,中国的贡献正在快速增强——从模型到工具链,中国力量正在改变全球AI开源的版图。
ModelScope(魔搭)是阿里达摩院推出的AI模型社区,被称为"中国版Hugging Face"。它汇聚了大量开源AI模型,让开发者可以一键下载、部署和使用。 OpenBMB是智源研究院主导的开源大模型工具链,帮助开发者更高效地训练和部署大模型。
而在所有中国开源贡献中,最具震撼力的,无疑是2025年1月DeepSeek R1的发布与开源。这一事件被全球媒体称为"DeepSeek时刻"(DeepSeek Moment),它对以美国为首的西方AI产业和学术界造成的冲击,用"地震"来形容毫不为过。
"DeepSeek时刻":一场撼动硅谷的地震
真实2025年1月20日, DeepSeek发布开源推理模型R1。在多个第三方基准测试中,R1的性能超越或持平OpenAI当时最先进的o1模型——而o1是OpenAI投入数十亿美元、动用数万张顶级GPU才训练出来的"旗舰"。更令西方震惊的是成本:DeepSeek公开V3基础模型的训练仅花费约560万美元,使用约2000张因美国出口管制而降级的H800芯片。作为对比,OpenAI的合作伙伴微软同年计划在AI基础设施上投入约800亿美元,Meta宣布全年AI投入高达650亿美元,特朗普政府刚宣布的"星际之门"项目更是豪掷5000亿美元。DeepSeek用不到美国巨头千分之一的投入,做出了同级水平的模型——这直接动摇了硅谷"大力出奇迹"(Scaling Law即正义)的发展范式叙事。
市场反应来得猛烈而直接。1月27日,DeepSeek登顶苹果中美两国应用商店免费下载榜首,超越ChatGPT。当天,英伟达股价暴跌近17%,单日市值蒸发约5890亿美元——创下美国股市历史上单日市值蒸发最高纪录。谷歌母公司损失约1000亿美元市值,与算力相关的电力公司股价普遍下跌超过20%。整个美国科技板块在数日内蒸发近1万亿美元市值。英国《金融时报》用"斯普特尼克时刻"(Sputnik Moment)来形容这一冲击——这是冷战时期苏联抢先发射人类首颗人造卫星后,美国社会陷入的集体震撼与危机感。
1957年10月,苏联率先发射人类首颗人造地球卫星"斯普特尼克1号",消息传到美国,举国震惊——美国人第一次意识到,自己引以为傲的科技霸权可能被超越。这种由外部冲击引发的集体危机感和奋起追赶的决心,被称为"斯普特尼克时刻"。2025年1月,美国硅谷风投教父马克·安德森(Marc Andreessen)在社交媒体上率先将DeepSeek R1的发布称为"AI的斯普特尼克时刻",随后美国参议院民主党领袖舒默、《华盛顿邮报》《纽约客》等纷纷引用这一说法。一个中国开源模型,被美国精英阶层比作当年苏联卫星升空的冲击——这在AI历史上前所未有。
硅谷巨头的集体震荡
DeepSeek R1引发的不仅是股价暴跌,更是对整个西方AI产业发展模式的根本性质疑。美国总统特朗普公开表示,DeepSeek应该成为"美国行业的警钟,我们需要全力以赴,专注于竞争以取得胜利"。OpenAI CEO山姆·奥特曼罕见地在社交媒体上承认R1"令人印象深刻,尤其是在他们能够以这样低的价格提供产品方面",同时强调"拥有新的竞争对手是一件令人振奋的事情"——但背后是OpenAI紧急调查DeepSeek是否"不当使用"其模型的焦虑。Anthropic联合创始人达里奥·阿莫迪撰文称这背后是"范式的改变"——DeepSeek摒弃了依赖人工标注反馈的传统路线,设计算法让模型自主识别和纠正错误,实现了推理能力的自进化。
更深层的冲击在于:DeepSeek用事实证明,在芯片被限制供应的条件下,凭借算法创新和工程效率,照样能做出世界级模型。美国长期以来以国家安全为由限制向中国出口高端AI芯片(A100、H100),本意是卡住中国AI的"算力脖子"。结果DeepSeek用降级版H800芯片+创新的MoE(混合专家)架构+多头潜在注意力机制,实现了与顶级模型比肩的性能。这等于告诉全世界:美国的芯片封锁非但没有锁死中国AI,反而倒逼出了更高效的算法路线。对冲基金Elliott Management在致投资者通知中直言,AI被"过度炒作",英伟达正处于"泡沫"之中——DeepSeek成了刺破这一泡沫的那根针。
学术界的范式反思
DeepSeek R1对西方AI学术界的冲击同样深远。自GPT-3以来,AI领域的主导范式是"Scaling Law"——只要把模型做得更大、数据喂得更多、算力堆得更猛,性能就会持续提升。这条路线由OpenAI开创,被Google、Meta、Anthropic等巨头奉为圭臬,也成为了数万亿美元投资计划的逻辑基础。而DeepSeek R1的发布,迫使学术界开始严肃思考一个此前被边缘化的问题:除了暴力堆算力,是否还有更聪明的路径?
R1的核心创新——纯强化学习驱动的推理能力涌现(无需人类示范数据,模型通过自我博弈学会"思考")、思维链推理(Chain-of-Thought,模型在给出答案前先"想"一遍)——为整个学术界打开了新方向。R1开源后,全球研究者争相复现和改进其方法,Hugging Face上涌现出数十个基于R1的衍生模型。Anthropic联合创始人杰克·克拉克直言:"现在互联网上出现了一个开放权重的模型,任何足够强大的基础模型都可以通过它引导成为一个AI推理器。"这意味着DeepSeek不只是提供了一个模型,更是提供了一套可被全世界复用和改进的方法论——这才是开源最深远的力量。
第一重:成本震撼——560万美元做出数十亿美元级别的模型,颠覆了"AI只有巨头玩得起"的认知。第二重:技术震撼——在芯片被封锁的条件下,用算法创新弥补算力劣势,证明了"穷则思变"的工程智慧。第三重:路线震撼——开源R1让全世界免费获得顶尖推理能力,直接挑战了闭源巨头通过API收费的商业模式。三重震撼叠加,让DeepSeek时刻成为AI发展史上一个真正的分水岭:它标志着中国AI从"跟随者"转变为"规则制定者"之一,全球AI格局从"美国单极"走向"中美双极"。
在Hugging Face等国际平台上,中国开发者和机构的活跃度持续攀升。DeepSeek、阿里Qwen、智谱GLM等开源模型的全球下载量屡创新高。一个耐人寻味的现象是:当美国通过芯片禁令试图限制中国AI发展时,中国反而通过开源向全世界输出了AI能力——封锁没能阻止创新,开源却加速了扩散。这或许是DeepSeek时刻留给世界最深刻的启示。
开源路线
- 模型权重和代码公开,任何人都能使用和改进
- 加速全行业进步,降低AI使用门槛
- 社区协作,集思广益
- 代表:DeepSeek、Meta Llama、阿里Qwen
- 商业模式靠服务、定制化、生态
闭源路线
- 模型不公开,通过API提供服务
- 保护核心技术,商业壁垒高
- 质量控制严格,体验一致
- 代表:OpenAI GPT、Anthropic Claude
- 商业模式靠API调用费、订阅
开源让AI不再是少数巨头的专利。一个非洲的学生,一台普通的电脑,就能下载DeepSeek或Qwen的开源模型,在自己的机器上跑起来、改起来。这种AI民主化的意义是深远的——它让全球每个角落的人都有机会参与AI创新,而不只是被动消费AI服务。中国在开源方向的积极贡献,正在让更多人受益于AI技术。DeepSeek R1的开源就是一个标志性事件:它证明了低成本也能做出顶尖模型,而且愿意把成果分享给全世界。
七、"在美国的中国人"与"在中国的中国人":双引擎驱动AGI
华人科学家在全球AI领域的分布,呈现出一个独特的格局:两个群体——在美国工作和在中国工作的华人科学家——同时活跃在AI最前沿,形成了推动AGI(通用人工智能)到来的"双引擎"。
在美国的华人科学家,拥有顶尖的算力资源、成熟的学术生态和全球化的平台。他们在OpenAI、Google、Meta、NVIDIA等机构的核心技术团队中扮演关键角色,贡献了从Transformer架构到ResNet、从ImageNet到CUDA的全链条创新。
在中国的华人科学家,则拥有丰富的应用场景、海量的数据和强大的工程能力。他们在国产大模型、AI芯片、开源社区等方向快速推进,DeepSeek、通义千问、昇腾芯片等成果正在改变全球AI格局。
近年来,人才流动的趋势也在发生变化。过去几十年是"出国潮"——中国最优秀的AI人才大量流向美国硅谷。但近年来越来越多的顶尖学者选择归国,或者在中美之间建立桥梁。"归国潮"的背后,既有中国AI产业快速崛起带来的吸引力,也有国际环境变化的推动。两个群体之间的交流与合作,正在加速AI的整体进步。
两个群体的协作互补性极强:在美国的群体更接近基础研究和前沿算法,在中国的群体更擅长工程落地和规模化应用。当"0到1"的创新与"1到100"的工程化能力结合,AI的发展速度会大幅加快。尽管地缘政治给合作带来了挑战,但科学无国界,人才流动和技术交流的潮流不会轻易逆转。两个群体的共同努力,正在让AGI的到来从"是否可能"变成"何时到来"。也许在未来的某一天,当我们回望AGI诞生的时刻,会发现它是由分布在全球的华人科学家群体共同推动的。
八、本章术语速查
| 术语 | 一句话解释 |
|---|---|
| 二进制 | 只用0和1表示信息,现代计算机的根基,思想源头可追溯到《易经》八卦 |
| ImageNet | 李飞飞创建的大规模图像标注数据集(1500万张图片),深度学习革命的"燃料" |
| ResNet | 何恺明发明的残差网络,解决梯度消失问题,21世纪被引用最多的论文 |
| Caffe | 贾扬清开发的第一个被广泛使用的深度学习框架,定义了框架的基本范式 |
| CUDA | NVIDIA的GPU编程平台,黄仁勋推动GPU从游戏走向AI算力 |
| MSRA | 微软亚洲研究院,中国AI的"黄埔军校",培养了大批顶尖AI人才 |
| DeepSeek | 以极低成本实现顶尖性能的中国大模型,"DeepSeek时刻"震动全球 |
| ModelScope(魔搭) | 阿里达摩院的AI模型开源社区,被称为"中国版Hugging Face" |
| 东数西算 | 将东部算力需求引导到西部电力充足地区的国家工程 |
| 百模大战 | 2023年以来中国大模型密集涌现的竞争格局,截至2025年底超1500个模型 |
| AGI | 通用人工智能,能在各种任务上达到或超越人类水平的AI |
| 开源vs闭源 | AI模型的两种路线,开源公开权重代码,闭源通过API提供服务 |
| DeepSeek时刻 | 2025年1月DeepSeek R1开源引发全球震动,被称为AI领域的"斯普特尼克时刻" |
| ERNIE(文心) | 百度的AI大模型品牌 |
| GLM | 智谱AI的大模型品牌 |
| MiniMax | MiniMax公司的AI大模型品牌 |
| Qwen(通义千问) | 阿里巴巴的AI大模型品牌 |
| Doubao(豆包) | 字节跳动的AI大模型品牌 |
| Hunyuan(混元) | 腾讯的AI大模型品牌 |
| Pangu(盘古) | 华为的AI大模型品牌 |
| SenseNova(日日新) | 商汤科技的AI大模型品牌 |
| Kimi | 月之暗面的AI大模型品牌,以超长上下文著称 |
| 昇腾 | 华为自研的AI芯片与计算平台,是中国算力自主化的核心底座 |
| 斯普特尼克时刻 | 1957年苏联抢先发射人造卫星引发美国危机感;2025年被用来形容DeepSeek震动西方 |
| 新基建 | 2020年起把AI、5G、数据中心等列为国家基础设施重点投资方向 |
| 三步走战略 | 2017年《新一代人工智能发展规划》提出的2020/2025/2030三阶段目标 |
本章小结
中国与AI的渊源从《易经》八卦到当代产业崛起——相传古代数理思想启发莱布尼茨发明二进制,现代华人科学家撑起AI半壁江山。
从李飞飞的ImageNet到何恺明的ResNet,从贾扬清的Caffe到黄仁勋的NVIDIA,华人科学家的贡献贯穿了AI生态的每一个关键层。
DeepSeek以560万美元成本震动全球,引发"斯普特尼克时刻"——中国AI正在从追赶走向引领,从"使用者"变成"贡献者"。
- 思想远源:中国古代《易经》的八卦与莱布尼茨的二进制有深刻的思想关联,算盘是最早的机械计算工具之一。但应客观看待——这是思想启发,不能简单说"AI起源于中国"。
- 华人科学家撑起AI半壁江山:李飞飞(ImageNet)、何恺明(ResNet)、贾扬清(Caffe)、吴恩达(AI教育)、黄仁勋(NVIDIA)、杨植麟(Transformer-XL)等人的贡献贯穿AI发展的每个关键环节。美国顶尖AI研究者中38%本科毕业于中国高校。
- 中国AI产业三阶段:起步追赶(1980s—2010s)→ 应用爆发(2016—2022)→ 大模型时代全面崛起(2023—2026)。MSRA是中国AI的"黄埔军校"。
- 2026年标志性进展:全国产10万卡超集群投用、国产大模型全球下载量破100亿次、悟界·Physis-v0.1发布、AI专利占全球60%、行业保持30%高增长。
- 政策战略:2017年《新一代人工智能发展规划》"三步走",AI纳入新基建,东数西算,生成式AI管理办法,人工智能法立法提速。
- 教育体系:500+高校开设AI专业,毕业生数量全球第一;在线教育(吴恩达、李宏毅)影响数百万人;编程教育进中小学。
- 开源贡献:ModelScope、OpenBMB、DeepSeek R1开源,中国力量正在改变全球AI开源版图。开源推动AI民主化。
- 双引擎驱动:"在美国的中国人"与"在中国的中国人"两个群体协同,从"出国潮"到"归国潮",将加速AGI到来。
中国与AI的故事,是一部从思想源头到当代贡献、从个人成就到产业崛起的恢弘史诗。理解了这段历史,你就会明白:AI不是某一个国家的发明,而是全人类共同的探索,而中国人和华人科学家在其中扮演了不可或缺的角色。第二篇"AI的发展历史"到此结束——下一章开始,我们将进入第三篇:AI的现状,从理论前沿、技术热点到产业落地,全面审视2026年AI的最新面貌。
"科学没有国界,因为知识属于全人类。"AI的未来,需要全球每一个角落的智慧共同点亮。而中国的故事告诉我们:一个民族的复兴,不只在于追赶,更在于为人类文明贡献独特的价值。