互联网技术与开源:AI的土壤与引擎 📘 稍难
上一节我们梳理了AI产品从"玩具"到"同事"的演化历程。但AI不是从石头缝里蹦出来的——没有互联网就没有海量数据,没有云计算就没有弹性算力,没有开源运动就没有AI的民主化。这一节,我们跳出AI本身,回到更大的技术版图:看看互联网软件、硬件基础设施、大数据和开源运动,如何一步步为AI的爆发铺好了路。理解了这条"土壤线",你才能真正理解AI为什么是在2012年爆发,而不是1972年或2032年。
一、总论:AI不是凭空出现的
回顾AI的历史,有一个问题值得深思:神经网络的数学理论在1986年就基本成熟了(反向传播算法),为什么直到2012年才真正爆发?答案不在算法本身,而在"土壤"——互联网技术积累的数据、算力和工具链,直到那时才足够肥沃。
我们可以把AI比作一棵树:算法是种子,数据是水分,算力是阳光,开源是肥料。种子再好,没有水、没有光、没有养分,也长不大。互联网技术就是提供水、光、养分的那片土壤。具体来说,三条线汇聚成了AI爆发的地基:
万维网(WWW)普及,数据开始爆炸式增长。Google、亚马逊、 eBay 成立,互联网公司开始积累海量用户数据。
AWS(2006)开创云计算,Hadoop(2006)解决大数据存储,GPU开始被用于非图形计算。三条线开始汇聚。
AlexNet用GPU训练深度网络,在ImageNet上碾压传统方法。这不是偶然——它是互联网数据、GPU算力、开源框架三条线交汇的必然结果。
TensorFlow(2015)、PyTorch(2016年9月预览、2017年1月正式发布)相继开源,Hugging Face成为AI模型集散地,DeepSeek以开源震动全球。开源让AI从"大公司特权"变成"人人可用"。
二、互联网软件基础设施与AI
互联网软件技术不只是"做网站"——它构建了一整套从数据采集、存储、处理到部署的基础设施,这套设施后来直接被AI"继承"和"复用"。
从Web到数据:互联网是最大的"数据农场"
互联网的本质是信息连接——把全世界的网页、图片、视频、社交关系连在一起。这个过程同时制造了人类历史上最大的数据集。
Google的PageRank算法本质上是"分析网页之间的链接关系"——这已经是早期的图数据处理。淘宝的推荐系统分析"用户—商品"关系,抖音的算法分析"用户—视频"关系。这些互联网应用每天产生PB级数据,为后来的AI模型提供了海量训练素材。没有互联网的"数据农场",就没有ImageNet,没有Common Crawl,没有今天大语言模型赖以训练的万亿token语料。
GPT-4的训练语料约13万亿token,主要来源包括:Common Crawl(互联网网页爬虫,占最大比例)、WebText2(Reddit高质量链接)、Books(书籍语料)、Wikipedia(维基百科)、代码仓库(GitHub)。这些语料全部是互联网时代的产物——没有互联网,就没有这些数据的产生、采集和积累。
云计算:让算力像水电一样流动
2006年,亚马逊推出AWS EC2(弹性计算云),开创了云计算时代。核心思想很简单:算力不再需要自己买服务器,而是像用水用电一样按需租用。这个模式对AI的影响是革命性的。
在云计算出现之前,要做大规模AI实验,你得先花几百万买服务器、建机房、配网络、装系统——还没开始做研究,钱和时间就花掉大半。云计算把这个门槛降到了接近零:研究者用一张信用卡,几分钟就能租到数百台服务器,用完即释放,按小时付费。云计算让"算力"从资本性支出变成了运营性支出,这对学术研究和小公司尤其关键。
到2025年,全球云计算市场规模超6000亿美元,AWS、Azure、Google Cloud三大平台均提供专门的AI训练服务(如AWS SageMaker、Azure ML、Google Vertex AI)。中国的阿里云、华为云、腾讯云也构建了完整的AI算力栈。云计算不只是"租服务器"——它还提供了对象存储(S3)、消息队列(Kafka)、数据仓库(Snowflake)等一整套数据基础设施,这些组件构成了AI训练和部署的"流水线"。
分布式系统:大模型训练的工程基石
训练一个千亿参数的大模型,不是一台机器能完成的——它需要数百甚至数千张GPU协同工作。这种"多机多卡"训练背后,依赖的正是互联网行业积累的分布式系统技术。
Google在2003—2006年间发表的三篇论文——GFS(分布式文件系统)、MapReduce(分布式计算框架)、BigTable(分布式数据库)——奠定了大数据处理的技术基础。后来开源的Hadoop和Spark就是这些思想的实现。这些技术原本是为了处理互联网搜索的海量数据,但它们的分布式存储和计算能力,恰好也是AI大规模训练所需要的。
大模型训练中的数据并行(把数据分到不同GPU上计算)和模型并行(把模型的不同层分到不同GPU上),底层依赖的通信协议(NCCL、MPI)、分布式存储系统、容错机制,全部继承自互联网分布式系统。没有这些"老本",今天的大模型根本训不起来。
容器化与DevOps:AI部署的标准化
互联网行业还贡献了一项看似不起眼但对AI极为关键的技术——容器化。2013年Docker问世,让应用的打包、部署、迁移变得标准化。AI模型训练好后需要部署上线,Docker容器让AI模型能"一次构建,到处运行",不再受环境差异的困扰。
后来的Kubernetes(K8s)进一步解决了大规模容器编排问题——管理数百个AI推理服务的自动扩缩容、负载均衡、滚动更新。到2025年,K8s已成为AI部署的事实标准,NVIDIA专门推出了GPUOperator来让K8s管理GPU资源。可以说,没有容器化,AI的工程化部署将困难十倍。
互联网行业催生的API经济不同软件之间"打交道"的标准接口,OpenAI、DeepSeek对外提供AI能力靠的就是它——通过标准接口对外提供服务——直接影响了AI的产品形态。OpenAI不是卖模型,而是卖API调用;DeepSeek、通义千问也都提供API接口。这种"模型即服务"(MaaS)的模式,让任何开发者都能用几行代码调用最强大的AI能力,极大降低了AI的应用门槛。
API解决的是"人类的软件之间怎么打交道"。而当AI开始自己动手调用工具时,一个新问题冒了出来:AI要连数据库、连日历、连浏览器、连公司内部系统,每接一个都得单独写一遍对接代码,费时费力还容易出错。于是2024年,Anthropic提出了MCPModel Context Protocol,模型上下文协议——它把互联网时代"定标准接口"的老智慧,搬到了AI连接外部工具这件事上。
三、互联网硬件基础设施与AI
互联网不只是软件——它还驱动了一场硬件基础设施的革命。从数据中心到网络带宽,从存储技术到GPU集群,这些"钢筋水泥"构成了AI算力的物理底座。
数据中心:从"机房"到"超算工厂"
互联网公司是数据中心的最大建设者。Google、亚马逊、微软、Meta在全球建设了数百个超大规模数据中心,每个中心容纳数万到数十万台服务器。这些数据中心最初是为了支撑搜索、电商、社交等互联网服务,但它们的基础设施——电力系统、冷却系统、网络架构——后来直接被用于AI训练。
到2025年,全球数据中心市场规模超3000亿美元。AI训练对数据中心提出了新要求:超高功率密度(一个机柜从传统的5-10kW飙升到40-100kW)、液冷散热(GPU发热远超CPU)、超高带宽网络(GPU之间需要TB级互联)。这些需求正在重塑数据中心的设计标准。中国的"东数西算"工程,本质就是把AI算力中心建在西部电力充足、气候凉爽的地区,通过光纤网络把算力送到东部。
网络带宽:AI训练的"血管"
大规模AI训练中,GPU之间需要频繁交换数据(梯度同步),网络带宽直接决定了训练效率。互联网行业推动的光纤网络和高带宽交换技术,在这里发挥了关键作用。
NVIDIA在2019年收购了Mellanox(网络解决方案公司),正是为了获取InfiniBand高速网络技术——这种网络最初用于高性能计算,后来成为大规模AI训练的标准配置。2025年,单个GPU训练集群的内部网络带宽可达数百Tbps,GPU之间的数据传输延迟降到微秒级。没有互联网行业推动的网络基础设施进步,千卡规模的AI训练根本无法实现。
GPU:从游戏显卡到AI引擎
GPU的故事是互联网硬件与AI交汇最经典的案例。GPU最初是为了游戏渲染而发明的——3D游戏需要大量并行的像素计算,GPU的众核架构恰好擅长这种并行任务。NVIDIA从游戏显卡起家,积累了GPU架构和CUDA编程平台。
2007年,NVIDIA发布CUDA,让GPU不再只做图形渲染,而是能执行通用计算。吴恩达最早意识到GPU可以加速深度学习训练——他用GPU训练神经网络识别猫的实验(2012年),直接启发了AlexNet使用GPU。从此GPU从游戏外设变成了AI引擎。
互联网游戏产业养活了GPU产业,GPU产业为AI提供了算力——这条链条说明了一个深刻道理:技术演化常常是"无心插柳"的。到2025年,NVIDIA市值超3万亿美元,AI芯片收入占其营收的80%以上。而游戏的"遗产"——GPU的并行计算能力——成为了AI时代最值钱的核心资产。
存储技术:数据洪水的治理者
互联网产生的数据量是天文级的——到2025年全球数据总量约175ZB(1ZB=1万亿GB)。这些数据需要被存储、检索、传输,推动了存储技术的飞速发展。
从机械硬盘(HDD)到固态硬盘(SSD),从直接存储(DAS)到网络存储(NAS/SAN),从关系数据库到NoSQL再到数据湖,存储技术的演进让"海量数据"变得可管理、可查询、可分析。AI训练需要频繁读取大量数据(尤其是多模态训练中的图片和视频),高速存储系统(如NVMe SSD)和分布式存储(如Ceph、MinIO)是AI训练流水线的必备组件。
| 互联网硬件技术 | 原始用途 | 对AI的意义 |
|---|---|---|
| 数据中心 | 搜索/电商/社交服务 | AI训练的物理载体 |
| GPU | 3D游戏渲染 | AI并行计算引擎 |
| InfiniBand网络 | 高性能计算 | 千卡训练的高速互联 |
| SSD/NVMe存储 | 互联网应用低延迟 | AI训练数据高速读取 |
| 边缘计算节点把计算放到离用户更近的地方,而不是全回中心机房 | CDN内容分发 | 端侧AI推理 |
四、大数据:AI的"燃料"
"数据是新石油"——这句话在AI时代得到了最充分的验证。没有大数据,就没有深度学习的成功。但"大数据"本身也是一项互联网技术——它指的是一系列处理海量数据的方法、工具和基础设施。
数据爆炸:从MB到ZB
1990年代互联网普及前,人类的数据量以MB和GB计。互联网普及后,数据量呈指数增长:2000年全球数据约50GB,2010年约2ZB,2020年约64ZB,2025年预计175ZB。这种增长主要来自:网页内容、社交媒体(文字/图片/视频)、电商交易、传感器数据(物联网)、日志数据等。
互联网公司是最早面对"数据洪水"的群体。Google每天处理数十亿次搜索,Facebook每天产生数十亿条互动,淘宝每天处理数亿笔交易。怎么存储、处理、分析这些数据?这就催生了大数据技术栈。
大数据技术栈:AI训练的"前置工程"
大数据技术的核心是分布式处理——把海量数据分到多台机器上并行处理。这条技术线的演进如下:
GFS(分布式文件系统)、MapReduce(分布式计算)、BigTable(分布式数据库)三篇论文发表,奠定了大数据处理的理论基础。
Doug Cutting基于Google论文开发了开源版Hadoop,让任何组织都能搭建大数据处理平台。Hadoop成为大数据时代的"操作系统"。
UC Berkeley开发Spark,用内存计算替代Hadoop的磁盘读写,速度提升100倍。Spark后来成为AI数据预处理的标准工具。
Kafka(流处理)、Flink(实时计算)、Delta Lake/Iceberg(数据湖)等技术让数据处理从"批处理"走向"实时"和"统一存储",为AI提供更高质量的数据管道。
这套大数据技术栈对AI的意义是什么?它是AI训练的"前置工程"。在训练模型之前,你需要:采集数据(爬虫/日志/传感器)→ 清洗数据(去重/去噪/格式化)→ 标注数据(人工/半自动标注)→ 构建数据管道(ETL/特征工程)。这些工作占AI项目总工作量的60%—80%,而它们全部依赖大数据技术栈。
AI需要标注数据——告诉模型"这是猫""这是停止标志""这段话的情感是积极的"。标注产业是一个庞大的隐形市场:2025年全球数据标注市场规模超200亿美元。中国是最大的标注基地——从ImageNet的标注到自动驾驶的3D框标注,数百万标注员在"数据工厂"里为AI提供训练燃料。开源标注工具如Label Studio、CVAT也降低了标注门槛。
数据质量决定AI上限
AI领域有一句行话:"Garbage In, Garbage Out"(垃圾进,垃圾出)。再强大的模型,用低质量数据训练,也只能产生低质量的结果。互联网积累了海量数据,但其中充满噪声——重复内容、错误信息、低质量文本、偏见数据。
大模型时代,数据质量成为核心竞争壁垒。OpenAI的GPT系列之所以领先,一个关键原因是其在数据清洗和过滤上的工程能力——从Common Crawl中去除低质量网页、去重、平衡语料比例。DeepSeek V3在训练中使用了高质量的中英文语料混合策略,用1/10的成本实现了GPT-4级性能。数据工程已经从"后勤工作"变成了AI竞争的核心战场。
五、开源运动与AI的相互成就
如果说大数据是AI的燃料、云计算是AI的引擎,那么开源运动就是AI的加速器。没有开源,AI永远只会是少数大公司的"黑箱特权"。开源让最先进的AI工具、模型和知识免费触达全球每一个角落,彻底改变了AI的传播速度和创新节奏。
开源软件运动:从理想主义到基础设施
开源运动的故事要从1980年代说起。1983年,理查德·斯托曼(Richard Stallman)发起GNU计划,主张软件应该自由共享、源代码应该公开。1991年,林纳斯·托瓦兹(Linus Torvalds)写出了Linux内核,与GNU工具结合,形成了完整的开源操作系统。
Linux的发展模式是革命性的:任何人都可以查看、修改、贡献代码,全球开发者协作改进。这种"众包"模式产出了质量不亚于商业软件的产品。到2025年,Linux驱动了全球90%以上的云服务器、几乎所有Android手机、所有超级计算机。开源从"理想主义运动"变成了"互联网基础设施"。
2000年代,开源进一步扩展:Apache开源了Web服务器(驱动了早期互联网)、MySQL开源了数据库、Git开源了版本控制。互联网的底层几乎全部是开源软件。这为后来AI工具链的开源化奠定了文化基础和工程实践——"重要软件应该开源"已经成为互联网行业的主流共识。
2005年Linus开发了Git(分布式版本控制),2008年GitHub上线。这两个工具不只管理代码——它们改变了软件协作的方式。AI研究者用GitHub分享模型代码、发布数据集、协作开发框架。Hugging Face本质上就是"AI版的GitHub"。到2025年,GitHub拥有超1亿开发者,AI相关仓库是增长最快的类别。没有Git/GitHub建立的协作基础设施,AI开源生态不可能发展得这么快。
AI框架开源:从TensorFlow到PyTorch
2015年是一个转折点。Google将内部的深度学习框架TensorFlow开源,这在当时是史无前例的——一家估值数千亿美元的公司,把自己的核心技术免费送给全世界。Facebook(Meta)紧随其后,在2016年9月开源预览了PyTorch(2017年1月正式发布)。
为什么要开源?不是慈善,而是战略。开源框架意味着全球研究者都在用你的工具,贡献改进,形成生态——这比独自闭门造车快得多。Google和Meta赌对了:TensorFlow和PyTorch迅速成为AI研究的事实标准,大量论文模型基于这些框架开发,形成正向循环。
到2025年,PyTorch在学术界占据主导(论文使用率超80%),TensorFlow在工业部署中仍有优势。更重要的是,开源框架催生了繁荣的工具生态:Hugging Face(模型托管与分享平台,托管超100万个模型)、ONNX(跨框架模型格式)、vLLM(大模型推理加速)、DeepSpeed(分布式训练优化)。这些开源工具让一个小团队也能训练和部署大模型——开源把AI的门槛从"亿级投入"降到了"万级投入"。
AI模型开源:从权宜之计到战略选择
AI框架开源只是第一步。更深远的变化是AI模型本身的开源——把训练好的模型权重公开,让任何人都能下载、使用、修改。
2017年,Google发表论文并开源了Transformer架构——这是后来所有大语言模型的基础。2022年,Stable Diffusion开源了图像生成模型,引爆了AI绘画热潮。但真正改变格局的是Meta在2023年开源的LLaMA系列——这是第一次有顶级大模型被免费公开。LLaMA的开源让全球研究者意识到:大模型不再是大公司的专属,"开源追平闭源"是可能的。
2025年1月,DeepSeek开源R1模型,用MIT许可证公开全部权重和训练方法,彻底引爆了"DeepSeek时刻"。R1的性能接近GPT-4o,但训练成本仅560万美元——开源让全世界看到:低成本高性能的大模型完全可行。此后,阿里通义千问Qwen系列、智谱GLM、百川等纷纷开源,形成了一波"开源潮"。
到2025年底,Hugging Face平台托管了超过100万个开源模型,下载量最大的模型月下载量超数千万次。开源已经成为AI发展的主线模式——闭源模型(GPT、Claude)负责"探路",开源模型(DeepSeek、Qwen)负责"铺路"。
中国的开源贡献
中国是AI开源生态的重要贡献者。2025年,全球下载量前十的开源大模型中,中国模型占据半数以上席位。代表性贡献包括:
- DeepSeek(深度求索):R1/V3系列以MIT许可证开源,性能对标GPT-4o,训练成本仅1/10,引发"DeepSeek时刻";
- Qwen(阿里巴巴):通义千问系列全尺寸开源(0.5B到72B+),覆盖72种语言,Hugging Face下载量超2000万次,是开源生态最完善的国产模型;
- GLM(智谱AI):GLM系列以MIT许可证开源,Agent能力突出,学术友好;
- ModelScope(魔搭社区):阿里达摩院建立的AI模型开源社区,被称为"中国版Hugging Face",托管超5万个模型;
- flagopen(飞智):BAAI(北京智源人工智能研究院)建设的开源社区,推动AI基础研究共享。
中国开源力量的崛起,标志着全球AI创新从"美国单极"走向"中美双极"。开源不仅是一种技术选择,更是一种战略选择——通过开源建立生态影响力,吸引全球开发者,形成正循环。
六、互联网巨头与AI的共生演化
互联网巨头既是AI的最大受益者,也是AI的最大推动者。它们的转型路径清晰地展示了互联网技术与AI的深度共生。
中国互联网巨头的AI转型同样值得关注。阿里从电商推荐切入AI,发展出通义千问大模型和阿里云AI算力;百度以搜索为基础,推出文心大模型和自动驾驶Apollo;腾讯依托社交数据积累,发展混元大模型和AI医疗;字节跳动凭借推荐算法的深厚积累,推出豆包大模型和AI编程工具Trae。这些公司的共同特点是:互联网业务积累的数据和算力,天然就是AI的养分。
互联网巨头掌握着最多的数据和算力,这带来了AI寡头化的风险。2025年,全球AI算力的70%集中在不到10家公司手中;训练千亿参数大模型的成本超1亿美元,中小企业难以独立完成。开源在一定程度上缓解了这个问题——DeepSeek用560万美元训出顶尖模型证明了"小团队也能做大模型"——但算力和数据的集中趋势仍值得关注。AI治理需要平衡创新效率与公平竞争。
七、总结:三位一体的AI基础设施
回顾本章,我们可以清晰地看到:AI的爆发不是单一技术的突破,而是三条技术线汇聚的必然结果。
这三条线之间还存在正向飞轮效应:互联网产生数据 → 大数据技术处理数据 → AI从数据中学习 → AI提升互联网产品体验 → 产生更多更好的数据 → 更强的AI。这个飞轮一旦转起来,就会越转越快。我们今天看到的AI飞速进步,本质上是这个飞轮已经高速运转了十几年。
展望未来,这个飞轮还在加速。新的变量正在加入:合成数据(AI生成数据训练AI)、端侧AI(在手机和设备上运行AI)、AI for Science(AI加速科学发现)。但万变不离其宗——数据、算力、开源,这三根支柱仍然是AI发展的地基。理解了这个地基,你就能更好地判断AI的未来走向。
如果你想在AI时代有所作为,不要只盯着算法和模型——数据工程能力(数据采集、清洗、标注、管道建设)和开源协作能力(使用开源工具、参与开源社区)同样是核心竞争力。很多AI项目的瓶颈不在算法,而在数据和工程。同时,关注开源生态的最新进展——Hugging Face、GitHub上的热门项目,往往预示着AI的下一个趋势。
八、本章术语速查
| 术语 | 一句话解释 |
|---|---|
| 云计算 | 通过互联网按需提供算力、存储等服务,像用水用电一样租用算力,代表平台AWS、Azure、阿里云 |
| 大数据 | 传统工具无法处理的海量数据集合,核心技术Hadoop/Spark,是AI训练的"前置工程" |
| 分布式系统 | 多台计算机协同完成计算任务的系统,是大模型"多机多卡"训练的工程基础 |
| 容器化 | Docker/Kubernetes将应用及其环境打包标准化部署,让AI模型"一次构建,到处运行" |
| 开源软件 | 源代码公开、可自由使用和修改的软件,如Linux、PyTorch,是AI民主化的根本动力 |
| Hugging Face | 全球最大的AI模型托管与分享平台,50万+开源模型,被称为"AI界的GitHub" |
| 合成数据 | 由AI生成的训练数据,用于补充真实数据的不足,是AI训练的新数据源 |
| MaaS | 模型即服务(Model as a Service),通过API提供AI模型调用,OpenAI、DeepSeek的商业模式 |
| 东数西算 | 中国将东部算力需求引导到西部电力充足、气候凉爽地区的国家工程 |
| 数据飞轮 | 数据产生→AI学习→产品提升→更多数据的正向循环,越转越快 |
| Hadoop | 大数据"搬运工",能把海量数据分散存储和处理 |
| Spark | 更快的大数据搬运工,用内存计算加速Hadoop |
| Kafka | 实时数据管道,像快递分拣中心一样处理源源不断的数据流 |
| Docker | 把软件装进"集装箱",搬到哪台电脑都能直接运行 |
| K8s(Kubernetes) | 管理很多Docker"集装箱"的"码头调度员" |
| MapReduce | 谷歌的大数据处理方法:先分头算(Map),再汇总(Reduce) |
| BigTable | 谷歌的海量数据存储系统,能存下整个互联网的网页信息 |
| GFS | 谷歌文件系统,把海量文件分散存储在成千上万台廉价服务器上 |
| PageRank | 谷歌搜索的核心算法,根据网页被链接的数量和质量来排名 |
| API | 应用程序接口,软件之间"打交道"的标准门口,OpenAI/DeepSeek靠它对外提供AI能力 |
| CDN | 内容分发网络,把内容缓存到离用户近的节点,加快访问,也是端侧AI的落地点 |
| 边缘计算 | 把计算放到离数据/用户更近的设备上,低延迟、省带宽 |
| GPU | 图形处理器,擅长并行计算,是训练与运行AI的主力芯片 |
| 算力 | 完成计算的能力,常被比作AI的"阳光/道路",是AI爆发的三大支柱之一 |
本章小结
AI不是凭空出现的——互联网技术积累的数据、算力和工具链构成了AI爆发的土壤,2012年AlexNet正是三条线交汇的必然结果。
大数据是AI的燃料,云计算是AI的引擎,开源是AI的加速器——三者缺一不可。
数据、算力、开源三根支柱形成的正向飞轮正在加速AI发展,合成数据和端侧AI是新的变量。
- 总论:AI爆发不是偶然,而是互联网数据、GPU算力、开源框架三条线在2012年交汇的必然结果。算法是种子,数据是水分,算力是阳光,开源是肥料。
- 互联网软件基础设施:互联网是最大的"数据农场",云计算让算力像水电一样流动,分布式系统是大模型训练的工程基石,容器化让AI部署标准化。
- 互联网硬件基础设施:数据中心从"机房"到"超算工厂",GPU从游戏显卡到AI引擎,InfiniBand网络是千卡训练的"血管"。
- 大数据:大数据技术栈(Hadoop/Spark/Kafka)是AI训练的"前置工程",数据质量决定AI上限,数据工程已从"后勤"变成"核心战场"。
- 开源运动:从Linux到PyTorch到Hugging Face,开源让AI从少数大公司的"特权"变成所有人的工具,实现了AI民主化。
- 互联网巨头与AI共生:Google、Meta、微软等互联网巨头既是AI技术的推动者,也是AI最大的受益者,形成了"数据→AI→产品→更多数据"的正反馈循环。
- 三位一体:数据、算力、开源三根支柱形成的正向飞轮正在加速,合成数据、端侧AI、AI for Science是新的加速变量。
互联网技术与开源为AI铺好了土壤,而在全球AI产业的版图中,中国扮演着越来越重要的角色。下一章,我们将走进中国与AI发展史,从《易经》八卦的千年回响到DeepSeek时刻震动全球,看中国人和华人科学家如何与AI结下不解之缘。
"算法是种子,数据是水分,算力是阳光,开源是肥料。"AI这棵参天大树,根植于互联网技术几十年积累的肥沃土壤。理解了这条"土壤线",你才能真正理解AI为什么是在2012年爆发。