人工智能通识读本
第三篇:AI的现状

中国AI发展成就(2026)🌱 入门

上一章我们看到了AI在全球范围内的应用全景——从编程到科研,从医疗到教育,AI正深度重塑各行各业。那么中国在这场AI浪潮中处于什么位置?2026年是中国AI发展具有里程碑意义的一年:国产模型跻身全球第一梯队,国产Agent从演示走向上工,国产算力撑起自主供给链,开源生态首次反超美国。这一章,我们用数据和事实,全景扫描中国AI在2026年取得的成就。

如果把2022年底ChatGPT的发布比作全球AI竞赛的"发令枪",那么此后的三年多里,中国AI经历了一条从跟跑到并跑、再到部分领跑的突围之路。2026年,这条路到了一个关键的收获期:DeepSeek V4在多项基准测试中超越GPT-5,华为昇腾950超节点撑起了国产大模型的算力底座,中国开源模型在全球下载量占比首次超过美国。

这不是某一家公司的胜利,而是一条完整产业链的集体跃迁。从芯片设计到框架软件,从基础模型到行业应用,从政策引导到市场驱动,中国AI在2026年展现出"全栈突破"的独特格局。这一章,我们将从大模型、智能体、芯片、开源、产业、政策和国际竞争七个维度,梳理中国AI走到今天的关键成就。

需要强调的是,本章的叙述基于公开可查的事实和数据。中国AI的进步是真实的,但挑战同样真实。在为成就感到自豪的同时,我们也将客观分析差距与不足——唯有正视现实,才能走得更远。

一、国产大模型:全球第一梯队

大模型是AI时代的基础设施,也是各国技术竞争的制高点。2026年,中国大模型在性能、效率、开源和成本四个维度上同时发力,多家企业的旗舰模型在权威评测中跻身全球前列,部分指标甚至登顶世界第一。

下表汇总了2026年中国主要国产大模型的核心参数与关键成就:

模型 发布时间 参数规模 关键成就 开源协议
DeepSeek V4 2026年4月 V4-Pro: 1.6T/49B MoE
V4-Flash: 284B/13B MoE
SWE-bench 80.6%(开源最高);Codeforces 3206分超越GPT-5;API价格约为GPT-5.6的1/18 开源
通义千问 Qwen 3.7/3.8 2026年 多规格 MoE 累计下载超10亿次,超越Llama成为全球下载量第一的开源模型家族 Apache 2.0
Kimi K3 2026年7月 3万亿级参数 全球首个3万亿级参数真开源模型,完整权重开源即登顶Hugging Face趋势榜 开源
智谱 GLM-5.2 2026年6月 大规模 MoE MIT协议全量开源;Artificial Analysis第三方AI模型评测机构开源智能指数51分一度领跑全球 MIT
百度 ERNIE 4.5 2026年 大规模 MoE 月活超1亿;百度Unlimited OCR首发登顶四大榜单 部分开源
字节跳动 豆包 持续迭代 多模态 MoE 月活3.45亿,国内C端AI应用用户规模第一 闭源

DeepSeek V4是2026年最受瞩目的国产模型。2026年4月发布的V4系列包含两个版本:V4-Pro(1.6万亿总参数、490亿激活参数的MoE架构)面向极致性能,V4-Flash(2840亿总参数、130亿激活参数)面向高性价比部署。在软件工程基准SWE-bench Verified上,V4-Pro取得80.6%的成绩,创下开源模型最高纪录;在竞技编程平台Codeforces上,V4-Pro以3206分超越GPT-5的3168分——这是国产模型首次在编程竞赛级别上击败OpenAI旗舰。更值得注意的是,V4-Flash正式版仅靠后训练优化就实现了Agent能力的巨幅提升,证明了"训练效率"比"堆参数"更重要。而其API价格约为GPT-5.6的1/18,直接拉低了全球大模型的使用门槛。

V4-Flash的后训练优化尤其值得关注。传统观点认为,Agent能力(即AI自主规划、调用工具、多步推理的能力)主要依赖预训练阶段的规模。但DeepSeek团队发现,通过精心设计的强化学习和后训练流程,即使是较小的模型也能获得强大的Agent能力。V4-Flash正式版(0731版)在后训练阶段实现了Agent能力的"巨幅提升",这意味着企业无需部署千亿级模型,也能获得接近旗舰水平的智能体能力——这对降低AI部署成本具有深远意义。

通义千问Qwen系列则代表了中国开源模型的"长跑"实力。经过3.7、3.8多个版本的迭代,Qwen家族累计下载量在2026年突破10亿次,超越Meta的Llama系列,成为全球下载量第一的开源大模型家族。从0.5B到千亿级,Qwen覆盖了从手机端到数据中心的全部部署场景,成为全球开发者最常用的"基座"之一。

Qwen的成功不仅在于技术性能,更在于其"全尺寸开源"策略。大多数模型团队只开源中大规模版本,而Qwen从0.5B的超小模型到千亿级旗舰模型全部开放,让不同需求的开发者都能找到合适的版本。手机厂商用它做端侧AI,创业公司用它做SaaS服务,科研机构用它做学术研究——一个模型家族,覆盖了整个AI应用光谱。

2026年7月,月之暗面发布Kimi K3——全球首个3万亿级参数的"真开源"模型。与以往只开源部分权重或延迟发布的做法不同,K3在发布当日即完整开放模型权重,上线Hugging Face后迅速登顶趋势榜。紧接着,智谱在6月以MIT协议全量开源GLM-5.2,在Artificial Analysis开源智能指数上拿下51分,一度领跑全球所有开源模型。这两次发布标志着中国开源大模型从"追赶开源"走向"定义开源"。

K3和GLM-5.2的发布还具有更深层的行业意义。3万亿级参数的真开源,意味着中国在模型规模上不再保守——此前,业界普遍认为超大模型不会开源,因为开放权重意味着放弃竞争优势。K3打破了这一惯例,证明了"开源也能做大模型"。而GLM-5.2选择MIT协议——这是最宽松的开源协议之一,几乎不限制任何使用方式——则向全球开发者传递了最大诚意的信号。这两次发布共同推动"真开源"(完整权重+宽松协议+即时发布)成为行业新标准。

🍳 打个比方:真开源 = 把整本菜谱连锅带灶送人

闭源模型像餐厅的秘方:你能吃到菜(调用API),但拿不到配方,改不了做法。普通"开源"有时只给部分配方。而"真开源"(Kimi K3、GLM-5.2的做法)是连锅带灶、连火候诀窍一起送你——完整权重+宽松协议+发布当天就给。

别人拿到就能自己开餐厅、自己改菜。这才是开源精神:不是"我喂你吃",而是"我教你做"。

在应用层面,百度ERNIE 4.5月活用户突破1亿,其配套的Unlimited OCR能力首发即登顶四大文字识别榜单;字节跳动豆包以3.45亿月活稳居国内C端AI应用用户规模第一。国产大模型正在从"技术验证"走向"规模化服务"。

纵观2026年的国产大模型格局,有三个趋势尤为清晰。第一,MoE架构成为标配——从DeepSeek到Qwen再到GLM,几乎所有旗舰模型都采用了混合专家架构,在参数规模和推理成本之间找到了平衡点。第二,开源成为默认选择——与美国的闭源趋势相反,中国头部模型团队大多选择开源核心权重,用生态影响力换取商业回报。第三,价格战驱动普及——DeepSeek V4将API价格降至约为GPT-5.6的1/18,倒逼整个行业降价,让AI从"奢侈品"变成"日用品"。这三个趋势共同作用,使得2026年成为中国大模型从"技术突破期"迈入"生态成熟期"的关键节点。

二、国产AI Agent:从"会说"到"会做"

如果说2023到2024年国产AI比的是"谁的模型考试分数高",那么2025到2026年比的就是另一件事:谁的AI真能替你把活干完。这件事的主角,叫做AI Agent(人话:智能体,一个能听懂任务、自己拆步骤、自己动手用工具、干完再交差的AI程序)

差别在哪儿?一个只会聊天的模型,你问它"帮我订下周去上海的高铁票",它会热情地告诉你订票流程有哪几步;而一个Agent会直接打开购票网站、查车次、比价、填信息,最后把订单号发给你。前者是顾问,后者是助手

🏠 打个比方:大模型是毛坯房,Agent是家政机器人

训练好的大模型像一套毛坯房——结构结实、面积够大,但空荡荡的,你搬不进去住。它有知识、会推理,可就是不会替你动手。

Agent则是请进这套房子的家政机器人:它知道厨房在哪、扫地机在哪、垃圾往哪倒,你说一句"把家收拾一下",它就自己规划先扫地还是先洗碗,中途发现拖把坏了还会换一把接着干。模型提供智力,Agent提供手脚。

2.1 Agent到底"多干"了哪三件事

把Agent拆开看,它比普通对话模型多出三个本事,缺一不可。

第一件,会拆任务。你说"帮我做一份上季度销售分析",它不会一口气蒙一个答案,而是先在心里列提纲:找数据 → 清洗 → 算同比环比 → 画图 → 写结论。这一步在技术上叫任务规划

第二件,会用工具。它可以调用搜索引擎、执行一段代码、读写文件、操作浏览器、连接数据库。模型自己不会精确计算1234×5678,但它会写一行代码让计算机去算——知道该找谁帮忙,比什么都自己会更重要

第三件,会自我纠错。代码报错了、网页没打开、数据对不上,Agent能看见这个"失败",然后换个方法重试。这是它和"一次性生成"最本质的区别:它在一个循环里工作,而不是一条直线。

Agent 干一件事的完整回路 ① 接任务 你说一句人话 ② 拆步骤 列出先做什么 ③ 调工具 搜索 / 写码 / 点网页 ④ 看结果 成了?还是错了? ⑤ 交差 给你能用的成品 错了就回头重来(这一步才是Agent的灵魂) 普通对话模型只有 ①→⑤ 一条直线:你问,它答,答错了它自己也不知道。 Agent 多了 ②③④ 和那条红色回头线,它会自己试、自己看、自己改——所以它能把活真正干完。
图24-1 Agent与聊天机器人的根本差别,就在那条红色的"回头线"上——会返工,才叫会干活。

2.2 国产Agent的三条主赛道

2025到2026年,国产Agent沿着三条路同时推进:通用型(什么活都试着接)、编程型(专门写代码)、端侧与办公型(长在手机和工位上)。

通用Agent:从一码难求到全民可用。2025年3月,中国团队蝴蝶效应(Monica)推出的Manus(人话:一款你说一句话、它自己开浏览器查资料并产出完整报告的通用智能体)意外破圈,内测邀请码一度被炒到高价,成为全球第一款引发大规模讨论的中国通用Agent产品。此后一年多,国内头部厂商的通用Agent密集落地:字节跳动的扣子(Coze)把"搭一个自己的智能体"变成拖拽积木一样的事,并在2025年7月开源了核心平台;阿里云的百炼为企业提供从模型到工具的一站式Agent编排;百度的文心智能体平台让不会写代码的人也能发布智能体;智谱的AutoGLM则走了另一条路——直接操控手机屏幕,像人一样点按钮、划页面,替你在App里完成点外卖、买车票这类操作;月之暗面的Kimi探索版OK Computer把"深度搜索+自动产出"做成了日常入口。

编程Agent:国产工具的第一个规模化战场。写代码是Agent最容易验证价值的场景——对错立刻能跑出来。阿里的通义灵码Qoder、腾讯的CodeBuddy、字节的Trae、百度的文心快码(Comate),都在2025年前后进入企业的日常开发流程。到2026年,模型侧也交出了硬指标:DeepSeek V4-Flash-0731在Terminal Bench 2.1(人话:一套考AI能不能在命令行黑框框里独立完成任务的题库)上拿到82.7分,DeepSWE(人话:考AI能不能自己修真实开源项目里的Bug)从7.3飙升到54.4——而这全靠后训练优化,模型架构和参数一个字没改。

端侧与办公Agent:AI搬进手机和工位。手机厂商把Agent做成了系统级能力:华为小艺、荣耀YOYO、小米超级小爱、vivo蓝心小V,都能跨App执行"把这张图发给妈妈并配一句祝福"这类连续操作。办公侧,钉钉AI助理、飞书的智能伙伴、企业微信的智能机器人,把会议纪要、审批流转、知识问答交给了Agent。这条赛道的特点是用户无感——很多人每天都在用Agent,却从没听过这个词。

速查 · 国产AI Agent产品一览(按赛道分)

Manus(蝴蝶效应)通用型。2025年3月发布,首款引发全球广泛讨论的中国通用Agent,擅长自主查资料并产出完整报告。
扣子 Coze(字节跳动)通用型平台。像拼积木一样搭建自己的智能体,2025年7月开源核心平台,零代码门槛。
百炼(阿里云)通用型平台。面向企业的一站式Agent开发与编排平台,打通模型、工具与数据。
文心智能体平台(百度)通用型平台。不写代码就能发布智能体,并可直接分发到搜索生态获取用户。
AutoGLM(智谱)手机操控型。直接在屏幕上点按划动,像人一样在App里替你完成操作。
Kimi探索版 / OK Computer(月之暗面)研究型。一句话触发多轮深度搜索,自动整理成结构化成果。
通义灵码 / Qoder(阿里)编程型。从代码补全走向"接需求、自己改一整个仓库"。
CodeBuddy(腾讯)编程型。深度嵌入企业研发流程,能读懂项目上下文再动手改。
Trae(字节跳动)编程型。AI原生代码编辑器,以"和AI结对编程"为核心交互。
文心快码 Comate(百度)编程型。面向中文开发者的代码助手,覆盖补全、注释、单元测试生成。
小艺 / YOYO / 超级小爱 / 蓝心小V端侧型。华为、荣耀、小米、vivo的系统级智能体,可跨App连续执行任务。
钉钉AI助理 / 飞书 / 企业微信办公型。会议纪要、审批流转、知识问答,Agent已成为工位上的隐形同事。

2.3 让Agent互通的"统一插座":MCP

Agent要干活,就得连工具——连数据库、连日历、连浏览器、连公司内部系统。麻烦在于,早期每接一个工具都得单独写一套对接代码,一百个工具就是一百根"定制线",谁也复用不了谁的。

🔌 打个比方:MCP = 给AI世界定了一个"统一插座"

想想充电线。以前每个手机品牌一个接口,出门要带一书包线;后来大家统一用Type-C,一根线走天下。

MCP(Model Context Protocol,模型上下文协议)干的就是这件事:它规定了"AI和工具之间该怎么说话"。工具方按标准做成一个"插头",AI这边按标准留一个"插座",插上就能用,不用再一根根单独接线。

MCP由Anthropic在2024年11月开源提出,但真正把它推成产业基础设施的,很大程度上是中国的云厂商。2025年起,阿里云百炼、腾讯云、火山引擎相继上线MCP服务市场——把地图、支付、办公、数据库等成百上千种工具做成标准插头,开发者点几下就能给自己的Agent装上"手"。这直接把搭建一个可用Agent的周期,从"数周"压缩到了"数小时"。

与MCP配套的还有两块拼图。一是A2A(Agent to Agent,智能体之间互相对话的协议),解决的是"多个Agent怎么组队干活"——就像一个项目组里,产品、设计、开发各司其职还能互通消息。二是接口层的兼容:DeepSeek V4-Flash-0731原生兼容OpenAI Responses API,意味着原本为海外模型写的Agent应用,几乎不用改代码就能切到国产模型上,迁移成本近乎为零。这一步看着不起眼,却是国产模型能大规模挤进全球开发者工具链的关键。

2.4 怎么判断一个Agent是不是"真能干"

Agent最容易注水的地方在演示:挑一个精心准备的任务录段视频,谁都很能干。所以业界很快建立起了一批专门考"动手能力"的基准——不看它说得多漂亮,只看它任务完没完成。

基准名称 考什么 说人话
Terminal Bench 命令行环境下的独立任务完成率 把AI丢进一个黑框框,看它能不能自己敲命令把事办成
DeepSWE / SWE-bench 真实开源项目中的Bug修复 给它一个真项目和一个真Bug,看它能不能改对并通过测试
GAIA 需要多步搜索与推理的现实问题 题目人一看就懂,但必须查好几轮资料才答得出来
BrowseComp 深度网页检索能力 考它会不会上网找那种藏得很深的答案
MCP Atlas 数百种真实工具的调用准确率 考它面对一屋子工具,知不知道该拿哪一件
xbench 贴近中文真实职业场景的任务 由中国机构发起,专门考在中文环境里能不能干活

表24-1 主流Agent能力基准。判断一个Agent值不值得用,看这些分数比看演示视频靠谱得多。

2.5 冷静看:Agent还没到"放手不管"的时候

成绩要认,问题也不能藏。2026年的Agent,离"完全托付"还有明显距离,主要卡在三个地方。

第一,长任务的成功率仍然不高。假设单步操作准确率有95%,但一个任务要连做20步,整体成功率就掉到约36%(0.95的20次方≈0.36)。步骤越长,翻车概率越高——这是Agent当前最硬的天花板,也正是"自我纠错"能力为什么如此关键的原因。

第二,成本还不便宜。一个Agent完成复杂任务动辄要几十上百次模型调用,费用可能是单次对话的百倍。国产模型的低价(DeepSeek V4-Flash-0731约为GPT-5.6的1/18)恰恰在这里成了关键优势——Agent时代,谁的单价低,谁就跑得起更长的任务

第三,安全边界还没划清。Agent一旦拿到你的账号、文件和支付权限,它做错一步的代价就不再是"回答错误",而是真金白银的损失。目前主流做法是关键动作前必须人工确认——涉及付款、删除、对外发送时,必须由人点头。这不是技术不成熟的权宜之计,而是应当长期保留的设计原则。

三条放在一起看,结论其实很清楚:2026年的国产Agent,已经从"能演示"走到了"能上工",但仍处在需要有人盯着的阶段。它更像一个刚入职、手脚麻利但还得师傅复核的实习生,而不是一个可以完全放手的老师傅。认清这一点,既不至于低估它,也不至于高估它。

三、国产AI芯片:全栈自主突破

大模型的背后是算力,算力的背后是芯片。长期以来,高端AI芯片被英伟达垄断,这既是中国AI最大的"卡脖子"环节,也是自主突破最有价值的战场。2026年,以华为昇腾为代表的国产AI芯片实现了从"能用"到"好用"的跨越,真正撑起了国产大模型的算力底座。

3.1 华为昇腾:国产算力的压舱石

2026年世界人工智能大会(WAIC)上,华为首次公开展示昇腾950超节点——这是国产AI算力的里程碑产品。超节点将1024张昇腾NPU通过高速互联网络组成一个统一的计算集群,提供1 EFLOPS(百亿亿次/秒)的FP8算力。在这个平台上,DeepSeek V4-Pro实现了20毫秒的TPOT(Time Per Output Token,每token生成延迟)和单卡Decode吞吐4700 TPS(tokens/second)——这一指标已达到国际一流水平,意味着国产芯片+国产模型的组合不仅能跑通,而且跑得快。

1 EFLOPS的算力是什么概念?它相当于每秒进行100亿亿次浮点运算,足以同时为数百万用户提供实时AI对话服务。更关键的是,昇腾950超节点不是简单的"芯片堆叠",而是通过高速互联网络将1024张NPU融合为一个整体——节点间的通信延迟极低,使得大规模MoE模型的专家分布和调度效率大幅提升。这种"规模化互联"能力,是支撑万亿级参数模型高效推理的关键基础设施。

📏 打个比方:把这些"大数字"换成你能摸到的尺度

1 EFLOPS(每秒100亿亿次):如果让一个人每秒算1次,要算大约317亿年——比宇宙现在的年龄(约138亿年)还长一倍多。这台机器一秒钟干的活,一个人得从宇宙诞生前算到宇宙老去两遍才赶上。

1.6万亿参数(DeepSeek V4-Pro):1.6万亿≈1143个全中国的人口总数。Kimi K3的3万亿参数,则相当于约2143个全中国人口。把这么多"脑细胞"塞进一个模型,难怪它什么都会一点。

2亿元(银联AI风控拦下的可疑交易):普通人月薪1万,要不吃不喝赚1667年;或者相当于2亿人每人捐1块钱。AI替银行守住的,是实打实的真金白银。

昇腾950超节点的性能飞跃来自三大底层架构升级:第一,原生精度加速,全面支持FP8、MXFP8、MXFP4等多种低精度计算格式,在保证精度的前提下大幅提升吞吐;第二,稀疏访存优化,针对MoE模型的稀疏激活特性专门设计,减少无效内存访问;第三,Vector与Cube共享Memory,让向量运算和矩阵运算共享存储资源,降低数据搬运开销。这些架构创新使得昇腾在运行MoE大模型时效率显著提升。

🔗 打个比方:超节点就像把1024个厨师连成一个超大厨房

单张NPU像一个厨师,一次只能炒一道菜。昇腾950把1024张NPU用高速"传菜带"连起来,变成一个超大厨房:前厅点单(用户提问)进来,后厨1024个厨师立刻分工——切菜的切菜、掌勺的掌勺,通过传菜带秒级互通,出菜比1024个孤立小餐馆快得多。

这就是"超节点":不是简单地堆芯片,而是让芯片像一个人一样协同。所以1024张卡合体的算力,远大于1024张卡各自为战。

面向高性价比场景,华为还推出了昇腾A3超节点,在V4-Flash上实现单卡Decode吞吐2000+ TPS,为中小企业和开发者提供了低成本的国产算力选择。从950到A3,昇腾产品线覆盖了从旗舰到普惠的完整需求。

在软件生态方面,华为CANN(Compute Architecture for Neural Networks)框架在2026年全面开源,支持PyTorch、MindSpore等主流深度学习框架。CANN的开源意味着开发者可以深入到底层算子进行优化,也让更多国产芯片厂商能够参考统一的标准接口。CANN与昇腾NPU的深度耦合,使得模型从训练到部署的迁移成本大幅降低——开发者无需修改模型代码,即可在昇腾平台上获得接近理论峰值的性能。这种"硬件-框架-模型"的无缝衔接,正是全栈自主供给链的核心价值所在。

更关键的是,中国已经走通了"昇腾NPU → CANN开源框架 → DeepSeek大模型"的全栈自主供给链。这意味着从底层硬件、驱动框架到上层模型,每一个环节都不依赖外部供应商。除了华为,寒武纪、摩尔线程、海光信息等国产芯片厂商也先后完成了DeepSeek V4的适配工作,形成了"多芯片+一模型"的兼容生态。国产芯片不再是某一家的独角戏,而是一个产业集群。

全栈自主的意义远超技术层面。在地缘政治不确定性持续升高的背景下,拥有完整的AI算力供给链意味着中国AI发展不再受制于外部断供风险。更重要的是,当芯片设计和模型训练由同一生态体系协同推进时,软硬件协同优化的效率远超"通用芯片+通用模型"的组合——这正是昇腾运行DeepSeek V4能够达到20ms TPOT和4700 TPS的根本原因。这种"芯片-框架-模型"三位一体的协同优化能力,正在成为中国AI区别于美国"垂直分工"模式的独特竞争优势。

💡
英伟达CEO黄仁勋的论述

2026年,英伟达CEO黄仁勋在公开场合多次谈及中国AI芯片的崛起。他直言:"如果DeepSeek V4是针对华为优化的,那将使美国处于劣势。"他指出,DeepSeek V4在昇腾平台上运行时性能表现优异,这意味着中国已经具备"芯片+模型"协同优化的能力,而这正是英伟达"CUDA生态+GPU"模式的核心壁垒。(人话:CUDA 是英伟达给自家 GPU 配的一套"软件工具箱",全称 Compute Unified Device Architecture。没有它,GPU 主要只会画图;有了它,程序员才能让 GPU 去算 AI、做科学计算。它真正的壁垒不是某一项技术,而是近二十年攒下的海量算子库、调试工具和开发者习惯——就像大家都习惯了某套办公软件,换一套就得重新学。)黄仁勋的表态从侧面印证了一个事实:国产AI芯片不再是"备胎",而是已经开始改变全球算力竞争的格局。

3.2 不只有华为:国产AI芯片全家福

一个国家的算力不可能由一家公司扛下来。在昇腾之外,中国还有一批各有专长的AI芯片企业,它们走的技术路线并不相同,凑在一起才拼出完整的版图。

先把路线分清楚,后面的名字就好记了。国产AI芯片大体走三条路:通用GPU路线(一颗芯片既能算AI,也能渲染画面、跑科学计算,通用性强、生态好迁移)、专用NPU/加速卡路线(只为AI计算而生,砍掉用不上的功能,换来更高的能效比)、端侧与车规路线(芯片装在汽车、摄像头、机器人里,讲究低功耗、高可靠、能扛住颠簸和高温)。

🔪 打个比方:通用GPU是瑞士军刀,专用NPU是专业厨刀

瑞士军刀什么都能干一点——开瓶盖、拧螺丝、削苹果,出门带一把就够,但削起土豆来肯定不如厨刀顺手。通用GPU就是这样:AI训练、游戏画面、天气模拟都能算,胜在万金油、软件生态成熟。

专业厨刀只干切菜这一件事,但切得又快又省力。专用NPU砍掉了图形渲染这些AI用不上的电路,把每一分芯片面积和每一度电都花在矩阵乘法上,所以同样功耗下算得更多。

两条路没有高下之分,只有取舍:要生态和灵活,选前者;要极致效率和成本,选后者。

海光信息走的是通用路线。它的深算系列DCU(Deep Computing Unit,深度计算处理器,可以理解成海光版的通用计算加速卡)最大的特点是软件生态好迁移——它兼容主流GPU的编程模型,原本写给英伟达卡的代码,改动量相对较小就能跑起来。对于已经积累了大量代码资产的科研院所和大型企业,这一点比峰值算力数字更实际。海光与中科曙光在服务器整机上的深度整合,也让它在超算中心和政企市场有稳固的基本盘。

寒武纪是国内最早专注AI芯片的公司之一,走的是纯粹的专用路线。思元(MLU)系列从边缘端到云端全线覆盖,思元370、思元590等产品先后进入互联网大厂和运营商的采购清单。寒武纪的技术特色在于自研指令集与Neuware软件栈——不依附于任何海外生态,这在供应链安全上是长板,但也意味着它必须自己把开发者生态一点点建起来,这是一条更慢但更自主的路。

摩尔线程选择了最难的一条路:做全功能GPU。它的MTT S系列不只能算AI,还支持图形渲染、视频编解码和科学计算——这是国内少有的"四位一体"完整GPU能力。配套的MUSA软件栈和夸娥(KUAE)智算集群方案,让它能直接向客户交付"从芯片到集群"的整套算力,而不是只卖一张卡。做全功能GPU意味着要同时啃下四块硬骨头,但一旦跑通,天花板也最高。

阿里巴巴的芯片故事写在平头哥身上。2019年发布的含光800是国内最早规模落地的AI推理专用芯片之一,在阿里内部的图片识别等场景中大规模上线;2021年的倚天710则是面向云服务器的自研CPU。近年阿里进一步自研AI加速芯片,并与自家磐久AI服务器整合,形成"芯片—服务器—云平台—通义大模型"的垂直闭环。阿里的打法很清楚:先在自己的超大规模业务里练兵,跑顺了再对外供给——这也是全球云厂商自研芯片的通用剧本。

地平线把战场放在了汽车里。它的征程(Journey)系列是车规级AI芯片(人话:能在零下40度到零上100多度、天天颠簸的车上稳定跑十几年的芯片,可靠性要求远高于机房里的卡),基于自研BPU架构,从早期的征程2、征程3一路做到面向高阶智能驾驶的征程6,累计出货量在中国乘用车智驾芯片市场位居前列。它还向车企提供软硬一体的智驾解决方案。地平线证明了一件事:AI芯片的战场不只在数据中心,路上跑的每一辆车都是一台移动的AI计算机。

此外,百度昆仑芯依托飞桨框架与百度自身的搜索、自动驾驶业务,形成了"芯片+框架+应用"的闭环;壁仞科技燧原科技天数智芯等新锐企业也在云端训练与推理市场各自占位。国产AI芯片已经从"一枝独秀"变成了"一片森林"。

速查 · 国产AI芯片厂商一览

华为 · 昇腾 Ascend专用NPU路线。旗舰产品线+超节点集群,配CANN软件栈与MindSpore框架,国产算力的压舱石。
海光信息 · 深算 DCU通用路线。最大优势是软件生态好迁移,原有代码改动小;与中科曙光整机深度整合。
寒武纪 · 思元 MLU专用NPU路线。国内最早的AI芯片公司之一,自研指令集与Neuware软件栈,云边端全线覆盖。
摩尔线程 · MTT S系列全功能GPU路线。AI计算+图形渲染+科学计算四位一体,配MUSA软件栈与夸娥智算集群方案。
阿里 · 平头哥自用优先路线。含光800推理芯片、倚天710服务器CPU,与磐久AI服务器和通义大模型垂直整合。
地平线 · 征程 Journey车规路线。自研BPU架构,中国乘用车智驾芯片出货量前列,提供软硬一体智驾方案。
百度 · 昆仑芯自用优先路线。与飞桨框架、文心大模型协同,支撑百度搜索与自动驾驶业务。
壁仞 / 燧原 / 天数智芯新锐力量。分别在云端训练、推理加速等细分市场卡位,丰富了国产算力的供给层次。

3.3 从单卡到万卡:国产算力集群

训练一个万亿参数的大模型,单靠几张卡是不可能完成的——必须把成千上万张卡连成一个整体。但集群的难点从来不在"买够卡",而在让这么多张卡步调一致

🗣️ 打个比方:万卡集群难在"一万人开会不吵架"

把一万个人塞进一个会议室不难,难的是让他们讨论出结果。每个人算完自己那部分,都得把结果告诉别人、再等别人的结果——只要有一个人卡住,全场就得干等;只要传话的通道堵了,一万张嘴说的话就全乱了。

所以集群真正的技术含量在"传菜带"——卡与卡之间的高速互联、任务调度、故障自愈。一张卡坏了能不能自动顶上,决定了这个万卡集群是能连跑三个月,还是每天崩两次。算力不是加法,是协同。

2026年,国产算力集群已经形成了几种成熟形态。华为的昇腾超节点把1024张NPU融合成一个逻辑整体,代表了"紧耦合"路线的最高水平;百度昆仑芯点亮了三万卡规模的集群,验证了国产芯片支撑超大规模训练的可行性;摩尔线程的夸娥(KUAE)提供从千卡到万卡的整柜交付方案,客户不用自己攒机器;阿里的磐久AI服务器与自研芯片、云平台打通,把集群能力直接变成云上可租用的算力;海光则借助中科曙光在超算领域的积累,在政企与科研市场提供整机柜方案。

与之配套的是国家层面的算力布局。"东数西算"工程把大量训练任务调度到西部——那里电价更低、气候更凉、绿电更充足,算完再把结果传回东部使用。全国一体化算力网络的建设,让算力像水电一样成为可以远程调用的公共资源。这是中国在算力基础设施上一个相当独特的制度优势:别的国家靠企业自己建机房,中国还额外多了一张国家级的算力调度网。

3.4 中国模型 + 中国算力:适配版图

有了国产模型,也有了国产芯片,还差最后一步:让它们真正配合默契。这一步比外行想象的难得多。

🎮 打个比方:适配 = 同一款游戏要在不同游戏机上都能玩

一款游戏做出来,想同时在几种游戏机上运行,不是把光盘塞进去就行——每台机器的处理器、内存、手柄按键都不一样,得专门"移植"一遍:重新编译、重调性能、修各种奇怪的兼容Bug。移植不好,画面会卡、按键会失灵。

大模型跑在不同芯片上是同一个道理。模型里那些算子(人话:模型运算的最小零件,比如矩阵乘法、归一化),在英伟达卡上有现成的高效实现,换到国产芯片上就得重新写一遍、重新调优。能跑起来只是及格,跑得和原生一样快才叫适配成功。

让人意外的是,这件苦活在中国推进得相当快。2025年初DeepSeek-R1发布后,国产芯片厂商在极短时间内密集宣布完成适配,出现了业界所说的"Day 0适配"(人话:模型发布当天或次日就宣布自家芯片能跑)现象。到2026年,主流国产大模型与主流国产芯片之间,已经基本织成了一张"多对多"的网。

芯片平台 配套软件栈 已适配的主要国产模型 典型应用场景
华为昇腾 CANN + MindSpore DeepSeek V4系列、Qwen、GLM、Kimi 超节点集群训练与推理,政企与运营商
海光 DCU DTK(兼容主流GPU编程模型) DeepSeek、Qwen、GLM 超算中心、科研院所、政企私有化部署
寒武纪 思元 Neuware(自研指令集) DeepSeek、Qwen 互联网大厂推理、运营商智算中心
摩尔线程 MTT MUSA + 夸娥集群方案 DeepSeek、Qwen 整柜交付的智算中心,兼顾渲染与科学计算
百度昆仑芯 飞桨 PaddlePaddle 文心ERNIE、DeepSeek 百度搜索、自动驾驶、三万卡级训练集群
阿里自研加速芯片 磐久服务器 + 阿里云平台 通义千问Qwen系列 自有业务推理与云上算力供给
地平线 征程 天工开物工具链 车端轻量化模型与智驾专用模型 乘用车高阶智能驾驶

表24-2 国产模型与国产芯片的适配版图。同一个模型能在多家国产芯片上跑,同一家芯片也能承接多个国产模型——这张"多对多"的网,才是供应链安全的真正含义。

这张网的价值,要放到风险场景里才看得清。如果只有"一款模型+一款芯片"能配合,那么任何一端出问题,整条链就断了;而当七八家芯片厂商都能跑DeepSeek和Qwen,任何单点故障都不再致命。冗余,就是安全。

更深一层的价值在于协同优化。当芯片团队和模型团队坐在一张桌子上,事情就不一样了:模型这边可以按芯片的强项调整架构(比如把MoE的专家数量设成芯片互联拓扑最舒服的数字),芯片那边可以为模型的高频算子专门做硬件加速。昇腾运行DeepSeek V4能达到20ms TPOT和4700 TPS,靠的正是这种"软硬一起改"的默契——这是"通用芯片+通用模型"各干各的组合很难达到的效率。

当然,也要如实说清楚差距。在单卡峰值算力制造工艺上,国产芯片与国际最先进产品仍有距离,很多时候是靠"更多卡+更好的集群调度"把总算力补回来的——这在功耗和成本上要付出代价。在软件生态成熟度上,CUDA积累了近二十年的算子库、调试工具和开发者习惯,国产软件栈还在追赶的路上,开发者迁移时踩坑仍然不少。承认这些差距,不会削弱2026年这份成绩单的分量;相反,正因为是在这样的约束下跑出来的成绩,才更说明工程能力的含金量。

四、开源生态:中国引领全球

开源是AI民主化的核心动力。2026年,中国不再只是开源模型的"消费者",而是成为了全球开源AI生态的"引领者"。从模型数量、下载量到社区活跃度,中国开源力量在多个维度上实现了历史性反超。

Hugging Face全球最大的AI开源模型社区发布的《2026春季开源现状报告》显示:中国团队开发的开源模型占该平台基础模型下载总量的41%,首次超越美国。这是一个标志性时刻——意味着全球开发者在选择开源基座模型时,首选正在从Llama转向DeepSeek、Qwen等中国模型。在多个权威调用榜单中,中国模型跻身前列。截至2026年中,中国开源大模型的全球累计下载量已突破100亿次。

在社区建设方面,国家级AI开源社区已汇聚用户超1100万,托管模型逾7万个,覆盖自然语言、多模态、科学计算等多个方向。国资委国务院国资委,管理国有企业的部门推动的"焕新社区"2.0计划开放了超2000张国产算力卡,专门供开发者免费使用,降低了开源创新的硬件门槛。这是全球范围内罕见的"国家级算力补贴开源"模式。

与Hugging Face等国际平台相比,中国开源社区形成了自身的差异化优势。一方面,国内社区更注重端侧部署和行业适配,提供了大量面向手机、边缘设备的轻量化模型和部署工具;另一方面,社区内置了中文优化和多语言支持,对非英语场景的适配更加完善。这种"端侧优先+多语言优化"的策略,让中国开源社区在全球南方市场(如东南亚、中东、拉美)获得了快速增长。

开源模型的透明性也为安全提供了额外保障。开源模型因代码可审计,安全风险更易被发现和修复——全球开发者和安全研究者可以随时审查模型权重、训练流程和推理代码,潜在漏洞在社区协作下往往能被快速定位和修补。这一优势凸显了开源的核心价值:透明可审计——当出问题时,你能看见、能追溯、能修复,而闭源模型则像一个黑箱。

价格优势也是中国开源生态的重要竞争力。中国开源模型的API价格较国际同类产品低60%至90%,直接推动了AI在全球的普及。Airbnb、西门子等跨国企业已开始接入测试中国开源模型,用于客服、代码生成、文档分析等场景。低成本+高质量+全开源的组合,正在让中国模型成为全球企业的"默认选项"。

中国开源生态的影响力还体现在标准制定层面。2026年,多个由中国团队发起的模型格式规范、评测基准和部署工具链被国际社区广泛采纳。例如,DeepSeek提出的MoE推理优化方案成为Hugging Face官方推荐的最佳实践之一;Qwen的多语言评测基准被多国研究机构用作标准测试集。这意味着中国不仅在"输出模型",更在"输出标准"——这是技术生态成熟度的重要标志。

下面是中国开源生态发展的关键里程碑:

2024年初
DeepSeek开源引爆社区
DeepSeek以极低训练成本和完整开源策略震撼业界,证明了"小团队+高效训练"也能产出顶级模型,开启了中国开源模型的全球影响力。
2025年
Qwen家族全球扩散
通义千问全尺寸开源,从0.5B到千亿级覆盖端云全场景,成为全球开发者最常用的开源基座之一,下载量持续攀升。
2026年春
中国开源下载量首超美国
Hugging Face报告显示中国开源模型下载占比达41%,超越美国,成为全球第一。在多个权威调用榜单中,中国模型跻身前列。
2026年6月
GLM-5.2以MIT协议全量开源
智谱以最宽松的MIT协议开源GLM-5.2完整权重,开源智能指数51分一度领跑全球,推动"真开源"成为行业新标准。
2026年7月
Kimi K3发布并登顶趋势榜
全球首个3万亿级参数真开源模型上线,完整权重开放即登顶Hugging Face趋势榜,标志着中国开源模型进入"定义开源"阶段。

五、产业应用:全面开花

技术突破的最终检验场是产业。2026年,中国AI不再停留在"demo演示"阶段,而是深入到工业、金融、能源、医疗等核心行业的真实业务流程中,创造出可量化的价值。从车间到手术室,从电网到银行,AI正在变成"新质生产力"的引擎。

与此前"AI做PPT""AI写文案"等轻量场景不同,2026年的产业AI具备三个新特征:一是深入核心业务流程而非辅助环节,二是产出可量化的经济效益而非模糊的"效率提升",三是形成可复制的行业解决方案而非一次性定制。这三个特征标志着中国AI产业应用从"试验阶段"进入"规模部署阶段"。

🏭
工业:卡尔斯工业大模型
卡尔斯工业大模型深入注塑车间,将工艺调参周期缩短90%,能耗显著降低。上海电气已部署51个行业智能体,覆盖设备运维、质量检测、生产调度等核心环节,实现从单点优化到全厂智能的跨越。
🏦
金融:银联智能风控
中国银联联合17家金融机构共建百亿级金融语料库,训练出行业级风控大模型。该模型上线后累计拦截可疑交易超2亿元,欺诈识别准确率大幅提升,同时将误报率降至历史最低。
能源:擎源发电大模型
国家能源集团发布全球首个千亿级发电行业大模型"擎源",覆盖火电、风电、光伏等多场景,用于设备预警、负荷预测和运行优化,推动传统能源行业向智能化转型。
🏥
医疗:观心智能体等51项应用
心血管病"观心"辅助诊疗智能体等51项医疗AI应用进入中试推广阶段,覆盖影像诊断、病历分析、用药建议等场景,辅助基层医生提升诊疗效率与准确率。

这些案例的共同特点是:AI不再是"锦上添花",而是"不可或缺"。工业大模型直接缩短了90%的调参周期——这不是百分之几的效率提升,而是量级跨越。金融风控大模型拦截了2亿元可疑交易——这是真金白银的损失挽回。发电大模型深入到设备预警和负荷预测——这是关乎国计民生的基础设施智能化。医疗智能体进入中试推广——这意味着AI正在从实验室走向临床一线。

更值得关注的是,这些应用并非孤立存在。2026年,中国正在形成"基础大模型+行业大模型+场景智能体"的三层应用架构:底层是DeepSeek、Qwen等通用基座,中间层是卡尔斯、擎源等行业定制模型,上层是面向具体任务的智能体。这种分层架构让AI能够快速适配不同行业的需求,大幅降低了落地成本。

以工业领域为例,卡尔斯工业大模型的成功并非偶然。注塑工艺长期依赖资深工程师的经验调参,一个新产品的工艺参数调试往往需要数天甚至数周。卡尔斯大模型通过学习海量历史工艺数据,将调参周期缩短90%——原本需要一周的工作,现在几小时内即可完成,且优化后的参数在能耗和良品率上均优于人工调参。上海电气的51个行业智能体更进一步,将AI嵌入到设备运维、质量检测、生产调度等核心环节,形成了"AI调度员""AI质检员""AI维修师"的智能体矩阵,实现了从单点优化到全厂智能的跨越。

金融领域的突破同样令人瞩目。中国银联联合17家机构共建的百亿级金融语料库,是行业内首次实现多方数据协同训练的尝试。传统风控系统依赖规则引擎,面对新型欺诈手段往往滞后;而基于大模型的风控系统能够理解交易语义、识别异常模式,在欺诈发生前即发出预警。累计拦截超2亿元可疑交易的成果,证明了AI风控的实际价值。

能源和医疗领域的进展则体现了AI的社会价值。国家能源集团的"擎源"大模型深入发电场景,通过设备预警减少非计划停机,通过负荷预测优化电网调度,直接关系到千家万户的用电稳定。医疗领域的"观心"智能体等51项应用进入中试推广,意味着AI辅助诊疗正在从实验室走向基层医院——在医疗资源分布不均的现实下,AI有望成为基层医生的"超级助手",缩小城乡诊疗能力差距。

六、政策与战略

技术突破的背后,是政策的系统性布局。2026年,中国在AI领域的政策支持从"鼓励发展"升级为"战略统筹",从中央规划到地方落地,从产业扶持到终端补贴,形成了一套完整的推动体系。

"十五五"规划2026—2030年的国家五年规划将人工智能明确定位为新质生产力的核心抓手。这一定位意味着AI不再被视为单一技术赛道,而是驱动所有产业升级的"元技术"。规划提出要加快AI与实体经济深度融合,推动AI在制造业、农业、服务业的全链条渗透,并明确要求突破高端芯片、基础软件等关键环节。

在算力基础设施方面,国家推动建设多层级算力网络,实现东数西算把东部计算需求调度到西部算力中心,像"西电东送"但送的是算力、算力调度和跨区域共享。国产算力中心大规模部署昇腾超节点,为科研机构和企业提供普惠算力服务。这一布局既解决了算力资源分布不均的问题,也为国产芯片提供了规模化应用场景,形成了"以用促研、以研促产"的正向循环。

教育部发布《"人工智能+教育"行动计划》,推动AI进入中小学课堂和高校科研体系。计划提出建设AI通识课程体系、培养复合型AI人才、建设AI教研基础设施三大任务。这正是本书所服务的目标——让每个人都能理解AI、使用AI。

在终端消费侧,AI智能眼镜被纳入国家补贴目录。这一政策直接降低了消费者购买AI硬件的门槛,推动了AI从"手机里的App"向"戴在身上的智能助手"演进。端云协同架构成为AI终端落地的核心路径——终端负责轻量推理和感知交互,云端负责复杂计算和知识服务,两者通过高速网络协同工作。这一架构既解决了端侧算力不足的问题,又兼顾了隐私和延迟需求,正在成为行业标准范式。

除了中央层面的政策,各地方政府也推出了差异化的AI发展方案。北京聚焦基础研究和前沿模型,上海侧重AI芯片和算力基础设施,深圳发力AI硬件和终端产品,杭州深耕AI+电商和AI+金融。这种"中央统筹+地方特色"的政策体系,避免了同质化竞争,让不同地区发挥各自优势,形成了全国AI产业的合理分工。

在数据要素方面,2026年进一步完善了数据流通和交易制度,推动高质量训练数据的合规共享。多个行业数据交易平台上线运营,覆盖医疗、金融、工业等领域,为大模型训练提供了合法、高质量的数据来源。数据要素的市场化配置,正在成为中国AI发展的又一制度优势。

七、中美AI竞争新格局

2026年,中美AI竞争的格局发生了深刻变化。中国从"追赶者"变为"并跑者",在部分领域甚至成为"领跑者"。这并不意味着竞争结束,而是进入了更复杂、更多维的新阶段。

回顾中国AI的竞争角色演变,大致经历了三个阶段。2022至2023年是"追赶期"——ChatGPT发布后,中国团队迅速跟进,但模型性能和应用深度与国际前沿存在明显差距。2024至2025年是"并跑期"——DeepSeek和Qwen等模型在多项基准上接近国际一流水平,国产芯片开始规模部署,差距快速缩小。2026年则是"部分领跑期"——在开源模型下载量、API成本、编程竞赛性能、国产算力吞吐等维度上,中国实现了反超。但这种领先是"部分"的、是"维度"的,而非全面的、压倒性的。

竞争的焦点正在从"谁的模型更强"扩展为"谁的生态更可持续"。美国凭借英伟达GPU和CUDA生态在高端算力上仍有优势,OpenAI和Google在闭源前沿模型上保持领先;而中国则凭借昇腾+DeepSeek的自主供给链、全球第一的开源下载量、以及低成本的API服务,构建了一个日益独立且更具包容性的AI生态系统。全球正在形成两个各有特色的AI技术栈。

这种"双生态"格局对全球其他国家和地区产生了深远影响。欧洲、东南亚、中东等地区的开发者和企业,不再只能选择美国技术栈,而是有了第二个完整且低成本的选择。一些国家开始同时接入中美两套AI体系,根据场景需求灵活选择——用美国闭源模型处理高难度推理任务,用中国开源模型处理大规模日常任务。这种"双栈并行"的策略正在成为全球AI应用的新常态。

更深层的分歧在于开源与封闭的路线之争。美国头部企业(OpenAI、Google、Anthropic)坚持闭源路线,将前沿模型作为核心竞争力加以保护;中国则选择了以开源为核心策略,通过开放权重、降低门槛来扩大影响力。两种路线各有逻辑:闭源有利于保持技术壁垒和商业回报,开源有利于生态扩散和社区共建。2026年的数据显示,开源路线在全球开发者中的接受度正在快速上升——中国开源模型41%的下载占比就是最好的证明。

中国路线:开源驱动

  • 核心策略:全量开源+低成本API
  • 算力底座:昇腾NPU+CANN自主供给链
  • 生态特点:模型权重开放,社区共建共享
  • 优势:成本低、扩散快、可审计
  • 代表:DeepSeek、Qwen、GLM、Kimi

美国路线:封闭前沿

  • 核心策略:闭源前沿模型+高端算力
  • 算力底座:英伟达GPU+CUDA生态
  • 生态特点:模型权重封闭,API商业变现
  • 优势:性能领先、商业回报高
  • 代表:GPT-5、Claude、Gemini

需要客观看待的是,中国AI并非全面领先。在高端芯片制造工艺(如先进制程光刻)、基础理论原创研究(如新型架构和训练范式)、以及顶尖人才储备等方面,中国与美国仍有差距。竞争是长期的,格局是动态的,任何阶段性的领先都不应成为懈怠的理由。

值得警惕的是,竞争也可能带来"脱钩"风险。如果中美AI生态走向完全隔离,全球开发者将面临"二选一"的困境,这对技术进步和人类福祉都是不利的。中国开源模型的全球流行,某种程度上正是对"脱钩"趋势的一种对冲——当全球开发者都在使用DeepSeek和Qwen时,技术隔离的代价将高到难以承受。从这个角度看,中国坚持开源路线不仅是技术策略,也是维护全球技术连通性的公共贡献。

八、展望

站在2026年中回望,中国AI取得的成就令人振奋;但展望未来,挑战同样清晰。理解优势与正视短板,同样重要。

中国AI的独特优势体现在三个方面:第一,超大规模应用市场——14亿人口和完整的工业体系为AI提供了全球最丰富的落地场景和数据积累;第二,完整产业链——从芯片设计到模型训练,从硬件制造到软件部署,中国几乎覆盖了AI全链条的每个环节;第三,系统性政策支持——从国家规划到地方落地,从产业扶持到终端补贴,政策力度和连贯性在全球范围内罕见。

这三大优势相互叠加,产生了强大的"飞轮效应":超大规模市场催生海量应用场景,应用场景产生丰富的数据和反馈,数据和反馈反哺模型迭代,模型迭代推动芯片优化,芯片优化又支撑更大规模的应用部署。这个飞轮一旦转起来,就会持续加速。2026年的成就,很大程度上就是这个飞轮开始高效运转的结果。

同时,中国AI也面临不容回避的挑战。在芯片制造工艺上,先进制程仍受限于光刻设备;在基础理论研究上,原创性架构创新和训练范式突破仍需积累;在人才储备上,顶尖AI研究人才的数量和质量与美国仍有差距。这些短板不是靠"举国体制"能短期弥补的,需要长期的、持续的基础投入。

具体而言,芯片制造工艺的差距是最紧迫的瓶颈。昇腾950在架构设计和互联方案上已达到世界一流,但其芯片制造仍依赖成熟制程,在单片芯片的晶体管密度和能效比上与英伟达最先进的制程存在差距。基础理论方面,Transformer架构、反向传播算法、RLHF等关键创新大多源自海外,中国在前沿架构(如非Transformer架构、全新训练范式)的原创性贡献上仍需持续发力。人才方面,虽然中国AI工程师规模庞大,但在能够定义研究方向、引领技术范式的顶尖科学家数量上,与美国顶尖高校和实验室仍有距离。

然而,挑战也意味着方向。2026年的突破已经证明,中国在工程效率、应用落地和生态构建上具有独特优势。如果能在基础研究和人才培养上持续投入,补齐"最后一公里"的短板,中国AI有望在未来几年实现从"部分领跑"到"系统领先"的跨越前瞻

展望未来,中国AI有几个值得关注的演进方向。在技术层面,端云协同架构将进一步成熟,AI将从云端走向手机、眼镜、汽车等终端,实现"无处不在"的智能服务。在产业层面,行业大模型将从单点应用走向全链条覆盖,AI将成为像电力一样的基础设施。在生态层面,中国开源模型有望从"下载量第一"走向"影响力第一",在全球AI标准制定中拥有更大话语权。这些方向的推进,将共同决定中国AI能否从"2026年的里程碑"走向"持续性的领先"前瞻

🌟
中国AI发展的启示

2026年的中国AI故事给我们的最大启示是:开放比封闭更有力量,效率比规模更重要,生态比单品更持久。DeepSeek用极低训练成本产出顶级模型,证明了工程效率的价值;中国开源模型以41%的下载占比反超美国,证明了开放生态的力量;昇腾+DeepSeek的全栈自主供给链,证明了产业链完整性的战略意义。

中国AI的下一步,不仅要在性能上追赶前沿,更要在基础理论、芯片工艺和人才培养上补齐短板。真正的领先,不是某一项指标的超越,而是整个创新体系的可持续。

九、本章术语速查

术语 一句话解释
MoE(混合专家架构) 将参数分为多个"专家"子网络,每次推理只激活一小部分,DeepSeek V4-Pro激活率仅约3%
AI Agent(智能体) 能听懂任务、自己拆步骤、调用工具、失败后返工的AI程序。模型提供智力,Agent提供手脚
任务规划 Agent接到任务后先列提纲、拆成若干步的能力,是它区别于"一问一答"的第一道门槛
工具调用 让模型去用搜索、代码、浏览器、数据库等外部能力。知道该找谁帮忙,比什么都自己会更重要
MCP(Model Context Protocol) 模型上下文协议,规定AI与工具之间怎么对话的统一标准,相当于AI世界的"统一插座"
A2A(Agent to Agent) 智能体之间互相通信、组队协作的协议,解决"多个Agent怎么分工"的问题
Terminal Bench / DeepSWE 两套专考Agent"动手能力"的基准:前者考命令行独立完成任务,后者考修真实项目的Bug
DCU(深度计算处理器) 海光的通用加速卡产品线,主打兼容主流GPU编程模型、原有代码迁移成本低
BPU 地平线自研的车规级AI处理架构,用在征程系列芯片上,为汽车智能驾驶专门设计
全功能GPU 同时支持AI计算、图形渲染、视频编解码与科学计算的GPU,摩尔线程走的就是这条路线
算子 模型运算的最小零件,如矩阵乘法、归一化。换一种芯片就要重写并重新调优这些零件
Day 0适配 模型发布当天或次日,芯片厂商就宣布自家硬件能跑通该模型,体现软硬件协同的响应速度
软件栈 芯片配套的驱动、算子库与开发工具的总称,如昇腾CANN、寒武纪Neuware、摩尔线程MUSA、海光DTK
TPOT(Time Per Output Token) 每生成一个token所需的时间,衡量大模型推理延迟的关键指标
TPS(Tokens Per Second) 每秒生成的token数量,衡量大模型推理吞吐量的关键指标
FP8 / MXFP8 / MXFP4 低精度浮点数格式,更低精度意味着更少内存和更快计算,是提升芯片效率的关键技术
SWE-bench Verified 软件工程基准测试,评估AI解决真实GitHub issue的能力,DeepSeek V4-Pro达80.6%
端云协同 终端负责轻量推理和感知交互,云端负责复杂计算和知识服务,兼顾延迟、隐私和算力
超节点 将大量AI加速芯片通过高速互联组成统一计算集群,昇腾950互联1024张NPU提供1 EFLOPS算力
CANN 华为计算架构 for 神经网络框架,2026年全面开源,支持PyTorch等主流框架
CUDA 英伟达给自家GPU配的"软件工具箱"(全称Compute Unified Device Architecture)。它让GPU从"只会画图"变成"能算AI、做科学计算",壁垒来自近二十年攒下的算子库、调试工具和开发者习惯
全栈自主供给链 从昇腾NPU到CANN框架再到DeepSeek大模型的"芯片-框架-模型"三位一体自主生态
"真开源" 完整权重+宽松协议+即时发布的开源模式,Kimi K3和GLM-5.2推动其成为行业新标准
Artificial Analysis开源智能指数 全球开源模型能力评测榜单,GLM-5.2以51分一度领跑全球
新质生产力 "十五五"规划对AI的定位,即驱动所有产业升级的"元技术"
EFLOPS 每秒百亿亿次运算(10的18次方),相当于全中国14亿人每人每秒各算7亿次
NPU 神经网络处理器,专门为AI运算设计的芯片(类似GPU但更专精AI)
OCR 光学字符识别,把图片里的文字"读"出来变成可编辑的文本
东数西算 把东部密集的计算需求调度到西部算力中心,像"西电东送"但送的是算力
国资委 国务院国有资产监督管理委员会,管理国有企业的部门
Hugging Face 全球最大的AI开源模型社区,中国开源模型下载量占比在此统计
"十五五"规划 2026—2030年的国家五年规划,将AI定位为新质生产力的核心抓手

本章小结

🎯
四句话记住本章

国产大模型跻身全球第一梯队:DeepSeek V4在Codeforces超越GPT-5,Kimi K3成为全球首个3T级真开源模型,Qwen累计下载超10亿次超越Llama。

Agent让模型从"会说"走向"会做":Manus引发全球关注,扣子、百炼、AutoGLM密集落地,MCP成为连接工具的"统一插座";但长任务成功率、成本与安全边界仍需有人盯着。

全栈自主供给链打通:昇腾950超节点提供1 EFLOPS算力,CANN框架全面开源,"芯片-框架-模型"三位一体协同优化成为独特竞争优势。

开源生态首次反超美国:中国开源模型占Hugging Face下载量41%,在多个权威调用榜单中中国模型跻身前列,开放比封闭更有力量。

  1. 国产大模型全面突破:DeepSeek V4编程竞赛超越GPT-5,API价格约为GPT-5.6的1/18;Qwen下载量全球第一;Kimi K3和GLM-5.2推动"真开源"成为行业新标准。
  2. 国产Agent从"会说"走向"会做":Manus引发全球关注,扣子、百炼、AutoGLM等平台密集落地,编程与端侧Agent进入日常;MCP成为连接工具的"统一插座";但长任务成功率、调用成本与安全边界仍是三道未过的坎。
  3. 国产AI芯片跨越式发展:昇腾950超节点1 EFLOPS算力,DeepSeek V4-Pro实现20ms TPOT和4700 TPS;海光、寒武纪、摩尔线程、阿里平头哥、地平线、昆仑芯沿通用、专用、车规三条路线各自成军,多芯片厂商完成适配形成产业集群。
  4. 中国模型+中国算力织成"多对多"网络:"Day 0适配"成为常态,同一模型可跑在多家国产芯片上,同一芯片可承接多个国产模型;软硬协同优化带来效率红利,但单卡算力、制造工艺与软件生态成熟度仍是短板。
  5. 开源生态历史性反超:中国开源模型下载占比41%首超美国,在多个权威调用榜单中中国模型跻身前列,累计下载突破100亿次。
  6. 产业应用全面开花:工业大模型缩短90%调参周期,银联风控拦截2亿元可疑交易,"基础大模型+行业大模型+场景智能体"三层架构成型。
  7. 政策系统性布局:"十五五"规划将AI定位为新质生产力核心抓手,AI眼镜纳入国家补贴目录,数据要素市场化配置成为制度优势。
  8. 中美竞争进入新格局:中国从"追赶者"变为"部分领跑者",在开源下载量、API成本、编程性能等维度实现反超,形成两个各有特色的AI技术栈。
  9. 优势与挑战并存:超大规模市场、完整产业链、系统性政策是优势,芯片制造工艺、基础理论原创、顶尖人才储备是仍需补齐的短板。

2026年的中国AI,已经走出了从跟跑到并跑、再到部分领跑的突围之路。但技术突破的最终归宿,是让AI真正成为千行百业的生产力。下一章,我们将看到中国"AI+"国家战略如何把AI从"技术话题"提升为"国家战略",以及在个人助手、一人公司、企业场景和WAIC大会上取得的落地成果。

"2026年的中国AI故事告诉我们:开放比封闭更有力量,效率比规模更重要,生态比单品更持久——真正的领先不是某一项指标的超越,而是整个创新体系的可持续。"