人工智能通识读本
第一篇:什么是AI

AI评价体系与基准测试🧗 硬核

上一章我们了解了 AI 脚手架与系统工程,知道了一个好产品不只是"用最好的模型",更是"搭最好的系统"。但随之而来一个自然的问题:怎么判断一个模型或一个系统到底"好不好"?参数越多就越强?分数越高就越聪明?价格越贵就越值?这一章,我们把AI评价这件事拆成五个维度——从模型自身的静态参数,到动态执行能力,到推理引擎性能,再到算力标准和计费体系——帮你建立一套立体的判断框架。

🗂️ 读前小抄:本章会遇到的字母与数字
这一章像一张汽车参数表,字母缩写扎堆。不用背——读到卡壳时翻回来看一眼就行。它们说的都是同一件事:这个 AI 快不快、强不强、贵不贵。
  • 参数量Parameters 模型脑子里有多少个可调的旋钮,相当于手机的内存有多大
  • 上下文窗口Context Window 短期记忆力:一次能同时记住多少内容,超出就忘
  • FLOPS每秒浮点运算次数 芯片每秒能做多少次算术,算力的跑分
  • TTFT首字延迟 按下发送键,到蹦出第一个字,要等多久
  • TPOT每字耗时 第一个字之后,字与字之间的间隔有多长
  • TPS每秒吐字数 整台机器一秒钟总共能吐出几个字
  • FP88 位浮点格式 用更省的笔写字,写得快、也省电,代价是字略糙
  • Elo天梯积分 下棋和电竞里那套排位分:赢强者加分多,赢弱者加分少

一、总论:评价AI的五个维度

如果你要买一辆车,你会关注什么?发动机排量、百公里加速、油耗、轴距、价格……你不会只看一个数字就做决定。评价AI模型也一样——它不是一张考卷上的一个分数,而是一个多维度的立体画像。2026年的AI评价体系,已经从早期单一的"排行榜分数"演化为五个相互独立又相互关联的维度:

📐
静态参数
模型的"出厂规格"——参数规模、上下文窗口大小、架构类型。这些是模型还没跑起来就能写在规格表上的数字,相当于车的排量和轴距。
动态执行能力
模型跑起来以后"能做什么"——编程、推理、数学、Agent任务、人类偏好。这是基准测试的核心战场,相当于车的百公里加速和操控表现。
🔧
推理引擎
模型"跑得多快"——首token延迟、每token耗时、吞吐量。引擎性能决定了用户体验的流畅度,相当于车的实际驾驶感受。
💾
算力标准
训练和推理"花了多少算力"——FLOPS、精度格式、内存带宽。算力是AI的物理底座,相当于车的发动机技术参数。
💰
计费体系
使用模型"要花多少钱"——按token计费、输入输出差价、缓存折扣。计费体系直接决定了模型的商业可用性,相当于车的油价和保养成本。

这五个维度从不同角度回答了同一个问题:"这个AI到底好不好?"一个参数规模大、基准分数高的模型,如果推理速度慢、价格昂贵,在实战中未必胜过一个更小但更快更便宜的模型。真正的评价,必须是多维度的综合判断。接下来,我们逐一拆解每个维度。

🎈 打个比方

这五个维度听起来专业,其实你早就会了——就是去店里挑一台手机的那套本事。

参数量是内存有多大,上下文窗口是短期记忆力、一次能记住多少事,算力是处理器的跑分。

定价是话费套餐,用多少算多少;能力榜单是各大跑分软件的排行榜——可以参考,但谁都知道,跑分高的手机不一定用着最顺手。

二、模型静态参数:出厂规格表

静态参数是AI模型最基本的信息——不需要运行模型就能知道的"出厂规格"。就像手机包装盒上写的处理器型号和内存大小,这些数字虽然不能完全代表实际体验,但是最直接的横向比较基准。

模型参数:越大越强?

参数(Parameters)是神经网络中"可学习的权重"的数量,通常以B(十亿)为单位。GPT-3有1750亿参数,2026年的旗舰模型参数已迈向万亿级别。参数越多,模型的"记忆容量"和"表达能力"理论上越强——但这条规律正在被打破。

原因在于MoE(混合专家)架构的普及。传统密集模型(Dense Model)每次推理都要激活全部参数,而MoE模型有多个"专家"子网络,每次推理只激活其中一小部分。这意味着总参数和激活参数是两个完全不同的概念

模型总参数激活参数架构开源
DeepSeek V4-Pro671B49BMoE是(MIT)
DeepSeek V4-Flash~1T32BMoE + 条件记忆是(MIT)
Kimi K32.8T16BMoE(896专家)
GLM-5745BMoE
Llama 4 Maverick400B17BMoE
GPT-5.6未公开未公开未公开
Claude Opus 4.8未公开未公开未公开

这张表揭示了一个关键事实:DeepSeek V4-Flash总参数约1万亿,但每次推理只激活320亿参数(约3%)。Kimi K3总参数2.8万亿,每token仅激活160亿。这意味着它们能用更少的计算量实现与大模型相当的性能——参数规模大不等于推理成本高,关键看激活了多少

💡
为什么"闭源三巨头"不公布参数?

OpenAI(GPT系列)、Anthropic(Claude系列)和Google(Gemini系列)均不公开模型参数规模。这既是商业保密——参数规模暴露了训练成本和架构选择——也是为了避免简单的"参数攀比"。对于闭源模型,用户只能通过API调用,无法也无需知道参数量,真正需要关注的是实际能力和价格。

上下文窗口:AI的"短期记忆"

上下文窗口(Context Window)是模型一次能接收和处理的文本长度,以token为单位。它相当于AI的"短期记忆"——窗口越大,模型一次能"看到"的信息越多。从早期的4K到2026年的200万token,上下文窗口的扩展速度令人惊叹:

2020—2022
4K—8K 时代
GPT-3仅支持2K-4K token,约等于一篇短文。GPT-4初期支持8K,约12页文字。
2023—2024
128K 成为标配
GPT-4 Turbo支持128K(约300页),Claude 2扩展到100K。长文档分析成为可能。
2025
迈向百万token
DeepSeek V3.2将上下文从12.8万扩展到100万。Gemini 1.5 Pro率先支持100万token。
2026
百万起步,两百万封顶
GPT-5.6支持105万,Claude Opus 4.8支持100万,Gemini 3.1 Pro支持100万-200万,Grok 4.1 Fast达到200万。百万token上下文已成为旗舰模型标配。

上下文窗口大有什么用?简单说:它决定了AI一次能处理多少信息。4K窗口只能处理一篇短文,100万窗口可以吞下整套《哈利·波特》七部曲。这对于长文档分析、代码库理解、多轮对话保持一致性等场景至关重要。

但上下文窗口也有"陷阱"。第一,窗口大不等于记忆好——模型可能在100万token的文本中找不到关键信息("大海捞针"问题)。第二,越长越贵——许多模型对超过特定阈值(如20万token)的输入加收费用。第三,越长越慢——处理百万token的延迟远高于处理数千token。因此,选模型时不要盲目追求最大窗口,要结合实际需求。

三、计费体系:用AI到底花多少钱

无论模型多强大,如果用不起,一切等于零。计费体系是评价AI模型的"经济维度"——它直接决定了一个模型是否能在商业场景中落地。2026年的AI计费体系已经形成了相当成熟的结构,理解它,才能算清"用AI到底花多少钱"这笔账。

Token:AI的计价单位

AI模型不按"字数"或"条数"收费,而是按Token收费。Token是大语言模型处理文本的基本单位——大约相当于一个词或几个汉字。英文中,一个token约等于0.75个单词("hello"是1个token,"understanding"可能被拆成2-3个token);中文中,一个汉字通常对应1-2个token。

行业标准计费单位是MToken(百万token),价格表述为"X美元/百万输入token"或"X元/百万输出token"。为什么用"百万"而不是"个"?因为单次调用的token量很小(一次对话可能消耗几百到几千token),用百万级单位能让价格数字更直观——"输入$5/百万token"比"输入$0.000005/token"好读得多。

📌
输入和输出为什么要分开计费?

因为计算成本完全不同。输入(Prompt)只需做一次前向传播的Prefill(预填充),可以高度并行;输出(Completion)需要逐token自回归生成(Decode),每一步都依赖上一步的结果,无法并行。因此输出价格通常是输入的4-6倍。这也意味着,控制输出长度是降低成本的最大杠杆——让模型说重点,别让它啰嗦。

2026年主流模型定价对比

以下表格汇总了2026年7月主流模型的API定价,数据来自各厂商官方定价页面。海外模型以美元计价,国产模型以人民币计价:

模型输入价输出价缓存输入价上下文
海外模型(美元/百万token)
GPT-5.6 Sol$5.00$30.00$0.501.05M
GPT-5.4 nano$0.20$1.25$0.021.05M
Claude Opus 4.8$5.00$25.00$0.501M
Claude Sonnet 5$3.00$15.00$0.301M
Gemini 3.1 Pro(≤200K)$2.00$12.00$0.201M-2M
Gemini 3.5 Flash$1.50$9.00$0.151M
国产模型(人民币/百万token)
DeepSeek V4-Flash≈¥1.01≈¥2.02≈¥0.021M
DeepSeek V4-Pro≈¥3.13≈¥6.26≈¥0.311M
通义千问 Qwen3-max¥2.50¥10.00256K
通义千问 Qwen3.7-max¥6.00¥18.001M
智谱 GLM-5.2¥8.00¥28.001M
智谱 GLM-4.7-Flash免费免费200K

这张价格表最能说明问题的不是绝对价格,而是价差。GPT-5.6 Sol的输出价是$30/百万token,DeepSeek V4-Flash的输出价约¥2.02(约$0.28)——相差超过100倍。如果两个模型在特定任务上效果接近,选择DeepSeek意味着同样预算可以做100倍的工作量。这就是为什么越来越多企业开始重新评估"只选最贵的"策略。

省钱的三个秘诀

🗂️
缓存折扣
当请求中包含重复内容(如system prompt、固定上下文),命中缓存后输入价格可降低约90%。DeepSeek V4-Flash缓存命中价仅$0.003/百万token,比正常输入低98%。大多数厂商已实现自动缓存,无需额外配置。
📦
批量调用
非实时场景可使用Batch API(24小时内异步完成),输入输出价格通常半价。通义千问、智谱GLM、OpenAI、Anthropic、Google均提供50%折扣的批量接口。适合离线数据处理、批量翻译、批量分类等场景。
📏
长上下文阶梯价
部分模型对超长输入加价。Gemini 3.1 Pro超过20万token后价格翻倍;GPT-5.x超过27.2万token后输入2倍、输出1.5倍。评估成本时务必考虑上下文长度的影响。
选模型的价格原则

第一,看输出价而非输入价。输出价通常是输入的4-6倍,是成本的大头。第二,看缓存策略。高频重复调用的场景,缓存折扣能省90%的输入成本。第三,看量级匹配。简单任务用nano/Flash级模型就够了,不必动用旗舰。GPT-5.4 nano的输出价$1.25只有GPT-5.6 Sol的4%——对于简单分类或短文本生成,效果差异可能微乎其微。

四、算力评价体系与标准

AI的底层是算力。没有足够的算力,再好的算法也跑不起来。算力评价体系解决的是"这台机器到底能跑多快、跑多大的模型"这个问题——它是AI基础设施的"度量衡"。

FLOPS:算力的基本单位

FLOPS(Floating-point Operations Per Second,每秒浮点运算次数)一句话:芯片一秒钟能做多少道算术题,算力的跑分是衡量计算设备运算速度的基本单位。常用量级包括:

单位量级直观理解
TFLOPS10¹²(万亿次/秒)一张消费级GPU的算力级别
PFLOPS10¹⁵(千万亿次/秒)单张H100英伟达面向数据中心的旗舰 AI 芯片,AI 界的"算力硬通货" GPU的FP16算力级别
EFLOPS10¹⁸(百亿亿次/秒)千卡GPU集群的总算力级别

但只看FLOPS数字是不够的——精度不同,算力含义完全不同。同一个芯片在不同精度下的算力可以相差数倍:

精度格式位宽典型用途算力关系
FP3232位传统科学计算、高精度训练基准基准精度
FP16 / BF1616位主流大模型训练与推理约为FP32的2倍
FP8用更省的笔写字,快且省电,代价是字略糙8位2024年后训练推理主流低精度格式约为FP16的2倍
INT88位整数推理量化部署与FP8接近
FP4 / MXFP44位最新一代芯片支持的极限低精度约为FP8的2倍

精度越低,算力越高——但精度越低,数值表示的精度也越差,可能影响模型质量。2026年的趋势是:训练用FP8/BF16,推理量化到INT4/FP4。NVIDIA Blackwell架构首次支持FP4,华为昇腾950支持MXFP4——低精度格式使同等硬件的算力翻倍,是当前AI芯片竞争的核心战场。

训练算力:多少FLOP能训出一个大模型

训练一个大模型需要多少算力?学界有一个经验公式:

📐
训练算力经验公式:C ≈ 6 × N × D

其中 C 是训练所需的总浮点运算次数(FLOP),N 是模型参数量,D 是训练token数。前向传播约2ND次运算,反向传播约4ND次运算,合计约6ND。这个公式来自Chinchilla scaling law研究,是估计训练算力的基本工具。

举例:一个1750亿参数的模型,训练1万亿token,约需 C = 6 × 175×10⁹ × 10¹² = 1.05×10²⁴ FLOP。换算成H100 GPU(FP16约989 TFLOPS),单卡需要约33,600张·天——即3万张H100跑一天,或1万张跑三天。

这个公式解释了为什么大模型训练如此昂贵——参数翻倍或数据翻倍,算力就翻倍。也解释了为什么MoE架构如此流行:虽然总参数大,但训练时不需要每个参数都被所有数据激活,实际计算量远低于密集模型。

推理性能指标:用户感受到的速度

训练算力关心的是"训一个模型要多久",推理性能关心的是"用户等一个回答要多久"。后者对用户体验的影响更为直接。三个核心指标:

⏱️
TTFT(首token延迟)按下发送键,到蹦出第一个字要等多久
从用户发出请求到收到第一个token的时间。这个阶段模型在做Prefill(预填充)——把整个输入prompt一次性处理完。TTFT主要由内存带宽决定,prompt越长TTFT越高。用户体验上,TTFT超过1秒就会让人感觉"卡"。
🔢
TPOT(每token耗时)第一个字之后,字与字之间的间隔
生成每个输出token所需的时间。这个阶段模型在做Decode(解码)——逐token自回归生成。TPOT决定了文字"流出来"的速度。DeepSeek V4-Pro在昇腾950上实现20ms TPOT,即每秒生成50个token,阅读速度远超人类。
🚀
TPS(吞吐量)整台机器一秒钟总共吐出几个字
系统每秒能输出的token总数。与TPOT不同,TPS是系统级指标——通过批处理,一个GPU可以同时服务多个用户,总吞吐量远大于单用户的TPOT倒数。昇腾950超节点上DeepSeek V4-Pro单卡Decode吞吐达4700 TPS。

主流AI芯片算力对比

算力的物理载体是AI芯片。2026年,NVIDIA和华为是两大主力阵营,它们的旗舰芯片在算力规格上各有千秋:

芯片FP16/BF16算力FP8算力FP4算力内存内存带宽
NVIDIA H100989 TFLOPS1979 TFLOPS80GB HBM33.35 TB/s
NVIDIA H200989 TFLOPS1979 TFLOPS141GB HBM3e4.8 TB/s
NVIDIA B2004.5 PFLOPS9 PFLOPS18 PFLOPS192GB HBM3e8 TB/s
华为昇腾910B256 TFLOPS64GB HBM400 GB/s
华为昇腾9501 PFLOPS2 PFLOPS128-144GB1.6-4 TB/s

从纯规格看,NVIDIA B200在FP16算力上是昇腾910B的近18倍。但算力对比不能只看峰值数字——实际有效算力还取决于软件栈优化、互联带宽、集群规模和模型适配。华为昇腾950超节点(1024张NPU互联)在DeepSeek V4推理上实现了20ms TPOT和4700 TPS的单卡吞吐,这个实际性能已经不逊于同级别的NVIDIA方案。英伟达CEO黄仁勋在2026年WAIC上也坦言:"如果DeepSeek V4是针对华为优化的,那将使美国处于劣势。"

⚠️
峰值算力 ≠ 有效算力

芯片厂商标称的FLOPS通常是峰值理论算力——在最优条件下、跑最优算子时才能达到的上限。实际运行大模型时,由于内存带宽瓶颈、通信开销、算子效率等因素,有效算力往往只有峰值的30%-60%。这就是为什么两块标称算力差2倍的芯片,实际推理速度可能只差1.3倍。选芯片时,关注实际推理基准测试而非纸面参数。

五、模型能力评价体系与指标

静态参数看"规格",计费看"价格",算力看"底座"——但最终用户最关心的还是"能力":这个模型到底能做什么?做到什么程度?模型能力评价是AI评测的核心战场,也是竞争最激烈的维度。

基准测试:AI的标准化考试

基准测试(Benchmark)是给AI出一份"标准化考卷",用统一题目、统一评分来横向比较不同模型。2026年7月,主流基准测试覆盖了知识储备、编程能力、科学推理、数学、Agent任务和人类偏好等多个领域:

📌
读分数之前先看这一条

本节型号与分数为面向 2026 年的推演,标 前瞻 者尚未成为既定事实。榜单名字和考法是真的,具体名次和小数点后的分数请当作趋势看,别当作定论背。

📇 AI 考试榜单速查
记不住没关系,知道各自考什么就够了——它们是给 AI 出的不同科目的卷子。
MMLU 覆盖 57 个学科的百科知识大考,全是多选题
HumanEval 164 道 Python 编程小题,相当于编程入门测验
SWE-bench Verified 给 AI 出的真实编程修 bug 考试,题目取自 GitHub 上的真实故障
SWE-bench Pro 加难版:掺入不公开的私有代码库,防止提前背答案
SWE-rebench 只用模型训练截止之后才出现的新故障出题,杜绝泄题
Terminal-Bench 2.0 89 个多步命令行任务,考的是"会不会自己动手操作电脑"
GPQA Diamond 博士级科学推理题,物理化学生物,搜答案也搜不到
ARC-AGI-2 考临场推理的智力测验,专治死记硬背,前沿模型都不及格
FrontierMath 数学家私下出题并保密,Tier 4 是其中最难的一档
GAIA 多步骤真实任务,考"能不能把一件事从头做完"
MCP Atlas 专测工具调用:该用哪个工具、参数填得对不对
LMArena(Arena) 让两个模型匿名对打、由网友投票的擂台,用 Elo 天梯分排名
基准测试领先模型/分数状态测试内容
MMLUGemini 3.1 Pro: 94.3%前瞻已饱和57个学科多领域知识多选题
HumanEval90%+集群已饱和/退役164道Python编程题
SWE-bench VerifiedClaude Mythos: 93.9%前瞻近饱和500个真实GitHub issue修复
SWE-bench ProClaude Mythos: 77.8%有区分度1865个含私有代码库任务
SWE-rebenchClaude Opus 4.6: 65.3%前瞻有区分度训练截止后的新鲜GitHub issue
Terminal-Bench 2.0GPT-5.5: 82.7%前瞻有区分度89个多步Docker终端任务
GPQA DiamondClaude Mythos: 94.6%有区分度博士级科学推理
ARC-AGI-2前沿模型 <30%最有区分度全新推理模式而非记忆
FrontierMath Tier 4GPT-5.5: 35.4%有区分度顶级期刊级数学问题
Arena (LMArena)Claude Opus 4.8: ~1,510 Elo下棋和电竞里的天梯积分,赢强者加分多前瞻持续有效680万+人类盲测投票

从这张表能看出一个关键趋势:早期的"经典"基准已全面饱和。MMLU从2020年的32%飙升至94%,HumanEval达90%+,大量模型挤在狭窄区间内,失去了区分度。取而代之的是一批更难、更新、更抗污染的基准——ARC-AGI-2前沿模型不足30%,FrontierMath Tier 4仅35.4%,分数低但可信度高。

三大危机:为什么不能只看分数

⚠️
危机一:饱和——考卷太简单

MMLU设计可用2-3年,结果数月内被攻克到94%。当十几个模型都考94%,你无法判断哪个更强——就像全班都考100分的考试测不出谁学得好。饱和分数制造了"AI已经很强"的错觉,但多选题格式根本不测生成能力和推理深度。

🚨
危机二:污染——考卷泄题了

公开的基准数据很可能被混入训练语料。SWE-bench Verified中发现模型能逐字复现金标准补丁代码——这不是"学会了",是"背过了"。59.4%的最难问题存在测试用例缺陷,模型可以"钻空子"通过。OpenAI已于2026年停止报告该成绩。

💡
危机三:实验室-生产差距——考分高不等于实战强

企业级Agent系统存在约37%的实验室-生产性能差距:SWE-bench上90%的模型,真实工程环境可能只有53%的任务完成率。更关键的是,相似准确度下推理成本差异可达50倍——只看分数选模型,可能花巨资买了个"高分低能"的模型。

抗污染基准的崛起

面对污染危机,一批新型基准从设计之初就把"防泄漏"作为核心目标:

2024初
SWE-bench开创真实编程评测
从真实GitHub仓库挖掘issue修复任务,但公开数据很快被发现存在训练污染。
2025中
FrontierMath:保密出题
数学家出题且严格保密,GPT-5.5在最高难度Tier 4仅获35.4%,真正拉开了差距。
2025末
ARC-AGI-2:测推理不测记忆
所有前沿模型得分低于30%,专门测试泛化推理能力而非知识储备。
2026初
SWE-bench Pro + SWE-rebench
前者引入私有代码库签保密协议,后者自动挖掘训练截止后的新issue。Claude Opus 4.6在SWE-rebench仅65.3%,远低于原版的90%+。

这些基准的共同特点是:分数明显更低,但可信度明显更高。在SWE-bench Verified上93.9%让人心生疑虑,在SWE-rebench上65.3%反而更值得信赖——前者可能见过答案,后者不可能。

多维评测矩阵:不只看一个分数

不同基准衡量不同能力。一个模型可能在MMLU上拿94%却在ARC-AGI-2上不足30%——说明它擅长"记住知识"却不擅长"全新推理"。业界因此转向多维评测矩阵:

💻
编程维度
SWE-bench Pro测工程问题修复,Terminal-Bench测多步终端操作。覆盖从"写代码"到"操作系统"的完整链条。
🧩
推理维度
GPQA测博士级科学推理,ARC-AGI-2测全新推理泛化。前者考"深度思考",后者考"举一反三"。
🤖
Agent维度
GAIA测多步任务完成,MCP Atlas测工具调用能力。测的不是"能回答什么",而是"能做什么"。
👥
人类偏好维度
Arena通过680万+盲测投票捕捉"用户满意度",涵盖风格、语气、可读性等难以量化的维度。
🛡️
安全维度
越狱抵抗率、幻觉检测、长文档忠实性。不代表"多强",而代表"多可靠"。

不同维度不可替代。编程强不等于推理强,推理强不等于安全可靠。一个真正优秀的模型,需要在多个维度上同时达到高水平,而非某一维度刷高分后在其他维度严重短板。

人类偏好评测:Arena模式

在所有基准中,Arena(LMArena)是最特殊的——它不给出标准答案,而是把两个匿名模型的回答并排展示给人类评审者,让人选"哪个更好"。这种"盲测PK"模式更像选秀比赛的PK赛,而非标准化考试。

截至2026年7月,LMArena已积累超过680万次人类投票。它采用Elo评分系统(最初用于国际象棋排名),每次PK后胜者加分、败者减分。当前排名最高的是Claude Opus 4.8(约1510 Elo),但这代表"最受人类欢迎"而非"绝对最强"。Arena捕捉的是基准测试难以量化的维度——回答的风格、语气、排版可读性、信息密度。完整的评测体系应当是"基准测试+人类偏好"双轮驱动

六、总结:如何立体地评价一个AI模型

回到开头的问题:"这个AI到底好不好?"经过五个维度的拆解,答案已经清晰:没有单一的"好"或"不好",只有特定场景下的"合适"或"不合适"

AI模型选型五步法

第一步:看静态参数。参数规模和上下文窗口是否满足需求?MoE模型的激活参数是多少?不要被"万亿参数"唬住,关键是激活量。

第二步:看能力基准。不要只看一个分数。关注与你场景相关的维度——编程看SWE-bench Pro,推理看ARC-AGI-2,通用看Arena。优先关注抗污染基准上的成绩。

第三步:看推理性能。TTFT是否在可接受范围?TPOT能否满足实时性要求?高并发场景看TPS吞吐量。

第四步:看算力适配。你的硬件能跑这个模型吗?FP8/INT4量化后的性能如何?如果是自部署,算力成本和内存带宽是否匹配?

第五步:看计费成本。按实际用量算一笔账:输入+输出的月度token消耗 × 单价。别忘了缓存折扣和批量折扣。相似效果下,选性价比最高的。

2026年的AI评价体系正在经历深刻变革。静态参数从"越大越好"走向"激活效率";能力评测从"单一分数"走向"多维矩阵";计费模式从"一刀一价"走向"分层+缓存+批量"的精细体系;算力标准从"峰值FLOPS"走向"有效算力"。理解这些维度和趋势,你就能在铺天盖地的"新模型登顶"新闻中保持清醒判断——知道该看什么、不该信什么、该怎么选。

七、本章术语速查

术语 一句话解释
参数(Parameters) 神经网络中可学习权重的数量,以B(十亿)为单位
上下文窗口(Context Window) 模型一次能处理的最大文本长度,以token为单位
Token 大语言模型处理文本的基本单位,约等于一个词或1-2个汉字
MToken 百万token,行业标准计费单位
FLOPS 每秒浮点运算次数,衡量计算设备的运算速度
FP8/FP4 8位/4位浮点数格式,低精度格式可提升算力但降低精度
MoE(混合专家) 模型有多个专家子网络,每次推理只激活一部分,降低推理成本
TTFT 首token延迟,从请求发出到收到第一个token的时间
TPOT 每输出token耗时,决定文字"流出来"的速度
TPS 每秒token数,系统级吞吐量指标
基准测试(Benchmark) 给AI设计的标准化考卷,用统一题目评分比较不同模型
数据污染 基准题目被混入训练数据,导致模型"背答案"而非"学能力"
Elo评分 基于对局结果动态调整的排名系统,LMArena用它为AI模型排名
SWE-bench 给AI出的编程考试卷,用真实GitHub项目的bug修复任务来考模型
MMLU AI的"常识考试",覆盖57个学科的多选题,测试模型的知识广度
ARC-AGI-2 AI的"智力测验",专门考全新推理能力而非记忆,前沿模型得分不足30%
Arena(LMArena) AI"擂台赛",让两个匿名模型回答同一问题,由人类投票选哪个更好
H100 英伟达的旗舰AI芯片型号,AI训练和推理的主力显卡
TFLOPS / PFLOPS FLOPS的大号:TFLOPS=万亿次/秒,PFLOPS=千万亿次/秒
GPU 图形处理器,原本用来渲染游戏画面,因为擅长同时算成千上万道题,成了AI训练和推理的主力芯片
API 应用程序接口,让两个程序互相"打电话"的电话号码;用别人的AI模型,基本都是通过API按token付费调用

本章小结

🎯
三句话记住本章

评价AI不能只看一个分数:静态参数、动态能力、推理引擎、算力标准、计费体系五个维度缺一不可,就像评价一辆车不能只看排量。

基准测试正面临饱和、污染和实验室-生产差距三大危机:早期经典基准已全面饱和失去区分度,新型抗污染基准(ARC-AGI-2、SWE-rebench)分数更低但可信度更高。

选模型的真正原则是"多维匹配+性价比":先看场景需要什么能力,再在效果相近的模型中选最便宜最快的,而非盲目追求参数最大、分数最高。

  1. 静态参数是模型的"出厂规格"——参数规模和上下文窗口。MoE架构下关键是激活参数而非总参数,参数大不等于推理成本高。
  2. 计费体系按Token收费,输出价是输入的4-6倍。缓存折扣、批量调用和量级匹配是控制成本的三大杠杆。
  3. 算力评价不能只看峰值FLOPS——精度格式(FP8/FP4)、内存带宽、实际有效算力同样重要,峰值算力通常只有30%-60%能转化为有效算力。
  4. 基准测试面临饱和(考卷太简单)、污染(考卷泄题)、实验室-生产差距(考分高不等于实战强)三大危机,抗污染基准正在崛起。
  5. 多维评测矩阵涵盖编程、推理、Agent、人类偏好和安全五个维度,不同维度不可替代,真正的优秀模型需要在多个维度同时达到高水平。
  6. AI模型选型五步法:看静态参数→看能力基准→看推理性能→看算力适配→看计费成本,综合判断而非单一指标决策。

理解了如何评价一个AI模型,你就拥有了一把"标尺"。但标尺本身不是目的——我们更关心的是:这些模型到底能做什么、不能做什么?哪些能力已经远超人类,哪些还远远不如?下一章,我们就来盘点 AI 的能力与局限,看看它在哪些领域让人惊叹,又在哪些地方仍然力不从心。

"评价AI的最高境界,不是看它排行榜上的分数,而是看它在你的真实场景中,能不能又快又好又便宜地完成任务。"