人工智能通识读本
第一篇:什么是AI

AI脚手架与系统工程🧗 硬核

前面几章我们了解了 AI 怎么学习、怎么训练、怎么微调。但你可能注意到一个现象:同样是用 GPT-4 或 DeepSeek 的模型,有的产品只是个"聊天框",有的却能自主完成复杂任务。差别不在模型,而在模型外面那一层"脚手架"。这一章,我们走进 AI 系统工程的世界,看看 MCP、Skills、Harness、RAG 这些从 AI 延伸出来的系统组件,是如何把一个"会说话的大脑"变成一个"能干活的助手"的。

🗂️ 读前小抄:本章会遇到的英文缩写
本章是全书英文词最密的一章。不用背——读到哪个词卡住了,翻回这张表看一眼就行。九个词说的是同一件事的九个零件。
  • LLM大语言模型 读完整座图书馆、什么都能聊的那个"大脑",本章的主角
  • Agent智能体 会自己动手干活的家政机器人,不只是给你出主意
  • Harness运行时脚手架 埋在墙里的水电煤管线,看不见,但没它房子没法住
  • MCP模型上下文协议 墙上统一规格的插座,什么电器插上都能用
  • RAG检索增强生成 答题前先翻资料的开卷考试
  • API应用程序接口 让两个程序互相打电话的电话号码
  • Skills技能 家电说明书:这台机器该怎么用,一步步写清楚
  • Plugin插件 打包好的成品工具箱,一键装上就能用
  • Tool工具 一把螺丝刀,只干一件具体的事,比如"查天气"
😌
先给你吃颗定心丸

本章讲的其实只有一件事:怎么把大模型这间"毛坯房"装修成能住人的房子。MCP、Skills、Harness、RAG 全是装修清单上的条目——管线、插座、说明书、资料柜。抓住这条主线,哪怕一个英文词都没记住,也不影响读后面任何一章

一、为什么需要"脚手架"?——模型不是产品

2026年,AI 工程界形成了一个关键共识:模型本身不再是产品的全部。Gartner 的数据显示,超过 80% 的企业计划接入生成式 AI,但完成规模化稳定落地的不足 20%。问题出在哪里?不是模型不够聪明,而是模型外面的"工程层"不够完善

LangChain 提出了一个简洁的公式,成为 2026 年的行业共识:

Agent = Model + Harness(智能体 = 模型 + 脚手架)Agent 是会自己动手干活的家政机器人,不是只会出主意的顾问

所谓AI 脚手架(Scaffolding),就是包裹在大模型LLM,Large Language Model,就是会聊天的那个"大脑"本身之外、使其在生产环境可靠运行的全部代码、配置与执行逻辑。它包括编排(任务调度)、记忆(状态管理)、工具使用(连接外部世界)、防护栏(安全控制)、可观测性(追踪监控)等系统性组件。

裸模型调用

  • Demo 环境能跑,上线后崩溃
  • 十几步后丢失任务线索
  • 无法维护跨对话的持久状态
  • 无法从失败的工具调用中恢复
  • 一个 $0.40 的任务可能花掉 $40

模型 + 脚手架

  • 生产环境稳定运行数百步
  • 自动压缩上下文、保持任务一致性
  • 跨会话长期记忆
  • 工具调用失败自动重试和降级
  • 高危操作有人审批、全程可追溯
💡
一个比喻

如果大模型是 CPU,上下文窗口是 内存(RAM),那么脚手架就是操作系统——它决定什么数据进入内存、何时清理、有哪些工具可用、崩溃时如何恢复。没有操作系统的 CPU 只能跑最简单的程序;没有脚手架的大模型,也只能做最简单的问答。

这一章,我们从五个核心组件切入,系统了解 AI 脚手架的技术版图:MCP 协议(工具连接的标准)、AI Skills(能力封装)、Harness 工程(运行时框架)、RAG 检索增强(知识接入)、以及其他系统组件(向量数据库、语义缓存、AI 网关、防护栏)。

🎈 打个比方

把大模型想成一套刚交付的毛坯房:承重墙、层高、朝向全是顶配,可你搬不进去——没水没电,没家具,墙上连个插座都没有。

这一章列的就是那张装修清单:Harness 是埋进墙里的水电煤管线,MCP 是墙上那排统一规格的插座,Skills 是每台家电附带的说明书,RAG 是随时能翻的资料柜。

装修完,再请进来一个 Agent——会自己动手干活的家政机器人。它插得上插座、看得懂说明书、翻得开资料柜,这才叫"能干活"。房子是模型,装修才是本章的题目。

毛坯房 → 精装房:大模型之上的五层装修 越往上越像"能干活的助手" Agent(智能体) 会自己动手干活的家政机器人 RAG(检索增强生成) 随时能翻的资料柜,答题前先查一查 Tools / Skills(工具与技能) 家电本身,加上每台家电的说明书 MCP(模型上下文协议) 墙上统一规格的插座,什么电器都能插 Harness(运行时脚手架) 埋在墙里的水电煤管线,让整套系统跑起来 大语言模型 LLM(毛坯房) 结构和层高都是顶配,但还不能住人
图:从毛坯房到精装房——同一套模型,装修水平不同,交付出来的产品天差地别。
用户 / 应用场景 AI 脚手架层(Scaffolding Layer) MCP 工具连接协议 "USB-C 接口" Skills 能力封装 "工作手册" Harness 运行时框架 "操作系统" RAG 知识检索 "开卷考试" 防护栏(Guardrails) 输入/输出/检索/工具 四点拦截 AI 网关 + 可观测性 路由/限流/追踪/成本监控 大语言模型(LLM) GPT / Claude / DeepSeek / 通义千问 ……
图:AI 脚手架层全景——包裹在大模型之外的完整系统工程

二、MCP:AI 的"USB-C 接口"

让 AI 使用工具(搜索网页、查数据库、发邮件),是它从"只会说"变成"能做事"的关键。但这里有个工程难题:5 个模型要连接 10 个工具,传统方式需要开发 5×10=50 个定制接口——这就是所谓的"M×N 碎片化问题"

MCP(Model Context Protocol,模型上下文协议)由 Anthropic 于 2024 年 11 月发布,目的就是解决这个问题。它被形象地称为 AI 应用的"USB-C 接口"——就像 USB-C 统一了各种设备的充电和数据线一样,MCP 统一了 AI 与工具之间的连接方式:写一次工具接口,任何支持 MCP 的 AI 应用都能用。

三层架构

MCP 采用宿主-客户端-服务器三层架构:

🏠
Host(宿主)
AI 应用程序本身,如 Claude Desktop、VS Code、Cursor。它管理所有连接、控制权限、执行安全策略。相当于"房东",决定谁能进来、能做什么。
🔌
Client(客户端)
由宿主创建的连接器,每个客户端维护与一个服务端的隔离连接。它负责协议协商、消息路由、维持安全边界。相当于"插头",每个工具一个。
🛠️
Server(服务端)
提供具体能力的程序,通过三种"原语"暴露能力:Tools(可执行的工具,如"查天气")、Resources(可读取的数据,如"项目文档")、Prompts(预定义的提示词模板)。相当于"电器"。

MCP vs Function Calling:不是替代,是升级

很多人会混淆 MCP 和 Function Calling(函数调用)。其实它们是不同层面的东西:

维度 Function Calling MCP
本质 模型能力——LLM 经过训练后能输出结构化调用指令 架构协议——规定 AI 与工具之间如何通信、发现和集成
解决的问题 让模型从"说话"变成"行动" 解决工具连接的 M×N 碎片化问题
集成方式 硬编码,每个应用需手动定义工具 Schema数据格式说明书,规定这份数据有哪些字段、各是什么类型,相当于表格的表头 即插即用,写一次 Server,所有 MCP 客户端自动发现
可移植性 低——为 OpenAI 写的 Schema 换到 Claude 可能要改 高——工具与应用完全解耦
关系 MCP 建立在 Function Calling 之上,不是替代。MCP 把工具描述自动转换成 Function Calling Schema 供 LLM 使用

简单说:Function Calling 是"功能",MCP 是"协议"。Function Calling 让模型"能"调用工具,MCP 让工具"被"标准化地发现和连接。

📌
2026 年 MCP 生态进展

2025 年 12 月,Anthropic 将 MCP 捐赠给 Linux Foundation 旗下的 Agentic AI Foundation,使其成为厂商中立的开放标准。2026 年 7 月发布的第 5 版规范是最大规模的修订——转向无状态设计,每个请求独立自包含,可无缝集成 AWS Lambda、Cloudflare Workers 等无服务器平台。目前已被 Claude Desktop、VS Code、Cursor、Cline 等主流 AI 应用采纳,阿里云百炼、火山方舟、腾讯云均提供 MCP 服务市场。

三、AI Skills:给 AI 发"工作手册"

如果说 MCP 解决的是"能拿到什么数据"(连接),那么 Skills 解决的是"该怎么做事情"(能力)。Skills 是 Anthropic 于 2025 年 10 月推出的模块化能力扩展机制,被公认为"自系统提示词诞生以来对 AI 自定义方式最根本的变革"。

核心理念:别造万能巨人,组装专业团队

Skills 的核心思路是:不要构建一个万能的巨型 Agent,而是让 Agent 拥有一组可组合的专业技能,需要时按需加载。就像医院不招"什么都会"的全科超人,而是有内科、外科、放射科各司其 specialist 的专业团队——需要什么科室挂什么号。

三级渐进式加载

Skills 最精妙的设计是渐进式披露(Progressive Disclosure),分三级加载,避免上下文浪费:

级别 加载时机 内容 Token 开销
Level 1:元数据 启动时始终加载 名称和描述,AI 只知道"有这个技能"和"什么时候用" ~100 tokens/技能
Level 2:指令 触发时加载 SKILL.md 正文,含工作流程、最佳实践、操作步骤 <5K tokens
Level 3:资源 按需加载 额外文档、可执行脚本、参考材料(脚本通过 bash 执行,不占上下文) 0(不进上下文)

这意味着你可以给 AI 安装几十个 Skills,但启动时只花几千 tokens 告诉它"有哪些技能可用"——真正用到某个技能时才加载详细指令,用完即可清理。就像你书架上有上百本参考书,工作时只把需要的那本翻开放在桌上。

Tool vs Skill vs Plugin:三个层次

概念 粒度 类比 作用
Tool(工具) 单一操作 一把螺丝刀 执行一个具体函数,如"查天气"
Skill(技能) 完整能力 一本工作手册 多工具 + 知识 + 流程,如"做 PDF 表单"
Plugin(插件)像给手机装 App 一样给 AI 装新能力 成品工具箱 一个工具箱 Skills + MCP 连接器 + 命令的集成包

三者的关系可以用一个比喻串联:MCP 像"水管",负责连接外部系统;Skills 像"工作手册",教 AI 具体怎么做事;Plugins 像"成品工具箱",把前两者打包成一键安装的成品。

💡
Skills 生态 = AI 的"应用商店"

Anthropic 已开源 20+ 个生产级 Skills(如 docx 文档处理、pdf 处理、xlsx 表格、pptx 幻灯片、skill-creator 技能创建器等)。Skills 生态正沿着"移动应用发展路径"演进:基础模型(Claude)= 操作系统,技能市场 = 应用商店,开发者社区 = 第三方应用。2026 年 1 月 Claude Cowork 插件功能发布后,据报 24 小时内传统软件公司市值蒸发 2850 亿美元——市场认为"AI 原生技能生态"正在颠覆传统软件。

四、Harness 工程:AI 的"操作系统"

Harness(脚手架/外壳)是包裹在 AI 模型之外的运行时软件基础设施,管理 AI 的工具、记忆、状态、执行、防护与可观测性。LangChain 有一句精辟的概括:"如果你不是模型,那你就是 Harness。"

"第 100 次工具调用"问题

为什么需要 Harness?一个裸模型在 Demo 里跑得很好——你问它答,一来一往。但让它自主执行一个需要 100 步的任务时,问题就来了:

  1. 上下文膨胀:到第 100 步,上下文里堆满了工具输出、中间推理、错误消息,模型开始"看花眼"
  2. 任务遗忘:模型忘了最初要干什么,开始做无关的事
  3. 陷入循环:反复调用同一个工具、反复犯同一个错误
  4. 成本失控:一个本该 $0.40 的任务,因为反复重试烧掉了 $40

Agent 在生产环境中失败,不是因为不够聪明,而是随时间失去一致性。Harness 就是来解决这些问题的。

Harness 的七大核心组件

组件 功能 类比
系统提示 控制模型基线行为:角色、规则、安全策略 员工手册
规划与编排 任务分解、进度跟踪、子 Agent 生成、模型路由 项目经理
记忆与状态 短期记忆保存在对话中,长期记忆写入文件系统;上下文压缩 笔记本 + 档案柜
工具 搜索、文件读写、数据库、API应用程序接口,让两个程序互相打电话的电话号码、浏览器、代码执行 工具箱
执行环境 文件系统、容器、沙箱、浏览器实例 工作台
防护栏 高危操作拦截、权限控制、审计日志 安全护栏
可观测性 记录每步决策、成本、输出,形成链路追踪 黑匣子记录仪

胖 Harness vs 瘦 Harness

2026 年业界有一场重要辩论:Harness 应该"胖"还是"瘦"?

胖 Harness(Fat)

  • 代表:LangChain Deep Agents
  • 主张:任务越长,Harness 必须越丰富
  • 内置规划工具、子 Agent、生命周期钩子
  • 让 200 步任务成为可能

瘦 Harness(Thin)

  • 代表:YC / Garry Tan
  • 主张:Harness 每行代码都从模型夺走推理权
  • 最小循环 + 领域知识编码在 Skill 文档中
  • 让前沿模型充分发挥推理能力

关键证据:LangChain Terminal Bench 2.0 排行榜显示,同一个模型在优化的第三方 Harness 中,排名从 30 名外跳到前 5 名——变的不是模型权重,而是 Harness。这说明 Harness 工程水平对 Agent 实际表现的影响,可能不亚于模型本身的能力。

⚠️
Harness vs Framework vs Runtime

这三个术语常被混用但有区别:Framework(框架,如 LangChain、CrewAI)提供构建块,对 Agent 怎么运行基本中立;Harness 是框架之上的运行时层,端到端指导 Agent 怎么运行(控制每步看到什么上下文、如何处理失败、何时压缩记忆);Runtime 是更底层的执行环境(容器、沙箱)。简言之:用框架组合能力,用 Harness 可靠地运行

五、OpenClaw(龙虾):现象级 AI Agent

2026 年开年,一个名为 OpenClaw(社区昵称"龙虾")的开源 AI Agent 框架爆火出圈,成为现象级产品。它生动地诠释了"模型 + 脚手架"如何变成一个能干活的 Agent。

是什么

OpenClaw 是一款开源、本地优先的 AI 智能体框架,核心突破是将大语言模型的"大脑"与本地计算机的"双手"结合——你用自然语言告诉它要做什么,它就直接操作电脑完成:整理文档、处理邮件、安排日程、编写代码、批量生成文件。

它的核心理念是"聊天即行动"——不是给你写一段"操作指南"让你自己去执行,而是它自己直接动手。你只需要说"把这周的会议纪要整理成 PDF 发给参会者",它就能自动完成全流程。

为什么叫"龙虾"

OpenClaw 直译"开放钳爪",项目标识就是一只龙虾,因谐音被网友亲切叫成"龙虾",部署使用过程被称为"养龙虾"/"养虾"。它由奥地利程序员 Peter Steinberger 开发,最初命名 Clawdbot,2026 年 1 月因 Anthropic 商标侵权指控更名为 OpenClaw。

核心特性

🏠
本地优先
所有数据保留在自己电脑上,隐私安全有保障。不依赖云端,断网也能用。
🧠
多模型支持
支持对接通义千问、GPT、Claude、DeepSeek 等多种大模型,按需切换。
🦞
Clawhub 技能市场
超 1700 个插件覆盖办公、开发、生活全场景,支持自定义技能开发。
💬
IM 接入
可接入钉钉、飞书、企业微信、QQ,群里 @它即可执行任务。
💾
持久记忆
电脑重启后仍记得之前的对话和使用习惯,不会"失忆"。
🔧
动手能力
调用浏览器、文件系统、邮件等工具,自动完成复杂任务。

爆火与安全争议

2026 年 3 月,OpenClaw 成为 AI 圈"现象级顶流"。腾讯、字节跳动、阿里云相继推出各自的"小龙虾"产品或部署方案,360 推出一键安装版本,首批"政务龙虾"在深圳福田区上线。

但"龙虾"也暴露了 AI Agent 的安全风险:有用户发现它会批量删除邮件而无法阻止,"龙虾一秒可搬空用户隐私信息"登上热搜。工信部发布预警,指出 OpenClaw 在默认配置下存在较高安全风险。这恰好印证了前面讲的道理——一个缺乏企业级 Harness 防护栏的 Agent,能力越强风险越大。

⚠️
OpenClaw 的教训

OpenClaw 本质上是一个相对"瘦"的本地 Agent——它给了模型很大的自主权,但防护栏不够完善。它的安全风险恰恰说明:Agent 的能力上限取决于 Harness,安全下限也取决于 Harness。一个没有防护栏的 Agent,就像一辆没有刹车的高跑车——跑得越快,越危险。

六、RAG:从"开卷考试"到"建立世界观"

前面章节已经介绍过 RAG 的基本概念——让 AI 先"查资料"再回答,像"开卷考试"。但 2026 年的 RAG 已经远不止"查资料"这么简单,它经历了从"朴素检索"到"知识引擎"的完整演化。

四级演进

级别 时期 范式 特点
Lv.1 朴素 RAG 2023 提问 → 向量搜索(Top-K) → 拼接 → 回答 碎片化、无推理、无记忆
Lv.2 高级 RAG 2024 查询重写 → 混合检索(向量+关键词) → 重排序 → 回答 检索精度提升,仍是单次被动检索
Lv.3 Agentic RAG 2025-2026 Agent 规划 → 动态路由(向量/SQL/API) → 多跳检索 → 自我反思 → 回答 赋予检索"自主性",解决多跳推理
Lv.4 GraphRAG 2025-2026 实体抽取 → 知识图谱 → 子图检索 → 图算法重排 赋予知识"全局观"

业界有一个精辟的总结:"2024 年教 AI'读书',2025 年教 AI'做笔记',2026 年教 AI'建立世界观'和'形成长期记忆'。"

朴素 RAG 的"三大绝症"

2026 年 4 月,硅谷 AI Engineering Summit 上一场名为《朴素 RAG 的死亡》的圆桌形成残酷共识:基于"文本切片 + 向量相似度"的传统 RAG 在企业级复杂知识场景已彻底破产。它有三大致命缺陷:

🐘
管中窥豹
向量检索只能找到语义相似的孤立文本块,无法跨数百篇文档汇总抽象宏观趋势。问"公司近三年战略重心变化",它只能找到零散段落,拼不出完整图景。
🦠
单细胞生物
缺乏多跳推理能力。问"A公司CEO和B公司首席科学家什么关系",需要 A→B→C 链式推理,单次检索无法完成。
🐟
金鱼记忆
上下文窗口只在单次会话有效,会话结束所有偏好和历史被遗忘。每次对话都从零开始,无法积累。

GraphRAG:给 AI"全局观"

GraphRAG(图增强检索)是微软开源的技术,在 GitHub 已获数万 Star,成为财富 500 强企业构建知识引擎的新标配。它的核心做法是:把非结构化文本提取为知识图谱——节点是实体(人、公司、概念),边是关系("任职于""投资了""合作过"),然后用图论算法(如 PageRank)计算实体的重要性,实现精准锚定。

这解决了"管中窥豹"问题:不再是找"相似的段落",而是找"重要的实体及其关系网络"。GraphRAG 能回答"A 公司和 B 公司有什么关联"这种需要跨文档推理的问题。

Agentic RAG:给检索"自主性"

Agentic RAG 让检索系统具备"自主规划与多跳推理"能力。它不再是一次性的"搜→答",而是:Agent 先分析问题需要哪些信息 → 决定去哪里找(向量库?SQL 数据库?API?)→ 多跳检索 → 检查是否够用 → 不够再找 → 最后综合回答。这解决了"单细胞生物"问题。

AI 原生记忆系统

Mem0Zep 为代表的 AI 原生记忆系统,让 Agent 拥有跨会话的"长期海马体",解决了"金鱼记忆"问题。AI 终于能记住你上次说过的话、你的偏好、你正在做的项目——不用你每次重复交代。

💡
RAG 演进的启示

RAG 的四级演进揭示了一个趋势:AI 知识系统正从"被动检索"走向"主动认知"。早期是"你问我查",后来变成"我先想想该查什么、去哪查、查够了没有"。这种从"工具"到"智能体"的跃迁,贯穿了整个 AI 脚手架的演化逻辑。

七、更多系统组件:脚手架的"基础设施"

除了 MCP、Skills、Harness、RAG 这四大核心组件,AI 脚手架还有一系列基础设施级的组件,它们共同支撑着 AI 在生产环境的可靠运行。

向量数据库:RAG 的"书架"

RAG 要先"查资料",资料存在哪里?向量数据库。它把文本、图片转化为高维向量(一串数字),然后按"语义相似度"检索——你搜"怎么减肥",它能找到"控制饮食和运动"的段落,即使原文没出现"减肥"两个字。

数据规模 推荐方案 特点
原型/小规模(<10万) Chroma / SQLite-vec 零成本,开箱即用
中小规模(10万-100万) pgvector(PostgreSQL 扩展) 零运维,向量与结构化数据同库查询
中大规模(100万-1000万) Qdrant / Milvus Lite 专业向量检索,性能与功能兼顾
大规模(>1000万) Milvus 集群 性能王者,但运维成本高

语义缓存:AI 的"已读回复"

语义缓存通过语义匹配复用已有的 AI 响应。当新问题与之前回答过的问题语义相近时,直接返回缓存结果,不必重新调用模型。Redis LangCache 可将响应速度提升最高 15 倍,token 消耗和 API 账单节省最高 70%。

就像客服系统的"已读回复"——如果 100 个人问了几乎一样的问题,没必要调用 100 次大模型,返回同一个答案就行。但语义缓存的难点在于判断"语义相近"——"怎么减肥"和"如何控制体重"是同一个问题,但"怎么增肥"就不是。

AI 网关:AI 的"总机"

AI 网关是连接多个模型与业务系统的关键枢纽,作为每个应用与每个 LLM 之间的中间层,集中执行:

  • 多模型统一接口:100+ 模型用同一套 API,切换模型无需改代码
  • 负载均衡与故障转移:一个模型挂了自动切到备用模型
  • 成本监控与分摊:按部门/项目追踪 token 消耗和费用
  • 限流与路由:控制调用频率,按任务类型路由到最合适的模型

代表项目有 LiteLLM(100+ LLM API,OpenAI 兼容格式)、Bifrost(Go 编写,统一 LLM 网关 + MCP 网关 + Agent 网关)等。

防护栏:AI 的"安全带"

防护栏(Guardrails)是控制 AI "允许做什么、不允许做什么"的运行时系统。2026 年的现代防护栏必须覆盖四个拦截点

用户输入 Prompt Input Rail 拦截注入/PII LLM 生成回答 /调用工具 Output Rail 拦截有害/泄露 返回用户 安全回答 ↑ Retrieval Rail:拦截投毒文档 ↓ Tool-call Rail:拦截危险操作
图:防护栏的四个拦截点——从输入到输出到检索到工具调用的全方位安全控制

仅过滤输出文本的是 2023 年的产品。现代防护栏必须覆盖全部四个点,且延迟必须极低(输入拦截 <100ms,输出拦截 <150ms),否则防护栏本身就成了产品的性能瓶颈。

八、全景图:AI 系统栈的分层架构

把前面讲的所有组件拼到一起,我们可以看到 2026 年 AI 系统栈的完整分层架构:

组件 作用 类比
应用层 Cursor、Dify、Manus、OpenClaw 面向用户的 AI 产品 应用程序
编排层 LangGraph、CrewAI、Agent SDK 多 Agent 协同、任务编排 进程调度器
能力层 Skills、Plugins 模块化能力封装 应用商店
连接层 MCP、Function Calling 标准化工具连接 驱动程序接口
知识层 RAG、向量数据库、记忆系统 外部知识接入与持久记忆 文件系统 + 数据库
安全层 Guardrails、红队测试 输入输出拦截、安全审计 防火墙
基础设施层 AI 网关、语义缓存、LLMOps 路由、缓存、监控、成本管理 网络 + 缓存 + 运维
模型层 GPT、Claude、DeepSeek、通义千问 推理与生成 CPU

这个分层架构说明了一个重要趋势:AI 正在从"一个模型"变成"一套系统"。就像智能手机的价值不只在 CPU——没有操作系统、应用生态、安全机制、网络通信,再强的 CPU 也只是个芯片。AI 也是如此:模型是核心,但模型外面那一层层的脚手架,才是把它变成"好用产品"的关键。

💡
关键时间线

2024.11 Anthropic 发布 MCP 协议
2025.09 Redis LangCache 语义缓存公开预览
2025.10 Anthropic 上线 Agent Skills 并开源 20+ 个技能
2025.12 MCP 捐赠给 Linux Foundation
2026.01 "Harness Engineering" 术语在业界流行;Claude Cowork 插件发布
2026.03 OpenClaw"龙虾"爆火;LangChain 发表 Harness 解剖文
2026.04 硅谷 AI Engineering Summit 宣告"朴素 RAG 的死亡"
2026.05 GraphRAG + Multi-Agent 论文登上 Nature
2026.07 MCP 第 5 版规范发布,转向无状态设计

九、本章术语速查

术语 一句话解释
AI 脚手架 包裹在大模型之外、使其在生产环境可靠运行的全部工程层
MCP 模型上下文协议,AI 与工具连接的"USB-C 接口"
Function Calling 模型能力,让 LLM 输出结构化工具调用指令
Skills 模块化能力扩展,给 AI 发"工作手册",按需三级加载
Harness Agent 运行时框架,管理工具/记忆/状态/安全/可观测性
RAG 检索增强生成,让 AI 先"查资料"再回答
GraphRAG 图增强检索,用知识图谱赋予 AI"全局观"
Agentic RAG 智能体化 RAG,Agent 自主规划检索策略和多跳推理
向量数据库 存储和检索语义向量的专用数据库,RAG 的"书架"
语义缓存 按语义相似度复用已有 AI 响应,降低成本和延迟
AI 网关 多模型统一接口、负载均衡、成本监控的中间层
防护栏 运行时安全控制,覆盖输入/输出/检索/工具四个拦截点
OpenClaw(龙虾) 开源本地优先 AI Agent 框架,"聊天即行动"
LLMOps 大模型运维体系,含监控、追踪、评估、版本管理
AI Agent(智能体) 能自己感知环境、做决策、执行任务的AI系统,就像一个会自己动手干活的家政机器人
LLM(大语言模型) Large Language Model,参数量巨大的语言模型,如GPT、Claude、DeepSeek等
API 应用程序接口,让不同程序互相"打电话"交流的通道,AI模型通过API提供服务
插件(Plugin) 给AI模型扩展功能的附加模块,像给手机装App一样给AI装新能力
LangChain 流行的AI应用开发框架,帮你把模型、工具、数据像搭积木一样组装成应用
Schema 数据结构定义,规定了数据长什么样、有哪些字段,像表格的表头

本章小结

🎯
三句话记住本章

Agent = Model + Harness:模型是"大脑",脚手架是"操作系统",二者缺一不可。模型决定能力上限,脚手架决定能否接近这个上限。

MCP 连接工具,Skills 封装能力,Harness 管理运行,RAG 接入知识——四大核心组件各司其职,共同构成 AI 脚手架层。

AI 正在从"一个模型"变成"一套系统":就像智能手机的价值不只在 CPU,AI 产品的价值也不只在模型,而在模型外面那一层层完整的系统工程。

  1. AI 脚手架是包裹在大模型之外的完整工程层,解决裸模型在生产环境中"上线即崩溃"的问题。核心公式:Agent = Model + Harness。
  2. MCP 是 AI 工具连接的标准化协议("USB-C 接口"),解决 M×N 碎片化问题;它建立在 Function Calling 之上,不是替代。
  3. Skills 是模块化能力扩展机制,通过三级渐进式加载实现"按需加载专业能力",避免上下文浪费。
  4. Harness 是 Agent 运行时框架,管理规划/记忆/工具/执行/防护/可观测性七大组件,解决"第 100 次工具调用"问题。
  5. RAG 经历了从朴素 RAG 到 GraphRAG/Agentic RAG 的四级演进,从"被动检索"走向"主动认知"。
  6. 向量数据库、语义缓存、AI 网关、防护栏等基础设施组件,共同支撑 AI 系统在生产环境的可靠运行。

理解了 AI 脚手架,你就明白了一个关键道理:好产品不只是"用最好的模型",更是"搭最好的系统"。下一章,我们将转向另一个维度——如何评价一个 AI 模型或 AI 系统到底"好不好",从参数规模到能力基准,建立一套立体的判断框架。

"2026 年的 AI 工程,比的不再是谁的模型参数多,而是谁的脚手架搭得好——因为模型是引擎,脚手架是整辆车,用户开的从来不是引擎,而是车。"