AI脚手架与系统工程🧗 硬核
前面几章我们了解了 AI 怎么学习、怎么训练、怎么微调。但你可能注意到一个现象:同样是用 GPT-4 或 DeepSeek 的模型,有的产品只是个"聊天框",有的却能自主完成复杂任务。差别不在模型,而在模型外面那一层"脚手架"。这一章,我们走进 AI 系统工程的世界,看看 MCP、Skills、Harness、RAG 这些从 AI 延伸出来的系统组件,是如何把一个"会说话的大脑"变成一个"能干活的助手"的。
- LLM大语言模型 读完整座图书馆、什么都能聊的那个"大脑",本章的主角
- Agent智能体 会自己动手干活的家政机器人,不只是给你出主意
- Harness运行时脚手架 埋在墙里的水电煤管线,看不见,但没它房子没法住
- MCP模型上下文协议 墙上统一规格的插座,什么电器插上都能用
- RAG检索增强生成 答题前先翻资料的开卷考试
- API应用程序接口 让两个程序互相打电话的电话号码
- Skills技能 家电说明书:这台机器该怎么用,一步步写清楚
- Plugin插件 打包好的成品工具箱,一键装上就能用
- Tool工具 一把螺丝刀,只干一件具体的事,比如"查天气"
本章讲的其实只有一件事:怎么把大模型这间"毛坯房"装修成能住人的房子。MCP、Skills、Harness、RAG 全是装修清单上的条目——管线、插座、说明书、资料柜。抓住这条主线,哪怕一个英文词都没记住,也不影响读后面任何一章。
一、为什么需要"脚手架"?——模型不是产品
2026年,AI 工程界形成了一个关键共识:模型本身不再是产品的全部。Gartner 的数据显示,超过 80% 的企业计划接入生成式 AI,但完成规模化稳定落地的不足 20%。问题出在哪里?不是模型不够聪明,而是模型外面的"工程层"不够完善。
LangChain 提出了一个简洁的公式,成为 2026 年的行业共识:
Agent = Model + Harness(智能体 = 模型 + 脚手架)Agent 是会自己动手干活的家政机器人,不是只会出主意的顾问
所谓AI 脚手架(Scaffolding),就是包裹在大模型LLM,Large Language Model,就是会聊天的那个"大脑"本身之外、使其在生产环境可靠运行的全部代码、配置与执行逻辑。它包括编排(任务调度)、记忆(状态管理)、工具使用(连接外部世界)、防护栏(安全控制)、可观测性(追踪监控)等系统性组件。
裸模型调用
- Demo 环境能跑,上线后崩溃
- 十几步后丢失任务线索
- 无法维护跨对话的持久状态
- 无法从失败的工具调用中恢复
- 一个 $0.40 的任务可能花掉 $40
模型 + 脚手架
- 生产环境稳定运行数百步
- 自动压缩上下文、保持任务一致性
- 跨会话长期记忆
- 工具调用失败自动重试和降级
- 高危操作有人审批、全程可追溯
如果大模型是 CPU,上下文窗口是 内存(RAM),那么脚手架就是操作系统——它决定什么数据进入内存、何时清理、有哪些工具可用、崩溃时如何恢复。没有操作系统的 CPU 只能跑最简单的程序;没有脚手架的大模型,也只能做最简单的问答。
这一章,我们从五个核心组件切入,系统了解 AI 脚手架的技术版图:MCP 协议(工具连接的标准)、AI Skills(能力封装)、Harness 工程(运行时框架)、RAG 检索增强(知识接入)、以及其他系统组件(向量数据库、语义缓存、AI 网关、防护栏)。
二、MCP:AI 的"USB-C 接口"
让 AI 使用工具(搜索网页、查数据库、发邮件),是它从"只会说"变成"能做事"的关键。但这里有个工程难题:5 个模型要连接 10 个工具,传统方式需要开发 5×10=50 个定制接口——这就是所谓的"M×N 碎片化问题"。
MCP(Model Context Protocol,模型上下文协议)由 Anthropic 于 2024 年 11 月发布,目的就是解决这个问题。它被形象地称为 AI 应用的"USB-C 接口"——就像 USB-C 统一了各种设备的充电和数据线一样,MCP 统一了 AI 与工具之间的连接方式:写一次工具接口,任何支持 MCP 的 AI 应用都能用。
三层架构
MCP 采用宿主-客户端-服务器三层架构:
MCP vs Function Calling:不是替代,是升级
很多人会混淆 MCP 和 Function Calling(函数调用)。其实它们是不同层面的东西:
| 维度 | Function Calling | MCP |
|---|---|---|
| 本质 | 模型能力——LLM 经过训练后能输出结构化调用指令 | 架构协议——规定 AI 与工具之间如何通信、发现和集成 |
| 解决的问题 | 让模型从"说话"变成"行动" | 解决工具连接的 M×N 碎片化问题 |
| 集成方式 | 硬编码,每个应用需手动定义工具 Schema数据格式说明书,规定这份数据有哪些字段、各是什么类型,相当于表格的表头 | 即插即用,写一次 Server,所有 MCP 客户端自动发现 |
| 可移植性 | 低——为 OpenAI 写的 Schema 换到 Claude 可能要改 | 高——工具与应用完全解耦 |
| 关系 | MCP 建立在 Function Calling 之上,不是替代。MCP 把工具描述自动转换成 Function Calling Schema 供 LLM 使用 | |
简单说:Function Calling 是"功能",MCP 是"协议"。Function Calling 让模型"能"调用工具,MCP 让工具"被"标准化地发现和连接。
2025 年 12 月,Anthropic 将 MCP 捐赠给 Linux Foundation 旗下的 Agentic AI Foundation,使其成为厂商中立的开放标准。2026 年 7 月发布的第 5 版规范是最大规模的修订——转向无状态设计,每个请求独立自包含,可无缝集成 AWS Lambda、Cloudflare Workers 等无服务器平台。目前已被 Claude Desktop、VS Code、Cursor、Cline 等主流 AI 应用采纳,阿里云百炼、火山方舟、腾讯云均提供 MCP 服务市场。
三、AI Skills:给 AI 发"工作手册"
如果说 MCP 解决的是"能拿到什么数据"(连接),那么 Skills 解决的是"该怎么做事情"(能力)。Skills 是 Anthropic 于 2025 年 10 月推出的模块化能力扩展机制,被公认为"自系统提示词诞生以来对 AI 自定义方式最根本的变革"。
核心理念:别造万能巨人,组装专业团队
Skills 的核心思路是:不要构建一个万能的巨型 Agent,而是让 Agent 拥有一组可组合的专业技能,需要时按需加载。就像医院不招"什么都会"的全科超人,而是有内科、外科、放射科各司其 specialist 的专业团队——需要什么科室挂什么号。
三级渐进式加载
Skills 最精妙的设计是渐进式披露(Progressive Disclosure),分三级加载,避免上下文浪费:
| 级别 | 加载时机 | 内容 | Token 开销 |
|---|---|---|---|
| Level 1:元数据 | 启动时始终加载 | 名称和描述,AI 只知道"有这个技能"和"什么时候用" | ~100 tokens/技能 |
| Level 2:指令 | 触发时加载 | SKILL.md 正文,含工作流程、最佳实践、操作步骤 | <5K tokens |
| Level 3:资源 | 按需加载 | 额外文档、可执行脚本、参考材料(脚本通过 bash 执行,不占上下文) | 0(不进上下文) |
这意味着你可以给 AI 安装几十个 Skills,但启动时只花几千 tokens 告诉它"有哪些技能可用"——真正用到某个技能时才加载详细指令,用完即可清理。就像你书架上有上百本参考书,工作时只把需要的那本翻开放在桌上。
Tool vs Skill vs Plugin:三个层次
| 概念 | 粒度 | 类比 | 作用 |
|---|---|---|---|
| Tool(工具) | 单一操作 | 一把螺丝刀 | 执行一个具体函数,如"查天气" |
| Skill(技能) | 完整能力 | 一本工作手册 | 多工具 + 知识 + 流程,如"做 PDF 表单" |
| Plugin(插件)像给手机装 App 一样给 AI 装新能力 | 成品工具箱 | 一个工具箱 | Skills + MCP 连接器 + 命令的集成包 |
三者的关系可以用一个比喻串联:MCP 像"水管",负责连接外部系统;Skills 像"工作手册",教 AI 具体怎么做事;Plugins 像"成品工具箱",把前两者打包成一键安装的成品。
Anthropic 已开源 20+ 个生产级 Skills(如 docx 文档处理、pdf 处理、xlsx 表格、pptx 幻灯片、skill-creator 技能创建器等)。Skills 生态正沿着"移动应用发展路径"演进:基础模型(Claude)= 操作系统,技能市场 = 应用商店,开发者社区 = 第三方应用。2026 年 1 月 Claude Cowork 插件功能发布后,据报 24 小时内传统软件公司市值蒸发 2850 亿美元——市场认为"AI 原生技能生态"正在颠覆传统软件。
四、Harness 工程:AI 的"操作系统"
Harness(脚手架/外壳)是包裹在 AI 模型之外的运行时软件基础设施,管理 AI 的工具、记忆、状态、执行、防护与可观测性。LangChain 有一句精辟的概括:"如果你不是模型,那你就是 Harness。"
"第 100 次工具调用"问题
为什么需要 Harness?一个裸模型在 Demo 里跑得很好——你问它答,一来一往。但让它自主执行一个需要 100 步的任务时,问题就来了:
- 上下文膨胀:到第 100 步,上下文里堆满了工具输出、中间推理、错误消息,模型开始"看花眼"
- 任务遗忘:模型忘了最初要干什么,开始做无关的事
- 陷入循环:反复调用同一个工具、反复犯同一个错误
- 成本失控:一个本该 $0.40 的任务,因为反复重试烧掉了 $40
Agent 在生产环境中失败,不是因为不够聪明,而是随时间失去一致性。Harness 就是来解决这些问题的。
Harness 的七大核心组件
| 组件 | 功能 | 类比 |
|---|---|---|
| 系统提示 | 控制模型基线行为:角色、规则、安全策略 | 员工手册 |
| 规划与编排 | 任务分解、进度跟踪、子 Agent 生成、模型路由 | 项目经理 |
| 记忆与状态 | 短期记忆保存在对话中,长期记忆写入文件系统;上下文压缩 | 笔记本 + 档案柜 |
| 工具 | 搜索、文件读写、数据库、API应用程序接口,让两个程序互相打电话的电话号码、浏览器、代码执行 | 工具箱 |
| 执行环境 | 文件系统、容器、沙箱、浏览器实例 | 工作台 |
| 防护栏 | 高危操作拦截、权限控制、审计日志 | 安全护栏 |
| 可观测性 | 记录每步决策、成本、输出,形成链路追踪 | 黑匣子记录仪 |
胖 Harness vs 瘦 Harness
2026 年业界有一场重要辩论:Harness 应该"胖"还是"瘦"?
胖 Harness(Fat)
- 代表:LangChain Deep Agents
- 主张:任务越长,Harness 必须越丰富
- 内置规划工具、子 Agent、生命周期钩子
- 让 200 步任务成为可能
瘦 Harness(Thin)
- 代表:YC / Garry Tan
- 主张:Harness 每行代码都从模型夺走推理权
- 最小循环 + 领域知识编码在 Skill 文档中
- 让前沿模型充分发挥推理能力
关键证据:LangChain Terminal Bench 2.0 排行榜显示,同一个模型在优化的第三方 Harness 中,排名从 30 名外跳到前 5 名——变的不是模型权重,而是 Harness。这说明 Harness 工程水平对 Agent 实际表现的影响,可能不亚于模型本身的能力。
这三个术语常被混用但有区别:Framework(框架,如 LangChain、CrewAI)提供构建块,对 Agent 怎么运行基本中立;Harness 是框架之上的运行时层,端到端指导 Agent 怎么运行(控制每步看到什么上下文、如何处理失败、何时压缩记忆);Runtime 是更底层的执行环境(容器、沙箱)。简言之:用框架组合能力,用 Harness 可靠地运行。
五、OpenClaw(龙虾):现象级 AI Agent
2026 年开年,一个名为 OpenClaw(社区昵称"龙虾")的开源 AI Agent 框架爆火出圈,成为现象级产品。它生动地诠释了"模型 + 脚手架"如何变成一个能干活的 Agent。
是什么
OpenClaw 是一款开源、本地优先的 AI 智能体框架,核心突破是将大语言模型的"大脑"与本地计算机的"双手"结合——你用自然语言告诉它要做什么,它就直接操作电脑完成:整理文档、处理邮件、安排日程、编写代码、批量生成文件。
它的核心理念是"聊天即行动"——不是给你写一段"操作指南"让你自己去执行,而是它自己直接动手。你只需要说"把这周的会议纪要整理成 PDF 发给参会者",它就能自动完成全流程。
为什么叫"龙虾"
OpenClaw 直译"开放钳爪",项目标识就是一只龙虾,因谐音被网友亲切叫成"龙虾",部署使用过程被称为"养龙虾"/"养虾"。它由奥地利程序员 Peter Steinberger 开发,最初命名 Clawdbot,2026 年 1 月因 Anthropic 商标侵权指控更名为 OpenClaw。
核心特性
爆火与安全争议
2026 年 3 月,OpenClaw 成为 AI 圈"现象级顶流"。腾讯、字节跳动、阿里云相继推出各自的"小龙虾"产品或部署方案,360 推出一键安装版本,首批"政务龙虾"在深圳福田区上线。
但"龙虾"也暴露了 AI Agent 的安全风险:有用户发现它会批量删除邮件而无法阻止,"龙虾一秒可搬空用户隐私信息"登上热搜。工信部发布预警,指出 OpenClaw 在默认配置下存在较高安全风险。这恰好印证了前面讲的道理——一个缺乏企业级 Harness 防护栏的 Agent,能力越强风险越大。
OpenClaw 本质上是一个相对"瘦"的本地 Agent——它给了模型很大的自主权,但防护栏不够完善。它的安全风险恰恰说明:Agent 的能力上限取决于 Harness,安全下限也取决于 Harness。一个没有防护栏的 Agent,就像一辆没有刹车的高跑车——跑得越快,越危险。
六、RAG:从"开卷考试"到"建立世界观"
前面章节已经介绍过 RAG 的基本概念——让 AI 先"查资料"再回答,像"开卷考试"。但 2026 年的 RAG 已经远不止"查资料"这么简单,它经历了从"朴素检索"到"知识引擎"的完整演化。
四级演进
| 级别 | 时期 | 范式 | 特点 |
|---|---|---|---|
| Lv.1 朴素 RAG | 2023 | 提问 → 向量搜索(Top-K) → 拼接 → 回答 | 碎片化、无推理、无记忆 |
| Lv.2 高级 RAG | 2024 | 查询重写 → 混合检索(向量+关键词) → 重排序 → 回答 | 检索精度提升,仍是单次被动检索 |
| Lv.3 Agentic RAG | 2025-2026 | Agent 规划 → 动态路由(向量/SQL/API) → 多跳检索 → 自我反思 → 回答 | 赋予检索"自主性",解决多跳推理 |
| Lv.4 GraphRAG | 2025-2026 | 实体抽取 → 知识图谱 → 子图检索 → 图算法重排 | 赋予知识"全局观" |
业界有一个精辟的总结:"2024 年教 AI'读书',2025 年教 AI'做笔记',2026 年教 AI'建立世界观'和'形成长期记忆'。"
朴素 RAG 的"三大绝症"
2026 年 4 月,硅谷 AI Engineering Summit 上一场名为《朴素 RAG 的死亡》的圆桌形成残酷共识:基于"文本切片 + 向量相似度"的传统 RAG 在企业级复杂知识场景已彻底破产。它有三大致命缺陷:
GraphRAG:给 AI"全局观"
GraphRAG(图增强检索)是微软开源的技术,在 GitHub 已获数万 Star,成为财富 500 强企业构建知识引擎的新标配。它的核心做法是:把非结构化文本提取为知识图谱——节点是实体(人、公司、概念),边是关系("任职于""投资了""合作过"),然后用图论算法(如 PageRank)计算实体的重要性,实现精准锚定。
这解决了"管中窥豹"问题:不再是找"相似的段落",而是找"重要的实体及其关系网络"。GraphRAG 能回答"A 公司和 B 公司有什么关联"这种需要跨文档推理的问题。
Agentic RAG:给检索"自主性"
Agentic RAG 让检索系统具备"自主规划与多跳推理"能力。它不再是一次性的"搜→答",而是:Agent 先分析问题需要哪些信息 → 决定去哪里找(向量库?SQL 数据库?API?)→ 多跳检索 → 检查是否够用 → 不够再找 → 最后综合回答。这解决了"单细胞生物"问题。
AI 原生记忆系统
以 Mem0 和 Zep 为代表的 AI 原生记忆系统,让 Agent 拥有跨会话的"长期海马体",解决了"金鱼记忆"问题。AI 终于能记住你上次说过的话、你的偏好、你正在做的项目——不用你每次重复交代。
RAG 的四级演进揭示了一个趋势:AI 知识系统正从"被动检索"走向"主动认知"。早期是"你问我查",后来变成"我先想想该查什么、去哪查、查够了没有"。这种从"工具"到"智能体"的跃迁,贯穿了整个 AI 脚手架的演化逻辑。
七、更多系统组件:脚手架的"基础设施"
除了 MCP、Skills、Harness、RAG 这四大核心组件,AI 脚手架还有一系列基础设施级的组件,它们共同支撑着 AI 在生产环境的可靠运行。
向量数据库:RAG 的"书架"
RAG 要先"查资料",资料存在哪里?向量数据库。它把文本、图片转化为高维向量(一串数字),然后按"语义相似度"检索——你搜"怎么减肥",它能找到"控制饮食和运动"的段落,即使原文没出现"减肥"两个字。
| 数据规模 | 推荐方案 | 特点 |
|---|---|---|
| 原型/小规模(<10万) | Chroma / SQLite-vec | 零成本,开箱即用 |
| 中小规模(10万-100万) | pgvector(PostgreSQL 扩展) | 零运维,向量与结构化数据同库查询 |
| 中大规模(100万-1000万) | Qdrant / Milvus Lite | 专业向量检索,性能与功能兼顾 |
| 大规模(>1000万) | Milvus 集群 | 性能王者,但运维成本高 |
语义缓存:AI 的"已读回复"
语义缓存通过语义匹配复用已有的 AI 响应。当新问题与之前回答过的问题语义相近时,直接返回缓存结果,不必重新调用模型。Redis LangCache 可将响应速度提升最高 15 倍,token 消耗和 API 账单节省最高 70%。
就像客服系统的"已读回复"——如果 100 个人问了几乎一样的问题,没必要调用 100 次大模型,返回同一个答案就行。但语义缓存的难点在于判断"语义相近"——"怎么减肥"和"如何控制体重"是同一个问题,但"怎么增肥"就不是。
AI 网关:AI 的"总机"
AI 网关是连接多个模型与业务系统的关键枢纽,作为每个应用与每个 LLM 之间的中间层,集中执行:
- 多模型统一接口:100+ 模型用同一套 API,切换模型无需改代码
- 负载均衡与故障转移:一个模型挂了自动切到备用模型
- 成本监控与分摊:按部门/项目追踪 token 消耗和费用
- 限流与路由:控制调用频率,按任务类型路由到最合适的模型
代表项目有 LiteLLM(100+ LLM API,OpenAI 兼容格式)、Bifrost(Go 编写,统一 LLM 网关 + MCP 网关 + Agent 网关)等。
防护栏:AI 的"安全带"
防护栏(Guardrails)是控制 AI "允许做什么、不允许做什么"的运行时系统。2026 年的现代防护栏必须覆盖四个拦截点:
仅过滤输出文本的是 2023 年的产品。现代防护栏必须覆盖全部四个点,且延迟必须极低(输入拦截 <100ms,输出拦截 <150ms),否则防护栏本身就成了产品的性能瓶颈。
八、全景图:AI 系统栈的分层架构
把前面讲的所有组件拼到一起,我们可以看到 2026 年 AI 系统栈的完整分层架构:
| 层 | 组件 | 作用 | 类比 |
|---|---|---|---|
| 应用层 | Cursor、Dify、Manus、OpenClaw | 面向用户的 AI 产品 | 应用程序 |
| 编排层 | LangGraph、CrewAI、Agent SDK | 多 Agent 协同、任务编排 | 进程调度器 |
| 能力层 | Skills、Plugins | 模块化能力封装 | 应用商店 |
| 连接层 | MCP、Function Calling | 标准化工具连接 | 驱动程序接口 |
| 知识层 | RAG、向量数据库、记忆系统 | 外部知识接入与持久记忆 | 文件系统 + 数据库 |
| 安全层 | Guardrails、红队测试 | 输入输出拦截、安全审计 | 防火墙 |
| 基础设施层 | AI 网关、语义缓存、LLMOps | 路由、缓存、监控、成本管理 | 网络 + 缓存 + 运维 |
| 模型层 | GPT、Claude、DeepSeek、通义千问 | 推理与生成 | CPU |
这个分层架构说明了一个重要趋势:AI 正在从"一个模型"变成"一套系统"。就像智能手机的价值不只在 CPU——没有操作系统、应用生态、安全机制、网络通信,再强的 CPU 也只是个芯片。AI 也是如此:模型是核心,但模型外面那一层层的脚手架,才是把它变成"好用产品"的关键。
2024.11 Anthropic 发布 MCP 协议
2025.09 Redis LangCache 语义缓存公开预览
2025.10 Anthropic 上线 Agent Skills 并开源 20+ 个技能
2025.12 MCP 捐赠给 Linux Foundation
2026.01 "Harness Engineering" 术语在业界流行;Claude Cowork 插件发布
2026.03 OpenClaw"龙虾"爆火;LangChain 发表 Harness 解剖文
2026.04 硅谷 AI Engineering Summit 宣告"朴素 RAG 的死亡"
2026.05 GraphRAG + Multi-Agent 论文登上 Nature
2026.07 MCP 第 5 版规范发布,转向无状态设计
九、本章术语速查
| 术语 | 一句话解释 |
|---|---|
| AI 脚手架 | 包裹在大模型之外、使其在生产环境可靠运行的全部工程层 |
| MCP | 模型上下文协议,AI 与工具连接的"USB-C 接口" |
| Function Calling | 模型能力,让 LLM 输出结构化工具调用指令 |
| Skills | 模块化能力扩展,给 AI 发"工作手册",按需三级加载 |
| Harness | Agent 运行时框架,管理工具/记忆/状态/安全/可观测性 |
| RAG | 检索增强生成,让 AI 先"查资料"再回答 |
| GraphRAG | 图增强检索,用知识图谱赋予 AI"全局观" |
| Agentic RAG | 智能体化 RAG,Agent 自主规划检索策略和多跳推理 |
| 向量数据库 | 存储和检索语义向量的专用数据库,RAG 的"书架" |
| 语义缓存 | 按语义相似度复用已有 AI 响应,降低成本和延迟 |
| AI 网关 | 多模型统一接口、负载均衡、成本监控的中间层 |
| 防护栏 | 运行时安全控制,覆盖输入/输出/检索/工具四个拦截点 |
| OpenClaw(龙虾) | 开源本地优先 AI Agent 框架,"聊天即行动" |
| LLMOps | 大模型运维体系,含监控、追踪、评估、版本管理 |
| AI Agent(智能体) | 能自己感知环境、做决策、执行任务的AI系统,就像一个会自己动手干活的家政机器人 |
| LLM(大语言模型) | Large Language Model,参数量巨大的语言模型,如GPT、Claude、DeepSeek等 |
| API | 应用程序接口,让不同程序互相"打电话"交流的通道,AI模型通过API提供服务 |
| 插件(Plugin) | 给AI模型扩展功能的附加模块,像给手机装App一样给AI装新能力 |
| LangChain | 流行的AI应用开发框架,帮你把模型、工具、数据像搭积木一样组装成应用 |
| Schema | 数据结构定义,规定了数据长什么样、有哪些字段,像表格的表头 |
本章小结
Agent = Model + Harness:模型是"大脑",脚手架是"操作系统",二者缺一不可。模型决定能力上限,脚手架决定能否接近这个上限。
MCP 连接工具,Skills 封装能力,Harness 管理运行,RAG 接入知识——四大核心组件各司其职,共同构成 AI 脚手架层。
AI 正在从"一个模型"变成"一套系统":就像智能手机的价值不只在 CPU,AI 产品的价值也不只在模型,而在模型外面那一层层完整的系统工程。
- AI 脚手架是包裹在大模型之外的完整工程层,解决裸模型在生产环境中"上线即崩溃"的问题。核心公式:Agent = Model + Harness。
- MCP 是 AI 工具连接的标准化协议("USB-C 接口"),解决 M×N 碎片化问题;它建立在 Function Calling 之上,不是替代。
- Skills 是模块化能力扩展机制,通过三级渐进式加载实现"按需加载专业能力",避免上下文浪费。
- Harness 是 Agent 运行时框架,管理规划/记忆/工具/执行/防护/可观测性七大组件,解决"第 100 次工具调用"问题。
- RAG 经历了从朴素 RAG 到 GraphRAG/Agentic RAG 的四级演进,从"被动检索"走向"主动认知"。
- 向量数据库、语义缓存、AI 网关、防护栏等基础设施组件,共同支撑 AI 系统在生产环境的可靠运行。
理解了 AI 脚手架,你就明白了一个关键道理:好产品不只是"用最好的模型",更是"搭最好的系统"。下一章,我们将转向另一个维度——如何评价一个 AI 模型或 AI 系统到底"好不好",从参数规模到能力基准,建立一套立体的判断框架。
"2026 年的 AI 工程,比的不再是谁的模型参数多,而是谁的脚手架搭得好——因为模型是引擎,脚手架是整辆车,用户开的从来不是引擎,而是车。"