人工智能通识读本
第一篇:什么是AI

AI就在你身边🌱 轻松

上一章我们看清了 AI 的能力与局限——知道它擅长什么、又在什么地方会"翻车"。但光知道理论还不够,你可能没意识到,AI 早就不是实验室里的高冷研究,它已经悄悄住进了你的手机、你的家、你每天用的每一个 App。这一章,我们就把 AI 从云端拉回地面,看看它在你身边都干了些什么。

一、语音助手:听懂你说的话

你对手机说一句"嘿,Siri,明天提醒我带伞",它就乖乖设好了提醒。你对小爱同学说"打开客厅的灯",家里的灯就亮了。这看似简单的对话背后,藏着三步精密的 AI 流程:

  1. 语音识别(ASR):把你说的声音波形,转换成文字。AI 要分辨你的口音、过滤背景噪音、断句,最后把"明天提醒我带伞"这几个字准确识别出来。
  2. 自然语言处理(NLP):理解这段文字的意思。AI 要明白"明天"指哪天、"提醒我带伞"是一个设提醒的指令,而不是在讨论天气。
  3. 语音合成(TTS):把 AI 的回答用自然的声音"说"出来。今天的合成声音已经很难听出是机器了,有的甚至能模仿你的语气。
声音 语音识别 声→文字 语言理解 懂意思 语音合成 文字→声
图:语音助手的三步工作流程——识别、理解、合成。

Siri、小爱同学、小度、天猫精灵……这些语音助手之所以越来越"聪明",正是因为背后的大语言模型让"自然语言处理"这一步突飞猛进。早期的语音助手只能听懂固定句式,现在它们已经能和你自然地多轮对话了。

📌
小知识

语音识别的准确率,已经从十几年前的 70% 左右提升到了今天的 97% 以上。这意味着在安静环境下,AI 听写比你手写还准。许多记者、学生已经习惯用语音转文字来记录会议和笔记。

二、推荐系统:它怎么知道你喜欢什么

刷抖音、刷B站、逛淘宝、听网易云……为什么每个平台都像长了眼睛一样,总能推到你心坎上?这背后是推荐系统的功劳,它是当今商业上最成功的 AI 应用之一。

两种核心思路

👥
协同过滤 · 找口味相似的人
"和你口味像的人,还喜欢这些。"系统发现你和另一群人点赞过相似的视频,就把那群人喜欢、而你还没看过的视频推给你。它不关心视频内容是什么,只关心"谁和谁品味像"。
🏷️
内容理解 · 分析视频本身
"这个视频是关于萌宠的,你之前看过很多萌宠,那你也可能喜欢它。"AI 给每个视频打标签(搞笑、美食、科技、宠物……),再和你历史喜欢的标签匹配,把对味的推给你。

实际中的推荐系统是两者的结合,再加上无数细节:你停留了多久、有没有看完、点没点赞、评没评论、分没分享……每一个动作都在帮 AI 更懂你。越用越懂你,越懂你越上瘾——这也是为什么短视频让人"刷到停不下来"。

⚠️
"信息茧房"的隐忧

推荐系统太懂你,也不全是好事。它可能让你只看到自己想看的内容、只听到自己赞同的观点,久而久之就像被困在一个"茧"里,视野变窄。这叫"信息茧房"。对抗它的办法是:偶尔主动搜索陌生领域、刻意关注不同观点、别只被动接受推荐。

三、自动驾驶:AI如何"看路"

特斯拉、百度 Apollo百度的自动驾驶开放平台,别的车厂可以直接拿它来造无人车、小鹏、华为……自动驾驶是 AI 最酷炫、也最具挑战的应用之一。它要解决的核心问题是:让汽车像人一样"看见"路况、"理解"发生了什么、再"决定"怎么开

AI 怎么"看"

自动驾驶汽车装了一堆"眼睛":摄像头(看颜色和标志)、雷达(测距)、激光雷达(构建周围的三维点云)。这些传感器每秒产生海量数据,AI 要在零点几秒内完成一个完整的循环:

  1. 看见:摄像头和雷达捕捉周围环境的原始数据;
  2. 理解:计算机视觉识别出车道线、行人、车辆、红绿灯、交通标志,判断它们的位置和运动方向;
  3. 决策:根据理解结果,决定是该加速、减速、变道还是停车;
  4. 执行:把决策变成方向盘、油门、刹车的具体动作。

这四步要在 0.1 秒内完成,而且容不得半点差错——毕竟事关人命。这也是为什么自动驾驶比下棋难得多:棋盘是封闭的、规则明确的,而马路是开放的、充满意外的。

L0 到 L5:自动驾驶的六个等级

聊自动驾驶,绕不开 L0 到 L5 这六个等级。它们看着像游戏段位,其实说的是同一件事:这辆车开起来,人还要操多少心。

🎈 打个比方

把这六级想成一个学员从学车到出师的过程:AI 是学员,你是坐在副驾的教练。等级越高,教练越轻松。

L2:学员能扶方向、控车速,但教练的脚一刻不能离开刹车,眼睛也不能离开路——这就是今天大多数家用车。L3:在高速这类简单路况上学员已能独当一面,教练可以松手歇一会儿,但一被叫就得马上接管。

L4:在划定的一片城区里,学员能自己跑完全程,教练甚至可以不上车。L5 才是真正出师的老司机——雨夜、山路、施工路段,什么情况都能自己应付。

自动驾驶等级 名称 谁负责 现状
L1—L2 辅助驾驶 人为主,AI辅助 已普及(自适应巡航、车道保持)
L3 有条件自动驾驶 特定场景AI负责 部分高端车型具备
L4 高度自动驾驶 限定区域内AI负责 Robotaxi试运营中
L5 完全自动驾驶 全程AI,无需人 仍在研发
人负责 人机共担 车负责 无自动化 L0 全靠人开 辅助驾驶 L1 帮着扶一把 部分自动 L2 人必须一直盯着 有条件自动 L3 可松手,随叫随到 高度自动 L4 划定区域内不用管 完全自动 L5 什么路况都能开 越往右,车越自主,人越省心 →
图:自动驾驶 L0—L5 阶梯图。台阶越高,方向盘越不需要人扶;颜色由暖转冷,代表责任从"人"一级级交到"车"手里。

目前大多数家用车处于 L2 级,能在高速上帮你跟车、保持车道,但人必须时刻注意。一些城市的 Robotaxi(无人出租车)已经达到 L4 级,能在限定区域里完全自己开。但距离"任何地方都能无人驾驶"的 L5,还有相当长的路要走。

四、图像识别:人脸解锁背后的秘密

你拿起手机看一眼,屏幕"啪"地解锁了。在医院,AI 能从一张 CT医院里的断层扫描,能拍出身体内部的切片图像,像把人一层层切开来看 片里标出医生都可能漏看的早期肿瘤。这些"看图"的本事,靠的是一种叫卷积神经网络(CNN)的深度学习技术。

模仿人眼的识别方式

CNN 的工作方式非常像人眼。科学家发现,人类视觉皮层处理图像是分层进行的:先识别边缘(哪里有线条),再组合成形状(圆形、三角形),最后拼成整体(这是一张脸)。CNN 也这么干:

  • 第一层:找边缘、颜色变化;
  • 第二层:把边缘拼成简单的形状;
  • 更深层:把形状拼成"眼睛""鼻子""嘴巴"这样的部件;
  • 最后一层:把部件组合起来,判断"这是不是你的脸"。

以人脸解锁为例:手机先扫描你的脸,提取出几十个甚至上百个关键特征(两眼间距、鼻梁角度、下颌轮廓……),转化成一串数字"脸的身份证"。之后每次解锁,它都把当下的脸和存的"身份证"比对,相似度够高就放行。它看的不是照片,而是数字

📌
AI 看了几百万张脸

人脸识别系统之所以准,是因为它在训练时"看"过几百万甚至上千万张人脸,从中学会了"什么样的特征组合代表同一个人"。这也是为什么戴口罩时识别会变难——AI 依赖的关键特征被遮住了一半。

除了人脸,图像识别还广泛用于:医学影像诊断、工业质检(找出零件上的瑕疵)、农业病虫害识别、卫星遥感分析、车牌识别……凡是需要"看图说话"的地方,几乎都有 CNN 的身影。

五、机器翻译:从"机翻味"到几乎自然

你还记得早年的机器翻译吗?把"好好学习,天天向上"翻成"Good good study, day day up"——这种令人啼笑皆非的"机翻味",曾经是机器翻译的标签。

但今天的 DeepL、谷歌翻译、百度翻译,翻译质量已经高得惊人,长段落读起来几乎像母语人士写的。是什么让翻译质量发生了质变?答案正是上一章讲到的 Transformer

为什么 Transformer 让翻译脱胎换骨

老式翻译方法是"逐词翻译"——一个词一个词地换语言,完全不顾上下文,所以才会闹"Good good study"的笑话。而 Transformer 凭借注意力机制,能统揽全局:它在翻译每个词时,会同时"看"整句话甚至整段话,判断这个词在当前语境下到底是什么意思。

比如"bank"这个词,单独看不知道是"银行"还是"河岸"。但如果整句话在讲"他在河边钓鱼",Transformer 会注意到"河边""钓鱼",从而把它翻译成"河岸"。这种根据上下文消歧的能力,正是它翻译自然的关键。

如今的翻译软件还能做到实时语音翻译——你说中文,它几乎同步地说出英文,让跨语言交流变得像聊天一样自然。这在十年前还是科幻电影里的场景。

六、AI创作:写文章、画画、拍视频、作曲

让 AI 写一首诗、画一幅画、拍一段视频、谱一段曲——这在过去听起来像天方夜谭,如今已经成了许多人每天都在做的事。这类能"创造"新内容的 AI,统称为生成式 AI

它们的原理,用一句话概括:学过海量人类作品后,重新组合出新的内容。AI 写文章,是因为它"读"过互联网上几乎所有公开文章,学会了语言的搭配规律;AI 画画,是因为它"看"过几十亿张图片,学会了不同风格的视觉规律;AI 拍视频,是因为它"观察"过海量动态画面,学会了物体如何运动、镜头如何流转。

✍️
AI 写作
写邮件、写总结、写故事、写代码。你给个题目或提纲,它能扩展成完整文章。本质是"预测下一个最可能的词"。
🎨
AI 绘画
输入"一只穿着宇航服的柴犬在月球散步",几秒后就生成一张精美图片。它学会了文字描述和画面之间的对应关系。代表产品有 Midjourney、Lovart 等。
🎬
AI 视频生成
输入一段文字或一张图片,AI 就能生成一段流畅的视频——人物会走动、表情会变化、镜头会推进。代表产品有字节即梦(Seedance)、快手可灵、Google Veo 等。
🎵
AI 作曲
根据你选的风格和情绪,生成一段完整的背景音乐,可用于短视频、游戏、播客。它学会了旋律和节奏的规律。
🔥
AI 短剧:从"技术奇观"到百亿赛道

2026 年,AI 视频生成最出圈的应用是AI 短剧。2025 年 5 月,国内首部全 AI 短剧《鬼吹灯之牧野诡事》上线,全程无真人拍摄。到 2026 年一季度,全网上线微短剧 12.8 万部,AI 短剧占比高达 95%,日均上线超 1300 部。

现象级作品《被裁掉的女孩》播放量突破 2 亿,观众一开始完全没意识到这是 AI 作品——人物微表情细腻、场景逼真,靠的是即梦 AI Seedance 2.0 模型的图生视频技术。首部全 AI 上星中剧《桃花潭记》登陆安徽卫视,标志着 AI 内容从短视频走向大屏。2026 年 AI 短剧市场规模预计突破 240—300 亿元。

制作成本也在断崖式下降:字节 Seedance 2.0 将纯视频生成成本压至 1 元/秒,一部 90 分钟漫剧的成本从 1 万余元降至约 2000 元。制作周期从传统 3—5 个月压缩至 7—14 天,团队从 30 人缩减至 1—3 人。AI 短剧还成为文化出海新载体——无需海外实景和真人演员,一键生成适配不同地区审美的剧集,TikTok 上 AI 短剧分账环比涨幅超 300%。

💡
AI 创意智能体:从"单点工具"到"一站式工作室"

早期的 AI 创作工具是"单点"的——生图归生图,做视频归做视频,你得在不同工具间来回切换。2026 年,一类全新的产品崛起:AI 创意智能体,它能理解你的需求,自动拆解任务,一站式交付图片、视频、3D、UI 等整套视觉方案。

Lovart 是目前图片生成领域口碑领先的产品之一,支持 GPT Image 2、Seedance 等多种模型,可以从文字直接生成图片、视频和 3D 模型,还提供品牌套件、IP 设计、电商海报等专业工作流,被许多设计师称为"图片生成断档第一"的工具。

Miora(妙境)是腾讯 2026 年 7 月全量上线的 AI 创意智能体平台,采用多智能体协同架构——你说一句话或给一份设计需求,它就拆解任务,调度生图、视频、3D 建模、UI 设计等不同专家智能体,在同一块画布上交付一整套风格统一的视觉方案,还有记忆系统学习你的审美偏好。

这类产品的出现,意味着 AI 创作正在从"生成单张图/单段视频"走向"交付完整项目"——就像拥有了一个由多位 AI 专家组成的创意团队。

⚠️
AI 创作的本质

需要澄清一点:AI 的"创作"本质是重新组合,而不是真正的灵感。它把学过的元素按概率重新拼接,结果可能很惊艳,但它并不"理解"自己写的是什么、画的是什么。所以 AI 是极好的创作助手,但真正的创意、情感和审美判断,依然需要人来把关。

七、更多领域:智能家居与医疗

AI 的触角远不止上面这些。在你能想到的几乎每个行业,AI 都在悄悄发力。下面这些只是冰山一角:

🏠
智能家居
空调根据你的习惯自动调温,扫地机器人规划最优清扫路线,冰箱提醒你牛奶快过期了。AI 让家更懂你。
🏥
医疗影像
AI 看 CT、X 光、病理切片,帮医生发现早期肺结节、眼底病变,速度和精度都达到甚至超过资深医师水平。
🌾
智慧农业
用手机拍一张叶子,AI 立刻识别出是什么病虫害,并给出治疗方案。还能预测产量、优化灌溉施肥。
🌦️
气象预报
AI 模型分析几十年气象数据,能更准地预测台风路径、暴雨落区,预报速度比传统方法快上万倍。
🏭
工业质检
流水线上的摄像头 + AI,一秒检查几百个零件,找出人眼难以发现的细微瑕疵,不良品无所遁形。
💳
金融风控
每一笔信用卡交易,AI 都在毫秒内判断是否被盗刷。它从海量交易里学会了"正常消费"和"异常行为"的区别。

你会发现,AI 的应用有一条共同主线:把人从重复、繁琐、海量的工作中解放出来,让人去做更有创造力的事。它不是来抢饭碗的,而是来当帮手的——至少在现阶段是这样。

八、2026新应用:AI手机与端侧AI

到了 2026 年,AI 应用出现了一个明显的新趋势:AI 从"云端"走向"终端"。过去用 AI 得联网把数据传到云端服务器处理,现在越来越多的 AI 能力直接跑在你的手机、电脑、甚至手表里,这叫端侧 AI

为什么要把 AI 搬到终端

  • 更快:不用等网络往返,响应几乎是瞬时的;
  • 更省流量:数据不用上传,省流量也省钱;
  • 更隐私:你的照片、聊天记录留在本地,不必担心泄露;
  • 更可靠:没网也能用,地铁里、飞机上照样行。

2026 年,AI 手机成为主流。市场研究预计,全年 AI 手机出货量将达到约 1.47 亿台。手机里的 AI 助手能帮你实时翻译通话、一键消除照片里的路人、根据你的习惯智能调度电量、甚至自动整理会议纪要。

一个标志性事件:阶跃星辰发布了全球首个大模型原生智能体手机——手机里的 AI 不再只是个"问答工具",而是一个能主动帮你办事的"智能体",它能跨 App 操作、自己拆解任务、替你完成一整套流程。

不止手机,AI 也在深入赋能千行百业:工厂里的 AI 质检、医院里的 AI 辅助诊断、农田里的 AI 病虫害识别、电网里的 AI 负荷预测……AI 不再只是"技术炫技",而是变成了实实在在的生产力,像当年的电力一样,渗透进每个行业的毛细血管。

📌
一个判断标准

判断一项 AI 应用是不是真有价值,有个简单标准:它是让人"哇"一声就忘了,还是让人离不开?前者是炫技,后者才是真正的赋能。2026 年的 AI,正在从"让人哇"走向"让人离不开"。

九、AI 与教育:每个孩子的专属老师

AI 在教育领域的应用,可能是和你关系最密切的一个。它正在让"因材施教"这个两千多年前的理想,第一次有了大规模实现的可能。

📝
个性化辅导
AI 能根据你的错题、薄弱点,量身定制练习,像一个永远耐心、随时在线的私教。会的少练,不会的多练,效率大幅提升。
随时答疑
深夜写作业卡住了?问 AI,它不光给答案,还能一步步讲解思路。比搜索引擎更懂"你到底卡在哪"。
🌐
语言学习
AI 陪你练口语、纠正发音、模拟对话场景,学外语不再"开不了口"。它还能根据你的水平调整难度。
📚
知识探索
对什么好奇,直接问 AI,它能把复杂概念用你能懂的方式讲清楚,像一位博学又亲切的家庭教师。
⚠️
AI 是助手,不是替身

AI 辅导虽好,但要警惕一个陷阱:直接抄答案而不思考。如果只把 AI 当成"答案生成器",你的思维能力反而会退化。正确的用法是:先自己想,卡住了再让 AI 提示思路,弄懂后用自己的话复述一遍。让 AI 帮你学懂,而不是帮你逃避学习。

十、便利背后:AI 的另一面

这一章我们讲了 AI 多么能干、多么方便。但在被便利包围的同时,也要清醒地看到 AI 的"另一面"——这些问题,我们会在第六章"AI 与伦理"里详细讨论,这里先给你提个醒。

隐私:你的数据去哪了

AI 越懂你,意味着它收集了越多关于你的数据——你搜过什么、买过什么、去过哪里、和谁聊过天。这些数据被谁掌握?用来做什么?会不会泄露?这些都是值得追问的问题。便利和隐私,往往是一枚硬币的两面

依赖:没有 AI 我们还会不会做事

当 AI 帮你写作文、帮你算题、帮你导航,你的这些能力会不会退化?就像有了计算器后,很多人的心算能力确实变差了。工具用得好是助力,过度依赖则是削弱。要在"借力"和"自立"之间找到平衡。

公平:AI 红利人人都能享受吗

AI 带来巨大便利,但并非人人都能平等享受。会用 AI 的人、能付费用好 AI 的人,会获得更大优势;而接触不到、不会用的人,可能被进一步拉开差距。这就是所谓的"数字鸿沟"。让 AI 红利惠及更多人,是社会要共同面对的课题。

📌
带着问题继续读

这些问题没有标准答案,但值得每个使用 AI 的人思考。先记住它们,读到第六章"AI 与伦理"时,你会对它们有更深入的理解。一个成熟的 AI 使用者,不仅要会用,还要会想。

"技术是中性的,它既可向善,也可向恶,关键看掌握它的人。"AI 给了我们前所未有的力量,也给了我们前所未有的责任。用好它,是这个时代每个人的必修课。

停下来想一想

🤔
想一想

读到这里,合上书(或者关掉页面),认真回想一下:你今天,用过哪些 AI?

是早上叫醒你的闹钟?是刷到的短视频?是拍照时的美颜?是搜索时的自动补全?还是写作业时问的 AI 助手?把它们一条条列出来,你会惊讶地发现——AI 早就不是"未来",它就是"现在"。

再想一步:这些 AI 里,哪些让你更高效了?哪些让你更上瘾了?哪些其实可以不用?带着这些问题读完后面的章节,你会对 AI 有更清醒的认识。

十一、AI 应用全景速览

本章讲了不少 AI 应用,把它们汇总成一张表,帮你建立整体印象。你会发现,这些应用背后用到的核心技术其实就那几样——这就是"原理少、应用多"的道理。

应用 核心技术 你身边的例子
语音助手 语音识别 + NLP + 语音合成 Siri、小爱同学、小度
推荐系统 协同过滤 + 内容理解 抖音、B站、淘宝、网易云
自动驾驶 计算机视觉 + 决策规划 特斯拉、百度 Apollo
图像识别 卷积神经网络(CNN) 人脸解锁、医学影像
机器翻译 Transformer + 注意力机制 DeepL、谷歌翻译
AI 创作 生成式模型 AI 写作、AI 绘画、AI 作曲
端侧 AI 小型化模型 + 终端芯片 AI 手机、智能手表

看出门道了吗?底层技术就那么几类(视觉、语言、推荐、生成),却能组合出千姿百态的应用。这也是为什么理解原理特别重要——懂了原理,再多的新应用你都能一眼看穿它的本质。

🎯
一个观察练习

从今天起,每用一个 App 或功能,试着猜猜它背后用了哪类 AI 技术:是视觉?是语言?是推荐?还是生成?猜多了你会发现,自己看 AI 的眼光变了——从"好神奇"变成了"原来如此"。这种洞察力,就是 AI 时代的"读写能力"。

十二、本章术语速查

术语 一句话解释
语音识别(ASR) 把声音波形转换成文字的技术
语音合成(TTS) 把文字用自然声音"说"出来的技术
自然语言处理(NLP) 让AI理解和生成人类语言的技术
协同过滤 推荐系统核心思路之一,找口味相似的人来推荐
信息茧房 推荐系统太精准导致用户只看到同质化内容的现象
卷积神经网络(CNN) 模仿人眼分层处理图像的深度学习技术
注意力机制 Transformer的核心,根据上下文判断每个词的重点
生成式AI 能写文章、画画、拍视频、作曲的AI,本质是重新组合
端侧AI AI能力直接跑在手机、电脑等终端设备上,更快更隐私
数字鸿沟 会用AI和不会用AI的人之间日益扩大的差距
L2 / L4 / L5 自动驾驶等级:L2=有教练在旁盯着、L4=基本能自己开、L5=彻底老司机
L0 / L1 自动驾驶最低两级:L0=全靠人开,车不插手;L1=车只帮一件事,比如自动跟车或自动保持车道
L3 有条件自动驾驶:高速等特定路况下人可以松手,但车一提示就得立刻接管,是"人机共担"的分界线
Apollo 百度的自动驾驶平台,中国自动驾驶的代表性项目
CT 计算机断层扫描,医院拍的片子,AI能帮助快速识别CT影像中的病灶

本章小结

🎯
三句话记住本章

AI已无处不在:从语音助手到推荐系统,从自动驾驶到图像识别,AI早已像水电一样融入日常生活的基础设施。

底层技术就那么几类:视觉、语言、推荐、生成——少量核心技术组合出千姿百态的应用,懂了原理就能看穿所有新应用的本质。

2026年AI从"炫技"走向"赋能":端侧AI成为主流,AI手机出货1.47亿台,AI从云端走向终端,从让人"哇"走向让人"离不开"。

  1. 语音助手靠"语音识别→语言理解→语音合成"三步听懂你的话。
  2. 推荐系统用协同过滤和内容理解两种思路,越用越懂你,也要警惕"信息茧房"。
  3. 自动驾驶在零点几秒内完成"看见→理解→决策→执行",目前多数家用车处于 L2 级。
  4. 图像识别用卷积神经网络模仿人眼,从边缘到形状到整体层层识别,人脸解锁是典型应用。
  5. 机器翻译因 Transformer 的"统揽全局"能力,从"机翻味"变得几乎自然。
  6. 生成式 AI能写能画能作曲,本质是重新组合而非真正灵感。
  7. AI 还广泛用于智能家居、医疗、农业、气象、工业、金融等领域。
  8. 2026 年,端侧 AI成主流,AI 手机出货约 1.47 亿台,AI 从"炫技"走向"赋能千行百业"。

看到 AI 在日常生活中这么能干,你可能会好奇:在更前沿的领域,AI 还有哪些令人兴奋的应用方向?下一章,我们就来盘点 AI 最热门的应用方向,看看从企业服务到科研创新,AI 正在哪些新赛道上大显身手。

"最好的技术是消失的技术——当你感觉不到它的存在,它就已经成功了。"今天的 AI,正在变成这样的技术:无处不在,却又悄无声息。