AI 圈的新词冒出来的速度,比大多数人跟上的速度快得多。多模态、智能体(Agent)、工具调用、MCP,这几个词天天出现在产品介绍里,但查完定义常常还是记不住——因为它们看起来是并列的新知识,实际上讲的是同一台机器的三个层面:它能收什么、它能不能自己做主、它到底怎么动手。把这三层理清楚,之后再冒出新词,也能自己找到位置。
在拆三个新词之前,先理顺底层的四个说法。人工智能(AI)是最外层的大圈,泛指让机器完成原本需要人类智能才能完成的任务。机器学习是这个大圈里的一条路径:不靠人把规则写死,而是让程序自己从数据里找规律。深度学习又是机器学习里的一种做法:用多层神经网络找规律。今天绝大多数"大模型"走的都是深度学习这条路。
这四层一层套一层,但套的方式不完全一样。人工智能、机器学习、深度学习是干净的包含关系,没有争议。但"大模型"这一层不同:绝大多数大模型确实用深度学习实现,可"大模型"本身不是边界清晰的技术分类,能生成内容的程序也不都依赖深度学习,所以这一层只能画成虚线。
顺带清掉一个误会:神经网络的名字借自生物学,实际是一层层堆叠的计算结构;里面的"参数"不是神经元,而是训练时一点点调出来的数值,参数量更大不等于能力更强。
理顺这三层后,多模态、智能体、工具调用与 MCP 都不装在这几个圈里,它们是常和大模型搭配使用的三件事,各自回答一个独立的问题。
给 AI 发一张照片问上面写了什么,它几秒钟就能答上来,看起来像是"看懂"了整张画面。但真实发生的是切块:模型读到的不是完整画面,而是一堆被切开的小块,每一小块和文字一样按 token(模型计数内容的最小单位)计量。
多模态(Multimodal)说的就是这件事:一个模型能接收或产出的形式不只是文字,图片、声音也算。但能接收什么和能产出什么是两回事。图片输入后被切成小块,每块算若干 token 送进模型,几家主流厂商的官方文档做法接近,只是各家一块切多大、算几个 token 不同。所以发一张图也在消耗 token,图越大越清晰,花掉的 token 越多。
能接收图片,不代表能产出图片。截至 2026 年 8 月,Claude 官方常见问题页写得很直接:它只是一个理解图像的模型,能解读分析图像,但不能生成、编辑、创造图像。它是公认的多模态模型,却一张图也画不出来——这是厂商自己写下的定位。反过来也不能推到另一头,别的模型有的确实能出图,也有的能把回答输出成语音,收和出必须分开看。
多模态也不意味着读图一定准。图里有几样东西模型数得出来,但具体几个只能算个大概,小东西一多更容易出错,这一条写在 Anthropic 官方文档里;Claude 官方还写明它判断不了一张图是不是 AI 生成的。AI 读图给出的结论,仍需要人自己核对一遍。多模态不是一类模型的名字,而是描述模型收得下、出得来哪些形式的属性,不属于前面的包含圈,只是常和大模型搭配出现。
假设有三种做法都用了 AI,也都在替人做事:第一种每一步都是人预先写死的,照着流程跑;第二种能对话、给建议,但不动手,事情最后还是人自己去办;第三种没有人告诉它先查哪个、再做什么,顺序是它自己边做边定的。按官方判据,只有第三种真正算得上智能体(Agent)。
智能体的定义看起来五花八门,拆开后真正把两边分开的只有一条:每一步是谁定的。Anthropic 在 2024 年 12 月的一篇工程文章里说:一边是大模型和工具按预先写好的代码路径被编排起来,这叫工作流;另一边是大模型自己动态掌控流程和工具用法,这才是智能体。阿里云百炼的中文文档给出同一条判据:工作流由预定义流程精确控制,智能体由大模型根据提示词自主规划任务步骤。一家国际、一家国内,判据完全一致——你告诉它每一步,那是流程;它自己决定下一步,才是智能体。
各家定义有出入,但三条基本没有分歧:必须能调用工具(读文件、跑命令、查知识库、调接口,至少得能做一样,只会说话不算);通常是多步任务(自己拆出好几步去办成一件事,不是一问一答就结束);聊天机器人不算(各家官方定义里没有一家把纯聊天算作智能体)。
值得一提,Agent 这个词有新旧两层含义。老用法比大模型古老得多:自动控制和人工智能领域早就在用它,判断标准宽泛得多——能感知环境并据此做出动作就算一个 agent,连温控器都算。技术媒体今天说的"智能体"绝大多数指新用法:以大模型为核心、自己决定下一步、还能调用工具。两层意思并存,只是范围差得远——一个能说明这个词还在定型的细节是,Anthropic 自己的官方术语表里都没有收录 agent 这个词条。
现在的智能体产品,介绍页上常见"帮你查天气""帮你发邮件""帮你查快递到哪了",听起来像是模型自己去办的。但模型本身是一个计算内容的程序:递给它什么它读什么,递不进来的东西碰不到。它没连着互联网,也碰不到你的邮箱。
真实机制叫工具调用(Tool Calling,也叫 Function Calling)。准确的图景是:模型不执行任何操作,它只输出一条内容,说清楚这一步要用哪个工具、要填哪些信息;真正去执行的是模型外面的程序,执行完再把结果递回给模型,模型才接着往下说。一个完整回合分四步:模型提要求、外部程序执行、结果递回、模型接着答——只有第一步和第四步是模型自己做的。
这件事国内外官方文档各自独立写过,说法几乎一样:阿里云百炼写的是运行工具函数由用户的计算环境完成,不是大模型完成;Anthropic 写的是模型从不自己执行任何东西,它发出结构化请求,由用户代码或 Anthropic 服务器执行,结果再回到对话里。Google 和 OpenAI 描述的是同一套流程,只是拆分步数不同。
所以看到 AI"上网搜了一下",是外面的程序替它跑完搜索再把结果喂回去;能不能发邮件,取决于外面那一层有没有接上账号权限。这个外部执行程序可能在用户自己电脑上,也可能在厂商的云端服务器。
有个容易混淆的细节:工具调用里"要填的信息",业内也叫参数,但和"模型参数"不是一回事——模型参数是训练时定下的数值,这里的参数是这次调用要告诉工具的具体内容,比如查哪个城市、哪一天。这件事连中文名都没统一,"工具调用"和"函数调用"指同一件事,根子在英文 Tool Calling 和 Function Calling 本来就两个说法并存。
模型这一侧解决了,工具那一侧还有个麻烦:以前每接一个新工具都得单独对接一遍——名字、能力、传参方式、返回格式。接十个工具就是十套活,换一个 AI 应用还得从头再来。
为此定的公共规矩叫模型上下文协议(Model Context Protocol,缩写 MCP):一套大家都照着来的规矩,名字怎么写、信息怎么传先讲好,各自实现也能对上。工具按这套规矩自我介绍一次,所有支持它的 AI 应用就能直接发现并接上。MCP 官网的比喻是,可以把它看作 AI 应用的 USB-C 接口:以前各配各的连接线,有了统一接口后一根线就能通用。
关于 MCP,最值得记住的是它归谁管:截至 2026 年 8 月,MCP 已不再由任何一家公司单独维护,2025 年 12 月它被交给 Linux 基金会下新设立的一个基金会,由几家互相竞争的公司共同托管,这比列举谁在用它更能说明它的行业位置。
有一条特别容易讲反:MCP 不是用来替代工具调用的。真实顺序是三步:工具先按 MCP 规矩被描述、发现、接上;中间调用工具的这一步和前面说的工具调用完全一样;调不调、调哪个、填什么信息,仍是模型自己决定。MCP 官网划了这条边界,写明它只管上下文交换协议,不管 AI 应用怎么使用模型,所以"有了 MCP 就不需要工具调用"这类说法和官方定位冲突。
简单说,MCP 补的是"工具怎么被找到、怎么被接上"这一层,不是模型怎么决定用不用工具那一层。不用 MCP 照样能做出智能体,只是每接一个工具都要单独对接,不够标准化而已,二者是常搭配的两样东西,不是谁包含谁。
给 AI 发一张图片,会消耗 token 吗? 会。图片进入模型后被切成小块,每块算若干 token,和文字用同一种计量单位。图片越大越清晰,切出来的块越多,消耗的 token 也越多。
一个模型能读懂图片,是不是就一定能画图?读图数数、判断真伪可靠吗? 不一定能画图,能接收和能产出是两件独立的事:以 Claude 为例,官方常见问题页写明它只是理解图像的模型,不能生成、编辑或创造图像。读图的结论也只能算参考——官方文档承认模型能粗略计数,但数量一多、物体一小就容易出错;判断一张图是不是 AI 生成的同样不可靠,厂商自己也说做不到。AI 读图之后给出的结论,仍需要人工核对。
不用 MCP,还能做出智能体吗? 能。智能体依靠的核心机制是工具调用——模型提要求、外部程序执行,这在 MCP 出现之前就一直存在,只是用的是各家自定义接口,每接一个工具都要单独对接。MCP 让这一层标准化、更省事,但不是必需品。
一个产品自称"智能体",怎么判断真假? 先看下一步是它自己决定的,还是人预先写死的。每一步都是固定路径、换个情况就得改代码,本质是工作流;模型能自主决定下一步并调用工具去执行,才符合智能体判据。工具接得多不代表更智能——接了一堆工具但每步仍按固定顺序走,那依然是工作流;用了哪家大模型也不是标准,模型再新,套进一条写死的流程里,输出的仍是流程。
这些内容出自哪里?要付费吗?
不用付费,也不需要编程基础。本文改编自 BotLearn 免费 AI 公开课第 9 讲《2026 必懂 AI 名词》,每讲 15-20 分钟。BotLearn是面向人与AI Agent的学习平台:为终身学习者提供AI新职业课程及免费AI通识课;为AI Agent提供A2A(Agent对Agent)评测与学习社区。
出品方:BotLearn免费AI公开课 | 对应课程:第 9 讲《2026 必懂 AI 名词》,免费 | 更新日期:2026-08-28