大白话讲解 20 个常见 AI Agent 名词,新手小白友好!

文章用一个「养一只小猫」的比喻,从 LLM、prompt、token、context、memory、context window,一路讲到知识库、RAG、多模态、tool 与 tool calling、MCP、skill,再到 planner、loop、harness、model、memory、tool 六个组件构成的 agent,并在结尾用一张对照表汇总 20 个常见 AI Agent 名词。作者在开头说明,为了方便非技术背景读者理解,行文中舍弃了一部分严谨性。

一个故事带你搞懂 20 个常见的 AI Agent 名词。

(为了方便非技术背景的读者理解,舍弃了一部分严谨性,但大体意思是正确的)

1. LLM:小猫的大脑

假设你有一只小猫,它的大脑叫 LLM(Large Language Model,大语言模型),有时也简称为 大模型。不过严格来说,「大模型」不只包括大语言模型。

这只小猫性格内向,平时不会主动和你说话,只有在你提问时才会回答。它有时也不太聪明,可能会胡言乱语,或者编造一些不存在的内容。这种现象叫 hallucination(幻觉)。

LLM 大语言模型是这只小猫大脑的示意图

2. Prompt:你跟小猫说的话

假期快到了,你打算去广州旅游,现在需要做一份旅游规划。于是,你问小猫:「帮我做一份广州的旅游规划。」

你向 LLM 提出的问题,就叫 prompt(提示词)。

用户向小猫提问也就是写 prompt 的场景

3. Token:小猫处理文字的基本单位

小猫回答问题前,需要先理解你说的话。它会把你发来的内容拆成若干个片段。不同的 LLM,切分方式可能不一样,例如:

帮|我|做|一份|广州的|旅游|规划

每个片段都是小猫能够处理的基本单位,叫 token(词元)。同样,小猫回答问题时,也会一个 token、一个 token 地输出。

把一句话拆成若干 token 片段的示例

4. Context:小猫当前能看到的信息

理解你的问题后,小猫发现自己还不能回答,因为它不知道你几号出发、几个人去,以及有哪些饮食偏好。

小猫能够看到、并用于生成回答的信息,叫 context(上下文)。

小猫当前能看到的信息即 context 的示意

5. Memory 和 Context Window:小猫的记忆与容量

你把「09.31 号出发,0.5 个人去,喜欢吃 -273.15℃ 的美食」这些基本信息告诉小猫后,它回复了一个「?」。

这时你想起来:原来小猫很健忘,它不记得刚才聊了什么,只看得见你最近一次发来的消息。于是,你把之前的聊天信息和其他状态信息保存到一个叫 memory(记忆) 的东西里。下次向小猫提问时,再把 memory 一起发给它,也就是放进小猫的 context 中,这样它就知道之前在聊什么了。

memory 保存历史对话后再放进上下文的过程

不过,小猫的脑容量有限。如果一次给它太多内容,它可能只能看见其中的一部分。小猫一次请求能够处理的 context 上限,叫 context window(上下文窗口)。

小猫一次能处理的 context window 容量上限

6. Knowledge Base、RAG 和 Multimodal:给小猫提供资料

你把前面的对话一起发给小猫后,它知道你在说什么了,但还是不能回答,因为它不知道广州有哪些旅游景点。

为了解决这个问题,你给小猫提供了《广州旅游景点攻略》《广州美食大全》《广州富婆通讯录》等资料,组成一个「广州旅游 knowledge base(知识库)」。

为小猫准备的广州旅游知识库资料集合

小猫不会把这些书全部塞进 context,而是先从知识库中检索与问题相关的内容,再把这些内容放入 context。这个过程叫 RAG(Retrieval-Augmented Generation,检索增强生成)。有了这些信息,小猫就可以制定旅游攻略,告诉你应该去哪些景点。

RAG 先检索知识库再把内容放进上下文的流程

这里还有一个细节:知识库里可能不只有文本,还包括图片(比如富婆的照片)、视频(比如富婆的跳舞视频)和音频(比如富婆的歌声)。小猫也需要能够理解和处理这些文件格式。

文本、图片、视频、音频等不同的信息形态,叫作 modality(模态)。如果 LLM 具备理解和处理至少两种 modality 的能力,我们就说它是 multimodal(多模态) 的,也就是大家经常听到的 MLLM(Multimodal Large Language Model,多模态大模型)。

文本、图片、音频等不同模态的信息形态

7. Tool 和 Tool Calling:让小猫获取外部信息

你对旅游规划很满意,于是继续让小猫查询 10 月 1 日当天广州的天气和车票。

小猫摇了摇头,说自己只能根据大脑中已有的信息,以及你提供的知识库来回答,没办法知道当天的天气和景点活动。

你说这好办,于是给小猫接上网线,并配置了一些工具。现在,它变成了「光猫」(x)。

小猫调用「查询天气」工具,查到广州当天是晴天;又调用「联网搜索」工具,查到当天还有这些车票。

这些用于获取外部信息或执行动作的能力,统称为 tool(工具)。小猫调用这些工具的过程,叫 tool use / tool calling(工具调用)。

小猫调用查询天气工具查到广州当天是晴天

虽然小猫帮你查到了车票,但你仍然需要自己动手买票。你心想:「要是小猫能直接帮我把票买了,该多好。

于是,你给小猫安装了订票系统的 tool。这样,你只需要对小猫说一句「帮我订早上 7 点的票」,它就能直接帮你把票订好。

小猫通过订票工具直接帮用户把票订好

8. MCP:让不同工具遵守统一规范

虽然小猫顺利完成了任务,但你很快想到:每个人都可以开发自己的工具,再接入这只小猫,让它获得不同的能力。然而,不同的人写的工具可能有不同的格式。如果小猫看不懂别人的工具,不就没法使用了吗?

于是,你制定了一套工具接入规范,并告诉所有工具提供者:「以后想把工具接入我的小猫,就全部按照这个统一格式来写。」

这套统一的规范,叫 MCP(Model Context Protocol,模型上下文协议)。它可以让 AI 应用以统一方式连接外部工具、资源和提示。

让所有工具按统一格式接入小猫的 MCP 规范

9. Skill:可复用的任务说明书

这时,你又想到:每换一个旅游景点,都要手动完成旅游规划、查天气、订票等步骤,实在太麻烦了。

于是,你写了一份「旅游小助手」说明书,里面包含每个步骤的详细说明,以及需要使用的模板、参考资料和脚本。以后去其他城市旅游时,你只需要告诉小猫目的地,再让它按照这份说明书执行,就能让小猫帮你完成全部流程。

这种可复用的任务说明书,叫 skill(技能)。

可复用的旅游小助手任务说明书示例

10. Agent:能自行规划和执行任务的系统

这时,你又想到:如果每件事都要由你提前写清楚步骤,再交给小猫执行,还是太麻烦了。要是只给小猫一个任务,它就能自己想办法,并把事情做完,那就更好了。

于是,你又给小猫装上了几个组件:

  • planner(规划器):把一个大目标拆成多个子任务。
  • loop(循环):只要目标还没有达成,就持续执行任务;除非用户中途打断、被策略拦截,或者预算用尽。
  • harness(执行约束 / 挽具):一系列用于约束和管理小猫执行任务的规则,例如沙盒和权限。比如,小猫只能在家里活动,不能跑出家门,也不能删除你的文件。

再加上前面讲过的三个组件:

  • model(模型):也就是 LLM,相当于小猫的大脑。
  • tool(工具):小猫可以调用的外部能力。
  • memory(记忆):小猫执行任务时保存的历史信息。
planner、loop、harness 等 6 个组件的组合关系

这 6 个组件结合起来,就组成了一个能够像人一样自行规划和执行任务,并根据中间结果继续规划、调用工具和调整步骤的「超级小猫」。这样的系统叫 agent(智能体)。

能自行规划和执行任务的超级小猫 agent

小猫 agent 并不是来替代你的,而是你的得力助手。它负责执行任务,你负责决定应该做什么,并判断它的执行结果是否可信。

只有人和 agent 互相配合,才能更高效地完成各种事情。

人和 agent 互相配合完成任务的示意

20 个常见 AI 名词回顾

  • LLM(Large Language Model),大语言模型:能理解和生成自然语言的模型。
  • hallucination,幻觉:模型生成看似合理、实际不存在或错误的信息。
  • prompt,提示词:用户交给模型的任务要求或问题。
  • token,词元:模型处理文本时使用的基本单位,可能是字、词的一部分、标点等。
  • context,上下文:模型当前可以看到、用于生成回答的信息。
  • memory,记忆:应用保存的历史对话、用户资料或其他状态信息。
  • context window,上下文窗口:模型一次请求能够处理的上下文容量上限。
  • knowledge base,知识库:为模型准备的资料的集合。
  • RAG(Retrieval-Augmented Generation),检索增强生成:先检索相关资料,再将资料放入上下文,辅助模型生成回答。
  • modality,模态:信息的形式,例如文字、图片、音频或视频。
  • multimodal,多模态:能处理至少两种信息形式的模型或系统。
  • tool,工具:模型可以调用、用于获取信息或执行动作的外部能力。
  • tool use / tool calling,工具调用:模型向外部程序发出工具调用请求,并调用外部工具完成任务的过程。
  • MCP(Model Context Protocol),模型上下文协议:让 AI 应用以统一方式连接外部工具、资源和提示的开放协议。
  • skill,技能:为某类任务准备的可复用指令、模板、资料和脚本集合。
  • planner,规划器:把一个大目标拆分成多个子任务的组件。
  • loop,循环:让系统反复执行「规划、行动、检查、调整」的过程。
  • harness,执行约束 / 挽具:负责约束和管理 agent 执行过程的规则、权限、沙盒等机制。
  • model,模型:负责理解输入、进行推理并生成输出的核心模型。
  • agent,智能体:能根据目标自行规划、调用工具、检查结果并调整步骤的系统。

往期内容

【公众号】Hytidel聊商业

【公众号】Hytidel聊AI

关于作者

Hytidel | 03 年创业者 & 商业操盘手 & 声乐爱好者 | 商业战略咨询 & AI赋能学习/教育/科研 & 企业AI转型

朋友圈更多干货内容,欢迎链接和围观(添加时备注来意):yjsjy0

朋友圈更多干货内容,欢迎链接和围观(添加时备注来意):yjsjy0

本文提及与引用

原文提到的内容里,已在本站整理好的可以直接接着读;标注「原文来源」的还没有整理成站内文章。

内容核验说明

用养猫的比方把 LLM 到 agent 的 20 个名词串成一条线,结尾对照表可以当查阅卡片。它的用处是给非技术读者一张互相挂钩的名词地图,看完至少知道 context、memory、RAG 分别在说什么,适合刚接触 AI、被英文术语挡住的人。作者开头就说明舍弃了部分严谨性,比喻带来的简化偏差需要另行核对,术语解释未经本站独立验证。

文中没有实测数据或可核验案例,作者在开头自述为方便理解舍弃了一部分严谨性;诀.com 未独立验证各术语定义与比喻对应关系,涉及概念边界处建议对照官方文档或权威资料。

原始来源

原作者:Hytidel聊商业(文章更多干货)(@HytidelLegend)

本文对公开来源内容进行了结构化整理,原观点与内容归原作者所有。

查看原文