大白话讲解 20 个常见 AI Agent 名词,新手小白友好!
文章用一个「养一只小猫」的比喻,从 LLM、prompt、token、context、memory、context window,一路讲到知识库、RAG、多模态、tool 与 tool calling、MCP、skill,再到 planner、loop、harness、model、memory、tool 六个组件构成的 agent,并在结尾用一张对照表汇总 20 个常见 AI Agent 名词。作者在开头说明,为了方便非技术背景读者理解,行文中舍弃了一部分严谨性。
一个故事带你搞懂 20 个常见的 AI Agent 名词。
(为了方便非技术背景的读者理解,舍弃了一部分严谨性,但大体意思是正确的)
1. LLM:小猫的大脑
假设你有一只小猫,它的大脑叫 LLM(Large Language Model,大语言模型),有时也简称为 大模型。不过严格来说,「大模型」不只包括大语言模型。
这只小猫性格内向,平时不会主动和你说话,只有在你提问时才会回答。它有时也不太聪明,可能会胡言乱语,或者编造一些不存在的内容。这种现象叫 hallucination(幻觉)。

2. Prompt:你跟小猫说的话
假期快到了,你打算去广州旅游,现在需要做一份旅游规划。于是,你问小猫:「帮我做一份广州的旅游规划。」
你向 LLM 提出的问题,就叫 prompt(提示词)。

3. Token:小猫处理文字的基本单位
小猫回答问题前,需要先理解你说的话。它会把你发来的内容拆成若干个片段。不同的 LLM,切分方式可能不一样,例如:
帮|我|做|一份|广州的|旅游|规划
每个片段都是小猫能够处理的基本单位,叫 token(词元)。同样,小猫回答问题时,也会一个 token、一个 token 地输出。

4. Context:小猫当前能看到的信息
理解你的问题后,小猫发现自己还不能回答,因为它不知道你几号出发、几个人去,以及有哪些饮食偏好。
小猫能够看到、并用于生成回答的信息,叫 context(上下文)。

5. Memory 和 Context Window:小猫的记忆与容量
你把「09.31 号出发,0.5 个人去,喜欢吃 -273.15℃ 的美食」这些基本信息告诉小猫后,它回复了一个「?」。
这时你想起来:原来小猫很健忘,它不记得刚才聊了什么,只看得见你最近一次发来的消息。于是,你把之前的聊天信息和其他状态信息保存到一个叫 memory(记忆) 的东西里。下次向小猫提问时,再把 memory 一起发给它,也就是放进小猫的 context 中,这样它就知道之前在聊什么了。

不过,小猫的脑容量有限。如果一次给它太多内容,它可能只能看见其中的一部分。小猫一次请求能够处理的 context 上限,叫 context window(上下文窗口)。

6. Knowledge Base、RAG 和 Multimodal:给小猫提供资料
你把前面的对话一起发给小猫后,它知道你在说什么了,但还是不能回答,因为它不知道广州有哪些旅游景点。
为了解决这个问题,你给小猫提供了《广州旅游景点攻略》《广州美食大全》《广州富婆通讯录》等资料,组成一个「广州旅游 knowledge base(知识库)」。

小猫不会把这些书全部塞进 context,而是先从知识库中检索与问题相关的内容,再把这些内容放入 context。这个过程叫 RAG(Retrieval-Augmented Generation,检索增强生成)。有了这些信息,小猫就可以制定旅游攻略,告诉你应该去哪些景点。

这里还有一个细节:知识库里可能不只有文本,还包括图片(比如富婆的照片)、视频(比如富婆的跳舞视频)和音频(比如富婆的歌声)。小猫也需要能够理解和处理这些文件格式。
文本、图片、视频、音频等不同的信息形态,叫作 modality(模态)。如果 LLM 具备理解和处理至少两种 modality 的能力,我们就说它是 multimodal(多模态) 的,也就是大家经常听到的 MLLM(Multimodal Large Language Model,多模态大模型)。

7. Tool 和 Tool Calling:让小猫获取外部信息
你对旅游规划很满意,于是继续让小猫查询 10 月 1 日当天广州的天气和车票。
小猫摇了摇头,说自己只能根据大脑中已有的信息,以及你提供的知识库来回答,没办法知道当天的天气和景点活动。
你说这好办,于是给小猫接上网线,并配置了一些工具。现在,它变成了「光猫」(x)。
小猫调用「查询天气」工具,查到广州当天是晴天;又调用「联网搜索」工具,查到当天还有这些车票。
这些用于获取外部信息或执行动作的能力,统称为 tool(工具)。小猫调用这些工具的过程,叫 tool use / tool calling(工具调用)。

虽然小猫帮你查到了车票,但你仍然需要自己动手买票。你心想:「要是小猫能直接帮我把票买了,该多好。
于是,你给小猫安装了订票系统的 tool。这样,你只需要对小猫说一句「帮我订早上 7 点的票」,它就能直接帮你把票订好。

8. MCP:让不同工具遵守统一规范
虽然小猫顺利完成了任务,但你很快想到:每个人都可以开发自己的工具,再接入这只小猫,让它获得不同的能力。然而,不同的人写的工具可能有不同的格式。如果小猫看不懂别人的工具,不就没法使用了吗?
于是,你制定了一套工具接入规范,并告诉所有工具提供者:「以后想把工具接入我的小猫,就全部按照这个统一格式来写。」
这套统一的规范,叫 MCP(Model Context Protocol,模型上下文协议)。它可以让 AI 应用以统一方式连接外部工具、资源和提示。

9. Skill:可复用的任务说明书
这时,你又想到:每换一个旅游景点,都要手动完成旅游规划、查天气、订票等步骤,实在太麻烦了。
于是,你写了一份「旅游小助手」说明书,里面包含每个步骤的详细说明,以及需要使用的模板、参考资料和脚本。以后去其他城市旅游时,你只需要告诉小猫目的地,再让它按照这份说明书执行,就能让小猫帮你完成全部流程。
这种可复用的任务说明书,叫 skill(技能)。

10. Agent:能自行规划和执行任务的系统
这时,你又想到:如果每件事都要由你提前写清楚步骤,再交给小猫执行,还是太麻烦了。要是只给小猫一个任务,它就能自己想办法,并把事情做完,那就更好了。
于是,你又给小猫装上了几个组件:
- planner(规划器):把一个大目标拆成多个子任务。
- loop(循环):只要目标还没有达成,就持续执行任务;除非用户中途打断、被策略拦截,或者预算用尽。
- harness(执行约束 / 挽具):一系列用于约束和管理小猫执行任务的规则,例如沙盒和权限。比如,小猫只能在家里活动,不能跑出家门,也不能删除你的文件。
再加上前面讲过的三个组件:
- model(模型):也就是 LLM,相当于小猫的大脑。
- tool(工具):小猫可以调用的外部能力。
- memory(记忆):小猫执行任务时保存的历史信息。

这 6 个组件结合起来,就组成了一个能够像人一样自行规划和执行任务,并根据中间结果继续规划、调用工具和调整步骤的「超级小猫」。这样的系统叫 agent(智能体)。

小猫 agent 并不是来替代你的,而是你的得力助手。它负责执行任务,你负责决定应该做什么,并判断它的执行结果是否可信。
只有人和 agent 互相配合,才能更高效地完成各种事情。

20 个常见 AI 名词回顾
- LLM(Large Language Model),大语言模型:能理解和生成自然语言的模型。
- hallucination,幻觉:模型生成看似合理、实际不存在或错误的信息。
- prompt,提示词:用户交给模型的任务要求或问题。
- token,词元:模型处理文本时使用的基本单位,可能是字、词的一部分、标点等。
- context,上下文:模型当前可以看到、用于生成回答的信息。
- memory,记忆:应用保存的历史对话、用户资料或其他状态信息。
- context window,上下文窗口:模型一次请求能够处理的上下文容量上限。
- knowledge base,知识库:为模型准备的资料的集合。
- RAG(Retrieval-Augmented Generation),检索增强生成:先检索相关资料,再将资料放入上下文,辅助模型生成回答。
- modality,模态:信息的形式,例如文字、图片、音频或视频。
- multimodal,多模态:能处理至少两种信息形式的模型或系统。
- tool,工具:模型可以调用、用于获取信息或执行动作的外部能力。
- tool use / tool calling,工具调用:模型向外部程序发出工具调用请求,并调用外部工具完成任务的过程。
- MCP(Model Context Protocol),模型上下文协议:让 AI 应用以统一方式连接外部工具、资源和提示的开放协议。
- skill,技能:为某类任务准备的可复用指令、模板、资料和脚本集合。
- planner,规划器:把一个大目标拆分成多个子任务的组件。
- loop,循环:让系统反复执行「规划、行动、检查、调整」的过程。
- harness,执行约束 / 挽具:负责约束和管理 agent 执行过程的规则、权限、沙盒等机制。
- model,模型:负责理解输入、进行推理并生成输出的核心模型。
- agent,智能体:能根据目标自行规划、调用工具、检查结果并调整步骤的系统。
往期内容
【公众号】Hytidel聊商业
- 闲鱼搞钱保姆级教程 https://x.com/HytidelLegend/status/2086034016281747894
- 上大学的意义、大学信息差&潜规则 https://x.com/HytidelLegend/status/2095724073217352157
- 企业软件开发、AI 服务定价教程 https://x.com/HytidelLegend/status/2095362345757471165
- 为什么提供服务一定要收定金? https://x.com/HytidelLegend/status/2096820806957552092
- 创业项目怎么找投资人 https://x.com/HytidelLegend/status/2098267354992173068
- 普通人如何抱大腿快速成长? https://x.com/HytidelLegend/status/2099123015384506710
- 事业成功所需的三种能力 https://x.com/HytidelLegend/status/2097638124348399942
- 找天赋教程 https://x.com/HytidelLegend/status/2096087126006014334
- 流量卡教程 https://x.com/HytidelLegend/status/2100929584531390723
- Starryblu 新加坡银行卡教程 https://x.com/HytidelLegend/status/2102369597500588534
【公众号】Hytidel聊AI
- 豆包工作教程 https://x.com/HytidelLegend/status/2101646852676518308
- ima 知识库教程 https://x.com/HytidelLegend/status/2103120812853346432
- GPT-6 Astra 接入 WorkBuddy 教程 https://x.com/HytidelLegend/status/2098726858628161763
- ENGSENCE 学英语教程 https://x.com/HytidelLegend/status/2100176733861503232
关于作者
Hytidel | 03 年创业者 & 商业操盘手 & 声乐爱好者 | 商业战略咨询 & AI赋能学习/教育/科研 & 企业AI转型
朋友圈更多干货内容,欢迎链接和围观(添加时备注来意):yjsjy0

本文提及与引用
原文提到的内容里,已在本站整理好的可以直接接着读;标注「原文来源」的还没有整理成站内文章。
- 毕业即失业的我,居然用豆包找到了双休工作?链接 · 站内已整理 · 这是一篇豆包工作的使用教程,分三章:第一章逐个讲解豆包工作的界面与功能组件,包括内容生成与文件处理、电脑与浏览器操作、技能体系、连接器、工作伙伴
- ima 知识库也有内置的 Agent 功能了!支持 Skills!原文来源 · 尚未整理成站内文章
- WorkBuddy 接入按量付费的最新模型 GPT-6 Astra原文来源 · 尚未整理成站内文章
内容核验说明
用养猫的比方把 LLM 到 agent 的 20 个名词串成一条线,结尾对照表可以当查阅卡片。它的用处是给非技术读者一张互相挂钩的名词地图,看完至少知道 context、memory、RAG 分别在说什么,适合刚接触 AI、被英文术语挡住的人。作者开头就说明舍弃了部分严谨性,比喻带来的简化偏差需要另行核对,术语解释未经本站独立验证。
文中没有实测数据或可核验案例,作者在开头自述为方便理解舍弃了一部分严谨性;诀.com 未独立验证各术语定义与比喻对应关系,涉及概念边界处建议对照官方文档或权威资料。评论区整合
根据评论整合来看,回复普遍认可小猫比喻好理解,多人表示要转发给刚学 AI 的朋友或同事,也有人称其中部分名词是第一次知道,对英文术语不熟的读者比较友好。一条较长的回复按原文顺序复述了各名词含义,并补充 agent 的效果取决于模型能力、外部信息、工具执行与流程控制的组合。另有回复建议做成儿童科普视频,或提到配图风格。未见针对内容准确性的质疑。
基于原帖公开评论整理,只反映讨论中的观点与反馈,不代表诀.com 立场。原始来源
原作者:Hytidel聊商业(文章更多干货)(@HytidelLegend)
本文对公开来源内容进行了结构化整理,原观点与内容归原作者所有。
查看原文