从 LLM 到 Agent Skill:这些 AI 概念其实是一条线
把 LLM、Token、Context 讲到 MCP、Agent 与 Agent Skill 的这期视频,整理成一张可跳读的概念地图。
这期视频来自 YouTube 频道「马克的技术工作坊」,把 LLM、Token、Context、Prompt、Tool、MCP、Agent、Agent Skill 这几个常被混着用的概念串成一条线。
作者的讲法是自下而上,先解释模型怎么生成文字,再解释它怎么记住上下文、怎么调用外部能力,最后落到 Agent 与 Agent Skill 这一层。视频按每个概念的底层角色逐个拆开,适合当成一张概念地图来读。
先补齐这几个词
Token:大模型处理文本的最小单位,文字先被切成 Token,再编码成数字参与计算。这条视频把它放在 LLM 之后讲,是因为「模型看到的不是字而是数字」这一点,是后面讨论容量与成本的起点。
Context Window:一次请求里模型能接收的 Token 总量上限,超出的部分进不了这次计算。视频讨论长文本处理时,它是最直接的约束条件。
MCP:Model Context Protocol,把外部工具接入大模型的统一协议标准。视频把它放在「工具」之后讲,用来解释不同平台各写一套接入代码这件事是怎么被处理的。
System Prompt:由开发者或使用者在后台配置的系统级提示词,界定模型的人设、禁忌与行为规范。视频用它区分两类 Prompt,也解释了 Agent Skill 想替用户省掉的那部分重复劳动。
一句话结论
视频的结论是:LLM、Token、Context、Prompt、Tool、MCP、Agent、Agent Skill 不是并列的新名词,而是一条自下而上的链路。底层是预测下一个词的文字接龙引擎,中间靠 Token 编码、Context 记忆、Prompt 指令和 Tool 外部调用补齐能力,顶层是能自主规划并持续执行的 Agent,Agent Skill 则把业务流程固化成说明书。
视频讲了哪几件事
- LLM 的底层本质:基于 Transformer 的文字接龙,靠注意力机制捕捉信息的关联
- Token 与 Tokenizer:文本怎么变成数字,又怎么变回文字
- Context 与 Context Window:模型的临时记忆体有多大,装不下时怎么办
- Prompt 的两层结构:User Prompt 与 System Prompt 的分工
- Tool、MCP、Agent 与 Agent Skill:模型如何走出文字预测,接上外部世界并被规范任务流程
关键结论与依据
LLM 不神秘。视频里把它描述成一个基于 Transformer 架构的文字接龙引擎,通过注意力机制捕捉信息之间的关联,每次输出时挑概率最高的下一个词。它的输入输出都停留在文字层面,这一点决定了后面那些组件为什么存在。
Token 不等于词。视频里提到,模型按训练阶段形成的切分规则(例如 BPE)来分 Token,遇到未知的长单词、复杂中文词或特殊字符,会拆成更小的片段。Tokenizer 负责两个方向的翻译:把文字编码成 Token ID 送进模型,再把模型输出的数字解回文字。
Context 是临时的。视频把它称作模型处理任务时的临时记忆体,里面装着对话历史和 System Prompt 等已经收到的信息,Context Window 则是这个记忆体的容量上限。长文本处理成本高、窗口装不下时,视频给出的思路是 RAG:从外部文档里抽取匹配的片段送进模型,而不是整篇塞进去。视频里还提到,目前主流模型已经支持百万级 Token 的输入。
Prompt 分两层。User Prompt 是用户当次给出的指令,System Prompt 是配置在后台的系统设定,用来界定模型的人设、禁忌和行为范式。区别在于谁写、写在哪一层。
Tool 让模型跳出文字预测。视频里把工具说成提供给大模型的函数,模型可以调用外部接口去感知和操作真实世界。工具多起来之后,每个平台各写一套接入代码就成了负担,MCP 作为统一的工具接入标准正是针对这件事。
Agent 与 Agent Skill 是链路的最上层。视频里说 Agent 具备自主规划和调用工具的能力,能持续运作直到把复杂任务解决掉;Agent Skill 是它的操作说明书,用规范化的 Markdown 文档定义任务步骤、规则和输出格式。视频给的理由很直接:没有这层说明书,用户每次提问都要把繁琐的规则和格式要求重新写进 Prompt。
适用条件
这期内容是一条概念主线,不是某个产品的操作教程。想学具体某个客户端怎么接入 MCP、某个框架怎么写 Agent Skill,得另找对应项目的官方文档。
涉及窗口容量、协议支持这类信息,视频给的是发布时的说法。模型能力和工具协议更新都快,动手前建议以官方当前说明为准。
这套框架适合用来建立概念地图。如果你的目标是判断某个具体产品值不值得用,它能帮你定位这个产品处在哪一层,但替代不了产品本身的评测。
要不要看原片
值得看原片的情况:第一次系统接触这些名词,希望有人按顺序从头讲到尾;或者你更习惯跟着时间轴听讲解,边听边暂停消化。视频的处理方式是每个概念点到为止,重点在顺序。
看这篇就够的情况:你已经知道 LLM、Token 大概是怎么回事,只缺一条把它们串起来的线。
视频里没有给出各概念之间的量化对比,也没有演示具体代码或配置,需要动手的部分要另找资料补上。
内容核验说明
把 LLM、Token、Context 到 MCP、Agent Skill 串成一条链路的整理,价值在顺序而非细节。适合已经知道零散名词、缺一张概念地图的人,能用来判断某个产品处在哪一层。文中窗口容量、协议支持等说法来自原视频发布时的口径,诀.com 未独立验证,动手前请以官方当前文档为准。
文中关于模型能力、窗口容量、协议支持及百万级 Token 输入等说法,均来自原视频作者公开表述,诀.com 未独立验证;视频未给出代码或配置演示,动手前应以官方当前文档为准。原始来源
原作者:马克的技术工作坊
本文对公开来源内容进行了结构化整理,原观点与内容归原作者所有。
查看原文