从 LLM 到 Agent Skill:这些 AI 概念其实是一条线

把 LLM、Token、Context 讲到 MCP、Agent 与 Agent Skill 的这期视频,整理成一张可跳读的概念地图。

从 LLM 到 Agent Skill,一期视频带你打通底层逻辑!
解读视频从 LLM 到 Agent Skill,一期视频带你打通底层逻辑!

YouTube · 马克的技术工作坊

本文由诀.com 原创整理,内容与判断来自这条视频;引用请以原视频为准。

这期视频来自 YouTube 频道「马克的技术工作坊」,把 LLM、Token、Context、Prompt、Tool、MCP、Agent、Agent Skill 这几个常被混着用的概念串成一条线。

作者的讲法是自下而上,先解释模型怎么生成文字,再解释它怎么记住上下文、怎么调用外部能力,最后落到 Agent 与 Agent Skill 这一层。视频按每个概念的底层角色逐个拆开,适合当成一张概念地图来读。

先补齐这几个词

Token:大模型处理文本的最小单位,文字先被切成 Token,再编码成数字参与计算。这条视频把它放在 LLM 之后讲,是因为「模型看到的不是字而是数字」这一点,是后面讨论容量与成本的起点。

Context Window:一次请求里模型能接收的 Token 总量上限,超出的部分进不了这次计算。视频讨论长文本处理时,它是最直接的约束条件。

MCP:Model Context Protocol,把外部工具接入大模型的统一协议标准。视频把它放在「工具」之后讲,用来解释不同平台各写一套接入代码这件事是怎么被处理的。

System Prompt:由开发者或使用者在后台配置的系统级提示词,界定模型的人设、禁忌与行为规范。视频用它区分两类 Prompt,也解释了 Agent Skill 想替用户省掉的那部分重复劳动。

一句话结论

视频的结论是:LLM、Token、Context、Prompt、Tool、MCP、Agent、Agent Skill 不是并列的新名词,而是一条自下而上的链路。底层是预测下一个词的文字接龙引擎,中间靠 Token 编码、Context 记忆、Prompt 指令和 Tool 外部调用补齐能力,顶层是能自主规划并持续执行的 Agent,Agent Skill 则把业务流程固化成说明书。

视频讲了哪几件事

  • LLM 的底层本质:基于 Transformer 的文字接龙,靠注意力机制捕捉信息的关联
  • Token 与 Tokenizer:文本怎么变成数字,又怎么变回文字
  • Context 与 Context Window:模型的临时记忆体有多大,装不下时怎么办
  • Prompt 的两层结构:User Prompt 与 System Prompt 的分工
  • Tool、MCP、Agent 与 Agent Skill:模型如何走出文字预测,接上外部世界并被规范任务流程

关键结论与依据

LLM 不神秘。视频里把它描述成一个基于 Transformer 架构的文字接龙引擎,通过注意力机制捕捉信息之间的关联,每次输出时挑概率最高的下一个词。它的输入输出都停留在文字层面,这一点决定了后面那些组件为什么存在。

Token 不等于词。视频里提到,模型按训练阶段形成的切分规则(例如 BPE)来分 Token,遇到未知的长单词、复杂中文词或特殊字符,会拆成更小的片段。Tokenizer 负责两个方向的翻译:把文字编码成 Token ID 送进模型,再把模型输出的数字解回文字。

Context 是临时的。视频把它称作模型处理任务时的临时记忆体,里面装着对话历史和 System Prompt 等已经收到的信息,Context Window 则是这个记忆体的容量上限。长文本处理成本高、窗口装不下时,视频给出的思路是 RAG:从外部文档里抽取匹配的片段送进模型,而不是整篇塞进去。视频里还提到,目前主流模型已经支持百万级 Token 的输入。

Prompt 分两层。User Prompt 是用户当次给出的指令,System Prompt 是配置在后台的系统设定,用来界定模型的人设、禁忌和行为范式。区别在于谁写、写在哪一层。

Tool 让模型跳出文字预测。视频里把工具说成提供给大模型的函数,模型可以调用外部接口去感知和操作真实世界。工具多起来之后,每个平台各写一套接入代码就成了负担,MCP 作为统一的工具接入标准正是针对这件事。

Agent 与 Agent Skill 是链路的最上层。视频里说 Agent 具备自主规划和调用工具的能力,能持续运作直到把复杂任务解决掉;Agent Skill 是它的操作说明书,用规范化的 Markdown 文档定义任务步骤、规则和输出格式。视频给的理由很直接:没有这层说明书,用户每次提问都要把繁琐的规则和格式要求重新写进 Prompt。

适用条件

这期内容是一条概念主线,不是某个产品的操作教程。想学具体某个客户端怎么接入 MCP、某个框架怎么写 Agent Skill,得另找对应项目的官方文档。

涉及窗口容量、协议支持这类信息,视频给的是发布时的说法。模型能力和工具协议更新都快,动手前建议以官方当前说明为准。

这套框架适合用来建立概念地图。如果你的目标是判断某个具体产品值不值得用,它能帮你定位这个产品处在哪一层,但替代不了产品本身的评测。

要不要看原片

值得看原片的情况:第一次系统接触这些名词,希望有人按顺序从头讲到尾;或者你更习惯跟着时间轴听讲解,边听边暂停消化。视频的处理方式是每个概念点到为止,重点在顺序。

看这篇就够的情况:你已经知道 LLM、Token 大概是怎么回事,只缺一条把它们串起来的线。

视频里没有给出各概念之间的量化对比,也没有演示具体代码或配置,需要动手的部分要另找资料补上。

内容核验说明

把 LLM、Token、Context 到 MCP、Agent Skill 串成一条链路的整理,价值在顺序而非细节。适合已经知道零散名词、缺一张概念地图的人,能用来判断某个产品处在哪一层。文中窗口容量、协议支持等说法来自原视频发布时的口径,诀.com 未独立验证,动手前请以官方当前文档为准。

文中关于模型能力、窗口容量、协议支持及百万级 Token 输入等说法,均来自原视频作者公开表述,诀.com 未独立验证;视频未给出代码或配置演示,动手前应以官方当前文档为准。

原始来源

原作者:马克的技术工作坊

本文对公开来源内容进行了结构化整理,原观点与内容归原作者所有。

查看原文