一句话摘要
多数 AI 名词并非全新发明,而是围绕同一个目标逐层抽象出来的工程产物:让模型更可控,让系统更好用,让普通人更容易上手。
目录
一切的起点:LLM
大语言模型(LLM),本质是“语义匹配”,是在上下文里预测下一个 token。它通过海量文本训练,学习语义关联,再根据输入给出概率上更合理的输出。
但 LLM 天生只会“说”,不会“做”。为了让它在对话中更稳定,第一层工程包装自然出现:
- prompt:你给模型的任务指令;
- context:补充给模型的背景信息和约束;
- memory:把历史对话压缩后再注入,减少跑偏和遗忘。
这些词有明确的工程目标:让多轮对话可持续、可复用、可控制。LLM、prompt、context、memory 是第一层名词,解决的是“怎么让对话可持续、可复用、可控制”。
本章小结
LLM 提供了语言能力底座,而 prompt、context、memory 是让这套能力可持续使用的第一层工程手段。
从会说到会做:agent 与外部知识
当你希望模型查网页、读本地文件、调用数据库或运行脚本时,问题就从“会不会说”变成了“会不会做”。模型本身不会直接执行动作,于是出现了中间层:agent。
agent 可以理解为调度器:它把模型意图翻译为工具调用,再把工具结果返回给模型继续推理。
这一层又带来了新名词,比如获取网络信息的 Web Search、获取本地知识库的 RAG(检索增强生成)。它们共同做的是把“模型参数外的信息”接进系统,提升答案的新鲜度和可靠性。agent、RAG 是第二层名词,旨在解决“让模型接入外部世界”的问题。
本章小结
当目标从“会说”升级到“会做”,agent 与 RAG 的价值就在于把模型接到真实世界的数据和动作上。
协议层:function calling 与 MCP
function calling 是模型与 agent 之间的约定,目标是让模型用结构化格式表达“我要调哪个工具、传什么参数”。它解决的是“模型怎么把意图说清楚”。
MCP 是 agent 与工具服务之间的约定,目标是标准化工具发现、参数传递与结果返回。它解决的是“系统怎么把这件事真正做出来”。
不要混淆两层协议function calling 面向模型输出格式,MCP 面向工具服务协议。两者互补,不互相替代。
此时的 agent 像一个传话与调度中枢:接收模型意图,执行工具调用,再把结果回传给模型和用户。
agent 与用户之间的交互形态也越来越多样,虽然底层交互方式还是文字,但表现形式有很多:
- 命令行(CLI):Claude Code、Codex、OpenCode;
- 编程 IDE:Cursor、Trae、Antigravity;
- 桌面助手:如 ClawBot(最近爆火的龙虾)
本章小结
function calling 负责“说清楚要做什么”,MCP 负责“把事情标准化做出来”,两者合起来才是完整调用链。
能力封装:workflow、skill 与 agentic AI
当你反复让 AI 做同类任务时,第一反应通常是把流程固化成脚本:
- 编程方式:LangChain;
- 低代码方式:workflow。
但固定流程在输入输出变化较大时会变得僵硬。于是会出现一个“能力目录”:把不同脚本和规则打包成可复用单元,让 agent 在执行前按需加载,这就是 skill 的价值。
从自动化能力的谱系看,大致可以这样理解:
- LangChain:偏硬编码,稳定但灵活性最低。
- workflow:流程模块化,修改更快,但仍依赖预设路径。
- skill:把流程规则沉淀为能力包,让 agent 按任务调用。
- agent:在循环中动态决策、调用工具,并判断完成度。
这本质上是从 workflow 范式逐渐向 agentic AI 范式的转变。workflow 预先将节点串联,编排好完成一件事的具体流程,并在节点中调用大模型来完成一部分需要智能的任务。这需要“n 份提示词 + 手动工具调用 + n 个 if-else”,更像是一种自动化而非智能化。相反,agentic AI 则充分发挥模型的推理能力,让 AI 在任务循环中自主决策、使用工具,并判断任务的完成度。它只需要“1 份提示词 + 自动工具调用 + 1 个循环”。
workflow 与 skill 解决的是复用效率,agentic AI 解决的是动态决策能力。
本章小结
workflow 与 skill 优化的是复用效率,而 agentic AI 真正放大的,是任务执行中的动态决策能力。
我的判断:无配置可用才是终局
MCP、skill、桌面助手等被过度炒作的概念,很多时候只是技术演化中的中间产物。褪去包装后,它们仍然围绕同一件事:减少用户与模型沟通成本,把该自动化的部分自动化。
从产品演化看,谁能降低上手门槛,谁就更容易获得规模化用户。普通用户不会长期为“术语先进”买单,而会为“能直接用、够稳定、性价比高”买单。以近期走红的工具为例,关键往往不是概念更新,而是连接能力、定时能力和可视化管理能力做得足够完整。
token 成本今天仍是约束,但如果推理成本继续下降,系统设计重心会进一步转向体验与可靠性,而不是手工拼装中间层概念。未来更可能胜出的,是“打包完成”的 agent 产品:常用能力内置,复杂协议隐藏,交互尽量自然。下一阶段的竞争焦点不是术语数量,而是无配置可用的产品完成度。
本章小结
从用户侧看,真正可持续的竞争力不是新名词,而是“几乎零配置就能稳定完成任务”的产品体验。
总结
从 LLM 到 agent,从 function calling 到 MCP,从 workflow 到 skill,本质都在回答同一个问题:如何在可控与灵活之间,用更低成本交付可用能力。
把这些词看成“能力分层”而不是“流行标签”,讨论会更清晰:先看需求,再谈架构。
部分信息可能已经过时




