【LLM】一文讲透 AI Agent:从概念到四大核心组件
Agent 到底是什么?
这两年,“Agent” 无疑是 AI 领域最高频的词汇之一。很多人对它有一个模糊的认知,知道它比普通 AI 更强大,但真要准确定义,又往往说不清楚。
抛开晦涩的学术定义,我们可以用一个生活化的场景来理解:
普通 AI 像一个百科全书式的顾问:你问它“蜜雪冰城和一点点哪个好喝?”,它能给你详尽的对比分析;而 Agent 更像一个贴心的私人助理:它会记住你“少糖、去冰、偏爱柠檬味”的偏好,直接帮你下单一杯快乐柠檬水,并跟踪配送进度。
一言以蔽之:普通 AI 的核心能力是“生成内容”,而 Agent 的核心能力是“完成任务”。它具备独立思考、规划路径、调用工具并执行行动的闭环能力。
那么,支撑 Agent 完成这一系列复杂操作的底层架构是什么?答案就是四大核心组件:Planning(规划)、Tools(工具)、Action(行动)、Memory(记忆)。
Agent 的四大核心组件
1. Planning(规划):先想后做,有条不紊
Planning 就是 AI 思考的过程,它接受、感知到任务时,会先拆解任务、分步骤、推理先做哪些后做哪些,而不是瞎干。
🎯 为什么需要 Planning?
想象一下这个场景:领导对你说“展厅太乱了,收拾一下”。
如果你只回一句“好的”就愣在原地,显然不合格。一个靠谱的执行者会这样思考:
- 拆解任务:地面脏了→扫地;文件散落→收纳;柜子满了→换新柜子。
- 排序优先级:先买扫把扫地,再整理文件,最后处理柜子问题。
- 异常处理:如果旧柜子卖不掉怎么办?不能卡住,得找备选方案(比如租个临时储物间)。
- 结果验收:完成后向领导汇报,确认是否达标。
AI 也是如此。有了 Planning,Agent 在面对复杂任务时才不会遗漏步骤;遇到报错或意外时,也能动态调整策略,而不是直接崩溃或输出错误结果。
🔍 三大主流 Planning 范式
表格
| 范式 | 核心思路 | 特点 | 适用场景 |
|---|---|---|---|
| LLM-based Planning | LLM 自主拆解任务、决定工具调用顺序 | 灵活性强,代表未来方向;但稳定性依赖模型能力 | 开放式探索、研究原型 |
| Hybrid Planning | 代码定义主干流程 + LLM 处理灵活分支与异常 | 兼顾稳定性与灵活性,当前企业落地主流 | 生产级产品、业务流程自动化 |
| Traditional Planning | 纯代码/规则驱动,固定状态机流转 | 稳定可控,但缺乏感知与适应能力 | 简单重复流程、合规要求极高的场景 |
💡关键洞察:虽然 LLM-based Planning(如 CoT、ReAct、ToT、Plan-and-Execute 等)是我们对 Agent 终极形态的期待,但在当下,Hybrid Planning才是平衡“智能”与“可靠”的最优解——用代码做骨架约束幻觉,用 LLM 做血肉处理长尾问题。
2. Tools(工具):让 AI 长出“手脚”
LLM 本质是一个文本生成器,“能言善辩”但“手无缚鸡之力”。没有 Tools 的 AI,遇到知识盲区只会一本正经地胡说八道(幻觉);有了 Tools,AI 才能真正连接现实世界。
Tools 解决了什么痛点?
回想 2023 年初的 ChatGPT,问天气靠编,查数据靠猜,看似流畅实则不可信。Tools 的出现,让 Agent 从“聊天机器人”进化为“问题解决者”:
- 信息获取:调用搜索 API、数据库查询、RAG 检索
- 外部操作:发送邮件、创建订单、修改配置
- 计算增强:调用代码解释器、计算器、专业软件
关键协议:Function Calling 与 MCP
Tools 的底层通信依赖Function Calling——通过结构化输出,让 AI 与代码“书同文、车同轨”。
而近期火热的MCP(Model Context Protocol)并非替代 Function Calling,而是在其之上构建了一层标准化的工具接入协议,解决了不同平台工具接口碎片化的问题,让 Agent 能以统一方式接入海量外部能力。
3. Action(行动):把想法落地
如果说 Planning 是“想”,Tools 是“能力”,那么 Action 就是“干”。它是将规划结果转化为具体执行的桥梁。
Action 的核心职责
- 参数映射:将 Planning 输出的抽象指令,转化为 Tools 所需的具体参数
- 执行调度:按序或并行调用 Tools,管理异步任务
- 结果解析:将 Tools 返回的原始数据(JSON/API Response)转化为 Agent 可理解的上下文
- 异常兜底:捕获执行错误,触发重试、降级或反馈给 Planning 重新规划
💻实现备注:Action 层的工程实现往往离不开条件判断、状态机、异步队列等传统编程手段。这并非“不 AI”,恰恰是 Hybrid Planning 理念的体现——用确定性的代码保障不确定性的 AI 输出能够安全落地。
4. Memory(记忆):让 AI 有“记性”
没有记忆的 Agent,每次对话都是从零开始的陌生人;有了记忆,它才能成为越用越懂你的伙伴。
两类记忆,缺一不可
表格
| 类型 | 类比 | 作用 | 典型实现 |
|---|---|---|---|
| 短期记忆 | 工作记忆 / 验证码 | 维持当前对话上下文,保证多轮交互连贯 | 滑动窗口、摘要压缩、Token 缓存 |
| 长期记忆 | 个人档案 / 经验库 | 记住用户偏好、历史决策、领域知识 | 向量数据库、KV 存储、知识图谱 |
** 为什么 Memory 至关重要?**
没有 Memory 的体验:
“帮我分析一下 XX 股票的基本面。”“技术面怎么样?”“市场情绪如何?”“综合以上,现在能买入吗?”(每次都要重新提供背景,反复交代前提)
有 Memory 的体验:
“按上次的分析策略,看看 XX 股票现在怎么样?”(Agent 自动调取历史分析框架、你的风险偏好、上次结论,直接给出增量对比与建议)
Memory 让 Agent 从“一次性问答工具”进化为“持续成长的个人助手”。
Memory 的实现方式:
向量数据库: 存储历史对话、文档知识
传统数据库: 存储结构化用户偏好
上下文窗口: 利用 LLM 自带的长上下文能力
记忆压缩: 将长对话总结为关键信息,节省空间
四组件如何协作?一张图看懂闭环
用户输入 → [Memory] 提取上下文与偏好 ↓ [Planning] 拆解任务、制定计划 ↓ [Action] 调度执行、参数映射 ↓ [Tools] 调用外部能力、返回结果 ↓ [Action] 解析结果、更新状态 ↓ [Memory] 存储新经验、更新上下文 ↓ 输出给用户 / 进入下一轮循环一句话总结:
- Planning负责“想清楚怎么做”
- Tools负责“有能力去做”
- Action负责“动手去做”
- Memory负责“记住做过什么、下次做得更好”
四者相互咬合,构成了 Agent 区别于传统 AI 的完整智能闭环。
理解 Agent 的四大组件,不是为了背诵概念,而是为了在设计自己的 AI 应用时,能够精准定位问题:
- 回答不靠谱?→ 检查 Planning 逻辑或 Tools 覆盖度
- 多轮对话丢失上下文?→ 优化 Memory 策略
- 执行结果不符合预期?→ 审视 Action 层的参数映射与异常处理
Agent 不是魔法,它是系统工程与 AI 能力的精密结合。希望这篇文章能帮你建立起清晰的认知框架,在实际项目中少走弯路。
