AI Agent核心原理技术笔记(LLM+上下文+工具体系)(AI Agent学习基础)(李博杰《深入理解 AI Agent》1.1观后总结)
一、现代Agent核心本质与核心公式
现代大模型智能体(Agent)彻底区别于传统对话式大模型,核心公式可定义为:Agent = LLM + 上下文 + 工具。这一公式完整概括了Agent的核心架构与能力来源,三者各司其职、协同配合,让AI从被动文本生成器,升级为可自主感知、决策、执行、迭代的主动智能系统。
可以用通俗的人体模型类比三者定位,直观理解核心分工:
- LLM(大脑):决策核心,负责意图理解、任务拆解、逻辑推理、动作判断,是Agent所有行为的思维源头;
- 上下文(眼睛):信息视野,承载Agent每一次决策所需的全部环境、历史、知识数据,决定决策的全面性与准确性;
- 工具(手脚):交互执行载体,打通大模型与外部世界的通道,让抽象推理转化为真实可落地的动作与结果。
二、三大核心组件深度拆解
2.1 LLM:Agent的决策大脑
LLM是Agent的核心内核,并非单纯的文本生成模型,而是具备理解-规划-决策-推演全链路能力的决策系统,其能力来源于两大核心训练阶段:预训练积累通用世界知识与语言逻辑,后训练(监督微调、强化学习RL)固化工具调用、任务规划等专属决策策略。
LLM支撑Agent智能化的两大核心原生能力:
- 内部推演能力:在执行外部动作前,可基于预训练习得的因果逻辑、数学规律、问题拆解策略完成虚拟推演,无需真实试错,大幅提升任务执行效率与成功率;
- 泛化适配能力:包含零样本泛化与少样本适配。零样本可无示例完成全新陌生任务,依托已有知识组合解决问题;少样本仅需少量示范案例,即可快速掌握新任务模式,适配场景灵活度极高。
2.1.1 前沿范式:模型即Agent
当前Agent发展核心趋势为模型即Agent(Model as Agent),通过强化学习等后训练手段,将工具调用时机、工具选择、参数配置等决策逻辑内化为模型原生能力,摆脱人工脚本、固定工作流的硬性编排,实现真正的自主决策。
同时衍生出Harness工程理念:模型是核心动力,Harness作为工程保障外壳,包含上下文管理、工具接口约束、安全校验、错误纠正、权限管控等基础设施。模型能力越强,自主决策风险越高,Harness的兜底、引导、约束价值越突出,是工业级Agent稳定落地的关键。
结合AI领域经典《苦涩的教训》核心思想:短期人工定制的领域规则、约束逻辑终将被规模化数据与算力训练出的通用模型能力替代,但工程落地存在节奏差。当前阶段,Harness负责补齐模型能力短板、兜底业务风险,模型持续迭代内化能力,逐步精简Harness依赖,是务实的落地思路。
2.2 工具:Agent的交互手脚
工具是Agent与外部世界交互的唯一桥梁,让Agent摆脱纯文本推演的局限,从被动观察者变为主动执行者。工具并非简单的API接口,而是Agent所有可执行能力的集合,包含预置能力、动态生成能力、多主体协作能力等广义形态。
2.2.1 工具五大核心分类
根据Agent与外界的交互方向,工具可系统化分为五类,覆盖全场景交互需求:
- 感知工具:负责信息获取,包含搜索引擎、本地文件读取、数据库、第三方API对接,解决模型实时信息、私有领域知识缺失问题;
- 执行工具:负责改变外部状态,包含代码执行、文件操作、系统命令调用、业务API提交,将决策转化为实际结果;
- 协作工具:负责多角色协同,包含子Agent委托、人工确认、多智能体任务协调,适配复杂分层任务;
- 事件触发工具:被动驱动型工具,区别于主动调用工具,由外部事件(定时任务、邮件消息、Webhook回调)激活Agent启动任务;
- 用户沟通工具:负责人机信息交互,通过文字、语音、邮件等形式同步任务进展、主动响应用户需求。
2.2.2 核心能力:工具调用(Function Calling)
工具调用是现代Agent的核心技术底座,通过结构化调用范式,让LLM自主完成工具决策与执行,完整流程分为四步闭环:
- 上下文注入:向模型告知当前可用工具的名称、功能、参数规范;
- 模型自主决策:LLM基于任务需求,判断是否调用工具、调用哪一个、传入对应参数;
- 工具执行:框架接收调用指令,执行对应工具并生成结果;
- 结果回传迭代:将工具执行结果追加至上下文,支撑模型判断下一步动作,直至任务完成。
工具设计核心原则:优先通用化设计,避免过度专用化。例如用通用Python代码沙盒替代专用计算器、用全局文件读写工具替代专属日志工具,让Agent可通过基础工具组合,创造性解决复杂未知问题。同时依托MCP模型上下文协议,实现工具插件化快速接入,拓展能力边界。
2.3 上下文:Agent的全局视野
上下文是Agent单次决策可感知的全部信息,是模型推理、工具决策的唯一依据,直接决定Agent的连贯性、准确性和稳定性。完整上下文由静态前缀+动态轨迹构成,包含五大核心组件。
2.3.1 上下文五大组成模块
- 系统提示词(静态):Agent的岗位准则,定义身份、权限、行为规范,可嵌入用户记忆、环境状态,全局生效不随单轮对话变更;
- 工具定义(静态):声明可用工具的Schema信息,是模型识别、调用工具的前提,无工具定义则Agent完全丧失执行能力;
- 用户消息(动态):用户实时输入,结合RAG检索的外部知识、私有数据,补充模型训练盲区;
- 模型回复(动态):包含模型思考链、文本回复、工具调用请求,保障多轮任务的思维连贯性;
- 工具执行结果(动态):每一轮工具调用的返回数据,是模型纠错、迭代下一步动作的核心依据。
2.3.2 上下文消融实验核心结论
各上下文组件缺一不可,缺失会直接导致Agent功能异常:无工具定义则无法执行任何操作;无工具结果回传会陷入重复调用死循环;缺失模型思考链会导致决策矛盾;无历史消息则Agent失忆、重复执行任务。
三、Agent三大学习范式(互补协同)
Agent的学习并非仅依赖模型训练,而是通过后训练、上下文学习、外部化学习三种范式,覆盖长期固化、即时适配、工程落地全场景,三者时间尺度、能力特性互补。
3.1 后训练(Post-training)
训练阶段修改模型权重,将任务经验、决策策略永久固化到模型参数中。特点是通用性强、可跨场景复用,但训练成本高、迭代周期长。典型应用是通过强化学习让模型原生掌握工具调用、长任务规划能力。类比人类系统性读书学习,形成永久能力提升。
3.2 上下文学习(In-Context Learning)
推理阶段依托注意力机制实现临时模式匹配,无需修改模型权重,通过提示词中的少量示例快速适配新任务。特点是毫秒级快速适配、零成本迭代,但能力临时生效,会话结束即失效,仅能复用已有模式,无法挖掘全新规律。类比临场查阅例题解题,看完即会、过后遗忘。
3.3 外部化学习(Externalized Learning)
运行时将业务流程、领域知识固化为知识库、可执行代码工具,不依赖模型参数更新。特点是持久化存储、可解释、可校验、稳定性强,适合固定业务流程沉淀。类比整理专属工作笔记,长期复用、随时更新。
四、Agent核心运行机制:ReAct循环
ReAct(Reasoning + Acting)是串联LLM、上下文、工具的核心运行闭环,是所有自主Agent的基础工作模式,核心逻辑为思考→行动→观察→迭代的无限循环,直至任务终止。
完整运行链路:LLM读取完整上下文(静态前缀+动态交互轨迹)→ 推理分析任务进度与下一步动作 → 自主选择是否调用工具并生成调用指令 → 框架执行工具并返回结果 → 结果纳入上下文更新轨迹 → 模型再次推理迭代,最终输出结论或继续执行。
ReAct循环让Agent具备了动态纠错、自主规划、渐进式完成复杂长任务的能力,彻底区别于单轮交互的传统大模型。
五、核心总结与工程启示
- 现代Agent的核心价值是闭环自主能力:依托LLM推理、上下文感知、工具执行,实现从理解、规划到落地、迭代的全自主任务处理;
- 模型能力与工程Harness相辅相成:模型负责智能决策,Harness负责稳定兜底,短期依赖工程约束保障落地可靠性,长期随模型迭代逐步简化人工干预;
- 三类学习范式分层落地:后训练做通用能力底座、上下文学习做临时场景适配、外部化学习做业务能力沉淀,三者结合实现高效、稳定、可迭代的Agent系统;
- 工具与上下文的工程设计,是决定Agent落地上限的关键,远超模型本身的基础能力,通用化工具、精细化上下文管理是工业级Agent优化核心。
