Agent 应该聪明到什么程度?
一场企业 Agent 演示会上,业务负责人提出任务:“帮我处理一下下周可能缺货的物料。”
Agent 很快查出库存、生成缺口分析,又调用接口创建了补货单。屏幕上的执行轨迹十分流畅,现场也很兴奋。直到计划员发现:Agent 选错了仓库,忽略了一张尚未入库的在途订单,还把“准备补货方案”理解成了“正式提交申请”。
每一步在技术上都成功了,整件事在业务上却做错了。
这类失败很容易被归因于模型还不够聪明。于是,团队继续优化提示词、增加工具、延长任务规划,希望 Agent 可以少问人、自己完成更多步骤。但问题也许恰好相反:它已经能做很多事,企业却没有说明哪些地方可以灵活判断,哪些地方必须接受确定性约束。
敲黑板:企业 Agent 的先进程度,不能用“能独立完成多少步骤”衡量。
Agent 应在意图理解、任务组织和非结构化信息处理中保持灵活,在对象身份、关键判断和高风险动作上接受确定性约束。好的自主性不是没有边界,而是知道何时继续、何时降级、何时把责任交还给人。
一、“越自主越先进”,为什么是个危险假设
在通用任务中,减少人工干预往往意味着更好的体验。但企业任务不是一条纯粹的信息生成链,它会改变客户、库存、资金、设备和责任状态。
Agent 生成一份补货分析,错误可以被人发现并改写;创建一张草稿,影响仍然有限;一旦正式下发采购,错误就进入交易系统,可能占用预算、形成供应承诺。类似地,整理客户流失原因与批量发送挽回消息,分析设备告警与执行停送电操作,虽然出现在同一条任务轨迹中,风险却完全不同。
所以,“自主”必须具体到某个场景、某一步动作,而不能给整个 Agent 贴一个统一标签。一个 Agent 可以自主检索资料、组合证据、安排查询顺序,同时在冻结库存、客户触达、采购下发或运行控制前停止。
更高自主度也不代表更高成熟度。边界稳定、风险较低、结果可观察且可补偿的场景适合自动执行;高影响、不可逆或规则尚不稳定的场景,保留人工确认本身就是成熟设计。
最危险的做法,是让 Agent 直接拿到一组接口,再在提示词里写“请谨慎操作,必要时询问用户”。提示词可以影响模型行为,却不能替代服务端权限、对象校验、审批规则、幂等控制、风险分级和结果回写。真正的边界必须位于执行链路中,而不是寄希望于模型每次都记得克制。
二、Agent 擅长什么:在不确定性中组织任务
Agent 的价值,不是复制一套固定流程。传统流程已经清楚知道下一步是什么时,工作流或普通程序往往更稳定。Agent 更适合处理目标用自然语言表达、上下文分散、路径需要动态选择的任务。
它首先擅长理解意图。用户说“处理一下这批有风险的客户”,Agent 可以追问或推断:风险是流失、投诉还是信用风险?用户要的是分析、建议、任务草稿,还是正式触达?“这批客户”指当前页面选中的对象,还是某个动态条件下的集合?
其次是任务拆解。面对“分析主变油温异常并准备处理建议”,它可以拆成识别设备、读取量测、查找相关部件、调取历史缺陷、调用告警逻辑、整理证据和预填巡检任务,而不是要求用户逐条发出命令。
再次是能力选择。Agent 可以根据任务决定先查对象还是先读文档,调用哪个逻辑能力、哪个只读工具,是否需要补充上下文。工具返回异常时,它也可以调整计划、寻找替代路径或把问题交给人。
最后是处理非结构化信息。检修报告、客服记录、合同条款、会议纪要和现场照片中包含大量难以预先写成字段的内容。Agent 可以提取候选事实、归纳原因、生成摘要,再把需要确认的结论送入结构化对象和逻辑能力。
这些能力都在处理开放问题与不完整上下文。Agent 可以提出路径和候选解释,但候选不能悄悄变成权威事实,语言上的合理也不能自动升级为业务许可。
三、本体承担什么:把企业的确定性部分交出来
如果 Agent 负责在不确定性中组织任务,本体负责把企业已经明确的业务世界表达出来。
对象告诉 Agent“企业里有什么”。客户、库存项、批次、设备、工单、补货单不是任意表名,而是有身份、状态和业务边界的运行对象。Agent 找到“物料 A”还不够,还要定位“物料 A 在华东仓的库存项”。
关系告诉 Agent“对象如何相连”。客户关联授权、账户和触达记录;异常批次关联工单、成品和客户订单;设备关联测点、部件、拓扑和责任班组。关系既提供上下文,也决定行动许可和影响范围。
状态告诉 Agent“此刻能做什么”。补货单已经待审批,就不应重复创建;客户已经退订短信,就不应进入营销触达;设备处于检修中,新的告警要与未关闭工单一起判断。
逻辑能力承接需要稳定复用的判断,例如客户触达资格、缺货风险、质量冻结条件、设备告警有效性和审批级别。它们有明确输入、输出、例外、版本和测试。Agent 可以解释逻辑结果,但不能为了让方案更顺畅而临场改写关键规则。
行动能力定义可以安全执行的业务动作。创建草稿、提交补货单、登记缺陷、发送渠道消息分别需要什么参数、权限和前置条件,怎样处理重复、失败与补偿,结果写回哪里,都应由行动契约约束。
治理边界则说明谁能看、谁能做、哪些动作要确认或审批、运行轨迹保留什么证据。Agent 继承用户的业务权限,不应因为连接了高权限集成账号,就获得用户本来没有的执行能力。
可以把分工概括为一句话:Agent 负责组织,本体负责定界,逻辑能力负责判断,行动能力负责受控执行,业务系统负责保存权威交易事实,人负责关键责任。
四、一条完整轨迹:不是“规划—调用”,而是六步闭环
一次可运行的 Agent 任务,可以写成六步:
意图 → 对象 → 判断 → 动作 → 观察 → 回写
仍以“处理下周可能缺货的物料”为例。
意图。Agent 先确认任务范围:哪个组织和仓库,未来多长时间,是生成风险清单、准备补货方案,还是提交动作。自然语言在这里负责灵活入口。
对象。Agent 在本体中定位库存项、需求、在途订单、供应商和未关闭补货单。对象身份、数据来源和读取权限不能靠它猜测。
判断。Agent 调用缺货风险与补货逻辑,得到风险时间、缺口数量、原因和替代路径。关键结论来自可测试的逻辑能力,Agent负责组合解释,而不是现场发明一套库存政策。
动作。如果用户只要求方案,轨迹在建议处停止;如果允许创建草稿,Agent预填行动参数;若要提交或下发,则行动层重新校验权限、重复单据、数量约束和审批要求。
观察。创建请求发出后,Agent要读取动作结果和外部回执。超时不等于失败,返回成功也不表示业务已经完成。补货单是否审批、采购是否下发,决定任务如何继续。
回写。外部单号、对象状态、人工修改、失败原因和后续任务回到本体,成为下一轮判断的输入。没有回写,Agent只是在发起动作,不是在承担任务。
这条轨迹还有一条“运行证据链”:原始请求是什么,选了哪些对象,调用了哪个版本的逻辑,预填了什么参数,谁确认或修改,外部系统返回什么。只有这些步骤能够回放,企业才知道错误发生在意图理解、对象定位、逻辑判断、行动参数还是系统执行。
五、人在回路应该放在哪里
不少企业为了安全,在每一步都弹出确认框。结果是用户习惯性点击“继续”,确认变成橡皮图章;另一些企业为了体验顺畅,尽量不让 Agent 停下来,又把责任边界藏进了系统内部。
人在回路不应按“每调用一次工具”设置,而应放在责任真正发生变化的位置。
意图歧义点。目标对象、任务范围或“分析/建议/执行”含义不清时,继续规划只会放大误解。这里需要用户澄清,不需要审批。
证据不足点。对象匹配置信度低、关系断链、数据过期、多个来源冲突时,应让业务人员复核事实。人是在补充判断基础,不是在替机器点按钮。
责任转移点。动作开始影响资金、库存、客户权益、生产或设备状态时,需要责任人确认或审批。确认页面必须展示对象、参数、依据、影响范围、风险和回退方式。
异常接管点。外部系统结果未知、动作部分成功、权限冲突或补偿失败时,Agent应停止扩展动作,把完整上下文交给人处理。
相反,已经授权、低风险、可逆、重复发生且结果可观察的查询、摘要、草稿、提醒,不必处处请求确认。人的注意力是稀缺资源,应留给歧义、例外和责任,而不是浪费在机械点击上。
六、Agent 自主度五级:不是能力排名,而是风险配置
为了帮助企业选择边界,我把 Agent 自主度分为五级。等级描述的是“在一个具体场景中,Agent 最远可以推进到哪里”,不是给模型打智力分,也不是要求所有场景最终升到第五级。
L1:只检索和解释
Agent 可以查询资料、汇总事实、解释规则,不选择业务对象集合,也不生成正式建议。适合刚接入、对象体系尚不完整,或者对答案质量仍在评估的场景。
例如,解释安全库存政策、汇总某设备的历史检修报告。主要风险是引用错误和越权读取,因此要控制来源、权限和引用证据。
L2:定位对象并生成建议
Agent 可以把自然语言落到具体对象,沿关系组织上下文,给出候选分析或下一步建议,但不调用关键判断替人作结论,也不执行写操作。
例如,定位高风险库存项并生成待核查清单,识别油温异常设备并整理可能原因。对象匹配不确定时必须显式提示并请人确认。
L3:调用逻辑能力形成方案
Agent 可以调用经过测试和版本管理的逻辑能力,生成结构化判断、方案和行动参数。它不再只靠语言模型推测规则,但仍停在建议或草稿层。
例如,计算缺货时间和建议数量,判断客户是否具备触达资格,生成质量异常影响范围。适合规则相对明确、方案需要复用,但正式动作仍有责任要求的场景。
L4:在确认后执行中风险动作
Agent 完成对象定位、逻辑调用和参数预填,向责任人展示证据、影响和风险;确认后,由行动能力执行创建任务、提交补货单、登记一般缺陷等中风险动作。
这里的关键不是多一个确认框,而是确认人真正理解并承担这次行动。高风险动作可以使用类似流程,但通常还需要更高层审批,甚至不允许 Agent 直接触发。
L5:在限定场景内自动执行并观察结果
Agent 可以在预先授权的对象范围、金额或数量阈值、时间窗口和工具集合内自动执行,并持续观察状态、处理可预期异常、触发补偿或转人工。
它适合低风险、标准化、可补偿、历史表现稳定且结果可观察的动作,例如创建内部观察任务、更新非关键备注、按明确策略生成低风险草稿。L5 不是“自由行动”,而是“在很窄的跑道内自动闭环”。
七、如何为一个场景选择等级
自主度不能只看动作是否简单。一个点击操作可能对应大额采购,一套复杂分析也可能只是只读报告。评估时至少要看六个问题。
业务影响:是否改变资金、库存、客户权益、生产或设备状态?
可逆程度:错误能否撤销、补偿,还是会形成不可恢复的外部后果?
判断稳定性:规则是否明确、经过测试,还是依赖大量情境经验?
对象与数据质量:身份、关系、状态是否完整及时,冲突能否被识别?
权限与责任:谁授权、谁承担结果,是否存在明确审批和接管角色?
观察能力:执行后能否取得权威回执,发现失败、重复和业务偏差?
影响越高、越难回退、判断越不稳定、观察越弱,自主度就应越低。即使运行在 L5,只要出现对象不确定、证据冲突、规则变化、系统异常或影响超阈值,也应降级到 L3 或 L4。
反过来,某个场景长期稳定并不意味着可以直接升级。企业要用历史回放和小范围运行证明:对象选对率、逻辑结果、动作成功率、人工修改率、异常接管和业务结果都处于可接受范围,再逐步放宽对象范围或动作权限。升级的是经过验证的运行边界,不是对模型的信心。
带走一张表:Agent 自主度五级评估表
等级 | Agent 最远推进到哪里 | 人在回路的位置 | 适用条件 | 典型产物 |
L1 检索解释 | 查询、汇总、解释 | 通常事后抽查 | 只读、来源可控 | 答案、摘要、依据 |
L2 对象建议 | 定位对象、生成候选建议 | 对象不确定时确认 | 低影响、判断仍需人负责 | 对象清单、建议说明 |
L3 逻辑方案 | 调用逻辑、形成结构化方案 | 方案或关键判断复核 | 逻辑可测试,动作尚未发生 | 风险结论、行动草稿 |
L4 确认执行 | 确认后执行中风险动作 | 责任转移前确认或审批 | 权限、行动契约、证据完整 | 任务、补货单、缺陷单 |
L5 限定闭环 | 限定范围内执行、观察、回写 | 异常或越界时接管 | 低风险、可补偿、可观察、运行稳定 | 自动闭环及完整轨迹 |
评审时不要只选一个等级,还要写清四项配置:允许作用的对象范围、允许调用的动作、必须降级的触发条件、结果观察和人工接管时限。没有这四项,“L5 自动执行”仍然只是一个模糊口号。
结语:让 Agent 灵活地想,受控地做
企业需要的 Agent,不是一个在所有环节都自由发挥的模型,也不是一个每走一步都等待确认的聊天界面。
它应该在用户表达模糊时理解意图,在上下文分散时组织信息,在路径不确定时拆解任务、选择能力;同时,它应接受对象身份、关系、状态、关键逻辑、行动契约和权限审批的约束。灵活性放在任务组织层,确定性放在业务后果层。
Agent 自主度五级提供的不是一条“从低级走向高级”的升级路线,而是一套配置语言:这项任务可以走到哪一步,哪里要停,谁来接手,什么条件下可以再向前。
真正聪明的 Agent,不是从不向人求助,而是能识别自己的边界;真正成熟的企业,也不是把人完全拿掉,而是把人的判断和责任放在最值得出现的位置。
留一道思考题:
企业为什么敢让 Agent 做事?答案不只在权限和审批,还在于每一次判断、行动、失败和人工干预,能不能留下完整的运行证据。
