为啥每家都在做 Agent
表面是"为啥每家都在做 Agent",底下其实是两层:Agent 是不是为了放大模型特性? 以及这种"放大"具体是怎么映射的? 分开讲。
一、先答动机:为什么不同大模型都要做自己的 Agent?
不全是为了"发挥模型特性",那是后半段的事。前半段是生存逻辑:
模型本身变现路径太窄——API 按 token 收费天花板低,Agent 是按"任务/结果"收费,单价高一个量级。
对标竞品——OpenAI 有 Operator、Anthropic 有 Claude Code、Google 有 Astra/Jules,不做就显弱势。
锁生态——Agent 会沉淀工具链、MCP 服务、私有知识库,迁移成本比换一个模型高得多。
"发挥自身模型特性"确实是 Agent 设计时的核心考量——因为通用 Agent 架设在任意模型上都能跑,但原厂 Agent 会把自家的长板做成默认路径,让竞品模型即使套同一个 Agent 框架也打不过。
二、Agent 特性 ↔ 大模型特性的直接映射关系
挑几条最清晰的对应链讲,配例子。
🔗 映射 1:长上下文窗口 → 长程 Agent(少检索、少摘要)
模型特性:Kimi K3 的 1M token + KDA 注意力,长距离依赖不衰减。
Agent 侧能做的事:把"对话历史 + 工具返回 + 中间规划"整个塞上下文里,不需要频繁做向量检索+RAG,也不需要用摘要压缩丢信息。
例子:Kimi 的"长文档审阅 Agent"——一份 80 万字并购合同,从头读到尾,Agent 在第 300 轮还能精确引用第 3 章第 5 条的措辞。换一个 32K 窗口的模型,Agent 就得切 RAG + 摘要,跳数多了必丢上下文。
💡 这里 Agent 的"记忆管理策略"是直接由模型上下文长度决定的——长窗口模型 Agent 可以懒汉式记忆(全塞上下文),短窗口模型 Agent 必须勤快式记忆(向量库+摘要+压缩),架构完全不同。
🔗 映射 2:强推理 / 代码训练占比 → 编程 Agent 的自我纠错闭环
模型特性:Qwen3.8 激活 288B、代码语料占比高、多模态统一;Claude 的 CoT 训练深度大。
Agent 侧能做的事:Agent 跑出报错 → 把 stack trace 喂回模型 → 模型能基于报错反推根因而不是瞎猜,多轮修到过为止。
例子:Claude Code(Anthropic 的编程 Agent)敢做"跑测试→红→自动改→再跑"的循环,底气是 Claude 的 CoT 在代码调试链上不容易跑偏。小模型做同样 Agent,经常改三轮就陷入"同个错误反复试"。
⚠️ 这里有个阈值:模型推理能力不到某个水位,Agent 的"反思(Reflection)"模块就是摆设——它会假装反思,其实在复读。
🔗 映射 3:多模态原生融合 → 跨模态文档 Agent(省掉 OCR/预处理链)
模型特性:Qwen3.8、Gemini 1.5+ 是预训练期就图文混训,不是 CLIP 外接。
Agent 侧能做的事:Agent 直接吞 PDF 扫描件 / 财务报表截图 / 工程图纸,不需要外挂 OCR → 结构化 → 再喂文本这套脆弱 pipeline。
例子:阿里内部用 Qwen3.8 做的报销审核 Agent——用户拍一张餐饮发票照片 + 上传 Excel 明细,Agent 自己看图对数字、对税号、对消费类型,一步出结论。换纯文本模型,这一整条 pipeline 得拆 3 个服务。
🔗 映射 4:MoE 高稀疏 → 并发 Agent 集群(成本侧映射)
模型特性:Kimi K3 是 896 专家选 16,单次激活参数很小。
Agent 侧能做的事:一个系统里并行跑几十个 Agent 实例(每个 Agent 负责一个子任务),算力账单不会炸。
例子:Kimi 技术报告里提到的"多 Agent 协同写前端"——一个 Agent 管布局、一个管组件、一个管样式,三个 Agent 反复互评修改,最后拼出一个完整页面。如果是稠密 2.8T 模型,光跑一个实例都费劲,别谈并发了。
🔗 映射 5:函数调用(Tool Use)训练深度 → Agent 的工具编排复杂度
模型特性:GPT-4 / Claude 在函数调用格式遵循、多工具顺序决策上训练过(fine-tune 专门做过 tool-call 数据)。
Agent 侧能做的事:Agent 框架可以放心把十几个工具同时注册给模型,让模型自己决定先调哪个、参数怎么填。
例子:OpenAI 的 Operator —— 模型自己决定"先搜价格 → 再查库存 → 再填表单 → 再点提交",四步工具链顺序模型自己排。换一个没做过 tool-use 训练的 base 模型套同样 Agent,常见症状是工具参数填错、顺序颠倒、忘了调最后一个。
三、反过来想:是不是"通用 Agent + 任意模型"就够了?
不是。通用 Agent 框架(LangChain、AutoGPT 这类)能做到 60 分,但原厂 Agent 能吃透自家模型的"脾气":
知道模型在哪类任务上容易幻,提前加校验;
知道模型的 CoT 格式偏好,prompt 不用通用模板;
知道模型的失败模式,Reflection 模块针对性补。
所以会看到一个有意思的现象——模型越强,Agent 越"轻"(Claude Code 核心逻辑很薄,靠模型撑);模型越弱,Agent 框架越"重"(拼命加规划、加校验、加人类确认来兜底)。
