Agent 跑通 Demo 只是第一步,真正的地狱在上线之后
https://github.com/limenagent/prodagent
现在几乎所有人都可以快速跑通一个 Agent 。 LangGraph、各种低代码平台,十几行代码就能实现工具调用、多轮思考。
但只要往生产环境一推,各种诡异故障接踵而至:
- Agent 无限循环,token 和成本一夜跑飞;
- 进程意外崩溃,全部执行状态直接丢失,任务只能从头重来;
- LLM 幻觉触发高危工具调用,发生越权、指令注入;
- 上下文不断膨胀,没有可控的压缩策略,语义疯狂丢失;
- 缺少熔断、重试、审批,异常场景全靠业务代码手写兜底;
- 多子 Agent 协作,花销、状态、权限完全失控。
绝大多数框架,擅长把 Agent 跑起来,但很少把「稳定性、护栏、故障恢复」作为一等公民设计。 很多生产防护能力,需要开发者自己一片片拼凑。
这里开源prodagent:一套面向生产环境的 Python LLM Agent 框架,它的核心理念:大模型是概率的,生产系统需要确定性。把刹车、护栏、状态机做进运行时内核,而不是事后补丁。
内置生产级原生能力
✅四维硬预算管控:turns / 时长 /token/ 费用四重硬阈值,触顶立刻终止;子 Agent 开销自动汇总回父 Agent
✅Checkpoint 崩溃恢复:进程 crash 重启,任务从断点继续执行,不用重做全部工作
✅完整韧性体系:多策略退避重试、工具级 + Agent 级熔断、异常自动 suspend
✅纵深安全防护:五层注入防护、污点追踪、工具分级权限、HITL 人工审批门禁
✅多种执行范式:动态 PLAN_FIRST DAG / ReAct 循环 / 静态 Workflow,一套框架自由切换
✅原生多智能体:父子委派、peer 横向接力,支持复杂业务任务编排
✅五级可控上下文压缩,每一档都定义语义损失边界,不是粗暴截断
✅存储可插拔:本地 File/Memory 开箱即用;生产切换 Postgres / Neo4j / Qdrant / Redis
✅原生 MCP 协议、OTLP 链路可观测、内置评测回归流水线
自带 Playground 可视化调试界面,make playground一条命令启动,支持 FakeLLM 零 API‑Key 体验,附带 8 个完整端到端业务示例:深度调研、金融审计、邮件分拣、AIOPS 故障处置等。
它不是又一个快速做原型的 Agent 脚手架,而是给长期运行业务 Agent 准备的生产底座。
GitHub:https://github.com/limenagent/prodagent
Agent 的可视化事件流 —— 每个 Agent 生命周期事件(PLAN 的 DAG、STEP 状态、SUB-AGENT fan-out、TOOL CALL、BUDGET ...)都是一张可观测的卡片。
