【COLM 2025】AIOS:LLM 智能体操作系统,内核化资源管理与调度|从智能体系统架构视角
摘要
本文解读 COLM 2025 论文《AIOS: LLM Agent Operating System》。该论文提出AIOS 智能体操作系统,通过融合操作系统内核思想、系统调用抽象与SDK 开发套件,把 LLM 与工具资源从智能体应用中隔离出来统一管理,其特别之处在于让并发智能体像进程一样被调度与隔离。实验表明接入 AIOS 后吞吐最高提升 2.1 倍,并发智能体从 250 个扩展到 2000 个仍保持近似线性性能,为规模化 LLM 智能体服务提供了系统级基础设施借鉴。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机:为什么智能体需要自己的操作系统
- 研究主线:从问题到结论
- 基准/方法设计:三层架构与七模块内核
- 分类全景:AIOS 内核的七大模块
- 方法细节:系统调用与调度机制
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- AIOS 和 AutoGen、LangChain 有什么区别?
- AIOS 如何提升并发吞吐?
- AIOS 对智能体性能有损吗?
- AIOS 支持哪些智能体框架?
- AIOS 开源吗?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | AIOS: LLM Agent Operating System |
| 标题(中文) | LLM 智能体操作系统:内核化资源管理与调度 |
| 作者 | Kai Mei, Xi Zhu, Wujiang Xu, Mingyu Jin, Wenyue Hua, Zelong Li, Shuyuan Xu, Ruosong Ye, Yingqiang Ge, Yongfeng Zhang |
| 机构 | Department of Computer Science, Rutgers University |
| 会议 | COLM 2025 |
| arXiv | https://arxiv.org/abs/2403.16971 |
| 项目网站 | https://github.com/agiresearch/AIOS |
背景与动机:为什么智能体需要自己的操作系统
LLM 智能体在真实任务中既要调用大模型服务(偏好检索、接口选择、回复生成),也要使用传统操作系统服务(文件、存储)。但现有智能体框架(AutoGen、LangChain 等)让智能体直接访问 LLM 与工具资源,带来三类问题:
- 无调度导致资源独占:一个智能体可以淹没 LLM 请求,其他智能体只能等待;
- 并发场景反复试错:提示词被转成张量加载进显存,直到触发 CUDA 显存上限异常再释放重试,严重拖慢吞吐;
- 缺乏隔离与访问控制:直接暴露系统级资源带来安全隐患。
AIOS 的解法是把操作系统演进史(批处理 → 分时 → 多任务 → 模块化内核)的思想搬到智能体场景:LLM 被视作类似 CPU 核心的资源,由内核统一调度、隔离与恢复。与 MemGPT 等只做单点记忆管理的工作不同,AIOS 提供完整的内核抽象——这正是它与既有工作最本质的差异。
研究主线:从问题到结论
图 1:AIOS 论文的研究主线 —— 从并发瓶颈到内核化资源管理的完整推理链
基准/方法设计:三层架构与七模块内核
AIOS 采用经典的三层架构:
图 2:旅行智能体完成任务需要 LLM 服务(红)与 OS 服务(蓝)协同 —— AIOS 将两者统一纳入内核管理
- 应用层:AIOS SDK 提供统一接口,既支持原生 agent 开发,也通过适配器接入 ReAct、Reflexion、AutoGen、Open-Interpreter、MetaGPT 五大框架;
- 内核层:AIOS Kernel 含调度器、LLM Core、上下文管理、内存管理、存储管理、工具管理、访问管理七模块;
- 硬件层:CPU/GPU/磁盘,AIOS 通过传统 OS 系统调用间接访问,不直接操作硬件。
核心机制是查询分解:智能体查询被拆成多个 AIOS 系统调用(syscall),由调度器分发到对应模块执行,实现并行与有序处理。
分类全景:AIOS 内核的七大模块
图 3:AIOS 内核七大模块 —— LLM 核心、调度、上下文、内存、存储、工具、访问管理
方法细节:系统调用与调度机制
图 4:AIOS 三层架构 —— 应用层通过 SDK 访问内核层,内核统一管理 LLM 核心、调度与各类资源
- LLM Core:统一接口封装不同 LLM 端点(API/本地),视作"核心"便于调度与切换;
- Agent Scheduler:RR/FIFO 策略调度系统调用,支持抢占式执行 + 上下文快照恢复;
- Context Manager:长上下文生成中断时快照并恢复,防止长请求独占 LLM 核心;
- Memory/Storage Manager:短期对话记忆与长期交互日志持久化分层管理;
- Tool/Access Manager:工具加载与调用冲突消解、访问控制与用户干预协议。
图 5:Agent 查询分解为 AIOS 系统调用,由调度器按策略分发到各执行模块(访问类调用不经过调度器)
每个模块通过系统调用对外提供服务(如 memory_store、tool_call、context_snapshot),智能体经由 SDK 透明调用——与操作系统 syscall 同构,应用无需关心资源细节。
实验设计与结果
评测协议:LLM Core 用 GPT-4o-mini(API)+ Llama-3.1-8b / Mistral-7b(本地 fp16,单张 RTX A5000);默认 250 个智能体并发、RR 调度;成功率 SR% 为统一指标;覆盖 HumanEval(代码生成)、MINT-Code(多轮交互代码)、GAIA(通用助手工具调用)、SWE-Bench-Lite(软件工程修复)四基准。
主表:五个框架接入 AIOS 前后成功率(SR%,括号为相对无 AIOS 的提升)
| 框架 (w/ AIOS) | HumanEval | MINT | GAIA | SWE-Lite |
|---|---|---|---|---|
| ReAct | 50.6 (+1.8) | 30.1 (+0.7) | 7.3 (+1.8) | 4.3 (+0.4) |
| Reflexion | 51.8 (+1.2) | 33.8 (+1.4) | 7.8 (+1.1) | 5.1 (+0.4) |
| Autogen | 87.8 (0) | 42.5 (0) | 9.7 (+2.4) | 4.3 (0) |
| Open-Interpreter | 86.0 (+0.6) | 48.7 (+2.8) | --- | 5.1 (+0.4) |
| MetaGPT | 82.9 (0) | 41.8 (+0.7) | --- | 5.9 (0) |
所有框架性能保持或提升,工具调用型基准 GAIA 提升最显著(最高 +2.4pp)。增益来自三机制:结构化 prompt 增强、工具调用参数预校验(正则)、冲突消解哈希表。
图 6:Llama-3.1-8b 上各框架归一化吞吐 —— AIOS 显著更高(Reflexion 达 2.1×)
扩展性实验:并发智能体从 250 增至 2000,总体执行时间与平均等待时间均近似线性增长,且与无 AIOS 的差距随并发数扩大持续拉大——高并发下优势更明显。
图 7:并发 agent 从 250 增至 2000 —— 总体执行时间与平均等待时间近似线性,AIOS 差距随并发扩大
附加实验:Mistral-7b 本地模型上重复吞吐/延迟实验趋势与 Llama 一致,确认效率收益与具体模型无关;FIFO 调度策略与默认 RR 差异可控。
图 8:Mistral-7b 上各框架归一化吞吐 —— AIOS 同样显著提升,验证跨模型普适性
结果对比总结
图 9:AIOS 结果对比总结 —— 吞吐 2.1×、GAIA +2.4pp、并发近似线性扩展
关键发现
Oral 信号分析:从创新模式视角看,AIOS 命中两个高 Oral 率模式——P6 重新表述为可解对象(n=79,Δ_OR=+2.9pp,Δ_OH=+7.1pp):把并发智能体共享 LLM 的难题重构为内核资源调度问题,LLM 视作类 CPU 核心,证据是 250→2000 并发近似线性扩展与 2.1× 吞吐;P11 分解并委托求解器(n=42,增长最快 τ=+6.3pp):查询分解为系统调用后由调度器委托专门模块执行,证据是 GAIA 最高 +2.4pp 且五框架性能无一回退。系统类贡献以可复用基础设施 + 大规模受控实验构成完整证据链。
- 性能保持或提升:5 个框架 × 4 个基准全部 SR% 无回退,Open-Interpreter 的 MINT 提升 +2.8pp(45.9→48.7);
- 吞吐最高 2.1 倍:Reflexion 框架在 Llama-3.1-8b 上执行加速最显著,源于避免显存试错;
- GAIA 工具调用提升显著:AutoGen +2.4pp(7.3→9.7),得益于参数预校验与冲突消解;
- 近似线性扩展:并发 250→2000,执行时间与等待时间线性增长,无 AIOS 差距随并发扩大;
- 跨模型普适:Llama-3.1-8b 与 Mistral-7b 上吞吐/延迟收益一致;
- 即插即用:SDK 适配器机制让 5 大框架接入零侵入。
局限性
- 单 GPU 单模型串行:默认一次只处理一个请求,未覆盖多模型并行/分布式推理;
- 调度策略简单:仅 RR/FIFO,未探索优先级、负载感知等更智能策略;
- 访问控制基础:Access Manager 提供基础鉴权,安全与隐私保障仍待加强;
- 覆盖有限:5 框架 × 4 基准,通用性需要更大生态验证。
作者明确的多 LLM 分布式资源管理、更智能调度与多智能体协作安全是未来方向。
常见问题(FAQ)
AIOS 和 AutoGen、LangChain 有什么区别?
AutoGen 等框架聚焦智能体编排逻辑,把 LLM 当外部 API 调用;AIOS 把 LLM 当作类似 CPU 核心的内核资源,统一调度、隔离与恢复,并可通过适配器让这些框架直接接入受益。
AIOS 如何提升并发吞吐?
核心是调度器避免"提示词装不上显存"的反复试错:请求被分解为系统调用统一排队,配合上下文快照实现抢占式执行,最高带来 2.1 倍吞吐提升。
AIOS 对智能体性能有损吗?
没有。四个基准 × 五个框架的成功率全部保持或提升,工具调用型基准 GAIA 最高 +2.4pp,性能增益来自 prompt 结构化增强与工具调用预校验。
AIOS 支持哪些智能体框架?
ReAct、Reflexion、AutoGen、Open-Interpreter、MetaGPT 五大框架均通过适配器接入,原生 agent 也可直接使用 AIOS SDK 开发。
AIOS 开源吗?
是的,代码在 GitHub agiresearch/AIOS 组织下开源,这是其作为可复用基础设施被社区广泛引用的基础。
参考链接
- arXiv 论文页:https://arxiv.org/abs/2403.16971
- 项目主页(GitHub):https://github.com/agiresearch/AIOS
- ReAct(ICLR 2023):https://arxiv.org/abs/2210.03629
- Reflexion(NeurIPS 2023):https://arxiv.org/abs/2303.11366
- AutoGen(COLM 2024):https://arxiv.org/abs/2308.08155
- MetaGPT(ICLR 2024):https://arxiv.org/abs/2308.00352
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
