当前位置: 首页 > news >正文

【COLM 2025】AIOS:LLM 智能体操作系统,内核化资源管理与调度|从智能体系统架构视角

摘要

本文解读 COLM 2025 论文《AIOS: LLM Agent Operating System》。该论文提出AIOS 智能体操作系统,通过融合操作系统内核思想系统调用抽象SDK 开发套件,把 LLM 与工具资源从智能体应用中隔离出来统一管理,其特别之处在于让并发智能体像进程一样被调度与隔离。实验表明接入 AIOS 后吞吐最高提升 2.1 倍,并发智能体从 250 个扩展到 2000 个仍保持近似线性性能,为规模化 LLM 智能体服务提供了系统级基础设施借鉴。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机:为什么智能体需要自己的操作系统
  • 研究主线:从问题到结论
  • 基准/方法设计:三层架构与七模块内核
  • 分类全景:AIOS 内核的七大模块
  • 方法细节:系统调用与调度机制
  • 实验设计与结果
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • AIOS 和 AutoGen、LangChain 有什么区别?
    • AIOS 如何提升并发吞吐?
    • AIOS 对智能体性能有损吗?
    • AIOS 支持哪些智能体框架?
    • AIOS 开源吗?
  • 参考链接

论文基本信息

项目内容
标题(英文)AIOS: LLM Agent Operating System
标题(中文)LLM 智能体操作系统:内核化资源管理与调度
作者Kai Mei, Xi Zhu, Wujiang Xu, Mingyu Jin, Wenyue Hua, Zelong Li, Shuyuan Xu, Ruosong Ye, Yingqiang Ge, Yongfeng Zhang
机构Department of Computer Science, Rutgers University
会议COLM 2025
arXivhttps://arxiv.org/abs/2403.16971
项目网站https://github.com/agiresearch/AIOS

背景与动机:为什么智能体需要自己的操作系统

LLM 智能体在真实任务中既要调用大模型服务(偏好检索、接口选择、回复生成),也要使用传统操作系统服务(文件、存储)。但现有智能体框架(AutoGen、LangChain 等)让智能体直接访问 LLM 与工具资源,带来三类问题:

  • 无调度导致资源独占:一个智能体可以淹没 LLM 请求,其他智能体只能等待;
  • 并发场景反复试错:提示词被转成张量加载进显存,直到触发 CUDA 显存上限异常再释放重试,严重拖慢吞吐;
  • 缺乏隔离与访问控制:直接暴露系统级资源带来安全隐患。

AIOS 的解法是把操作系统演进史(批处理 → 分时 → 多任务 → 模块化内核)的思想搬到智能体场景:LLM 被视作类似 CPU 核心的资源,由内核统一调度、隔离与恢复。与 MemGPT 等只做单点记忆管理的工作不同,AIOS 提供完整的内核抽象——这正是它与既有工作最本质的差异。

研究主线:从问题到结论

图 1:AIOS 论文的研究主线 —— 从并发瓶颈到内核化资源管理的完整推理链

基准/方法设计:三层架构与七模块内核

AIOS 采用经典的三层架构:

图 2:旅行智能体完成任务需要 LLM 服务(红)与 OS 服务(蓝)协同 —— AIOS 将两者统一纳入内核管理

  • 应用层:AIOS SDK 提供统一接口,既支持原生 agent 开发,也通过适配器接入 ReAct、Reflexion、AutoGen、Open-Interpreter、MetaGPT 五大框架;
  • 内核层:AIOS Kernel 含调度器、LLM Core、上下文管理、内存管理、存储管理、工具管理、访问管理七模块;
  • 硬件层:CPU/GPU/磁盘,AIOS 通过传统 OS 系统调用间接访问,不直接操作硬件。

核心机制是查询分解:智能体查询被拆成多个 AIOS 系统调用(syscall),由调度器分发到对应模块执行,实现并行与有序处理。

分类全景:AIOS 内核的七大模块

图 3:AIOS 内核七大模块 —— LLM 核心、调度、上下文、内存、存储、工具、访问管理

方法细节:系统调用与调度机制

图 4:AIOS 三层架构 —— 应用层通过 SDK 访问内核层,内核统一管理 LLM 核心、调度与各类资源

  • LLM Core:统一接口封装不同 LLM 端点(API/本地),视作"核心"便于调度与切换;
  • Agent Scheduler:RR/FIFO 策略调度系统调用,支持抢占式执行 + 上下文快照恢复;
  • Context Manager:长上下文生成中断时快照并恢复,防止长请求独占 LLM 核心;
  • Memory/Storage Manager:短期对话记忆与长期交互日志持久化分层管理;
  • Tool/Access Manager:工具加载与调用冲突消解、访问控制与用户干预协议。

图 5:Agent 查询分解为 AIOS 系统调用,由调度器按策略分发到各执行模块(访问类调用不经过调度器)

每个模块通过系统调用对外提供服务(如 memory_store、tool_call、context_snapshot),智能体经由 SDK 透明调用——与操作系统 syscall 同构,应用无需关心资源细节。

实验设计与结果

评测协议:LLM Core 用 GPT-4o-mini(API)+ Llama-3.1-8b / Mistral-7b(本地 fp16,单张 RTX A5000);默认 250 个智能体并发、RR 调度;成功率 SR% 为统一指标;覆盖 HumanEval(代码生成)、MINT-Code(多轮交互代码)、GAIA(通用助手工具调用)、SWE-Bench-Lite(软件工程修复)四基准。

主表:五个框架接入 AIOS 前后成功率(SR%,括号为相对无 AIOS 的提升)

框架 (w/ AIOS)HumanEvalMINTGAIASWE-Lite
ReAct50.6 (+1.8)30.1 (+0.7)7.3 (+1.8)4.3 (+0.4)
Reflexion51.8 (+1.2)33.8 (+1.4)7.8 (+1.1)5.1 (+0.4)
Autogen87.8 (0)42.5 (0)9.7 (+2.4)4.3 (0)
Open-Interpreter86.0 (+0.6)48.7 (+2.8)---5.1 (+0.4)
MetaGPT82.9 (0)41.8 (+0.7)---5.9 (0)

所有框架性能保持或提升,工具调用型基准 GAIA 提升最显著(最高 +2.4pp)。增益来自三机制:结构化 prompt 增强、工具调用参数预校验(正则)、冲突消解哈希表。

图 6:Llama-3.1-8b 上各框架归一化吞吐 —— AIOS 显著更高(Reflexion 达 2.1×)

扩展性实验:并发智能体从 250 增至 2000,总体执行时间与平均等待时间均近似线性增长,且与无 AIOS 的差距随并发数扩大持续拉大——高并发下优势更明显。

图 7:并发 agent 从 250 增至 2000 —— 总体执行时间与平均等待时间近似线性,AIOS 差距随并发扩大

附加实验:Mistral-7b 本地模型上重复吞吐/延迟实验趋势与 Llama 一致,确认效率收益与具体模型无关;FIFO 调度策略与默认 RR 差异可控。

图 8:Mistral-7b 上各框架归一化吞吐 —— AIOS 同样显著提升,验证跨模型普适性

结果对比总结

图 9:AIOS 结果对比总结 —— 吞吐 2.1×、GAIA +2.4pp、并发近似线性扩展

关键发现

Oral 信号分析:从创新模式视角看,AIOS 命中两个高 Oral 率模式——P6 重新表述为可解对象(n=79,Δ_OR=+2.9pp,Δ_OH=+7.1pp):把并发智能体共享 LLM 的难题重构为内核资源调度问题,LLM 视作类 CPU 核心,证据是 250→2000 并发近似线性扩展与 2.1× 吞吐;P11 分解并委托求解器(n=42,增长最快 τ=+6.3pp):查询分解为系统调用后由调度器委托专门模块执行,证据是 GAIA 最高 +2.4pp 且五框架性能无一回退。系统类贡献以可复用基础设施 + 大规模受控实验构成完整证据链。

  • 性能保持或提升:5 个框架 × 4 个基准全部 SR% 无回退,Open-Interpreter 的 MINT 提升 +2.8pp(45.9→48.7);
  • 吞吐最高 2.1 倍:Reflexion 框架在 Llama-3.1-8b 上执行加速最显著,源于避免显存试错;
  • GAIA 工具调用提升显著:AutoGen +2.4pp(7.3→9.7),得益于参数预校验与冲突消解;
  • 近似线性扩展:并发 250→2000,执行时间与等待时间线性增长,无 AIOS 差距随并发扩大;
  • 跨模型普适:Llama-3.1-8b 与 Mistral-7b 上吞吐/延迟收益一致;
  • 即插即用:SDK 适配器机制让 5 大框架接入零侵入。

局限性

  • 单 GPU 单模型串行:默认一次只处理一个请求,未覆盖多模型并行/分布式推理;
  • 调度策略简单:仅 RR/FIFO,未探索优先级、负载感知等更智能策略;
  • 访问控制基础:Access Manager 提供基础鉴权,安全与隐私保障仍待加强;
  • 覆盖有限:5 框架 × 4 基准,通用性需要更大生态验证。

作者明确的多 LLM 分布式资源管理、更智能调度与多智能体协作安全是未来方向。

常见问题(FAQ)

AIOS 和 AutoGen、LangChain 有什么区别?

AutoGen 等框架聚焦智能体编排逻辑,把 LLM 当外部 API 调用;AIOS 把 LLM 当作类似 CPU 核心的内核资源,统一调度、隔离与恢复,并可通过适配器让这些框架直接接入受益。

AIOS 如何提升并发吞吐?

核心是调度器避免"提示词装不上显存"的反复试错:请求被分解为系统调用统一排队,配合上下文快照实现抢占式执行,最高带来 2.1 倍吞吐提升。

AIOS 对智能体性能有损吗?

没有。四个基准 × 五个框架的成功率全部保持或提升,工具调用型基准 GAIA 最高 +2.4pp,性能增益来自 prompt 结构化增强与工具调用预校验。

AIOS 支持哪些智能体框架?

ReAct、Reflexion、AutoGen、Open-Interpreter、MetaGPT 五大框架均通过适配器接入,原生 agent 也可直接使用 AIOS SDK 开发。

AIOS 开源吗?

是的,代码在 GitHub agiresearch/AIOS 组织下开源,这是其作为可复用基础设施被社区广泛引用的基础。

参考链接

  • arXiv 论文页:https://arxiv.org/abs/2403.16971
  • 项目主页(GitHub):https://github.com/agiresearch/AIOS
  • ReAct(ICLR 2023):https://arxiv.org/abs/2210.03629
  • Reflexion(NeurIPS 2023):https://arxiv.org/abs/2303.11366
  • AutoGen(COLM 2024):https://arxiv.org/abs/2308.08155
  • MetaGPT(ICLR 2024):https://arxiv.org/abs/2308.00352

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

http://www.jsqmd.com/news/1405960/

相关文章:

  • 永城装修品牌 - 滚动商讯
  • 2026石家庄房屋漏水维修避坑指南|正规修缮与乱象对比,少花冤枉钱 - 筑宅安
  • 2026年8月北京同城废品回收实地测评|大兴区工业金属电器批量回收服务指南 - 超人防水
  • 零建模基础也能做!三步完成图片转3D模型,把照片变成侧光可见的浮雕
  • 2026博士论文学术争议规避,规范研究表述逻辑 - 艾德思Editsprings
  • Revit模型如何快速变身Web3D?Revit2GLTF导出GLTF完整指南
  • 从零入门游戏资源编辑器Harepacker-resurrected:一次跑通素材解包、AI高清化与地图搭建
  • 2026年8月最新消息:宁德移动阳光房品牌厂家阁楼采光通风差,智能电动天窗一键通风排烟?-慕轩建材 - 行业甄选汇
  • NVIDIA Profile Inspector 显卡调优实战手册:从零解锁驱动隐藏性能设置
  • 2026四川合规鹦鹉养殖行业发展趋势|四川合法鹦鹉养殖与源头厂家发展解析 - 滚动商讯
  • 录音又吵又糊?免费插件让你秒变AI音频处理高手
  • 2026向上走科技活动报名小程序系统
  • AI 张嘴就编?tri-true 的四道防线我全测了一遍
  • AndroidArchitectureBook避坑指南:10个Clean Architecture最常见错误与解决方案
  • 2026年8月上海徐汇区附近花店实测|本地鲜花布置配送服务真实体验 - 超人防水
  • 多品牌摄像头难以统一管理?一套国标28181视频监控平台完成接入与级联的全过程
  • 3步快速接入PingFangSC字体包:六字重中文排版的完整落地手册
  • 告别奥创中心:G-Helper完整指南,让华硕笔记本性能、风扇与电池尽在掌握
  • Wand-Enhancer实测:如何不花一分钱解锁Wand专业版全部功能
  • 3分钟快速配置洛雪音乐音源:免费听全平台无损音乐的完整指南
  • JetBrains 试用期重置终极指南:5 分钟用 ide-eval-resetter 免费续回 30 天
  • AI 新闻日报 - 2026年8月16日
  • 百度文库文档存不下来?一个开源脚本把免费存PDF的时间从半小时压到3分钟
  • 2026 年 8 月沈阳和平区手机回收门店实测|多家同城商家深度体验,高价回收当场结算上门回收怎么选 - 超人防水
  • 2026年8月北京同城废品回收实测 大兴区高价批量当场结算服务测评 - 超人防水
  • 麦芽AI:企业产研经验进入AI,第一步不是“什么都自动存”
  • Godot逆向工程实战:三步把编译后的PCK包还原成可编辑的完整项目
  • 2026 滁州中考生如何报名安徽建工技师学院?报名步骤、开设专业、招生条件等最新解读 - 小张zc
  • 2026博士论文学术体系搭建,构建完整研究框架 - 艾德思Editsprings
  • 微信聊天记录导出免费方案实测:从备份到年度报告,一个开源工具全搞定