AtumAI:面向数据中心控制平面策略的规范化智能体生成框架
AtumAI:面向数据中心控制平面策略的规范化智能体生成框架
论文arXiv编号:2608.02569v1 | 发布时间:2026-08-03 | 开源协议:CC BY-NC-SA 4.0
摘要
数据中心的运行效率完全依赖控制平面:即调度硬件资源的各类管理策略。但人工设计控制平面策略的难度正持续加剧:软硬件栈规模扩张速度远超工程师的理解上限;优化空间庞大、变量高度耦合,专家极易错过性能优化机会;单套候选策略的原型验证往往需要数月周期。
现有开箱即用的智能体AI系统虽可自动化策略搜索,但存在三大核心缺陷:
- 非规范化:无结构化、可检索的问题描述,硬约束无法得到强制保证,搜索过程缺少可利用的固定结构;
- 无迁移能力:每个任务从零求解,跨场景学到的经验无法复用;
- 非系统化搜索:仅依靠大模型生成候选方案,探索空间狭窄、存在模型偏见,极易收敛到局部最优。
本文提出AtumAI框架,通过智能体AI自动生成数据中心控制平面策略,同时补齐上述三大短板。工程师仅需自然语言描述优化目标,AtumAI即可自主完成候选策略生成、仿真测试、迭代调优直至产出满足全部约束的可用方案。框架由两大核心组件协同工作:
- 数据中心任务编译器:将自然语言需求编译为可机器校验、可检索的形式化规约,规约绑定真实业务负载与硬件平台采集数据,包含优化目标、决策变量、硬约束、评测方案;
- 进化式设计迭代环:基于规约开展全域搜索,通过扩散模型探索差异化策略结构、进化算法调参、代理模型预过滤低价值候选,大幅降低高精度仿真的计算开销。
在三类完全不同的控制平面任务(负载部署、资源弹性扩缩、功耗管理)上完成评测:AtumAI生成的策略性能全面超越人工专家基线;单套统一流水线可适配所有数据中心优化场景,无需针对任务定制开发。
| 现有系统缺失能力 | 带来的问题 | AtumAI解决方案 |
|---|---|---|
| 规范化形式化描述 | 无绑定真实负载的结构化问题定义,硬约束无法保证 | 任务编译器生成绑定业务/硬件的标准化可检索中间表示IR |
| 知识迁移机制 | 每个任务独立开发,经验无法复用 | 统一IR+共享优化算子库,跨任务蒸馏知识可复用 |
| 全域系统化搜索 | 仅依赖LLM生成方案,搜索范围窄、易陷入局部最优 | 扩散模型(结构探索)+进化算法(参数调优)+代理预过滤三重搜索 |
1 引言
数据中心支撑微服务、网页检索、存储、数据分析、大模型训练推理全场景业务,其成本、吞吐、稳定性完全由控制平面决定。控制平面包含一系列调度策略:通过负载部署、缓存、流量路由榨取硬件算力,或直接调控服务器功耗。
每类策略都存在多目标权衡(服务器利用率、尾延迟、成本、功耗)与硬性约束(SLA服务指标、硬件容量、功耗上限)。随着硬件异构性、业务负载持续迭代,策略的优化空间呈组合爆炸式增长。传统专家手工设计、调优模式已跟不上业务迭代速度,带来海量资源浪费。
智能体AI(LLM驱动多步执行系统)可自主理解目标、调用工具、执行代码,正在革新软件工程与科学计算领域。本文提出:智能体可大幅提升数据中心控制平面策略研发效率,扩充人类可探索的优化空间,让工程师聚焦问题定义与结果评判,而非手工调参。
但直接使用通用智能体解决调度优化存在三大致命短板:
- 无形式化规约:目标、约束隐式写在Prompt与自定义适应度函数中,未绑定真实业务数据;优化过程缺少结构化边界,生产环境极易出现仿真达标但线上失效的策略;
- 无迁移复用:每个任务都需要从零搭建脚手架,无法复用过往调度经验;
- 搜索范围受限:全部候选方案由LLM生成,继承模型固有偏见,仅能探索极小一片设计空间,快速收敛局部最优。
本文核心工作
本文设计AtumAI规范化智能体框架:工程师自然语言描述需求,框架全自动生成、评测、迭代验证控制平面策略,支持负载、硬件持续变化下的数据中心自演化。
框架核心两大创新组件:
- 数据中心任务编译器:将需求编译为标准化、可校验中间表示IR,实现问题形式化;配套共享优化算子库,实现跨任务知识迁移;
- 进化式设计迭代环:突破LLM单一生成局限,扩散模型探索策略结构、进化算法优化参数、代理模型提前筛除劣质方案,实现系统化全域搜索。
三大评测场景效果
- 负载部署:对比人工基线,部署成功率提升17%,调度吞吐提升8%;
- 资源弹性扩缩:资源使用成本降低24%,SLA违规率仅1.3%;
- 功耗管理:集群功耗下降21%,业务吞吐同步提升17%。
三类场景共用同一套Atum流水线,无需定制改造;策略设计周期从数月压缩至数小时,跨领域调度经验可完全复用。
本文四大核心贡献
- 提出AtumAI框架,实现自然语言需求到可用数据中心控制策略的全自动智能体流水线;
- 设计数据中心任务编译器:将自然语言意图转化绑定真实负载、硬件的可检索、机器校验IR规约;
- 提出进化式设计迭代环:融合扩散结构搜索、进化参数调优、代理预过滤,突破LLM搜索边界;
- 在负载部署、资源扩缩、功耗管理三大典型数据中心任务完成全量实验,验证框架通用性与性能优势。
2 背景与动机
2.1 数据中心控制平面
控制平面是管理服务器、CPU、内存、功耗等硬件资源的软件集合,由多套独立策略组成,每套策略包含决策变量、优化目标、硬约束、业务评测负载四大统一要素。本文全程使用三类典型策略作为示例:
- 负载部署策略(Borg/Protean等集群调度器)
决策每个虚拟机/服务运行节点,权衡服务器利用率、部署成功率、业务尾延迟、调度器自身吞吐;约束为节点CPU/内存容量、服务共存限制。传统方案依赖数十年手工启发式规则,负载迭代后性能持续衰减。 - 资源弹性扩缩策略(Autopilot自动扩缩容系统)
动态调整服务CPU、内存配额,权衡资源开销与流量峰值下SLA违规风险;结合时序预测、反馈控制与人工安全阈值。 - 集群功耗管理(Dynamo、Thunderbolt)
统一分配整机功耗预算,通过功耗超配提升硬件利用率,约束为单服务精度下限、整机功耗上限。
人工策略的固有缺陷
软硬件规模持续扩张,策略优化空间组合爆炸;单套候选策略原型、仿真、上线验证周期长达数月;策略上线后随负载、硬件迭代性能持续退化,无法自适应变化。
亟需自动化方案:输入高层优化目标,全自动生成适配当前集群调度策略。该方案需要两大能力:
- 将自然语言意图转化绑定真实集群硬件、负载的精准数学规约;
- 大范围搜索优质策略,不局限于人类专家的启发式思路。智能体AI为上述能力提供落地路径。
2.2 智能体系统与现有相关工作
(1)传统机器学习调度优化
LLM智能体出现前,各类独立ML模型被用于单一场景优化(分支预测、缓存替换、芯片布局、资源扩缩),但每个场景都需要独立定制模型与训练流水线,无法跨任务复用。
(2)LLM代码生成、软件智能体
MetaGPT、SWE-agent等多智能体框架通过测试反馈完成代码纠错,但仅聚焦功能正确性;ECO-LLM基于反模式重构代码,仅面向狭义性能优化,无法处理多约束数据中心调度问题。
(3)内核/算子智能进化框架
KernelEvolve、AI CUDA Engineer等工具迭代优化计算内核,仅单目标性能调优;而数据中心策略存在多冲突目标+大量硬性约束,无法直接复用。
(4)LLM驱动进化搜索(AlphaEvolve、SkyDiscover)
通过LLM变异代码、适应度筛选迭代,但存在两大致命局限:
- 所有候选均由LLM生成,搜索空间狭窄,容易局部最优;
- 每个新任务需要人工编写适应度函数、搭建仿真脚手架,把自然需求转为约束优化的专家步骤无法自动化。
现有方案三大缺失
无形式化绑定业务的规约、无跨任务知识迁移、仅LLM单一搜索源;本文AtumAI完整补齐三点。
3 AtumAI整体架构
AtumAI单条完整流水线:自然语言需求 → 数据中心任务编译器 → 可执行搜索问题 → 进化式设计迭代环 → 验证通过的最优控制策略
两大核心模块:
- 前端:数据中心任务编译器:将非正式意图形式化为统一中间表示IR,实现知识可迁移,最终输出可执行搜索任务;
- 后端:进化式设计迭代环:系统化全域搜索,输出满足全部IR约束的最优策略;
迭代环输出评测反馈回传编译器,形成闭环持续优化。
运行示例(贯穿全文案例)
需求:在不提升延迟的前提下,最小化服务资源占用(资源扩缩场景,固定服务器硬件、附带历史流量追踪,p99延迟≤50ms硬SLA约束)
编译器自动将模糊需求转化完整形式IR规约,迭代环全域搜索扩缩控制器策略。
4 数据中心任务编译器
现有智能体将问题定义藏在Prompt、手写适应度函数中,目标约束隐式表达,经验无法复用。编译器通过三大设计解决该问题:
- 形式化:自然语言意图转为显式IR规约(决策变量、目标、约束、评测方法);
- 可迁移:共享优化算子库,单任务学到的调度逻辑跨场景复用;
- 系统化搜索前置:将IR规约转化结构清晰的可执行优化问题。
编译器三阶段执行流程:
- 意图提升:自然语言需求转为标准化形式IR;
- 算子投射:从共享库选取适配优化算子,绑定当前场景变量;
- 下编译:IR规约输出完整可执行搜索任务(参数空间、生成器、代理模型、高精度仿真器)。
4.1 意图提升:自然语言转形式规约
输入:工程师文字需求 + 可选工件(负载追踪、部署配置、历史策略)
输出:基础未绑定IR规约,分两步执行
- 意图解析
智能体识别调度决策、优化目标、隐含硬约束;规则校验器(非LLM)确定性校验规约完整性,缺失信息自动反问工程师;空白值从领域标准模板填充,保证简短需求也能生成完整规约。校验器强制IR类型规范:变量定义域、约束可观测、单位统一,拒绝非法规约。 - 负载与硬件特征挖掘
自动拉取集群真实流量、硬件上限数据绑定IR,优化搜索不再基于抽象假设,全部贴合真实线上环境。
4.2 中间表示IR(统一标准规约)
所有数据中心调度任务共用同一份IR结构,作为编译器与迭代环的标准接口,包含六大核心字段,示例如下:
task_type:resource scaling# 决策变量:控制器可调参数decision_variables:replicas:int in[1,12]cpu_limit:float in[0.5,4.0]# CPU核心数mem_limit:float in[0.5,8.0]# 内存GB# 优化目标(支持多目标优先级)objectives:minimize allocated_resources# 优先级1.0# 硬性约束(绝对不可违反)constraints:p99_latency_ms \leq 50 cooldown \geq 1 interval# 评测规范evaluation:simulator = autoscaling_evaluator trace = mined_load(service) metrics ={p99_latency,resources,slo_violation_rate}# 执行预算(策略推理时延上限)execution_budget:class=loose interval=30s mode=full# 绑定真实集群特征characterization:load profile,latency-vs-alloc curve,platform limits- 决策变量:策略可调整参数与取值空间;
- 目标:多优化方向+优先级,不强制合并为单一标量;
- 硬约束:任何候选策略违反即直接淘汰;
- 评测方法:固定仿真器、负载追踪、观测指标,保证所有方案可复现对比;
- 执行预算:策略在线推理最大时延,约束策略复杂度;
- 特征绑定:自动挖掘的集群负载、硬件数据。
4.3 可迁移控制知识:共享优化算子库
形式IR描述优化目标,但不包含实现调度逻辑的方法;编译器维护全局共享优化算子库,实现跨任务知识迁移。
算子库结构
单个优化算子(抽象调度逻辑)包含4部分:适用条件、需满足目标、领域适配投射公式、历史置信度。
示例算子:突发流量预警防护
- 抽象公式:压力 = f(流量趋势, 队列深度, SLA风险)
- 适配负载部署场景:转化为主机剩余容量打分公式
- 适配资源扩缩场景:转化为扩容触发压力指标
算子筛选三步流程
- 过滤:仅保留匹配IR适用条件算子;
- 打分:算子描述与IR目标匹配度排序;
- 覆盖贪心选择:最小算子集合完整覆盖全部IR约束/目标。
算子投射机制
抽象公式绑定当前场景真实观测指标,生成领域专属调度项;同一套预警算子无需重新开发,直接复用在部署、扩缩两类完全不同任务。
Figure3:抽象算子跨领域投射示例4.4 下编译:IR转为可执行搜索任务
输入IR与筛选后的优化算子,输出四件套搜索工件:
- 参数空间:所有算子阈值、变量取值范围;
- 候选生成器:基于算子库初始化初始策略;
- 代理预评估模型:低成本预测策略指标,减少高精度仿真次数;
- 高精度仿真器:基于挖掘的真实负载搭建评测环境。
评估栈设计
代理模型:编译器根据IR指标、负载特征自动构建,迭代过程持续重训练,提前筛除劣质候选;
仿真器:扩展IR所需观测指标,完整复刻线上集群环境。
完整编译算法(算法1)
输入:自然语言需求r,目标领域d,算子库L 1. ir = Raise(r) # 意图提升,挖掘负载硬件特征 2. 标准化+校验IR,空白填充领域模板 3. P = SelectPasses(ir, L) # 筛选适配优化算子 4. 遍历所有算子p∈P: tp = Project(p, d) # 投射为领域专属公式 5. 遍历IR所需但无匹配算子的目标: 生成安全DSL原语,校验硬件是否支持 6. prob = Bind(ir, {tp}) # 绑定生成完整搜索任务 7. 根据IR执行预算裁剪搜索规模 8. 返回可执行搜索任务prob4.5 开放世界扩展机制
算子库无法覆盖全部全新调度逻辑时,编译器生成安全公式DSL原语(仅基础四则运算,无可执行代码);若仿真器缺少所需观测指标,标记能力缺口,后续迭代完善。
4.6 证据驱动算子库演化
每次迭代的评测结果更新算子置信度,负收益算子自动降低筛选优先级;每完成一类任务,新增算子入库,后续所有任务均可复用,知识持续累积。
5 进化式设计迭代环
编译器输出搜索任务后,迭代环完成全域系统化搜索;单LLM仅能探索局部空间,迭代环通过结构扩散+参数进化双向拓展候选范围,搭配代理预过滤降低仿真开销。
单次迭代5阶段:生成种子 → 结构/参数扩展 → 代理过滤 → 高精度仿真验证 → 反馈迭代。
5.1 Generate:种子策略生成
迭代首轮初始化种子:LLM结合算子库、历史成功/失败案例生成基础可行策略;不限制单一模型,多条种子并行生成,错误方案不阻塞流程。
5.2 Expand:双向全域扩展
基于少量种子生成海量差异化候选,分两条扩展路径:
- 结构扩散(离散扩散模型)
掩码策略局部模块(打分逻辑、安全阈值),仅重生成掩码区域,保留有效逻辑;约束编辑边界,仅修改指定片段,避免破坏已有可行逻辑;可融合多条最优策略的优势结构。实现层面用LLM完成掩码重写,拒绝越界修改。 - 参数进化算法
对同一策略结构,高斯扰动阈值、窗口、容量等数值参数;搭配模拟退火局部寻优,允许临时变差跳出局部最优;全部参数调整通过代理模型预打分,不占用高精度仿真资源。
5.3 Filter:代理模型低成本预筛选
扩展后候选数量巨大,无法全部仿真;代理模型快速预测所有指标(带置信区间),基于探索感知打分筛选高价值方案。
打分规则
综合预测收益、不确定性奖励、失败修复增益、新颖度,淘汰重复劣质方案;配额制预留小众、高不确定候选,避免最优方案被过滤。
代理模型实现
高斯过程+树集成融合回归器,输入策略结构特征、负载场景,输出多指标预测;每轮仿真数据增量重训练,预测精度持续提升。
5.4 评估与校验
过滤后少量候选送入全量高精度仿真,覆盖稳态、突发、碎片多类负载场景,避免策略过拟合单一流量;强制校验全部IR硬约束,只要一项违规直接淘汰;持续校验代理预测准确度,防止过滤失效。
5.5 反馈与迭代
仿真结果生成结构化反馈:约束违规场景、最优对比样本;反馈指导下一轮种子生成、扩散掩码选取;本轮最优/最差策略存入算子库作为正负样本,跨任务复用经验。
单次迭代完整算法(算法2)
输入:搜索任务S,上轮最优父策略P,代理模型M,历史反馈B,算子库L 1. seeds = Generate(S, L, B) # 算子库引导生成种子 2. cand = Diffuse(P∪seeds) ∪ Mutate(P∪seeds) ∪ Anneal(P∪seeds) 3. pool = P ∪ seeds ∪ cand 4. ranked = Rank(pool, M) # 代理不确定性打分排序 5. filter = Select(ranked) # 配额筛选少量候选 6. rows = Simulate(filter) # 多负载高精度仿真,剔除违规方案 7. M = Refit(M) # 增量重训练代理模型 8. P = ParetoParents(rows) # 帕累托最优作为下轮父策略 9. B = Failures(rows) # 记录约束违规反馈 10. 更新算子库,存入本轮最优/最差策略 11. 返回本轮验证通过最优策略6 多场景案例实验
三大独立数据中心调度任务:负载部署、资源弹性扩缩、功耗管理;每个场景人工专家基线为线上成熟调度系统;评测指标归一化基线分数=1.0;迭代环默认使用Claude Opus 4.8,同时测试多款LLM鲁棒性。
6.1 场景1:虚拟机负载部署
任务定义
90台服务器集群,Azure真实VM流量追踪;优化目标:最大化部署成功率、调度吞吐,降低CPU热点;硬约束:CPU/内存容量、服务共存隔离;基线为工业界Best-Fit装箱调度器。
评测指标VMScore = 0.5部署成功率 + 0.2调度吞吐 + 0.2 P50热点惩罚 + 0.1 P99热点惩罚
实验结果
AtumAI综合得分1.13倍基线:部署成功率+17%,调度吞吐+8%,热点负载无恶化。
核心创新策略
- 谐波CPU/内存剩余容量打分,预留未来部署空间;
- 拓扑分组筛选主机,大幅降低单轮调度计算开销;
消融结论
仅LLM仅1.01倍;增加扩散+进化至1.05;完整反馈闭环提升至1.13,反馈是核心增益来源;更换Gemini等其他LLM依旧稳定超越基线。
Figure6 负载部署实验曲线(得分迭代、消融、LLM敏感性)6.2 场景2:服务资源弹性扩缩
任务定义
100微服务共享30节点,阿里真实多模式流量(稳态/突发/趋势);目标:最小分配资源,硬约束p99延迟SLO;基线为阈值式被动扩缩控制器。
指标:0.5 SLA质量 + 0.5资源成本,归一化基线
实验结果
综合得分1.27倍基线,资源开销降低24%,SLA违规率仅1.3%。
核心创新策略
区分扩容/缩容预测窗口,高风险服务优先分配资源,低压力场景缩容避免震荡。
消融
纯LLM 1.16,扩散进化1.21,完整反馈闭环1.27;多款大模型均稳定1.20以上,鲁棒性强。
Figure7 资源扩缩实验图表6.3 场景3:LLM推理集群功耗管理
任务定义
960服务器大模型推理集群,Azure线上两周流量;目标:同等功耗下提升吞吐;硬约束单服务精度≥0.9;基线为固定大模型高功耗调度策略。
指标:0.4功耗优化 + 0.3精度 + 0.2吞吐
实验结果
综合得分1.31倍基线,功耗下降21%,吞吐提升17%,所有服务精度达标。
核心策略
差异化模型尺寸分配,低精度负载使用小模型,功耗导向流量路由。
消融
仅LLM等于基线;结构扩散提升至1.14;完整迭代环1.31;轻量化LLM依旧可达1.28倍。
Figure8 功耗管理实验图表6.4 数据中心任务编译器价值消融实验
设置6组对比:仅LLM、手写IR、IR+人工提示、无知识迁移完整编译器、单轮编译器、完整Atum编译器。
- 纯LLM:无合法满足约束策略,得分0;
- 手写IR:仅82%-93%完整系统性能;
- IR+提示:92%-96%;
- 关闭算子知识迁移:性能下降3.6%-4%;
- 单轮编译器不迭代优化:性能下降1.2%-3.2%;
结论自动挖掘负载硬件+跨任务算子迁移是Atum核心收益来源,仅靠LLM或人工规约无法产出线上可用策略。
7 结论
人工设计数据中心控制平面策略难以匹配软硬件迭代速度;现有通用智能体存在非形式化、无迁移、搜索范围窄三大缺陷。
本文提出AtumAI:
- 数据中心任务编译器将自然语言需求转为绑定真实业务的形式化IR,实现跨任务调度知识迁移;
- 进化式设计迭代环融合扩散结构搜索、进化调参、代理预过滤,实现全域系统化策略搜索;
在负载部署、资源扩缩、功耗管理三类典型数据中心任务验证,统一流水线生成策略全面超越人工专家基线,将数月策略研发周期压缩至数小时。未来可基于Atum构建持续自适应、全自动演化的数据中心调度系统。
论文资源链接
- 论文HTML原文:https://arxiv.org/html/2608.02569v1
- arXiv论文PDF:https://arxiv.org/pdf/2608.02569v1
- 配套仿真测试工具:VLMEvalKit同类数据中心评测框架(文中提及)
- 实验负载数据集:Azure Public Dataset V2、阿里微服务追踪数据集(开源下载地址见参考文献)
