当前位置: 首页 > news >正文

清华智谱开源发布ScaleCUA:可扩展的任务合成和在线强化学习 GUI Agent框架,9B模型刷新开源SOTA

一句话讲清楚👉🏻清华大学与 Z.AI 提出 ScaleCUA :用 VeriGen 在真实桌面容器里规模化合成可验证 GUI 任务,再配合前沿采样与视觉上下文切分,把开源计算机使用智能体做到 OSWorld 68.7%、 ScienceBoard 54.0%。

计算机使用智能体( Computer Use Agent , CUA )看屏幕截图、点鼠标敲键盘,想把「装主题、改表格、跨应用搬文件」这类桌面流程自动化。商业 Demo 已经能跑通;要继续往上推,研究侧更押可验证奖励的在线强化学习( RLVR :环境终态可被确定性函数打分,再用在线交互更新策略)。

论文里有个 47 步装 GNOME 主题的例子:逛主题站、下载解压、终端安装、再用gsettings切换。中间点错一次目录,后面几十步往往白烧。 GUI 强化学习难,首先是因为这种题通常只有指令和环境,没有数学题那种现成判题器

Figure 2 :训练后的 ScaleCUA 端到端完成 47 步跨应用任务:从浏览 gnome-look.org 、下载 Orchis 主题,到终端解压并用 gsettings 切换,直到环境裁判给出 score=1.0 。

第二个坑在训练本身。多轮截图又长又贵;同一题采一组轨迹做相对比较时,如果全成功或全失败,组内就学不到有效信号。若把每一步都拆成单独训练样本,样本数又会跟着交互轮数直线涨——用 条轨迹、平均每条 步估算,量级大约是 。

把「可验证任务能不能规模化」「采样是否有效」「能不能做大规模在线 RL 」「多轮训练是否高效」这四条拆开看,既往 GUI Agent 方法往往只覆盖其中一两项。 ScaleCUA 在表上四项都勾上了:

Table 1 :代表性 GUI Agent 方法在四条缩放维度上的对比; ScaleCUA 是唯一四项全覆盖的一行。

ScaleCUA 的做法是把「造可验证题」和「省着训」绑在同一条流水线上。 Qwen3.5-9B 版本 OSWorld 到68.7%(开源侧此前较强的 Kimi K2.5 为 63.3%, Claude Sonnet 4.5 为 62.9%), ScienceBoard 到54.0%。代码、模型与数据集已开源。

开源模型在 OSWorld 上的成功率对比: ScaleCUA ( 9B ) 68.7%,高于更大参数的若干开源基线。

同一训练流水线下,可验证合成任务规模扩大, OSWorld 成功率同步抬升。

框架:数据侧造裁判,训练侧盯能力边界

ScaleCUA 分三块。

VeriGen在 live Docker 桌面里迭代写出「指令 + 可执行裁判」。 Frontier Sampling 按每道题的实时成功率,把采样压到「半会不会」的难度区。 Visual Context Segmentation 只保留最近 张截图做视觉输入,文字历史不断档——避免 rollout 侧硬堆全部历史截图、训练侧又被超长多模态样本拖死。

流程分三阶段:先在 VeriGen 初期任务池上暖起来;收集 rollout 后再做轨迹引导合成(失败拆细、成功拼难);最后在精炼池上跑带前沿采样与滑动窗的在线 RL 。

ScaleCUA 总览:左端 VeriGen 并行造可验证任务,右端前沿采样 + 大规模 rollout ,中间用视觉上下文切分喂训练引擎。

VeriGen :在 Docker 里把 GUI 题写成可跑的裁判

可验证 GUI 任务的标准很硬:必须带确定性裁判,例如查文件是否存在、读浏览器状态、跑一段 Python ,根据终态打分,不靠人或大模型口头判。

VeriGen 用三个独立 Agent 闭环。 proposer 根据环境知识文档和容器接口起草题面与裁判; judger 做静态审查,看指令是否歧义、裁判逻辑是否自洽; checker 在容器里实际点选,读截图和无障碍树,检验目标是否可达、裁判是否给终态打对分。两边都过才留下,否则回灌下一轮。

「写得出」还不够适合 RL 。轨迹引导阶段会读模型在旧题上的成功率和逐步反馈:失败任务从最早偏题步切开,变成更短的子目标;成功任务在同应用内聚类,再把目标与裁判串成更难的多目标题。环境侧有一层共享探头( docker interaction probe ):合成 Agent 一律经这层接口取状态、下发动作,才能撑到 100+ 合成工人并发对 100+ 环境。论文报告产出24K+可验证候选,最终约 3K 条进入高质量 RL 池。

VeriGen 产出的可验证任务量相对既有桌面 CUA 方法高出约一个数量级。

RL 池加入轨迹引导合成任务后,训练过程中的任务级通过率更高。

人工抽查里,可执行裁判与专家标注在抽样轨迹上约 82.5% 一致;有无轨迹引导时, OSWorld 测试从 64.6% 提到 68.7%。完整流水线裁判可执行率 94.5%,去掉 LLM Judge 跌到 62.3%。独立审查和修复角色对「奖励函数能不能真跑」影响很大。

Frontier Sampling :优先抽成功率贴近五成的题

池子一大,均匀抽题很快浪费。像 GRPO 这类「同一题采多条轨迹、比相对好坏」的算法,若一组里全过或全挂,学不到信号。课程学习固定难度表,又跟不上「同一题过几天就从难变易」。

Frontier Sampling 给每道题维护成功率的指数滑动平均( EMA )。训练前先全库试探,丢掉过易或过难的题(例如成功率落在 之外)。之后每轮优先抽成功率贴近 50% 附近的题,并约留两成名额随便抽,免得采样盯死一小撮题。效果是采样会跟着能力边界滑:太容易的少抽,一时全挂的也少抽,主要押在模型「半会不会」的那一批。

Frontier Sampling 相对均匀采样、 DAPO 、课程学习,能在更长训练步数里维持更高的平均通过率。

Visual Context Segmentation :截图只留近窗,文字历史不断

GUI 轨迹有两种极端包装。整条当一个样本,截图堆满上下文,在线交互侧推理变慢;每一步单独切样本、只留末帧截图,训练条数又跟交互轮数一起涨。

Visual Context Segmentation 的直觉是:聊天文字全文保留,屏幕图只盯最近 张。图太多就先把当前这段存成一条训练样本,丢掉最早若干张,再继续滚。文字链路不断档,视觉 token 有上界;样本数大约从 收到 。

滑动窗切分示意:截图只保留最近若干帧,更早视觉丢掉;可训部分主要覆盖助手回复。

预先在窗口大小取 1 、 3 、 5 、 8 、 10 、 15 ,并在 2/4/8 节点规模上扫过;单局最多 50 步时, 取 5 到 8 对端到端步时最友好。相对「一步一切」的步进分解,滑动窗在实验设定下给出2.83×加速:策略更新段从 485s 降到 154s ,参考模型前向从 241s 降到 88s ,单步总计从 750s 到 265s 。

滑动窗相对步进分解的分阶段耗时:端到端约 2.83 倍加速。

加速没有明显伤正确率。 OSWorld 上单次采样通过率( pass@1 )在 约 58.9%,高于 的 56.4% 和 的 56.8%。个案呈倒 U 形:把若干 Chrome 博文另存为 PDF 并按标题命名时, 八次里过七次; 容易忘掉命名约定; 又被早期无关界面拖进循环。中等窗口更像是在「记得住目标」和「不被旧截图干扰」之间取折中。

不同视觉窗口 下的 pass@k :中等窗口(约 3–5 )最好,窗口过大并不自动更好。

主结果:开源桌面与科学软件两条线

训练走在线强化学习:一边大规模采样轨迹,一边用相对比较类算法( GRPO 一族)更新策略。骨干覆盖 GLM-4.6V-Flash 、 Qwen3-VL-8B-Thinking 、 Qwen3.5-9B ;评测看桌面开放任务 OSWorld 和专业科研软件 ScienceBoard 。

OSWorld 分域成功率。 ScaleCUA-Qwen3.5-9B 总体 68.7%; Professional 89.5%、 Workflow 48.1%,长流程相关子域抬得更明显。

Qwen3.5-9B 从基座 41.8% 到 68.7%,跳了 26.9 个百分点; GLM 与 Qwen3-VL 骨干上也是同向抬升。读这个数字时要连边界一起记:可验证任务池扩起来之后, 8B–9B 级可以上桌面公开榜,但仍锁在 Ubuntu 、单局大约 50 步上限里。

ScienceBoard 覆盖符号计算、分子可视化、 GIS 、 Lean 证明、天文模拟、 TeX 写作等。 ScaleCUA-Qwen3.5-9B 总体 54.0%,略高于 Claude Opus 4.6 的 52.7%;文档写作域 86.7%, Lean 证明 19.0%(论文列出的闭源对比最高不超过 15.4%)。办公 GUI 之外,专业科研软件也能配上可跑裁判,这是 VeriGen 更值得记的一点。

模型总体文档Lean
Claude Opus 4.652.787.515.4
ScaleCUA-9B54.086.719.0

消融对照也很直接。完整 ScaleCUA 68.7%;去掉 VeriGen 回到基座 43.9%;去掉前沿采样 63.7%;去掉视觉上下文切分 62.2%。三块各自掉分,说明没有哪一块是单纯加戏。

边界

单局交互上限 50 步,覆盖多数 OSWorld / ScienceBoard 题,但代表不了超长流程。评测环境是 Ubuntu 桌面, Windows / macOS 应用栈没有直接结论。验证主要落在 8B–9B 级视觉语言模型,更大或更小规模的行为还缺刻画。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

http://www.jsqmd.com/news/1301767/

相关文章:

  • 大语言模型选型指南:从技术原理到生产部署的实践路径
  • 祈盟游戏运营平台?业务范围、合作流程与适用团队说明
  • ComfyUI LLM Party终极指南:三步构建你的AI智能工作流
  • 1688货源对接抖店一件代发|密文下单+AI违规预检完整实操流程(2026合规标准版) - 电商分享
  • Python打字游戏开发:从零实现GUI打字速度练习工具
  • STM32定时器同步触发启动:硬件级精准时序控制实战指南
  • 无线动能开关|户外露天快递驿站雨棚照明免布线控制方案
  • STM32F407嵌入式开发实战:从Cortex-M4内核到以太网通信全解析
  • 告别游戏限制!3步解锁Wand-Enhancer专业功能完整体验
  • 全球DC/RF探针台市场前景调研分析及投资建议研究报告2026年版
  • GEZHI(格致):面向社科研究的智能体架构
  • 信息系统的五大组成要素
  • 观察五年,铝艺大门的几个真实现状
  • SIOC测试是什么?亚马逊6A测试卖家必看的包装闯关全解
  • 如何快速掌握Akagi:你的智能麻将AI教练从入门到精通完整指南
  • 【单片机毕业设计推荐】基于 STM32/51 单片机的智能坐姿矫正护眼补光系统设计与实现 基于 STM32/51 单片机的人体感应智能台灯监测控制系统设计(021304)
  • 语雀文档批量导出终极方案:一键迁移你的技术资产
  • 假面骑士诺克斯驱动器:形态切换与音效灯光玩法全解析
  • gogin ErrorMiddleware的使用错误
  • tri-state(三态)介绍(状态设计模式,一个值或结果可以有三种明确的状态:成功(Success)、失败(Failure)、进行中/未知/未完成(Pending/Unknown))
  • WSA-Windows-10完整指南:在Windows 10上部署Android子系统的深度解析与实战教程
  • 从人治到法治,长松咨询详解民营企业的组织系统搭建路径 - 产品推荐官
  • 加急办理公证流程怎么走?加急办理公证支持远程申办吗?
  • Windows平台Swoole-CLI安装与性能优化指南
  • 15兆瓦海上风机开源模型:从入门到精通的完整指南
  • 7 月总结:Go 与 Node.js 后端架构的实践复盘——技术选型的最终答案
  • 终极指南:如何使用applera1n免费绕过iOS 15-16设备激活锁
  • 【单片机毕业设计推荐】基于 STM32/51 单片机的红外循迹超声波避障智能小车设计与实现 基于 STM32/51 单片机的多模式循迹避障智能小车控制系统设计(022204)
  • 2026 开封装修口碑榜单|深耕10年,开封鸿艺装饰凭精工与诚信服务收获开封业主一致好评 - 推途云
  • C#关键字