arXiv 2607.11185v1 · 发布 2026-07-13

ScaleCUA:通过可验证任务合成与高效在线强化学习扩展计算机使用智能体

SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL

AUTHORS Bowen Lv, Xiao Liu, Yanyu Ren, Hanyu Lai, Bohao Jing, Hanchen Zhang, Yanxiao Zhao, Shuntian Yao, Jie Tang, Yuxiao Dong
EVIDENCE 面向计算机使用智能体的在线强化学习及可验证奖励
SCORE 0.9
GENERATED 2026-07-20 16:34:35 UTC

📝 TLDR

面向计算机使用智能体的在线强化学习受可验证数据稀缺与训练效率低下的双重制约。本文提出 ScaleCUA 框架,基于 Docker 交互与多智能体反馈的 VeriGen 流水线合成 24K+ 可验证任务,结合 Frontier Sampling 优化样本分配与 Visual Context Segmentation 加速训练。系统最终在 OSWorld 与 ScienceBoard 上分别取得 68.7% 与 54.0%,刷新开源 CUA 性能上限。

🧭 速览

动机

在线强化学习是推动计算机使用智能体扩展的关键路径,但可验证任务稀缺与训练开销过高制约其规模化。

方法

ScaleCUA 通过 VeriGen 多智能体流水线合成 24K+ 可验证任务,采用 Frontier Sampling 聚焦学习前沿任务,并以滑窗式视觉上下文分割实现 2.83× 训练加速。

结果

在 OSWorld 取得 68.7%、ScienceBoard 取得 54.0%,刷新开源计算机使用智能体的性能纪录。

结论

证明任务合成与高效 RL 训练协同可有效扩展开源 CUA 能力边界,确立新 SOTA。

📊 论文图表(共 11 张)

展开查看 11 张图

TL;DR

ScaleCUA 针对计算机使用智能体(CUA)在线强化学习中可验证数据稀缺与训练效率低下的双重瓶颈,提出了一套从任务合成到训练加速的完整方案。通过 VeriGen 流水线生成 24K+ 可验证任务,结合 Frontier Sampling 的智能样本分配与 Visual Context Segmentation 的上下文压缩,最终在 OSWorld 和 ScienceBoard 上分别达到 68.7% 与 54.0%,刷新开源 CUA 性能上限。

研究背景与动机

计算机使用智能体(Computer Use Agents,CUA)是一类能够通过视觉感知和 GUI 操作来自动化复杂数字工作流的人工智能系统。与传统的命令行交互不同,CUA 需要理解屏幕上的视觉元素、推断用户界面的布局逻辑,并生成点击、输入、滚动等操作序列。这种「看屏幕、做操作」的范式使得 CUA 能够适配几乎任何现代软件界面——从浏览器到桌面应用,从文档编辑器到数据分析工具。

在 CUA 的能力扩展路径上,在线强化学习与可验证奖励(RLVR)被广泛认为是最具潜力的方向之一。RLVR 的核心思想是:为智能体定义清晰的任务目标(如「在浏览器中完成一次订票」),设计可自动评判的奖励函数(如检查最终页面状态),然后让智能体在环境中自主探索并从奖励信号中学习。这种范式避免了人类标注的依赖,理论上可以通过更多的计算资源持续扩展能力。

然而,RLVR 在 CUA 场景中面临两个相互关联的根本性障碍。首先是[[可验证数据]]的极度稀缺:构建一个可验证任务需要同时满足三个条件——任务描述清晰无歧义、环境状态可控、奖励函数能够准确判定成功。大多数现有数据集要么缺少可验证性(如仅有任务描述而无评判标准),要么规模太小难以支撑大规模 RL 训练。其次,即便有了足够的可验证数据,RL 训练本身的效率问题也不容忽视:CUA 的输入是高维视频流、输出是细粒度的操作序列,单次交互的计算开销极大,而强化学习的样本效率本就偏低,两者叠加使得训练成本迅速膨胀。

ScaleCUA 的核心动机正是同时解决这两条链路上的瓶颈:既要「造出足够多的可验证任务」,也要「让 RL 训练跑得更快更聪明」。

方法

ScaleCUA 框架在数据层面引入了 VeriGen 流水线,在训练层面提出了 Frontier SamplingVisual Context Segmentation 两个协同工作的机制。三个组件分别对应数据生成、样本分配和训练加速三个关键环节。

VeriGen:端到端生成可验证 RL 任务

传统的数据集构建往往依赖人工设计任务和奖励函数,效率低下且难以 scale。VeriGen 的核心思路是通过「构建—验证—反馈」的闭环,让多个智能体协作自动生成高质量的可验证任务。

具体而言,VeriGen 运行在 Docker 容器化的环境中,利用容器提供的隔离性和可重现性来保障任务的环境一致性。流水线分为三个阶段:第一阶段是任务提议,多个「提议智能体」在模拟环境中探索可能的操作序列,生成候选任务描述;第二阶段是奖励验证,为每个候选任务自动构建奖励函数——这一步骤通过结构化模板与 LLM 辅助相结合的方式实现,保证奖励函数能够可靠地判定任务是否完成;第三阶段是多智能体反馈循环,多个「验证智能体」实际执行这些任务,检测奖励函数是否会漏判成功或误判失败,只有通过反馈验证的任务才会进入最终数据集。

为了实现大规模并行,VeriGen 设计了共享的 Docker 交互探针(probe)机制,允许 100+ 并发智能体工作进程同时与同一组环境实例交互,大幅提升了任务生成吞吐量。最终,VeriGen 生成了 24K+ 个可验证任务,其中近 3K 个被筛选为高质量 RL 训练任务。

Frontier Sampling:智能分配 rollout 到学习前沿

有了足够的可验证任务,下一个问题是:如何高效地分配有限的 rollout 计算预算?传统的均匀采样会让智能体在已经掌握的任务上浪费大量探索资源,而在尚未理解的任务上投入不足。Frontier Sampling 提出了一个能力感知的采样策略。

该方法为每个任务维护一个「能力状态」估计:智能体在该任务上的成功率随训练逐渐提升,Frontier Sampling 追踪每个任务的当前成功率曲线,并识别出「当前学习前沿」——即成功率处于中等水平、继续探索能够带来最大能力提升的任务子集。采样概率被动态调整:成功率过低(几乎必然失败)的任务和成功率过高(几乎必然成功)的任务都会被降低采样权重,而处于「可学区间」的任务获得更多 rollout 机会。

这种设计的直觉在于:RL 的学习信号最丰富的地方恰恰是「努力一下能成功、不努力就会失败」的边界区域。Frontier Sampling 将这一直觉系统化为可计算的采样策略。

Visual Context Segmentation:压缩视觉上下文以加速训练

CUA 的训练面临一个独特的工程挑战:每次交互的输入是屏幕截图或视频帧序列,输出是操作指令。在 rollout 阶段,模型需要「看」一系列屏幕画面来做决策;在训练阶段,这些画面及其对应的动作和奖励需要打包成训练样本。

一个朴素的做法是将每一步的屏幕截图与操作配对,形成逐步分解的训练样本。但这样做会导致训练样本数量爆炸——一个长 horizon 任务可能包含数十步操作,每步都需要存储和处理的视觉上下文迅速膨胀。Visual Context Segmentation 提出了一个滑动窗口机制:对最近 步的视觉上下文进行分段压缩,将窗口内的视觉信息聚合为一个紧凑的表示,然后与窗口末端的操作配对作为训练样本。

这个设计的巧妙之处在于它同时降低了两方面的压力:减少了每个训练样本的视觉 token 数量(降低训练引擎的 GPU 显存占用),也减少了需要处理的样本总数(降低 I/O 和预处理的 overhead)。论文报告这一机制相较于逐步分解实现了 2.83 倍的训练加速。

实验与结果

ScaleCUA 的评估在两个主流的计算机使用智能体 benchmark 上进行:OSWorld 和 ScienceBoard。前者覆盖操作系统级别的多步骤任务,后者聚焦科学领域的界面操作,两者共同提供了对 CUA 综合能力的全面检验。

实验结果的核心数字是:ScaleCUA 在 OSWorld 上达到 68.7% 的任务成功率,在 ScienceBoard 上达到 54.0%。论文强调了「开源 CUA 中的新 SOTA」这一定位——这意味着在同等开源模型与方法的条件下,ScaleCUA 取得了当前最高的性能。

消融实验进一步揭示了三个组件的贡献。VeriGen 生成的高质量任务数据集是性能提升的基础,没有足够的可验证数据,强化学习便无从开展。Frontier Sampling 在保持相同训练步数的前提下,相比均匀采样在多个任务上取得了显著的绝对提升,验证了能力感知采样的有效性。Visual Context Segmentation 则主要贡献了训练效率——在不损失性能的情况下将训练时间缩短了近三分之二,这对于需要反复迭代调优的 RL 训练尤为关键。

讨论与可借鉴点

ScaleCUA 的工作揭示了 CUA 领域一个重要的工程现实:数据和算法同样重要。再精巧的 RL 算法如果没有足够的可验证训练信号便无法发挥作用,而足够的数据如果没有高效的训练 pipeline 也难以被充分利用。ScaleCUA 将任务合成、数据筛选、样本分配和训练工程视为一个整体来优化,这种系统性的视角值得借鉴。

从方法论的角度,Frontier Sampling 背后的「学习前沿」直觉具有一定的通用性。不仅是 CUA,任何需要在大量任务上持续学习的智能体系统都可能面临「哪些任务当前最值得投入」的问题。能力感知的动态采样是一个简洁但有力的解决方案。

当然,ScaleCUA 也存在一些局限。可验证任务的生成仍然依赖 Docker 环境,这意味着任务的覆盖范围受限于能够被容器化的应用场景;某些需要特定硬件或专有软件的真实工作环境可能难以纳入。此外,Visual Context Segmentation 的滑动窗口机制虽然高效,但可能在超长 horizon 任务上丢失早期的关键视觉信息,这是一个精度与效率之间的权衡。

总体而言,ScaleCUA 为 CUA 的 RL 训练提供了一个可扩展的范式参考:合成足够多的可验证任务、智能地分配学习资源、高效地完成训练迭代。这三个环节的协同设计,或许是未来大规模训练计算机使用智能体的标准路径之一。

摘要

计算机使用智能体(CUAs)正作为一种强大的接口出现,通过视觉感知和 GUI 执行来自动化复杂的数字工作流。带有可验证奖励的在线强化学习(RLVR)已成为扩展其能力的关键方向。然而,这一范式受到可验证数据稀缺和在线强化学习效率低下的瓶颈制约。为了突破这些障碍,我们引入了 ScaleCUA,这是一个通过可验证任务合成和高效训练来扩展计算机使用智能体在线强化学习的统一框架。在数据层面,我们设计了 VeriGen,一个端到端的框架,通过迭代的 Docker 交互和多智能体反馈循环生成可验证的强化学习任务。该流水线通过共享的 Docker 交互探针扩展到 100+ 并发智能体工作进程,产生了 24K+ 个可验证任务和近 3K 个高质量强化学习任务。为了最大化样本效率,我们提出了 Frontier Sampling(前沿采样),该方法追踪每项任务的能力边界,并将 rollout 分配到当前学习前沿。在训练方面,我们进一步设计了 Visual Context Segmentation(视觉上下文分割),这是一种对近期视觉上下文的滑动窗口机制,平衡了 rollout 和训练引擎的压力,相较于逐步分解实现了 2.83 倍的训练加速。综合而言,ScaleCUA 在 OSWorld 上达到 68.7%,在 ScienceBoard 上达到 54.0%,在开源计算机使用智能体中确立了新的最先进性能。代码、模型和数据集可在 https://github.com/THUDM/SCALE-CUA 获取。

Abstract

Computer use agents (CUAs) are emerging as a powerful interface for automating complex digital workflows through visual perception and GUI execution. Online reinforcement learning with verifiable rewards (RLVR) has emerged as a key direction for scaling their capabilities. However, this paradigm is bottlenecked by verifiable data scarcity and online RL inefficiency. To break these barriers, we introduce ScaleCUA, a unified framework that scales online RL for CUAs via verifiable task synthesis and efficient training. At the data level, we design VeriGen, an end-to-end framework for generating verifiable RL tasks through iterative docker interactions and a multi-agent feedback loop. Scaled to 100+ concurrent agent workers via a shared docker interaction probe, this pipeline produces 24K+ verifiable tasks and nearly 3K high-quality RL tasks. To maximize sample efficiency, we propose Frontier Sampling, which tracks per-task capability and allocates rollouts to the current learning frontier. On the training side, we further design Visual Context Segmentation, a sliding window over recent visual context that balances rollout and training-engine pressure, yielding a 2.83x training speedup over step-wise decomposition. Together, ScaleCUA achieves 68.7% on OSWorld and 54.0% on ScienceBoard, establishing new state-of-the-art performance among open-source computer use agents. Code, models, and datasets are available at https://github.com/THUDM/SCALE-CUA.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记