arXiv 2606.31958v1 · 发布 2026-06-30

用语义强化学习自适应通用机器人策略

Adapting Generalist Robot Policies with Semantic Reinforcement Learning

AUTHORS Jagdeep Singh Bhatia, Andrew Wagenmaker, William Chen, Sergey Levine
EVIDENCE 语义强化学习以语言提示为干预空间适配通用机器人策略
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-08 21:43:53 UTC

📝 TLDR

通用机器人策略从大规模预训练获得多样化技能,但传统强化学习在动作空间直接优化,难以处理预训练分布外的复杂长程任务。本文提出语义动作强化学习SARL,将语言提示作为可学习调制空间,通过在线交互学习提示策略,将视觉-语言-动作模型视为可控技能先验,实现结构化语义探索与高效在线提升。实验表明SARL能解锁复杂长程任务能力,显著优于现有部署期策略改进方法。

🧭 速览

动机

传统RL在动作空间直接优化,假设预训练策略动作分布接近最优,难以处理偏离预训练分布的复杂长程任务。

方法

SARL将语言提示作为新的可优化空间,通过在线RL学习提示调制策略,把通用VLA模型视为可控技能先验。

结果

在真实环境和仿真基准上,SARL能解锁VLA模型复杂长程任务能力,显著优于现有部署期策略改进方法。

结论

证明语言提示是适配通用机器人策略的有效优化空间,能带来结构化探索和高效在线改进。

📊 论文图表(共 1 张)

展开查看 1 张图

TL;DR

这篇论文提出了语义动作强化学习(SARL),核心思路是:不直接在动作空间优化,而是把语言提示作为可学习的调制空间,通过在线交互学习来优化提示,从而激活预训练VLA模型中已有的技能并将其组合使用。实验表明,SARL在复杂长程任务上显著优于直接优化动作空间的基线方法,真正释放了通用机器人策略的潜力。

研究背景与动机

通用机器人策略通过大规模预训练,已经习得了丰富的行为技能库。理想情况下,这些策略应该成为下游任务中强化学习的优秀先验——直接在这个基础上微调,比从头训练要高效得多。然而,问题恰恰出在这个"直接微调"的环节上。

传统强化学习方法在利用预训练先验时,通常选择在动作空间直接优化。也就是说,算法会不断调整机器人应该输出的具体动作数值。这要求一个隐含假设成立:基础策略的动作分布从一开始就要接近高性能策略的分布。只有在这个假设成立的情况下,强化学习的探索才能在合理的步数内找到好的策略。

但这个假设在复杂或长时域任务上往往会失效。当任务超出预训练的分布范围时,基础策略的动作输出可能离"正确答案"非常远,此时从头在动作空间探索就如同大海捞针——探索效率极低,需要与环境进行大量交互才能逐步改进策略。

这篇论文的核心洞察是:对于表达力足够强的通用策略来说,语言提示是解决这类问题的更有效空间。预训练的VLA模型通常接受语言指令作为输入,而模型内部已经编码了与各种语言描述相对应的技能。当我们调节语言提示的内容时,可以激活模型技能库中已有的相关技能,这些技能可以组合起来完成超出其零样本能力的任务。

这就好比一个经验丰富的工匠,他的工具箱里有各种工具(对应预训练的技能),直接告诉他"做这个动作"可能说不清楚,但如果用语言描述具体的操作步骤,他就能调动自己的经验和技能来完成复杂工作。

方法

SARL的核心设计围绕一个关键问题展开:如何在提示空间而不是动作空间进行有效的强化学习优化?

论文的做法是将通用策略视为一个可控的技能先验,而非直接优化的目标。具体来说,SARL学习一个提示策略(prompt policy),这个策略的输出不是具体的机器人动作,而是一系列语言提示或提示的调制信号。当这些提示被输入到VLA模型时,模型会根据自己的预训练知识,输出与提示语义相符的机器人动作。

这种设计的巧妙之处在于:预训练的VLA模型在语言和动作之间建立了一种丰富的语义关联。通过调节语言输入来改变动作输出,本质上是在利用模型已经学会的语言-动作映射关系,而不是重新学习一个全新的动作策略。这意味着探索天然具有结构性和语义意义——当提示从"拿起红色积木"变化到"拿起蓝色积木"时,策略的行为会按照直觉可预期的方式改变,搜索空间被大幅压缩。

SARL的在线学习流程可以这样理解:智能体在真实环境中收集经验数据,这些数据包含"什么样的提示序列能够逐步推进任务完成"的信息。然后,它使用强化学习算法来改进提示策略本身,使其学会在各种情境下生成最有效的语言提示。由于提示空间比原始动作空间的维度更低、语义更结构化,学习效率得到了显著提升。

另一个重要设计考量是提示的锚定(grounding)。通过与真实世界的交互学习来调节提示,能够将语言描述与实际诱发的行为紧密联系起来,避免出现语言和现实脱节的问题。这使得SARL学到的提示策略具有稳健性——它不是在模拟器中过拟合的提示,而是真正能够引导机器人完成现实任务的有效指令。

实验与结果

论文在仿真基准测试和真实世界机器人环境两处进行了验证。仿真环境使用标准的机器人操作基准,真实世界实验则部署在实际的机械臂平台上,任务涵盖多步骤物体操作和复杂的空间推理。

关键的对比对象包括:直接优化动作空间的强化学习方法、仅使用零样本VLA策略、以及其他部署时改进方法。实验结果表明,当任务复杂度增加、时域变长时,直接在动作空间优化的方法性能急剧下降,而SARL能够保持稳定的任务完成率。在真实世界实验中,SARL展现出了处理长程任务的能力——这类任务需要连续多个步骤的正确决策,单靠VLA的零样本能力是无法完成的。

值得注意的是,SARL的优势不仅体现在最终任务成功率上,还体现在样本效率上。由于利用了预训练技能而非从头学习,SARL在达到相同性能水平时所需的实际环境交互次数大幅减少。这对于真实机器人应用来说尤为重要——现实环境中每次交互都意味着时间和成本消耗。

讨论与可借鉴点

SARL展示了[[强化学习]]与[[视觉-语言-动作模型]]结合的一种新范式:不是简单地把预训练模型当作固定的工具,而是将其作为可控的技能先验,通过学习如何"调度"模型已有的能力来实现更复杂的目标。这种思路对于[[具身智能]]领域具有重要启发——当预训练模型的零样本能力不足以覆盖任务需求时,如何高效地激发和组合其隐含技能,是比直接微调更值得关注的问题。

论文也指出了当前的局限性:SARL的效果依赖于基础VLA模型的表达能力,如果模型本身缺乏与任务相关的技能储备,提示调制的效果就会受限。此外,提示空间的设计——如何构造提示的表示方式、如何定义提示与技能激活的关系——仍有探索空间。

对于后续研究,一个有价值的探索方向是:能否自动发现有效的提示策略,而不需要人工设计提示的形式?另一个方向是将这种方法推广到更多类型的控制问题,比如连续控制或混合离散-连续动作空间。SARL的核心思想——在语义空间而非原始动作空间进行优化——或许能够为更广泛的[[在线强化学习]]问题提供新的解决思路。

摘要

通用机器人策略通过大规模预训练学习到多样化的行为库。原则上,这使其成为通过强化学习(RL)进行下游自适应的优秀先验。然而在实践中,利用该先验的标准RL方法直接对机器人动作进行优化,要求基础策略的动作分布从一开始就要接近高性能策略的分布。对于那些超出预训练分布的复杂或长时域任务,这一假设不再成立。我们的核心洞察是,对于表达力足够强的通用策略,语言提示是解决此类任务的有效替代空间:通过调节语言输入可以激发策略已有技能库中的技能,这些技能可以组合起来以解决超出其零样本能力的任务。我们提出了语义动作强化学习(SARL),它通过在线交互学习来优化这一提示空间,将通用策略视为一个可控的技能先验。重要的是,利用预训练技能而非从头学习新技能可产生结构化的、语义上有意义的探索以及高效的在线提升,而通过经验学习来调节提示能将其锚定于真实世界中诱发的行为,从而实现稳健的任务求解。在真实世界环境和仿真基准测试上的结果表明,SARL释放了全新的能力——自适应VLA行为以解决复杂的、长时域任务——并显著优于现有部署时改进机器人行为的方法。

Abstract

Generalist robot policies learn a diverse repertoire of behaviors from large-scale pretraining. In principle, this makes them excellent priors for downstream adaptation via reinforcement learning (RL). In practice, however, standard RL methods leveraging this prior optimize directly over robot actions, requiring the base policy's action distribution to be close to that of a performant policy from the start. This assumption breaks down for complex or long-horizon tasks that fall outside the pretraining distribution. Our key insight is that, for sufficiently expressive generalist policies, language prompts are an effective alternative space for learning to solve such tasks: modulating language inputs elicits skills already within the policy's repertoire, which can be composed to solve tasks beyond its zero-shot capabilities. We propose Semantic Action Reinforcement Learning (SARL), which learns to optimize this prompt space through online interaction, treating the generalist policy as a controllable skill prior. Importantly, leveraging pretrained skills rather than learning new ones from scratch yields structured, semantically meaningful exploration and highly efficient online improvement, and learning to modulate prompts through experience grounds them in induced real-world behaviors for robust task-solving. Across real-world settings and simulated benchmarks, we show SARL unlocks fundamentally new capabilities -- adapting VLA behavior to solve complex, long-horizon tasks -- and significantly outperforms existing approaches for improving robot behavior in deployment.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记