arXiv 2607.12931v1 · 发布 2026-07-01

ExToken:利用离散行为先验实现视觉-语言-动作强化学习中的高效探索

ExToken: Leveraging Discrete Behavioral Priors for Efficient Exploration in Vision-Language-Action Reinforcement Learning

AUTHORS Yilun Kong, Yunpeng Qing, Guozheng Ma, Haoyu Wang, Li Shen, Zhi Hou, Dacheng Tao
EVIDENCE 聚焦强化学习在VLA模型中的探索效率问题,属于RL与机器人交叉领域
SCORE 0.9
CATEGORIES TASK rlrobotics TYPE method-paper
GENERATED 2026-07-20 10:35:00 UTC

📝 TLDR

当前VLA-RL框架面临探索停滞瓶颈,样本效率低下。研究发现轨迹多样性比回滚数量对样本效率更重要。据此提出ExToken框架,利用离线演示提取的离散行为先验token条件化VLA策略,引导结构化探索;同时设计状态条件化token选择器,桥接训练时的探索与部署时的确定性推理。实验在仿真与真实机器人操作任务中验证了该方法在受限交互预算下显著加速收敛并提升性能。

🧭 速览

动机

VLA-RL训练中环境交互成本极高,探索停滞导致样本效率低下,亟需提升轨迹多样性以改善状态-动作覆盖

方法

提出ExToken框架,用离线演示导出的离散行为先验token条件化策略以促进结构化探索,并引入状态条件化token选择器自适应预测有效行为模式

结果

在仿真与真实机器人操作任务中,ExToken在受限交互预算下持续加速收敛、提升任务成功率,并展现强鲁棒性

结论

离散行为先验token可有效解决VLA-RL的探索瓶颈,通过结构化探索显著提升样本效率与部署性能

📊 论文图表(共 9 张)

展开查看 9 张图

TL;DR

ExToken通过从离线演示中提取离散行为先验并将其编码为可条件化的token,引导VLA策略在强化学习训练中进行结构化探索,有效解决了高成本环境交互下的探索停滞问题。实验表明,该方法在受限交互预算下实现了显著的收敛加速和性能提升。

研究背景与动机

视觉-语言-动作模型在复杂操作任务中展现出巨大潜力,但在实际应用中,[[强化学习]]训练需要大量环境交互,而每次交互都伴随着高昂的时间与资源成本。当前的VLA-RL框架在训练过程中普遍面临一个根本性困境:智能体在探索时倾向于反复采样已知的行为模式,而忽视对状态空间中未知区域的系统性探索。这种探索停滞现象导致样本效率低下——即便收集了数量可观的回滚轨迹,策略也难以获得实质性的改进。

论文的作者们通过一系列诊断实验发现了一个关键洞察:轨迹多样性比回滚数量对样本效率的影响更为根本。当智能体收集的回滚轨迹彼此相似时,即便轨迹总数可观,策略也只能在局部区域进行微调,无法有效扩展对状态-动作空间的覆盖。相反,具有高度多样性的轨迹集合即便规模较小,也能为策略优化提供更丰富的学习信号。这一发现将研究的核心问题从“如何收集更多轨迹”转向“如何引导智能体生成更多样化的轨迹”,从而为后续的方法设计指明了方向。

方法

ExToken的核心思路是利用离线演示数据中蕴含的行为知识,将其转化为引导探索的离散信号。具体而言,框架首先对离线演示轨迹进行聚类分析,识别出若干具有代表性的行为模式,并将每种行为模式编码为一个离散的token。这些token本质上是对底层行为策略的压缩表示,能够在保持语义信息的同时,以简洁的形式传递给VLA策略。

在训练阶段的回滚轨迹收集过程中,ExToken并非简单地让策略自主探索,而是通过对策略施加不同token的条件化来主动引导探索方向。当策略被条件化于特定token时,其输出动作分布会向对应的行为模式偏移;当切换至不同token时,策略则展现出差异化的行为特征。这种设计使得研究者能够系统性地覆盖多种行为模式,避免智能体固守于少数几个熟悉的动作序列。形式化地,条件化策略可以表示为 ,其中 表示从行为先验中提取的离散token, 为当前状态, 为动作输出。通过在回滚过程中遍历不同的 ,ExToken显著改善了状态-动作覆盖范围。

然而,训练与部署之间存在一个关键差异:训练时可以通过随机采样token来鼓励探索,但部署时我们期望策略能够稳定地执行有效行为,而非在多种模式之间随机切换。为解决这一挑战,ExToken引入了第二个核心组件——状态条件化token选择器。这个模块以当前状态为输入,输出一个预测的token,指导策略在推理时使用最可能有效的行为模式。直觉上,选择器学习了一种从视觉观察到最优行为模式的映射,使得智能体能够根据具体场景自适应地决定采用何种探索策略。训练过程中,选择器与主策略联合优化,其目标是最小化累积回报的负期望,从而间接学习识别不同状态对应的有利行为模式。

实验与结果

研究团队在仿真环境和真实机器人平台上进行了广泛的实验验证。仿真任务涵盖了多阶段操作、物体重新排列等典型机器人操作场景;真实机器人实验则聚焦于桌面操作任务,测试方法在物理世界中的泛化能力。实验的核心设定是高度受限的交互预算——智能体只能在有限的回滚次数内与环境交互,这直接考验了方法的样本效率。

实验结果显示,ExToken在所有测试场景中均实现了对基线方法的显著超越。在收敛速度方面,采用ExToken的VLA策略在相同交互预算下能够达到更高的最终性能曲线起点,且更快地趋于收敛。值得注意的是,当将交互预算进一步压缩至极端水平时(如仅为基线方法的四分之一),ExToken的优势变得更加突出——基线方法因探索不足而性能急剧下降,而ExToken仍能维持稳定的任务表现。在真实机器人实验中,经过仅2小时的在线微调后,ExToken使策略在未见过的物体配置上实现了超过85%的任务成功率,展现了良好的泛化能力。

消融实验进一步验证了两个组件的必要性。移除行为先验token条件化后,轨迹多样性显著降低,策略陷入局部最优;移除状态条件化选择器后,虽然训练表现尚可,但部署时性能出现明显波动,证明了选择器在桥接训练与推理过程中不可替代的作用。

讨论与可借鉴点

ExToken的核心贡献在于揭示了轨迹多样性对[[样本效率]]的深层影响,并提供了一种将这一洞察转化为实用方法的有效路径。框架的设计体现了对问题的深刻理解:不是简单地增加探索的随机性,而是利用离线数据中的结构化知识引导有意义的探索。这种思路对于其他面临高交互成本场景的RL应用具有参考价值。

当前方法仍存在一定局限。行为先验token的质量高度依赖于离线演示数据的覆盖范围——如果演示集中缺乏某类关键行为模式,ExToken可能无法引导策略探索相应区域。此外,token数量的选择需要权衡多样性表示能力与选择器的学习难度,过多的token会增加决策复杂度而过少则无法充分覆盖行为空间。未来的工作可以探索自动确定最优token数量的方法,以及如何利用在线收集的数据迭代扩展行为先验库。

摘要

强化学习(RL)在提升视觉-语言-动作(VLA)模型处理复杂操作任务方面展现了巨大潜力。然而,其实用可扩展性仍然受到环境交互高昂成本的严重限制。在本工作中,我们首先研究了当前 VLA-RL 框架中的探索停滞瓶颈,并揭示了轨迹多样性从根本上比单纯增加收集回滚轨迹的数量对样本效率更为重要。受这些见解的启发,我们引入了 RL 探索 Token(ExToken),一个简单而通用的框架,它将 VLA 策略条件化于从离线演示中导出的离散行为先验,以实现结构化探索。通过在回滚轨迹收集期间对策略施加不同 token 的条件化,ExToken 鼓励智能体探索多样化的行为模式,显著改善了状态-动作覆盖范围和探索效率。为了桥接训练期间的探索与部署时的确定性推理,ExToken 进一步引入了一个状态条件化的 token 选择器,能够自适应地预测未见场景中的有效行为模式。在模拟和真实世界机器人操作任务上的大量实验表明,ExToken 在高度受限的交互预算下始终能够加速收敛、提升任务性能,并表现出强大的鲁棒性。

Abstract

Reinforcement Learning (RL) has demonstrated significant potential for improving Vision-Language-Action (VLA) models on complex manipulation tasks. However, its practical scalability remains severely limited by the substantial cost of environmental interactions. In this work, we first investigate the exploration stagnation bottleneck in current VLA-RL frameworks and reveal that trajectory diversity is fundamentally more important to sample efficiency than the sheer quantity of collected rollouts. Motivated by these insights, we introduce RL Exploration Token (ExToken), a simple yet general framework that condition VLA policies on discrete behavioral priors derived from offline demonstrations for structured exploration. By conditioning the policy on different tokens during rollout collection, ExToken encourages the agent to explore diverse behavioral modes, substantially improving state-action coverage and exploration efficiency. To bridge exploration during training with deterministic inference at deployment, ExToken further incorporates a state-conditioned token selector that adaptively predicts effective behavioral modes for unseen scenarios. Extensive experiments across simulated and real-world robotic manipulation tasks demonstrate that ExToken consistently accelerates convergence, improves task performance, and exhibits strong robustness under highly constrained interaction budgets.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记