引用本概念的论文(3)
- Robo-ValueRL:面向离在线强化学习的可靠价值估计 Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning arXiv 2607.09866
- CoRe:结合视觉-语言模型反馈的组合奖励用于偏好对齐的强化学习 CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning arXiv 2607.01721
- ExToken:利用离散行为先验实现视觉-语言-动作强化学习中的高效探索 ExToken: Leveraging Discrete Behavioral Priors for Efficient Exploration in Vision-Language-Action Reinforcement Learning arXiv 2607.12931