引用本概念的论文(1) CoRe:结合视觉-语言模型反馈的组合奖励用于偏好对齐的强化学习 CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning arXiv 2607.01721
共现相关概念 在引用本概念的论文中,与下列概念同时出现的次数(降序)。 Reinforcement Learning method · 共现 1 Robotic Manipulation other · 共现 1 偏好对齐 method · 共现 1 奖励设计 method · 共现 1 形式化奖励 methodology · 共现 1 视觉语言模型反馈 method · 共现 1