非参数贝叶斯逆强化学习与数据并行Gibbs采样
Nonparametric Bayesian Inverse Reinforcement Learning with Data-Parallel Gibbs Sampling
📝 TLDR
提出非参数贝叶斯逆强化学习方法,采用数据并行Gibbs采样提高推断效率。
🧭 速览
多专家场景下参数化逆强化学习退化为平均化,丧失对个体偏好的建模能力,需要引入能自动推断专家数量的非参数方法。
折叠Gibbs采样器融合中国餐馆过程的聚类分配与Metropolis-Hastings权重采样,软值迭代作为内层规划,在狄利克雷过程先验下联合推断奖励簇数与权重。
ObjectWorld上两专家时ARI达1.000远胜零值基线;三专家簇数推断正确但ARI中等,反映行为重叠;Ray并行8核获4.79倍加速。
非参数贝叶斯框架为多专家逆强化学习提供可行路径,簇数自适应推断优势明显,但评估需更受控的场景设计,并行化带来吞吐提升。
📊 论文图表(共 5 张)
展开查看 5 张图
TL;DR
这篇论文提出了基于[[狄利克雷过程]]先验的非参数贝叶斯逆强化学习方法,允许从多人专家演示中自动推断潜在奖励类型的数量及其对应的奖励函数。在 10×10 ObjectWorld 网格环境中,该方法在二人专家场景下以 1.000 的[[调整兰德指数]]完美恢复聚类结构,远超最大熵 IRL 基线。进一步引入基于 Ray 的数据并行[[吉布斯采样]],在高性能计算环境中实现近线性加速,为大规模应用奠定了基础。
研究背景与动机
逆强化学习(IRL)的核心任务是从专家演示中反推奖励函数,这一能力在机器人学习、自动驾驶辅助和用户偏好建模等领域具有重要价值。传统 IRL 方法通常假设所有演示来自单一专家,奖励函数是唯一的、确定的。然而现实场景要复杂得多:一位司机的驾驶演示可能同时来自保守型和激进型驾驶员;一个推荐系统中的用户行为可能混合了价格敏感型和品质敏感型消费者。在这些情况下,用单一奖励函数去拟合所有人的行为,结果必然是“四不像”——对每类专家都拟合不佳。
参数化方法面对这一问题时只能输出某种加权平均的奖励,这种妥协本质上是把多峰分布强行压成了单峰。研究者们很自然会问:能否让模型自己发现演示中潜在的不同专家类型?能否同时推断出有多少类不同的奖励函数,以及每一类的奖励权重?这正是非参数贝叶斯方法的优势所在——通过选择合适的先验分布,模型可以在不预设类别数量的情况下进行后验推断。
方法
论文采用[[狄利克雷过程]]作为奖励函数空间上的先验,其聚类诱导特性天然适合“自动发现类别数量”这一需求。直观上,狄利克雷过程会产生一种“富者愈富”的效应:已有的聚类更容易吸引新的数据点,但同时保留生成全新聚类的概率。这种性质使得模型既不会过度聚类,也不会因预设类别数而受限。
推理部分使用坍缩吉布斯采样器,其核心由两个交替更新的步骤构成。第一步是聚类分配更新,采用“中餐馆过程”(Chinese Restaurant Process)——这个名字形象地描述了顾客选择座位的规则:新顾客可以选择坐到已有聚类的桌旁(对应加入现有类别),也可以另开新桌(对应创建新类别)。采样器根据后验概率在两种选择间进行随机采样,从而实现聚类分配的贝叶斯推断。
第二步是奖励权重的更新。这里没有对奖励权重进行完整的贝叶斯积分,而是使用 [[Metropolis-Hastings]] 算法在参数空间中进行探索。关键的巧妙之处在于将[[软值迭代]]作为内部规划例程——相比标准值迭代只选择最优动作,软值迭代根据动作的价值分布进行概率采样,这使得梯度信号能够更平滑地反向传播到奖励参数。
采样器的并行化策略建立在状态聚合的共识合并启发式之上。直观理解是:如果两个状态在历史采样中被反复聚合到同一类别,它们很可能确实属于同一聚类,可以安全地共享计算。这个启发式在吞吐量和精度之间引入了一个可调节的权衡——更激进的合并策略能提高并行效率,但可能牺牲一些推断精度。
实验与结果
实验在 10×10 ObjectWorld 网格世界中进行,这是一个经典的多步推理任务:智能体需要根据物体颜色和相对位置来推断奖励结构。研究者设计了两种设定:二人专家(K=2)和三人专家(K=3),每个设定下通过随机撒点生成多个网格实例进行评估。
串行采样器的结果令人振奋。在 K=2 的设定下,[[调整兰德指数]]达到完美的 1.000,意味着聚类结果与真实标签完全一致。作为对比,最大熵 IRL 基线的 ARI 为 0.000——这个零分并不意外,因为最大熵方法根本不具备区分不同专家类型的机制,它只能给出一个“平均”奖励。
K=3 的设定更有启发意义。采样器在所有运行中都正确识别了聚类数量,但分配 ARI 下降到 0.48–0.58。这个看似矛盾的结论实际上揭示了一个重要的方法论问题:在 ObjectWorld 上,当三个人专家类型的行为存在显著重叠时,单纯依赖随机种子生成的评估实例不足以可靠地区分它们。研究者据此建议,未来工作应采用受控的物体放置策略来构建更具区分性的评估场景。
并行化实验在高性能计算硬件上进行,使用 Ray 框架实现跨 CPU 核的采样器并行。在 8 个工作节点时达到 4.79 倍的峰值加速比。需要注意的是,这个数字小于理论上的 8 倍,差距来源于工作节点间的通信开销以及共识合并启发式带来的精度损失。论文详细刻画了这一权衡:提高合并阈值能增加吞吐量,但累积的近似误差会逐渐侵蚀推断精度。
讨论与可借鉴点
这篇论文在方法层面展示了非参数贝叶斯与逆强化学习的自然融合。狄利克雷过程先验不仅提供了数学上优雅的先验选择,其坍缩吉布斯采样的实现也在计算效率和推断质量间取得了良好平衡。将软值迭代作为内部规划例程的决策值得借鉴——这避免了硬最大化带来的梯度估计问题,使整个流程能够以端到端方式进行。
实验设计中的反思同样有价值。K=3 场景下的结果提醒我们,benchmark 的可靠性与任务本身的结构特性密切相关。当不同类别之间的行为重叠度较高时,仅靠随机采样可能无法产生足够区分度的测试实例。这一点对整个逆强化学习领域的方法论都有参考意义。
当然,方法也存在局限。10×10 的网格世界相对简单,扩展到高维连续状态空间时状态聚合的效果如何尚不明确。共识合并启发式的超参数选择目前缺乏理论指导,更多依赖经验调优。此外,采样器的收敛诊断也是一个未充分讨论的问题——在并行场景下判断所有链是否都已平稳分布,比串行情况更加棘手。
对于后续研究,一个有前景的方向是将这类方法推广到部分可观测的马尔可夫决策过程,或者结合深度表示学习来处理高维观测输入。另一个方向是在用户建模、推荐系统等实际应用中验证这套框架的有效性——那里的用户类型往往更加多样且边界模糊,非参数方法或许能捕捉到参数化方法遗漏的细微偏好差异。
摘要
逆强化学习从专家演示中恢复奖励函数,但标准形式假设所有演示均来自单一专家。当演示来自多个具有不同偏好的专家时,参数化方法恢复出的奖励是某种平均,对任一专家都拟合不佳。我们实现了基于狄利克雷过程先验的非参数贝叶斯逆强化学习,允许潜在奖励类型的数量与奖励本身被联合推断。推理使用一种坍缩吉布斯采样器,将用于聚类分配的中餐馆过程更新与用于奖励权重的 Metropolis-Hastings 更新相结合,并以软值迭代作为内部规划例程。我们在 10×10 的 ObjectWorld 网格上,以两种和三种真实奖励类型进行评估。串行采样器在 K=2 时以 1.000 的调整兰德指数恢复了聚类,显著优于最大熵 IRL 基线(ARI=0.000)。扩展到 K=3 表明,采样器在所有运行中都正确识别了聚类数量;分配 ARI 在 0.48–0.58 之间,这反映了跨网格实例化持续存在的专家类型之间的行为重叠,揭示了在 ObjectWorld 上对 K=3 进行可靠评估需要受控的物体放置而非随机播种。我们进一步使用 Ray 在高性能计算硬件的 CPU 核上并行化采样器,在 8 个工作节点时达到了 4.79 倍的峰值加速比,并刻画了由状态聚合过程中共识合并启发式所引起的吞吐量与精度之间的权衡。代码与容器化环境可在 https://github.com/dasashreeya/np_bayes_irl 获取。
Abstract
Inverse Reinforcement Learning recovers reward functions from expert demonstrations, but standard formulations assume that all demonstrations come from a single expert. When demonstrations are pooled from multiple experts with distinct preferences, parametric methods recover an averaged reward that fits no individual expert well. We implement Nonparametric Bayesian Inverse Reinforcement Learning with a Dirichlet Process prior over reward functions, allowing the number of latent reward types to be inferred jointly with the rewards themselves. Inference uses a collapsed Gibbs sampler combining a Chinese Restaurant Process update for cluster assignments with a Metropolis-Hastings update for reward weights, and soft value iteration as the inner planning routine. We evaluate on a 10x10 ObjectWorld grid with two and three ground-truth reward types. The serial sampler recovers K=2 with Adjusted Rand Index of 1.000, substantially outperforming a Maximum Entropy IRL baseline (ARI=0.000). Extension to K=3 shows that the sampler correctly identifies the number of clusters in all runs; assignment ARI of 0.48-0.58 reflects behavioral overlap between expert types that persists across grid instantiations, revealing that reliable K=3 evaluation on ObjectWorld requires controlled object placement rather than random seeding. We further parallelize the sampler across CPU cores using Ray on HPC hardware, achieving a peak speedup of 4.79x at 8 workers, and characterize a throughput-versus-accuracy tradeoff arising from the consensus merge heuristic used during state aggregation. Code and a containerized environment are available at https://github.com/dasashreeya/np_bayes_irl.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。




