arXiv 2606.28764v1 · 发布 2026-06-27

基于结构化策略的分层决策制定:一种通过逆优化的原则性设计

Hierarchical Decision Making with Structured Policies: A Principled Design via Inverse Optimization

AUTHORS Yuexuan Wang, Jingyuan Zhou, Kaidi Yang
EVIDENCE 层级强化学习与最优控制结合及逆优化设计
SCORE 0.8
CATEGORIES TASK rl
GENERATED 2026-07-04 21:40:21 UTC

📝 TLDR

层次化决策是处理复杂控制任务的关键,但现有方法存在两类缺陷:基于强化学习难以严格满足约束,基于最优控制往往短视且计算昂贵。论文提出一种层次化RL-OC架构,核心在于用逆优化方法从专家演示中学习下层策略的目标结构,使下层优化与长期任务目标保持一致。在网络资源分配和连续避碰两个任务上的实验表明,该方法在效率和决策质量上均优于端到端RL、学习增强最优控制和现有层次化RL基线。

🧭 速览

动机

现有层次策略存在RL难以保证严格约束、OC方法短视且计算昂贵的问题,RL-OC架构中下层目标设计缺乏原则性指导。

方法

采用逆优化方法从专家演示中推断下层问题结构,使下层结构化决策与上层长期目标对齐。

结果

在网络资源分配与连续避碰任务上,效率与决策质量均优于端到端RL、学习增强OC和现有层次化RL基线。

结论

提出了一种原则性框架,统一上层目标抽象与下层结构化决策,验证了逆优化驱动层次策略设计的有效性。

📊 论文图表(共 11 张)

展开查看 11 张图

TL;DR

这篇论文针对层次化决策制定中下层优化目标难以与长期任务目标对齐的问题,提出将逆优化方法引入分层 RL-OC 架构,从专家演示中学习下层策略的目标结构。在网络资源分配和连续避碰两个任务上的实验表明,该方法在决策质量和计算效率上均显著优于端到端 RL、学习增强最优控制以及现有层次化 RL 基线。

研究背景与动机

在机器人控制、自动驾驶、网络资源调度等复杂决策场景中,智能体往往需要在高维状态空间中进行连续决策。这类任务的一个核心挑战在于:完全扁平的决策框架难以同时兼顾短期执行与长期规划,导致策略要么短视、要么难以处理约束。层次化决策框架的出现正是为了解决这一矛盾——它允许智能体将复杂任务分解为一系列可管理的子目标,上层负责抽象的目标规划,下层负责具体的动作执行。

然而,现有的层次化策略面临两条难以调和的路径。一方面,基于[[强化学习]]的方法通过与环境交互学习策略,能够处理高维状态空间和复杂动态,但在约束满足方面存在天然短板——尤其是当任务要求严格的安全边界或硬性资源限制时,RL 的探索-利用范式难以保证约束被始终满足。另一方面,基于[[最优控制]]的方法在理论上有严格的最优性保证,但传统最优控制往往采用短视的目标函数设计,只考虑即时收益而忽视长期累积效果;同时,精确的最优控制求解在连续状态动作空间中计算代价极高,难以满足实时决策的需求。

分层 RL-OC 架构试图在两者之间找到平衡点。这类框架通常让 RL 负责上层的抽象决策,再由一个轻量化的最优控制模块处理下层的具体执行。但问题在于:下层优化的目标函数应该如何设计?如果沿用启发式的短视目标,下层策略就可能与上层意图产生偏差;如果照搬完整的最优控制公式,则计算成本又会回到原点。这篇论文的切入点正是:能否从专家演示中反向推断出下层策略应该优化的目标结构,使得下层决策自然地服务于长期任务目标?

方法

论文提出的核心框架包含两条并行的学习路径:上层通过标准的 RL 方式学习目标抽象能力,下层则通过[[逆优化]]方法从专家演示中学习目标结构。这一设计的直觉来源于一个观察——人类专家在执行复杂任务时,其底层行为往往隐式地优化着某个目标函数(例如能量消耗、通信延迟、碰撞风险),而这个目标与我们关心的长期任务目标是协调一致的。

逆优化方法的核心思想是从观察到的最优决策反推隐含的优化目标。具体而言,假设下层的最优策略 满足以下最优性条件:

其中 是从状态-动作对中提取的特征向量, 是待学习的权重参数, 是已知的短期成本项。通过收集专家演示数据 ,我们可以建立如下的参数学习问题:

这里 是衡量预测动作与专家动作差异的损失函数。通过端到端地学习特征函数 和权重 ,框架能够自动发现下层策略真正应该优化的目标结构,而无需人工设计奖励函数。

这一设计的巧妙之处在于,它将下层从"被动执行上层指令"转变为"主动理解为什么要这样做"。当下层策略理解了自己行为背后的目标动机,它就能在面对未见过的状态时做出与长期目标一致的选择,而不是机械地复制上层给定的子目标。此外,由于 通常是低维的紧凑表示,下层的优化求解仍然保持高效。

实验与结果

论文在两个不同领域的任务上验证了方法的有效性:基于网络的服务资源分配和连续环境中的碰撞规避。在服务资源分配任务中,智能体需要为动态到来的请求分配合适的计算资源,目标是同时最小化响应延迟和资源消耗;连续避碰任务则要求机器人在有限空间内规划运动轨迹,既要到达目标位置又要避免与动态障碍物碰撞。

实验对比了四类基线方法:端到端的策略梯度方法、基于模型预测控制的最优控制方法、添加了学习模块的增强最优控制,以及三种不同的层次化 RL 方法。论文报告的核心指标包括任务成功率、约束满足率、决策延迟和策略的泛化能力。

从结果来看,逆优化增强的分层 RL-OC 方法在所有维度上都取得了最优或次优的表现。特别值得注意的是,在约束满足率这一指标上,该方法显著优于纯 RL 方法,体现了逆优化目标结构对决策行为的引导作用;在决策延迟方面,则明显优于需要在线求解完整最优控制问题的方法。此外,当训练环境与测试环境存在分布偏移时,逆优化学到的目标结构展现出更强的鲁棒性,这表明它捕捉到了决策行为背后的本质规律,而非简单的状态-动作映射。

讨论与可借鉴点

尽管实验结果令人鼓舞,这项工作仍存在若干局限值得指出。首先,逆优化的成功依赖于专家演示的质量和多样性——如果演示数据本身存在偏差或覆盖不足,学到的目标结构可能反映的是次优行为而非真正应该追求的目标。其次,论文假设下层优化问题可以表达为特征线性组合的形式,这一假设在某些复杂场景中可能过于受限。

从更宽泛的角度看,这篇论文为[[层次化决策]]的研究提供了一个有价值的思路转变:与其在上层如何抽象目标上做文章,不如追问下层如何才能真正"理解"目标。逆优化方法将目标学习从人工设计转变为数据驱动,这一范式转换值得在更多场景中探索。另一个值得借鉴的设计原则是:将长期目标与短期行为解耦,但通过学习到的目标结构保持两者的内在一致性——这或许是构建可靠、可解释 AI 系统的一条可行路径。

摘要

层次化决策框架对于应对复杂控制任务至关重要,它使智能体能够将复杂问题分解为可管理的子目标。尽管前景广阔,但现有的分层策略面临关键性局限:(i) 基于强化学习(RL)的方法难以保证严格满足约束条件,而 (ii) 基于最优控制(OC)的方法往往依赖于短视且计算代价高昂的公式化表述。为调和这些权衡,分层 RL-OC 架构作为一种有前景的范式应运而生。然而,这些框架中下层优化的构建仍未得到充分探索,通常依赖于启发式或短视的目标。在本工作中,我们提出了一个原则性的框架,系统地整合了上层目标抽象与结构化的下层决策制定。我们采用逆优化方法,根据专家演示来指导下层问题的结构,确保下层策略的目标与整体长期任务目标保持一致。为验证该方法的有效性,我们的框架在不同的决策任务上进行了评估:基于网络的资源分配和连续避碰。实验结果表明,无论是在效率还是决策质量方面,我们的方法始终优于基于端到端 RL、学习增强最优控制以及现有分层 RL 方法的强基线。

Abstract

Hierarchical decision-making frameworks are pivotal for addressing complex control tasks, enabling agents to decompose intricate problems into manageable subgoals. Despite their promise, existing hierarchical policies face critical limitations: (i) reinforcement learning (RL)-based methods struggle to guarantee strict constraint satisfaction, and (ii) optimal control (OC)-based approaches often rely on myopic and computationally prohibitive formulations. To reconcile these trade-offs, hierarchical RL-OC architectures have emerged as a promising paradigm. However, the formulation of the lower-level optimization within these frameworks remains underexplored, often relying on heuristic or myopic objectives. In this work, we propose a principled framework that systematically integrates upper-level goal abstraction with structured lower-level decision making. We adopt an inverse optimization approach to inform the structure of the lower-level problem from expert demonstrations, ensuring that the objective of the lower-level policy remains aligned with the overall long-term task goal. To validate the approach, our framework is evaluated on distinct decision making tasks: network-based resource allocation and continuous collision avoidance. Empirical results demonstrate that our method consistently outperforms strong baselines based on end-to-end RL, learning-augmented optimal control, and existing hierarchical RL approaches in both efficiency and decision quality.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记