用变分同态在选项诱导抽象MDP中学习时间抽象
Learning Temporal Abstractions via Variational Homomorphisms in Option-Induced Abstract MDPs
📝 TLDR
显式 CoT 推理慢且贵,本文主张让模型在潜空间里以「option(时间扩展抽象动作)」的形式隐式思考。为此提出 off-policy 变分算法 VMOC 在 HiT-MDP 框架内学习多样 option 嵌入,并首次把连续 MDP 同态理论扩展到 HiT-MDP,证明在抽象潜空间学策略能保持原问题最优解;再用 SFT 数据冷启动把人类推理蒸馏进 option 空间。实验在 MuJoCo locomotion 与逻辑推理基准上均有力。
🧭 速览
显式 Chain-of-Thought 逐字生成计算昂贵且缓慢;同时传统 SMDP option 框架存在探索退化、样本低效、option 三元组计算昂贵三大痼疾。作者希望让模型在潜空间「思考」,把隐式推理步骤建模为时间扩展的抽象动作(option),并为「在抽象空间学习」提供理论保证。
三件套:(1) VMOC——在 HiT-MDP 上做结构化变分推断的 off-policy soft actor-critic,最大熵项作为内在奖励自然涌现,用低成本 option 嵌入替代 option 三元组;(2) 连续 HiT-MDP 同态——用向量丛(vector bundle)刻画状态-option 联合空间的抽象映射,证明最优值等价与策略提升(lifting);(3) 冷启动——用 SFT 的 (prompt, CoT, answer) 三元组通过 ELBO 把推理蒸馏为离散 option 嵌入(Gumbel-Softmax),为 VMOC 提供初始化。
MuJoCo 10 个 locomotion 环境上,VMOC 在回报、收敛速度、方差上显著超过 6 个 option 基线(MOPG/DAC+PPO/AHP+PPO/IOPG/PPOC/OC)与无层级 PPO,在高维 Humanoid/HumanoidStandup 上优势最明显。语言侧 VMOC-SFT(LLaMA3.2-1B)在 CommonSense 逻辑推理达 SOTA 78.1,OOD 的 GSM-HARD 上 15.6 领先,但在 GSM8k/SVAMP/MultiArith 上不敌显式 CoT。
把「隐式推理」与「locomotion 技能」统一到 option 学习框架:VMOC 的变分 off-policy 保证探索与多样性,连续 HiT-MDP 同态为抽象空间学习提供最优性保证,SFT 冷启动给出可用初始化。抽象 option 空间对多跳逻辑与难样本泛化更鲁棒,但在需要精确算术模仿的任务上仍逊于显式 CoT,属于用可解释性/效率换取部分精度的路线。
TL;DR
大语言模型生成显式思维链(CoT)推理成本高昂,本文提出让模型在潜空间中以「option」——即时间扩展抽象动作——的形式完成隐式推理。具体而言,论文提出一种名为 VMOC 的 off-policy 变分算法,在 HiT-MDP 框架内高效学习多样化 option 嵌入;并首次将连续 MDP 同态理论扩展至 HiT-MDP,证明在抽象潜空间学得的策略能够保持原始问题的最优性;最后通过 SFT 数据冷启动,将人类推理示范蒸馏为 option 嵌入作为初始化。实验在 MuJoCo locomotion 与逻辑推理基准上均验证了该框架的有效性。
研究背景与动机
深度强化学习已在 Atari、Go 等复杂任务上取得了令人瞩目的成功,但长期以来面临三大核心挑战:探索不足导致策略易陷入局部最优、时间扩展动作的学习效率低下、以及对海量样本的依赖。这些问题在真实机器人控制与大规模语言推理场景中尤为突出。
在分层强化学习的 option 框架下,研究者将非平稳的长时任务分解为多个时间扩展的抽象动作(option),由高层策略决定何时调用哪个 option、低层策略负责具体执行。然而基于半马尔可夫决策过程(SMDP)的传统 option 框架长期受制于三个痼疾:最大似然更新使早期高回报的 option 迅速占据主导地位,导致 option 库要么单一化、要么每步频繁切换,多样性严重坍塌;半马尔可夫特性使高层策略每次更新跨越多个时间步,信息增益有限,加之 on-policy 采样需要同时重新采集高层与低层经验,样本效率极低;此外,option 需建模为「初始集 + 内部策略 + 终止函数」三元组,神经网络参数化后优化困难。
与此同时,大语言模型虽通过显式思维链(CoT)展现出卓越推理能力,但逐 token 生成中间步骤的计算开销巨大——这在需要快速响应的应用场景中几乎不可接受。作者敏锐地意识到:如果能将「隐式推理」的效率优势与分层强化学习的 option 框架结合,或许能同时解决两边的痛点。于是本文的核心主张浮现:让模型在潜空间中「思考」,以 option 作为隐式的中间推理步骤,既保留层次化抽象的表征能力,又规避显式文本生成的高昂成本。
方法
方法的整体架构围绕三个紧密关联的组件展开。
第一层:控制即结构化变分推断。 作者从 control-as-inference 的视角出发,将最优轨迹推断问题转化为变分学习问题。具体地,引入二值最优性变量 ,令 ,用变分分布近似真实的最优轨迹后验。在变分目标中,环境动态被自然抵消,最大熵项作为正则化项自动涌现:
这一形式为后续算法提供了统一的优化框架。
第二层:HiT-MDP 与 option 嵌入表示。 传统 SMDP 将 option 视为「初始集-内部策略-终止函数」的三元组,建模与优化均显繁琐。本文采用 Li 等人提出的 HiT-MDP 框架,将 option 重新定义为带时间结构的潜变量,融入状态转移过程:
这样每个 option 可以用一个稠密向量嵌入表示,大幅降低了参数化复杂度。HiT-MDP 已被证明与 SMDP option 框架同态等价,意味着理论上的严格性并未因此丧失。
第三层:VMOC 算法。 这是论文的核心算法贡献。作者将 SMDP 最优 option 轨迹与动作/选项两组最优性变量联合建模为概率图模型,再以 HiT-MDP 作为变分分布近似。推导得到的 ELBO 包含两支最大熵项,分别对应动作策略与 option 策略的探索压力。从优化角度看,最大熵目标天然驱动策略维持多样性,避免被早期高回报 option 垄断。
在工程实现上,VMOC 采用 off-policy soft actor-critic 架构。这一设计带来三重优势:off-policy 特性使其能够复用 replay buffer,样本效率远高于 on-policy 方案;最大熵探索机制有效对抗 option 退化;低维 option 嵌入使计算成本可控。相比同期基于 HiT-MDP 但使用 on-policy 梯度的 MOPG 算法,VMOC 在探索稳定性与样本效率上均显著更优。
关键理论贡献:连续 HiT-MDP 同态。 这是论文相对于 Skill Discovery、LatentSkill、METRA 等工作的独特之处。作者基于 Panangaden 等人对标准连续 MDP 同态的形式化,创造性地将其扩展至 HiT-MDP 场景。核心思想是用向量丛(vector bundle)建模状态-option 联合空间:以状态流形 为基空间,option 空间 作为纤维,不同连通分量甚至可以拥有不同维度的 option 纤维。连续 HiT-MDP 被定义为七元组 ,同态 由基空间映射与逐纤维映射共同组成。
作者证明的核心结论具有深远意义:Theorem 11(最优值等价)表明同态保持最优值函数,即 ;Definition 13 与 Proposition 14(策略提升) 说明抽象空间的策略可以提升回原始空间且保持最优性;Theorem 15(值等价) 则给出了完整的等价性条件。这意味着:使用 VMOC 在简化的抽象潜空间中优化,实质上就是在原始复杂状态空间上优化原始 ELBO——为「在抽象空间学习」提供了严格的理论担保,填补了技能发现文献长期缺失的重要一环。
冷启动:从示范蒸馏推理模式。 面向语言推理场景,论文设计了利用 SFT 数据进行冷启动的流程。给定人类推理示范 ,其中 为问题、 为中间推理步骤、 为最终答案,引入隐式 option 变量 后可写出证据下界:
这里 option 被参数化为离散 token 序列,通过 Gumbel-Softmax 重参数化实现端到端训练。训练完成后学到的 option 嵌入矩阵与先验分布直接作为 VMOC 的初始化,相当于为后续强化学习阶段提供了一个「推理模式库」作为先验,大幅加速收敛。
实验与结果
论文在两个不同领域展开实验,分别验证控制技能学习与语言推理的能力。
Locomotion 控制实验。 在 OpenAI Gym MuJoCo 的 10 个环境中,VMOC 与六个 option 基线(MOPG、DAC+PPO、AHP+PPO、IOPG、PPOC、OC)以及无层级 PPO 展开对比。实验设置采用温度参数 、探索噪声 、4 个 option、100 万步训练、10 次独立运行取平均。结果显示 VMOC 在 episodic return、收敛速度、步内方差、跨运行方差四项指标上全面领先。值得注意的是,在低维简单环境 InvertedDoublePendulum 上 VMOC 略逊于部分基线,作者认为这是由于简单任务不需要复杂的层次化抽象;而在高维挑战 Humanoid-v2(状态空间 )与 HumanoidStandup-v2 上,VMOC 的优势最为显著——这正印证了最大熵探索在高维稀疏奖励场景中的关键作用。
语言推理实验。 使用 LLaMA3.2-1B 模型、6 个 option 嵌入、冷启动系数 ,在多个推理基准上评估。VMOC-SFT 在 CommonSense 逻辑推理任务上达到 78.1,显著超越基线;在分布外(OOD)的 GSM-HARD 难例集上取得最佳 15.6,展示了隐式推理在泛化上的潜力。然而在 GSM8k-Aug、GSM8k-NL、SVAMP、MultiArith 等需要精确算术模仿的任务上,该方法仍不及显式 CoT-SFT 与 CODI。这一现象合理:隐式 option 空间追求抽象概括能力,但在需要精确步骤复现的场景中,显式文本提供了更强的监督信号。
讨论与可借鉴点
这项工作的核心启示在于:[[分层强化学习]] 与语言模型隐式推理之间存在深层的结构同构,而变分推断为桥接两者提供了优雅的数学语言。VMOC 的设计哲学——用最大熵目标驱动探索、用 off-policy 复用提升效率、用嵌入表示降低成本——对处理多模态技能学习问题具有广泛参考价值。更重要的是,连续 HiT-MDP 同态理论为「在抽象空间学习」这一长期实践提供了首个严格的最优性保证,这一理论框架值得在更广泛的技能发现研究中推广。
论文的局限同样值得注意。隐式推理在精确算术、需要逐步模仿的任务上仍存在明显短板——这是抽象压缩带来的固有代价。此外,option 数量与维度的选择尚缺乏系统性指导,高维语言任务中 embedding size 与 reasoning depth 的匹配关系有待进一步探索。如何在保持抽象效率的同时恢复精确性,将是后续研究的重要方向。
TLDR
显式 Chain-of-Thought 推理既慢又贵。本文主张让模型在潜空间里以「option(时间扩展的抽象动作)」的形式隐式思考。为此提出 off-policy 变分算法 VMOC,在 HiT-MDP 框架内学习一批多样化的 option 嵌入;并首次把连续 MDP 同态理论扩展到 HiT-MDP,证明在简化的抽象潜空间里学策略能保持原始复杂问题解的最优性;最后用 SFT 数据做冷启动,把人类推理示范蒸馏进 option 空间作为初始化。实验在 MuJoCo locomotion 与逻辑推理基准上均验证有效,统一了「控制」与「语言推理」两类抽象技能学习。
Abstract (English)
Large Language Models (LLMs) have shown remarkable reasoning ability through explicit Chain-of-Thought (CoT) prompting, but generating these step-by-step textual explanations is computationally expensive and slow. To overcome this, we aim to develop a framework for efficient, implicit reasoning, where the model "thinks" in a latent space without generating explicit text for every step. We propose that these latent thoughts can be modeled as temporally-extended abstract actions, or "options," within a hierarchical reinforcement learning framework. To effectively learn a diverse library of options as latent embeddings, we first introduce the Variational Markovian Option Critic (VMOC), an off-policy algorithm that uses variational inference within the HiT-MDP framework. To then provide a rigorous foundation for using these options as an abstract reasoning space, we extend the theory of continuous MDP homomorphisms. This proves that learning a policy in the simplified, abstract latent space—for which VMOC is suited—preserves the optimality of the solution to the original, complex problem. Finally, we propose a cold-start procedure that leverages supervised fine-tuning (SFT) data to distill human reasoning demonstrations into this latent option space, providing a rich initialization for the model's reasoning capabilities. Extensive experiments demonstrate that our approach achieves strong performance on complex logical reasoning benchmarks and challenging locomotion tasks, validating our framework as a principled method for learning abstract skills for both language and control.
Abstract (中文)
大语言模型(LLM)通过显式的思维链(CoT)提示展现出卓越的推理能力,但逐步生成这些文本解释计算昂贵且缓慢。为克服这一点,我们希望构建一个高效的隐式推理框架,让模型在潜空间中「思考」,无需为每一步生成显式文本。我们提出:这些潜在的「思考」可以在分层强化学习框架中被建模为时间扩展的抽象动作,即「option」。为高效地学习一整套作为潜嵌入的多样 option,我们首先提出 Variational Markovian Option Critic(VMOC),一个在 HiT-MDP 框架内使用变分推断的 off-policy 算法。为给「把这些 option 用作抽象推理空间」提供严格基础,我们扩展了连续 MDP 同态理论,证明在 VMOC 所适配的简化抽象潜空间中学习策略,能够保持原始复杂问题解的最优性。最后,我们提出一个冷启动流程,利用有监督微调(SFT)数据把人类推理示范蒸馏进该潜 option 空间,为模型推理能力提供丰富初始化。大量实验表明,我们的方法在复杂逻辑推理基准和高难度 locomotion 任务上均取得强劲表现,验证了该框架是一种同时适用于语言与控制、学习抽象技能的原则性方法。
动机
两条动机并线:其一,LLM 的显式 CoT 逐 token 生成中间步骤,推理慢、算力贵,作者希望把「思考」搬到潜空间做隐式推理。其二,把隐式推理落到分层 RL 的 option 框架时,传统 SMDP 有三大痼疾——(1) 探索不足与 option 退化:最大似然更新下策略被早期高回报淹没,单个 option 独霸或每步切换;(2) 样本低效:半马尔可夫性质 + on-policy 采样浪费经验;(3) 计算昂贵:option 三元组用神经网络建模难优化。本文用变分 off-policy + option 嵌入 + 同态理论一次性回应这些问题。
方法
三大组件。VMOC:把 SMDP 最优 option 轨迹写成 PGM,以 HiT-MDP 作为变分分布近似,推出的 ELBO 中最大熵项自然涌现;实现为 off-policy soft actor-critic,可复用 replay buffer,option 以低成本嵌入表示。连续 HiT-MDP 同态:用向量丛(vector bundle,以状态流形 为基空间、option 空间 为纤维)刻画状态-option 联合空间上的抽象映射 ,证明最优值等价与策略 lifting。冷启动:用 SFT 的 (prompt , CoT , answer ) 三元组,通过 ELBO 与 Gumbel-Softmax 把推理蒸馏为离散 option 嵌入,给 VMOC 提供先验初始化。
结果
控制侧:在 OpenAI Gym MuJoCo 10 个环境上,VMOC 在 episodic return、收敛速度、步内方差与 10 次运行间方差四方面显著优于六个 option 基线(MOPG、DAC+PPO、AHP+PPO、IOPG、PPOC、OC)及无层级 PPO,仅在简单的 InvertedDoublePendulum 略逊;高维 Humanoid-v2()与 HumanoidStandup-v2 上优势最明显,归因于最大熵探索。语言侧:VMOC-SFT(LLaMA3.2-1B,6 个 option 嵌入,)在 CommonSense 逻辑推理取得 SOTA 78.1,OOD 的 GSM-HARD 取得最佳 15.6;但在 GSM8k-Aug/-NL、SVAMP、MultiArith 上不敌显式 CoT-SFT 与 CODI。
结论
本文把「LLM 隐式推理」与「locomotion 技能学习」统一进 option 学习框架:VMOC 的变分 off-policy 保证探索多样性与样本效率;连续 HiT-MDP 同态为「在抽象潜空间学习」提供最优性保证,回补了技能发现文献普遍缺失的理论环节;SFT 冷启动把人类推理蒸馏成可用初始化。抽象 option 空间在多跳逻辑与难样本泛化上更鲁棒,但在需精确算术模仿的任务上仍逊于显式 CoT——本质是用效率/抽象性换取部分精度。
深度精读
> 基于 arXiv HTML(LaTeXML)全文生成 · 全文 ~120 KB · 公式以 LaTeX 表达
一、研究背景与动机
深度 RL 已在 Atari、Go 等复杂域取得成功,但仍面临探索不足、时间扩展动作学习低效、样本需求巨大等挑战。分层强化学习(HRL) 中的 option 框架(Sutton et al. 2 建立在 SMDP 之上,把非平稳任务阶段切成时间扩展动作(option),由 master policy 决定何时执行/终止。然而基于 SMDP 的 option 框架长期受三大问题拖累:
1. 探索不足与 option 退化:传统最大似然(MLE)更新使 option 被早期高回报观测饱和,导致要么单个 option 独霸整个策略,要么每个时间步都切换,option 多样性坍塌;
2. 样本低效:半马尔可夫性质使 master 级每次更新跨多个时间步、信息增益低;且大量 on-policy option 算法需同时从高层与低层重新采样,昂贵;
3. 计算昂贵:option 常被定义为「初始集 + 内策略 + 终止函数」三元组,用神经网络建模难以优化。
作者的立场是:这些痼疾可以用 控制即推断(control-as-inference)的结构化变分视角 + HiT-MDP 的 option 嵌入表示 + 同态理论 一并解决;更进一步,把这套「时间抽象」搬到 LLM 上,就得到了在潜空间隐式推理、免去昂贵显式 CoT 的新范式。
二、方法详解
#### 2.1 预备:控制即结构化变分推断 & HiT-MDP
作者先给出 control-as-inference 的变分推导。引入二值最优性变量 ,令 。用变分分布
近似最优轨迹,环境动态在 ELBO 中抵消,最大熵目标自然涌现:
Theorem 1 证明该 EM 式软策略迭代收敛。option 侧采用 Li et al. 的 HiT-MDP,把 SMDP 的半马尔可夫依赖改写为马尔可夫式:
其中 option 是带时间结构 的潜变量,可用稠密嵌入表示,替代 option 三元组。HiT-MDP 已被证明与 SMDP option 框架同态等价。
#### 2.2 VMOC(关键模块)
把 SMDP 最优 option 轨迹连同动作/选项两组最优性变量 写成 PGM(式 3),再以 HiT-MDP 为变分分布近似。推出变分目标后,得到含两支最大熵项的 ELBO,并由 Theorem 2/3 保证 soft option policy iteration 在表格与近似(神经网络)设置下收敛。工程上实现为 off-policy soft actor-critic:可复用 replay buffer(样本效率)、最大熵驱动探索(避免 option 退化)、option 用低成本嵌入(计算效率)。相比同基于 HiT-MDP 但用 on-policy 梯度的 MOPG,VMOC 的 off-policy 变分方案在探索与稳定性上更优。
#### 2.3 连续 HiT-MDP 同态(核心理论贡献)
这是本文相对 LatentSkill / METRA / CSD 一脉最独特的部分。作者基于 Panangaden et al. 对标准连续 MDP 同态的形式化,首次把它扩展到 HiT-MDP。关键是用向量丛(vector bundle) 建模状态-option 联合空间:以状态流形 为基空间,option 空间 作为纤维(不同连通分量可有不同维度的 option 纤维)。连续 HiT-MDP 定义为 7 元组 。同态 由基空间映射 与逐纤维映射 组成。核心结论:
- Theorem 11 (Optimal Value Equivalence):同态保持最优值函数,(以归纳法在 Bellman 迭代上证明);
- Definition 13 / Proposition 14 (Policy Lifting):抽象空间的策略可 lift 回原空间且保持最优;
- Theorem 15 (Value Equivalence) 给出完整等价性。
这为「在 VMOC 发现的简化抽象空间里学习」提供了严格的最优性担保——技能/option 发现文献里罕见的形式化保证。
#### 2.4 抽象 HiT-MDP 上的变分推断
第 6 节把上面两块缝合:为抽象 MDP 推导 ELBO (式 24–30),并证明 Theorem 16(ELBO Equivalence under Homomorphism):关于抽象策略 最大化 ,等价于关于对应 lifted 策略 最大化原始 ELBO 。即用 VMOC 在抽象空间优化,本质就是在原始复杂空间优化变分目标。
#### 2.5 冷启动:从示范中学习潜推理(关键模块)
面向语言,先在 SFT 数据 上冷启动。生成模型:
引入后验 得 ELBO(式 12–13),分解为三项:推理重构 、答案重构 、KL 正则 。option 参数化为离散 token 序列 ,,共用 VMOC 的 option 嵌入矩阵 ;先验/后验自回归分解,用 Gumbel-Softmax 重参数化反传(Algorithm 1)。训练后学到的 与先验 作为 VMOC option 策略的初始化——相当于给 VMOC 一个「推理模式库」,再由环境交互精炼。
三、实验设置与结果
主实验 A — Locomotion(第 7.1 节):OpenAI Gym MuJoCo 10 个环境,温度 ,探索噪声 ,4 个 option,1M 步,10 次独立运行、窗口 20 平滑。对比 6 个 option 基线(MOPG、DAC+PPO、AHP+PPO、IOPG、PPOC、OC)与无层级 PPO。结果:VMOC 在回报、收敛速度、步内方差、跨运行方差上全面领先,唯一例外是简单的 InvertedDoublePendulum(疑为调参问题)。高维 Humanoid-v2()与 HumanoidStandup-v2 优势最突出,作者归因于最大熵在大状态-动作空间里避免了 MLE 的早期饱和。与同源 MOPG(on-policy)对比,VMOC 的 off-policy 变分方案明显更好。
主实验 B — 语言推理(第 7.2 节):LLaMA3.2-1B,AdamW,lr=5e-5,10% warmup 后线性衰减;6 个 option 嵌入,;8×NVIDIA H200(ml.p5d.24xlarge)。数据:in-domain(GSM8k-Aug、GSM8k-Aug-NL、CommonSense),OOD(SVAMP、GSM-HARD、MultiArith,训练于 GSM8k-NL)。基线:CoT-SFT、No-CoT-SFT、Pause-CoT-SFT、iCoT、COCONUT、CODI。
Table 1 主要数字(准确率 %):
| Model | GSM8k-Aug | GSM8k-Aug-NL | CommonSense | SVAMP | GSM-HARD | MultiArith |
|---|---|---|---|---|---|---|
| CoT-SFT | 60.8 | 55.1 | 68.2 | 66.7 | 15.8 | 99.3 |
| CODI | 55.6 | 49.7 | 74.0 | 61.1 | 12.8 | 96.1 |
| VMOC-SFT | 37.5 | 43.8 | 78.1 | 31.3 | 15.6 | 62.5 |
| COCONUT | 45.3 | 27.2 | 60.6 | 48.8 | 9.9 | 90.1 |
| No-CoT-SFT | 28.7 | 28.7 | 74.9 | 44.1 | 6.8 | 69.2 |
| Pause-CoT-SFT | 28.1 | 28.1 | - | 41.2 | 6.7 | 65.3 |
| iCoT | 19.2 | 15.1 | 72.6 | 40.9 | 5.2 | 45.8 |
分析:在 GSM 变体上 VMOC-SFT 低于显式 CoT(变分方法优化的是压缩潜表示而非文本模仿,属预期取舍);但在 CommonSense 达 SOTA 78.1,说明离散 option 潜空间擅长捕捉抽象、多跳逻辑结构;OOD 的 GSM-HARD 取得最佳 15.6,表明学到的推理策略对难样本更鲁棒、泛化更好——学到的是更根本的推理原语而非训练模式的过拟合。可视作「消融式对照」:纯隐式(No-CoT/Pause/iCoT)普遍弱,latent-code 类(COCONUT/CODI)居中,结构化 option 空间在抽象/鲁棒维度胜出。
四、Related Work 与本文定位
VMOC 融合三条线:option 框架、结构化变分 off-policy、潜变量策略。相较传统 MLE option 框架易退化、on-policy option 学习偏向低熵 option,VMOC 的最大熵项在变分框架内自然涌现并可证收敛;相较已有 off-policy option 方法(多聚焦样本效率、缺 option 行为约束),VMOC 兼具约束与嵌入学习。作者还点名批评一篇相近变分 option 工作的 PGM「可能有误、或致收敛问题」。状态抽象方面,本文承接 Panangaden et al. 的连续 MDP 同态,首次扩展到 HiT-MDP 并用向量丛形式化联合状态-option 空间。LLM 隐式推理方面,与 iCoT(逐步移除 CoT)、Pause-token、COCONUT(潜码替换 CoT)、CODI(蒸馏对齐隐状态)并列,本文独特之处是把 HiT-MDP 的离散 option 空间 作为结构化的潜推理媒介。
五、优点与局限性
优点:(1) 少见地把「隐式推理」与「技能/option 发现」统一在一套变分 HRL 框架下,跨语言与控制两模态;(2) 提供罕见的理论保证——连续 HiT-MDP 同态证明抽象空间学习保持最优,填补技能发现文献理论空白;(3) off-policy + 最大熵 + option 嵌入,同时缓解探索退化、样本低效、计算昂贵三大痼疾;(4) SFT 冷启动给出工程可落地的初始化路径。
局限:(1) 语言侧在标准算术基准(GSM8k、SVAMP、MultiArith)明显不敌显式 CoT,精度-效率权衡代价不小;(2) 只在 1B 小模型验证,规模化到大模型未知;(3) 同态理论假设(状态为拓扑流形、向量丛结构等)较强,实际是否满足难验证;(4) locomotion 只在 MuJoCo 单任务,未做真机/多任务迁移;(5) VMOC 与冷启动的完整两阶段(冷启动→RL 精炼)端到端联合训练在语言任务上似乎未充分展开;(6) option 数(4 / 6)等超参敏感性缺系统消融。
六、复现要点
- 控制:遵循 DAC 开源实现与超参,4 个 option,,探索噪声 ,1M 步,10 seeds,窗口 20 平滑;单线程 i9-9900X 亦可跑。
- 语言:LLaMA3.2-1B;AdamW,lr=5e-5,10% warmup+线性衰减;latent 词表 6 个 option 嵌入;KL 权重 ;8×H200。
- 冷启动:后验 与先验 共享编码器;Gumbel-Softmax 采样离散 option;损失 = CoT 重构 + 答案重构 + KL;推理时只用先验采样 option 再自回归解码。
- 关键实现细节见原文 Appendix B(VMOC 算法)与 Appendix C(超参)。
七、适用场景与延伸思考
适用:需要高效隐式推理而非逐字 CoT 的场景;抽象多跳逻辑推理(CommonSense 型);需要理论保证的分层技能学习/状态-option 抽象。延伸:(1) 把两阶段真正闭环——冷启动初始化后用 VMOC 的 RL 精炼语言 option,验证 CoT 精度回补;(2) 规模化到更大 LLM 与更长推理链;(3) 向量丛同态框架是否能推广到 METRA/CSD 式互信息技能发现,给这些方法补最优性保证;(4) 把控制侧学到的 option 与语言侧 option 词表做真正的跨模态共享/迁移;(5) 探索连续(而非离散 Gumbel-Softmax)option 嵌入在推理任务上的表现。
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。