arXiv 2606.30520v1 · 发布 2026-06-29

面向视觉量子强化学习的知识蒸馏分阶段混合策略

Staged Hybridisation for Visual Quantum Reinforcement Learning via Knowledge Distillation

AUTHORS Javier Lazaro, Juan-Ignacio Vazquez, Pablo Garcia-Bringas
EVIDENCE 通过知识蒸馏混合视觉量子强化学习与经典教师
SCORE 0.8
CATEGORIES TASK rl
GENERATED 2026-07-04 02:28:24 UTC

📝 TLDR

视觉量子强化学习在高维像素输入下同时优化不稳定RL和受限变分量子电路十分困难。为此,论文提出一种分阶段混合策略:先训练经典视觉教师,冻结其编码器作为特征接口,再通过知识蒸馏将策略行为压缩到紧凑的下游分类头(含经典头与VQC头)。在CartPole Pixels和Acrobot Pixels上,角度编码VQC头接近教师性能,振幅编码头极致紧凑但更脆弱。该方法将视觉QRL重构为紧凑头的学习问题,为端到端RL循环外训练小型量子兼容策略提供了可行路径。

🧭 速览

动机

视觉量子强化学习在高维像素观测、不稳定的RL优化与受限变分量子电路三重困难下难以联合训练。

方法

采用分阶段知识蒸馏:先训练经典视觉教师,冻结其编码器作为特征接口,再将策略行为蒸馏到紧凑的经典或VQC下游头中。

结果

在CartPole Pixels与Acrobot Pixels上,角度编码VQC头接近教师性能,振幅编码头极度紧凑但更脆弱且对预算敏感。

结论

该方法将视觉QRL重构为紧凑头学习问题,为端到端RL循环外训练小型量子兼容策略提供了一条实用路径。

📊 论文图表(共 3 张)

展开查看 3 张图

TL;DR

这篇论文探索了知识蒸馏在视觉量子强化学习中的应用。研究者没有选择端到端训练 CNN+VQC 混合智能体的困难路径,而是采用分阶段策略:先训练一个经典的视觉教师模型并冻结其编码器,再将教师的决策能力蒸馏到紧凑的下游模块(包括纯经典头和基于变分量子电路的混合头)。在 CartPole Pixels 和 Acrobot Pixels 两个视觉控制任务上的实验表明,角度编码的量子变分电路头能够在保持接近教师性能的同时实现参数压缩,为在标准端到端强化学习流程之外训练量子兼容策略提供了一条可行路径。

研究背景与动机

视觉环境对量子强化学习构成了三重叠加的挑战。首先,高维像素观测要求智能体具备强大的视觉感知能力;其次,强化学习的策略优化本身具有高方差特性,使得训练过程本身就不够稳定;最后,当前 NISQ 时代的变分量子电路在电路深度、可训练参数规模以及输入维度等方面都受到严格限制。这三重困难同时作用于一个端到端的混合智能体,使得直接从像素训练 CNN+VQC 混合架构的难度急剧上升。

此前的研究已经表明,在 Atari 等像素级控制任务上直接端到端训练混合视觉智能体的效果并不理想。Lockwood 与 Si 的工作在这个方向上的尝试以失败告终,提示研究者需要重新思考视觉量子强化学习的问题架构。这篇论文的核心洞察是:能否将"感知"与"紧凑控制"这两个功能解耦,让视觉编码器专注于特征提取,而让下游的控制模块保持足够紧凑以兼容量子硬件的约束?

知识蒸馏作为一种将大模型知识迁移到小模型的技术,此时进入了研究者的视野。如果能够先训练一个功能完整的经典视觉教师,再将教师的决策能力迁移到专门设计的紧凑下游模块,就可以在不牺牲太多性能的前提下实现策略的量子化。这种思路将视觉量子强化学习从端到端优化的困境中解放出来,重新定义为一个"紧凑模块学习"问题。

方法

论文提出的分阶段混合策略将整个训练流程划分为三个阶段,每个阶段都有明确的目标和接口定义。

第一阶段是视觉教师的构建。研究者使用标准的经典在线强化学习方法训练视觉教师模型,将其表示为 (视觉编码器)和 (策略头)的组合。对于 CartPole Pixels 这样的密集奖励环境,可以直接进行视觉强化学习训练;而对于 Acrobot Pixels 这类奖励稀疏的任务,则需要额外的技术路线——先在状态空间训练教师,再进行视觉 bootstrap 和像素级微调。这一阶段的核心输出是一个能够将原始像素观测映射为特征表示并输出有效策略的完整教师模型。

第二阶段是冻结特征接口与蒸馏数据集的构建。关键操作是将教师拆分为编码器 与策略头 ,然后冻结编码器的权重。具体而言,视觉编码器被固定下来作为特征接口,研究者让教师在环境中进行大量的 rollout 轨迹采集,导出离线数据集。数据集中的每条记录包含三个要素:编码后的特征 、教师的 logits 输出 、以及教师实际选择的动作 。这个数据集记作:

通过这种设计,后续的紧凑下游头只需要在这个冻结的特征空间上进行学习,而不必再处理原始的高维像素输入。这大大简化了优化问题,因为特征提取的负担已经被预先解决。

第三阶段是紧凑头的知识蒸馏。学生头 接收冻结的特征 并输出自己的 logits 。蒸馏损失采用带温度缩放的 KL 散度形式,以软化教师与学生的概率分布:

这里的温度参数 控制软化程度,较高的温度使得分布更加平滑,有助于传递教师对相似动作的相对偏好信息。最终部署的策略为

在学生头的设计上,研究者系统地对比了五种不同的架构变体。Classical (D512) 作为基线,是一个无瓶颈的经典 MLP。Classical (D16) 和 Classical (D8) 则引入了越来越强的线性瓶颈,实现参数的极致压缩。在量子侧,Angle VQC (8Q) 采用 8 维预 VQC 瓶颈配合 8 量子比特的 Y 轴角编码,通过两层 RY+RZ+环形 CNOT 纠缠电路后以 Pauli-Z 期望值读出。Amplitude VQC (9Q) 则直接将 512 维特征幅度编码到 维的量子态空间,采用相同的浅层变分电路结构。前者通过预编码瓶颈实现了降维与量子接口的平衡,后者则将压缩推向极致但引入了更高的脆弱性。所有量子电路统一采用两层变分结构,每层包含 RY 旋转、RZ 旋转和环形 CNOT 纠缠操作。

实验与结果

实验在 CartPole Pixels 和 Acrobot Pixels 两个视觉控制环境中进行,两者的观测都是 84×84 分辨率、4 帧堆叠的像素输入,但奖励密度和动力学复杂度存在显著差异——前者密集且相对简单,后者稀疏且更具挑战性。

在教师构建阶段,CartPole 的视觉教师实现了 的平均回报,Acrobot 的教师则达到了 。这些教师模型作为后续蒸馏的参考上界。

主实验对比了五种下游头在全蒸馏预算下的表现。CartPole 上的结果清晰地揭示了不同架构的权衡:Classical (D512) 达到了 的接近教师水平;即使压缩到 Classical (D8) 也仅略微下降到 ,说明对于这个相对简单的任务,紧凑的经典头完全能够保留教师的大部分能力。Angle VQC (8Q) 达到了 ,方差显著低于经典对照,证明了角度编码的量子头在这个任务上是实用的混合变体。相比之下,Amplitude VQC (9Q) 仅为 ,方差极大、性能明显下滑,尽管其参数量压缩了 99.8%(仅 56-66 个可训练参数)。

Acrobot 上的结果进一步印证了这些发现。Angle VQC (8Q) 同样表现稳健,而 Amplitude VQC (9Q) 再次暴露了其脆弱性。

预算敏感性研究揭示了架构对数据需求的关键差异。Classical (D8) 对蒸馏数据集的规模几乎不敏感,在任何预算下都能保持稳定性能。Angle VQC (8Q) 在小预算下偶尔出现波动,但总体能够达标。相比之下,Amplitude VQC (9Q) 的性能随蒸馏样本量的减少单调下降,对数据的需求最为迫切。

资源消耗方面,量子电路的模拟成本不容忽视。在全预算下,Classical 头的训练仅需约 5.9-6.3 分钟(CartPole)或 1.3 分钟(Acrobot),而 Angle VQC 头需要 66.8 分钟和 53.7 分钟,Amplitude VQC 头更是长达 115.6 分钟和 103.7 分钟。进一步分析显示,在 VQC 头的训练过程中,QNode 执行时间占据了总训练时间的 83.7%-88.4%,这意味着量子电路的模拟是绝对的性能瓶颈。

讨论与可借鉴点

这项研究的核心贡献在于方法学层面的重新定位:它没有追求量子模型在视觉任务上的端到端性能突破,而是务实地将视觉量子强化学习重构为紧凑头的学习问题。通过将感知负担外包给冻结的经典编码器,研究者成功证明了浅层变分量子电路在视觉控制任务中能够获得非平凡的策略行为。这种分阶段混合策略为量子机器学习在实际应用中的落地提供了可行的工程路径。

然而,这项研究也存在明显的局限性。首先,环境覆盖范围有限,仅涉及 CartPole 和 Acrobot 两个相对简单的像素控制任务,未能验证在 Atari 或 DeepMind Control 等更复杂视觉基准上的泛化能力。其次,紧凑性的实现是局部的——冻结的教师 CNN 编码器本身参数量巨大,整个系统的量子化程度并不像参数压缩数字暗示的那么高。此外,研究仅在无噪声态向量模拟下进行评估,未涉及真实量子硬件或噪声模型的实验。变分电路的设计也相对简单,仅采用了 RY+RZ+环形 CNOT 的组合,没有系统探索更丰富的 ansatz 结构。

对于后续研究而言,这篇论文的启示在于:知识蒸馏可以作为量子机器学习落地的重要桥梁,将"能否训练"与"如何高效训练"解耦开来。未来的工作可以在更复杂的视觉环境中验证这一范式的有效性,探索端到端预训练特征与蒸馏特征的协同优化,并考虑在真实量子硬件上评估部署后的策略表现。

摘要

视觉环境对量子强化学习(QRL)而言是一个具有挑战性的场景:高维观测、不稳定的强化学习优化以及受限的变分量子电路(VQC)难以联合训练。本文研究将知识蒸馏(KD)作为一种分阶段混合策略应用于视觉QRL。我们并非端到端地从像素训练混合视觉智能体,而是首先训练一个经典视觉教师模型,将其编码器冻结作为特征接口,并将教师策略行为蒸馏到紧凑的下游模块中。这些下游模块可以是经典的,也可以基于VQC,从而使得小型量子兼容学生模型能够在与紧凑经典对照组相同的冻结表征下进行评估。我们在 CartPole Pixels 和 Acrobot Pixels 上对该流水线进行了评估。结果表明,分阶段知识蒸馏能够使浅层VQC模块在直接基于像素训练将极为困难的场景中获得非平凡的视觉控制行为。角度编码的VQC模块保留了接近教师的性能,而振幅编码的模块则将紧凑性推向极致,但代价是更高的脆弱性、更强的预算敏感性以及更长的仿真时间。总体而言,分阶段知识蒸馏将视觉QRL重新构建为一个紧凑模块学习问题,为在标准端到端强化学习流程之外训练小型量子兼容策略开辟了一条切实可行的路径。

Abstract

Visual environments are a demanding setting for quantum reinforcement learning (QRL): high-dimensional observations, unstable RL optimisation, and constrained variational quantum circuits (VQCs) are difficult to train jointly. This paper studies knowledge distillation (KD) as a staged hybridisation strategy for visual QRL. Instead of training a hybrid visual agent end-to-end from pixels, we first train a classical visual teacher, freeze its encoder as a feature interface, and distil the teacher's policy behaviour into compact downstream heads. These heads can be classical or VQC-based, enabling small quantum-compatible students to be evaluated under the same frozen representation as compact classical controls. We evaluate the pipeline on CartPole Pixels and Acrobot Pixels. The results show that staged KD enables shallow VQC heads to acquire non-trivial visual-control behaviour in settings where direct pixel-based training would be substantially more difficult. Angle-encoded VQC heads retain near-teacher performance, while amplitude-encoded heads push compactness to an extreme regime, at the cost of greater fragility, stronger budget sensitivity, and higher simulation time. Overall, staged KD reframes visual QRL as a compact-head learning problem, opening a practical route for training small quantum-compatible policies outside the standard end-to-end RL loop.


论文详细总结(自动生成)

论文总结:面向视觉量子强化学习的知识蒸馏分阶段混合策略

1. 核心问题与研究动机

视觉环境对量子强化学习(QRL)构成严峻挑战,主要困难源于三重叠加:

  • 高维像素观测:智能体需同时学习感知与控制;
  • RL 优化的不稳定性:策略梯度类方法本身方差大;
  • 受限的变分量子电路(VQC):电路深度、可训练性、输入维度均受 NISQ 时代硬件约束。

在像素级控制场景下,直接以端到端方式训练 CNN+VQC 的混合智能体已被前人研究证明效果不佳(如 Lockwood & Si 在 Breakout/Pong 上失败)。因此,论文提出将"感知"与"紧凑控制"解耦,核心问题是:能否通过一种分阶段混合策略,使浅层 VQC 在视觉控制任务中获得非平凡的策略行为?


2. 方法论

2.1 核心思想

将视觉 QRL 重构为"紧凑下游策略头"的学习问题,取代端到端像素训练。三阶段流水线:

1. Stage 1(视觉教师构建):先用经典在线 RL 训练视觉教师。CartPole Pixels 采用直接视觉 RL;Acrobot Pixels 因奖励稀疏,采用"状态 RL → 视觉 bootstrap → 像素微调"的额外分级路线。

2. Stage 2(冻结特征接口与蒸馏数据集):将教师拆为视觉编码器 与策略头;冻结编码器,对教师在环境中进行 rollout,导出离线特征级数据集:

其中 为教师 logits, 为所选动作。

3. Stage 3(紧凑头蒸馏):学生头 在冻结特征 上输出 logits ,通过温度缩放 KL 散度匹配教师软化分布:

最终部署策略为

2.2 学生头家族(五种)

变体描述关键特性
Classical (D512)无瓶颈,直接 MLP基线
Classical (D16)线性瓶颈→16 维→MLP强压缩经典
Classical (D8)线性瓶颈→8 维→MLP极致压缩经典
Angle VQC (8Q)8 维预 VQC 瓶颈 → 8 量子比特 Y 轴角编码 → 2 层 RY+RZ+环形 CNOT → Pauli-Z 期望 → 线性读出主要混合变体
Amplitude VQC (9Q)直接将 512 维特征幅度编码至 维量子态 → 相同浅层变分电路极致紧凑对比

VQC 统一为 2 层变分电路(每层 RY+RZ+环形 CNOT 纠缠)。


3. 实验设计

3.1 环境

  • CartPole Pixels:密集奖励,相对易学的视觉控制任务;
  • Acrobot Pixels:稀疏奖励、动力学复杂,作为压力测试;
  • 两者均为 84×84 分辨率、4 帧堆叠的像素观测。

3.2 教师构建

  • CartPole:直接视觉 RL,5 个种子,教师平均回报
  • Acrobot:状态 RL→视觉 bootstrap→像素微调,5 个种子,教师平均回报

3.3 对比方法

五类学生头在同一冻结 512 维教师特征接口同一蒸馏协议下对比:

  • 三种紧凑经典头(D512/D16/D8)作为强对照;
  • 两种 VQC 头(角度编码、振幅编码);
  • 教师自身作为上界参考。

3.4 评估指标

  • 主要指标:selected return ,避免低估峰值;
  • 漂移 量化训练后性能退化;
  • 辅助指标:可训练头参数量、相对 D512 的参数削减比例、总训练时间、QNode 执行时间占比。

3.5 评估范式

  • 主比较:全下游 KD 数据集下五种头对比;
  • 预算敏感性研究:缩减蒸馏数据集规模,比较 Classical (D8)、Angle VQC (8Q)、Amplitude VQC (9Q)。

4. 资源与算力

  • 模拟后端:PennyLane 的 lightning.qubit(无噪声态向量模拟);
  • 硬件:AMD Ryzen 9 9900X CPU,16 GB RAM,Ubuntu 24.04;
  • 未使用 GPU(量子电路态向量模拟在 CPU 上即可完成);
  • 训练时长(全预算中位数):
  • CartPole:Classical 头 ≈5.9–6.3 分钟;Angle VQC ≈66.8 分钟;Amplitude VQC ≈115.6 分钟;
  • Acrobot:Classical 头 ≈1.3 分钟;Angle VQC ≈53.7 分钟;Amplitude VQC ≈103.7 分钟;
  • QNode 时间占比:VQC 头训练中 83.7%–88.4% 时间消耗于 QNode 执行。

5. 实验数量与充分性

  • 5 种学生头 × 2 个环境 × 5 个种子 = 50 组主实验(Table 2);
  • 预算扫描:3 种头 × 2 个环境 × 多档预算(至少 5 档,图 2);
  • 计算开销分析:全预算下参数量、训练时间、QNode 时间占比的完整对比(Table 3);
  • 教师构建:每环境 5 个种子,并分别报告均值与标准差(Table 1);
  • 公平性:所有学生共享同一冻结 512 维教师特征与同一 KD 损失协议,差异仅在下游头;每个环境使用 100 episode 评估;
  • 不足:实验仅覆盖 2 个像素控制环境,未涉及 Atari 等更复杂视觉任务;种子数较少(5),部分 VQC 变体标准差较大。

总体而言,实验设计在纵向(多种头、多种预算)横向(两环境、多种子)上较为充分,但环境覆盖广度有限,主要面向方法论论证而非性能 SOTA 验证。


6. 主要结论与发现

1. 紧凑头可保留大部分教师视觉控制行为:CartPole 上 Classical (D8) 达 ,与 Classical (D512) () 几乎一致;Angle VQC (8Q) 达

2. Angle VQC (8Q) 是最实用的混合变体:在两环境下均接近紧凑经典对照;8 维预 VQC 瓶颈同时充当降维与"经典-量子接口"。

3. Amplitude VQC (9Q) 是极致紧凑但脆弱:CartPole 仅 ;参数量压缩达 99.8%(仅 56–66 个可训练参数),但需更多蒸馏数据、稳定性更差、仿真时间最长。

4. 预算敏感性架构依赖性强:Classical (D8) 对预算几乎不敏感;Angle VQC (8Q) 在小预算下偶有波动但能达标;Amplitude VQC (9Q) 性能随蒸馏样本量单调提升,对数据需求最高。

5. 计算开销是混合方法的现实瓶颈:尽管 VQC 头参数极少,但 QNode 执行占总训练时间的 83.7%–88.4%,训练时间比同压缩率经典头高约 10–18 倍。

6. 方法学核心论点:分阶段 KD 把"视觉 QRL"重写为"紧凑头学习",使浅层 VQC 能在冻结特征上评估,而不必承担端到端感知负担。


7. 优点

  • 方法学定位清晰:明确将 KD 视为"分阶段混合策略"而非简单压缩工具,区分了"局部紧凑"与"全局压缩"。
  • 公平对照设计严谨:所有学生共享同一冻结 512 维特征接口与同一蒸馏协议,仅下游头不同;同环境下设教师参考与经典对照。
  • 多维评估体系完善:性能(selected return + drift)、紧凑度(参数削减)、效率(训练时间、QNode 占比)、数据需求(预算扫描)四维度同步报告。
  • 环境差异互补:CartPole(密集奖励)与 Acrobot(稀疏奖励)覆盖两类典型设置。
  • 关注评估陷阱:提出 与漂移指标,避免 RL 训练中常见的"仅报最终 checkpoint 低估能力"问题。
  • 诚实呈现限制:明确指出紧凑性是局部的、仿真成本高、不声称量子优于经典。

8. 不足与局限

  • 环境覆盖有限:仅 2 个低维像素控制任务,未涵盖 Atari、DM Control 等更复杂视觉 RL 基准;结论外推性受限。
  • 种子数较少:每条件 5 个种子,对 Amplitude VQC 等高方差估计可能不足。
  • 量子侧限制
  • 仅在无噪声态向量模拟下评估,未涉及真实量子硬件或噪声模型;
  • VQC 电路设计相对简单(仅 RY+RZ+环形 CNOT),未系统探索不同 ansatz 与编码方式;
  • QNode 仿真开销主导训练时间,距实际硬件部署的经济性仍有距离。
  • 紧凑性是局部的:冻结的教师 CNN 编码器仍参数量巨大;论文并未压缩"整个视觉策略"为量子模型。
  • 策略蒸馏单一:仅采用 policy-logit KL 蒸馏,未对比 value-based、joint policy-value 或其他教师-学生目标。
  • 潜在偏差风险:教师本身的策略质量与覆盖面直接决定学生上限;不同环境下教师构造路径不同(Acrobot 用了额外 bootstrap),可能引入教师质量差异带来的间接偏差。
  • 缺乏与端到端 VQC 基线的直接比较:未在同一环境上同时训练 CNN+VQC 端到端基线,难以量化"分阶段"相对于"端到端"的精确收益。
  • 应用限制:当前方法本质上是离线蒸馏,依赖一个已训练良好的教师;对无法获取优质视觉教师的实际场景适用性有限。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记