arXiv 2607.04364v1 · 发布 2026-07-05

强化学习也会遗忘!迈向持续策略优化

RL Forgets! Towards Continual Policy Optimization

AUTHORS Mao-Lin Luo, Zhe-Xu Wang, Zi-Hao Zhou, Bo Ye, Jian Zhao, Min-Ling Zhang, Tong Wei
EVIDENCE 强化学习持续后训练与策略优化算法
SCORE 0.8
CATEGORIES TASK rl
GENERATED 2026-07-12 21:24:33 UTC

📝 TLDR

多模态模型的持续后训练逐渐依赖强化学习,但强化学习不易遗忘的假设缺乏充分验证。本文构建多源多模态推理持续学习基准MRCL,发现强化学习同样存在严重灾难性遗忘。为此提出无回放框架Continual Policy Optimization(CPO),通过基于先验任务行为KL的目标约束参数漂移。实验显示CPO在多模型规模上一致降低遗忘并保留甚至提升预训练能力,其中Qwen3-VL-8B上遗忘减少13.7%、预训练能力提升7.0%。

🧭 速览

动机

现有证据多基于过时或同质化的多模态基准,难以支撑强化学习天然抗遗忘的广泛假设。

方法

提出CPO,一种基于先验任务行为KL目标的无回放参数正则化框架,限制模型在历史任务上的策略漂移。

结果

在多模型规模上一致有效,其中Qwen3-VL-8B上遗忘降低13.7%,预训练能力提升7.0%。

结论

证明强化学习并非天然抗遗忘,基于KL的参数正则化是持续后训练中兼顾稳定性与可塑性的可行路径。

📊 论文图表(共 10 张)

展开查看 10 张图

TL;DR

多模态大模型的持续后训练中,社区长期认为强化学习比监督微调更抗遗忘,但这一假设在最新基准上缺乏验证。本文构建了多模态推理持续学习基准 MRCL,实验发现强化学习同样会遭受严重的灾难性遗忘。为此提出无回放框架 CPO,通过参数移动正则化限制策略在旧任务上的漂移。在 Qwen3-VL-8B 上,CPO 将遗忘率降低 13.7%,同时将预训练能力提升 7.0%,挑战了 RL 天然抗遗忘的固有认知。

研究背景与动机

多模态大模型正以前所未有的速度融入各类应用场景,视觉-语言模型需要持续适应新任务的需求日益迫切。持续后训练已成为使模型适应不断演变任务的核心范式,但如何在学习新知识的同时保持对旧任务的掌握,始终是这一范式面临的核心挑战——即[[灾难性遗忘]]问题。

近年来,一个值得注意的趋势是社区越来越倾向于在持续后训练中使用[[强化学习]]而非[[监督微调]]。这一偏好的背后是一种广泛存在的信念:强化学习本质上不易发生遗忘。多个前沿研究都报告称,RL 方法引入的遗忘显著少于 SFT 方法。然而,本文作者敏锐地指出,这些乐观结论可能存在一个根本性问题——它们大多来自过时或同质化的评估基准。

具体而言,现有证据的局限性体现在多个层面。首先,许多评测使用了年份较早的数据集来训练新近发布的大模型,例如用 2018-2023 年的数据训练 2025 年发布的 Qwen2.5-VL,这可能导致数据泄露——预训练语料中已经包含了评测数据,使得遗忘程度的测量被严重低估。其次,部分研究仅在单一任务(如 jigsaw 拼图)上得出结论,缺乏对多样化推理能力的覆盖。更重要的是,关于 RL 为何抗遗忘的机制本身也存在争议:一些研究者认为 KL 正则项是关键,而另一些则认为其作用可以忽略。这些相互矛盾的结论促使本文作者重新审视一个根本问题:在更新、更具挑战性的多模态推理基准上,RL 后训练是否仍然显著抗遗忘?如果不是,如何在无历史数据回放的条件下有效抑制遗忘?

方法

针对上述问题,本文提出了两个核心贡献:MRCL 基准和 CPO 方法。

CPO 的核心设计理念源于对 GRPO(Group Relative Policy Optimization)中 KL 正则项失效机制的深入分析。作者证明了一个关键命题:在持续学习场景中,新旧任务的分布差异使得在当前任务数据上计算的 KL 正则项无法有效约束策略在先前任务上的漂移。基于这一理论洞察,CPO 转而直接在参数空间施加约束。

具体而言,论文通过 Fisher 信息矩阵建立了参数移动与旧任务性能退化之间的联系。理论分析表明,在局部平稳 SGD 假设下,参数移动的期望与 Fisher 信息矩阵的对角元成正比。这一发现具有重要意义:它意味着可以直接使用训练过程中参数的实际移动量作为 Fisher 重要性的无梯度代理,而无需额外估计 Fisher 矩阵或存储旧任务数据。

基于这一洞见,CPO 在每次训练新任务时维持一个累积保护集合 ,并优化如下目标:

其中 是旧策略的参数, 是正则化强度。任务完成后,按照移动量大小选取 top- 的参数加入保护集。这一设计的巧妙之处在于:它无需回放任何旧数据,仅通过监控参数在训练过程中的漂移程度来识别对旧任务重要的“关键参数”,并限制这些参数在新任务训练时的移动。

论文特别强调了一个关键设计选择:使用 L1 而非 L2 正则。实验表明,掩码 L2 正则会导致受保护参数上的密集移动模式,而掩码 L1 保持稀疏移动模式。在 Qwen3-VL-2B 上的消融实验显示,将 L1 替换为 L2 会使 MFN 与 MTA 分别下降 23% 和 15%,说明 L1 的稀疏性对于平衡保护效果与新任务学习至关重要。

实验与结果

论文首先构建了 MRCL(Multimodal Reasoning Continual Learning)基准,以解决现有评测的局限性。该基准包含五个任务,全部来自 2025 年中后发布的数据集,包括医学问答(MedBookVQA)、导航推理(Navigation)、数学推理(We-Math2.0)、视觉谜题(Puzzle)和金融理解(FinMME)。这些数据集涵盖多种认知推理能力,且发布时间与训练模型的预训练数据存在时间差,有效降低了数据泄露风险。

实验采用三个评估指标:MFT(Mean Finetune Accuracy)反映可塑性,MFN(Mean Final Accuracy)反映稳定性,MTA(Mean Task Accuracy)综合两者。论文对比了多种基线方法,包括 SFT 系列(Full SFT、LoRA、O-LoRA、SEFE、KeepLoRA)和 RL 系列(GRPO、GRPO*、GSPO)。

核心实验结果揭示了几个重要发现。首先,RL 同样会灾难性遗忘:在 MRCL 基准上,GRPO/GSPO 等 RL 方法在 5 阶段持续训练后出现严重的旧任务性能退化。其次,GRPO 的当前任务 KL 不能抑制遗忘:GRPO*(带当前任务 KL 约束 )反而损害可塑性,且不能阻止旧任务漂移。第三,CPO 显著优于所有基线:在 Qwen3-VL-2B/4B/8B 三个规模上,CPO 均实现最佳 MFN,其中 8B 模型上 CPO 将 GSPO 的 MFN 从 61.79% 提升至 75.46%,提升幅度达 13.67%;相比 Full SFT(43.99%)提升约 31.5%。

更值得关注的是 CPO 在通用能力保留方面的表现。论文进一步在 10 个分布外多模态基准上评估了模型的预训练能力保留情况,涵盖 STEM 推理、通用 VQA、幻觉检测、文档理解和定位等多种能力。在 Qwen3-VL-8B 上,CPO 实现了 7.0% 的预训练能力提升,表明该方法在抑制遗忘的同时,甚至能够增强而非削弱模型的通用能力。

讨论与可借鉴点

这项研究的价值首先在于它挑战了一个在社区中根深蒂固的假设。RL 天然抗遗忘的信念为近年来越来越多地采用 RL 后训练提供了直觉支撑,但本文通过精心设计的基准和充分的实验表明,这一信念可能过于乐观。这一发现对于实践者的启示是:在部署持续后训练系统时,无论使用 SFT 还是 RL,都应当将遗忘防控纳入核心设计考量。

CPO 方法的一个核心优势在于其无回放特性。传统持续学习方法往往依赖回放缓冲区存储旧数据,这在 RL 场景下尤其困难——不仅需要存储数据,还需要能够生成与训练时相同分布的交互轨迹。CPO 通过将问题从“如何回放数据”转化为“如何识别和保护关键参数”,提供了一条优雅的解决路径。其背后的理论分析——参数移动与 Fisher 信息矩阵的等价关系——也具有独立的理论价值。

然而,这项工作也存在若干局限性。首先,论文未对 top- 比例和 强度等关键超参进行系统性消融实验。其次,CPO 目前仅在 Qwen3-VL 系列上验证,对于其他模型架构(如 InternVL、LLaVA)的泛化性尚未探索。再次,方法依赖参数移动量作为重要性指标,这在理论上假设了训练动态的平稳性,实际应用中可能出现偏差。最后,论文未讨论任务边界明确这一假设在实际场景中如何确定,以及当任务边界模糊或存在任务重叠时方法的表现。

对于持续学习领域而言,这项工作开辟了一个新的研究方向:将持续学习问题的研究从监督微调扩展到[[强化学习]]后训练场景。同时,其基于参数空间的正则化思路为设计更通用的抗遗忘机制提供了新范式。在更广泛的意义上,这项研究提醒我们不应盲目相信某些方法“天然”具备某些特性,而应当通过严谨的实验验证来检验这些假设。

摘要

持续后训练正成为使视觉-语言模型适应不断演变任务的核心范式。最近的研究越来越倾向于使用强化学习而非监督微调,其依据在于人们相信强化学习本质上不易发生遗忘。然而,这一信念尚未得到充分验证,因为现有证据大多来自过时或同质化的基准。为重新审视这一假设,我们提出了 MRCL,一个基于多样化且最新发布的多模态数据集构建的多模态推理持续学习基准。在 MRCL 上的实验表明,强化学习在持续后训练过程中仍可能遭受严重的灾难性遗忘。为应对这一挑战,我们提出了持续策略优化(Continual Policy Optimization, CPO),一个基于先前任务行为 KL 目标的无回放框架。CPO 采用具有理论依据的参数移动正则化来限制在先前任务上的策略漂移。在多种模型规模上的大量实验表明,CPO 在保留预训练模型能力的同时持续降低遗忘率,在某些情况下还能提升这些能力。在 Qwen3-VL-8B 上,CPO 将遗忘率降低了 13.7%,并将预训练能力提升了 7.0%。实现代码可在 https://github.com/MaolinLuo/CPO 获取。

速览

TLDR:持续后训练正成为多模态大模型适应新任务的主流方式,社区普遍认为强化学习比监督微调更不易遗忘。本文构建多模态推理持续学习基准 MRCL,实验表明 RL 仍会发生严重灾难性遗忘。为此提出无回放的持续策略优化方法 CPO,利用基于旧任务行为 KL 的参数移动正则化约束策略漂移。在 Qwen3-VL-8B 上遗忘降低 13.7%,预训练能力提升 7.0%。 \

Motivation:社区广泛认为 RL 后训练比 SFT 更抗遗忘,但该直觉在最新多模态基准上缺乏充分验证。 \

Method:提出无回放框架 CPO,基于旧任务行为 KL 目标推导参数移动正则项,限制策略在先前任务上的漂移。 \

Result:在 MRCL 及多模型规模实验上,CPO 持续降低遗忘;Qwen3-VL-8B 上遗忘减少 13.7%,预训练能力提升 7.0%。 \

Conclusion:CPO 在抑制灾难性遗忘的同时保留乃至增强预训练能力,挑战了 RL 天然抗遗忘的固有认知。

Context:该工作将持续学习遗忘问题拓展至 RL 后训练场景,针对现有基准同质化、过时等局限构建 MRCL,并探索无回放正则化路径;仍依赖旧任务分布近似,未解决任务异质性下的稳定性问题。


Abstract

Continual post-training is becoming a central paradigm for adapting vision-language models to evolving tasks. Recent work has increasingly favored reinforcement learning over supervised fine-tuning, driven by the belief that reinforcement learning is inherently less prone to forgetting. However, the belief remains insufficiently validated, as existing evidence is largely drawn from outdated or homogeneous benchmarks. To revisit this assumption, we introduce MRCL, a Multimodal Reasoning Continual Learning benchmark built from diverse and recently released multimodal datasets. Experiments on MRCL show that reinforcement learning can still suffer from severe catastrophic forgetting during continual post-training. To address this challenge, we propose Continual Policy Optimization (CPO), a replay-free framework grounded in the prior-task behavioral KL objective. CPO uses a theoretically justified parameter-movement regularization to limit policy drift on previous tasks. Extensive experiments across multiple model scales demonstrate that CPO consistently reduces forgetting while preserving, and in some cases improving, pretrained model capabilities. On Qwen3-VL-8B, CPO reduces forgetting by 13.7\% and improves pretrained capability by 7.0\%. The implementation code is available at https://github.com/MaolinLuo/CPO.


论文详细总结(自动生成)

论文总结:RL Forgets! Towards Continual Policy Optimization

1. 核心问题与研究动机

随着视觉-语言模型(VLM)在动态环境中持续部署,持续后训练(continual post-training)成为使模型适应新任务的核心范式,但其关键挑战在于灾难性遗忘(catastrophic forgetting):模型在学习新任务时会显著丢失先前已掌握的能力。

近年社区普遍存在一种信念:强化学习(RL)比监督微调(SFT)天然更抗遗忘。多个研究(Shenfeld et al., 2026; Zhang et al., 2026; Lai et al., 2025; Chen et al., 2025a)报告 RL 引入的遗忘显著少于 SFT。然而本文指出:

  • 现有评测多基于过时或同质化的基准,例如 Lai et al. (2025) 使用 2018–2023 年数据集训练 2025 年发布的 Qwen2.5-VL,可能与预训练语料重叠,难以真实反映遗忘程度;
  • 部分研究仅在单一任务(如 jigsaw)上得出结论,覆盖面不足;
  • 关于 RL 为何抗遗忘的机制存在争议:Shenfeld et al. 认为归功于 GRPO 中的 KL 正则项,Lai et al. 与 Chen et al. 则认为 KL 项作用可忽略。

因此,本文的核心问题是:在更新、更具挑战性的多模态推理基准上,RL 后训练是否仍然显著抗遗忘?若否,如何在无历史数据回放的条件下有效抑制遗忘?


2. 方法论

2.1 总体框架

本文提出 Continual Policy Optimization (CPO),一种无回放(replay-free)的持续 RL 框架。其核心思想是:在持续学习过程中,应通过约束当前策略在先前任务上的行为 KL 漂移来抑制遗忘,而非依赖当前任务上的 KL 正则。

2.2 理论分析:旧任务行为 KL 约束

Proposition 3.1(有限视野 KL 遗忘界):给定旧任务 ,设旧策略 与当前策略 在旧任务前缀访问分布下的平均 token 级 KL 为

\bar{D}^{T_{i-1}}_{\tilde\pi}_{\text{KL}}(\tilde\pi,\pi) = \mathbb{E}_{(t,x,y_{<t})\sim d^{T_{i-1}}_{\tilde\pi}}\bigl[D_{\text{KL}}(\tilde\pi(\cdot|x,y_{<t}) \,\|\, \pi(\cdot|x,y_{<t}))\bigr]

则旧任务性能退化满足:

|\eta_{i-1}(\tilde\pi) - \eta_{i-1}(\pi)| \leq B_{i-1}\sqrt{\tfrac{H}{2}\bar{D}^{T_{i-1}}_{\tilde\pi}_{\text{KL}}(\tilde\pi,\pi)}

该证明通过 Pinsker 不等式与自回归 KL 链式分解完成(详见 Appendix A.1)。关键洞见:GRPO 中在当前任务 数据上计算的 KL 正则项 仅当新旧任务分布相近时才近似等价于旧任务 KL,而持续学习中新旧分布差异显著,因此 GRPO 的 KL 项并不能真正抑制旧任务遗忘。

2.3 无回放参数替代目标

由于无法访问旧任务数据 ,直接计算 不可行。本文在旧策略参数 附近对旧任务 KL 进行二阶 Taylor 展开:

其中 在数学上等价于旧任务的 Fisher 信息矩阵(FIM)的对角部分:

为避免 FIM 估计带来的额外梯度与内存开销,Proposition 3.2(参数移动作为含噪 Fisher 代理)证明:在局部平稳 SGD 假设下,期望平方参数移动

近似均匀时,按参数移动幅度排序与按 Fisher 对角元排序一致。基于此洞见,直接采用训练过程中参数的实际移动量 作为 Fisher 重要性的无梯度代理

2.4 实际算法实现

CPO 在训练任务 时维持累积保护集合 ,并优化如下目标:

其中 的二元掩码。任务完成后,按移动量大小选取 top-% 参数加入保护集:

关键设计选择:使用 L1 而非 L2 正则。实验表明(Fig. 3-4),掩码 L2 在受保护参数上引发密集移动,而掩码 L1 保持稀疏移动模式。在 Qwen3-VL-2B 上将 L1 替换为 L2 会使 MFN 与 MTA 分别下降 23% 和 15%。

算法流程(Algorithm 1)

1. 初始化保护集

2. 对每个任务 :以旧检查点 初始化,按式 训练;保存任务末检查点 ;按式更新


3. 实验设计

3.1 新基准:MRCL

为减少预训练数据污染并覆盖多种认知推理(System 2 thinking)能力,本文构建 MRCL (Multimodal Reasoning Continual Learning) 基准,五个任务全部来自 2025 年中后发布的数据集:

任务发布时间训练/测试规模答案格式
MedBookVQA2025-061.4k / 0.6k多选题
Navigation2025-101.5k / 0.5k方向序列
We-Math2.02025-085.7k / 3.7k数值/多选
Puzzle2025-106.0k / 0.4k多选题
FinMME2025-058.0k / 1.0k数值/多选

训练序列为 5 阶段顺序后训练。

3.2 评估指标

  • MFT(Mean Finetune Accuracy):刚训练后各任务准确率均值,反映可塑性
  • MFN(Mean Final Accuracy):全部训练完成后各任务准确率均值,反映稳定性
  • MTA(Mean Task Accuracy):每个任务在整个训练过程中的平均准确率,综合稳定性与可塑性。

此外,附录 Fig. 1 还引入了 CAI(累计目标任务提升)与 CAD(累计旧任务衰减),以绘制可塑性-稳定性 Pareto 前沿。

3.3 对比方法

  • SFT 基线:Full SFT、LoRA(r=128)、O-LoRA、SEFE、KeepLoRA;
  • RL 基线:GRPO(带 DAPO 改进)、GRPO*(GRPO + 当前任务 KL 约束 )、GSPO;
  • 本文方法:CPO(基于 GSPO,, top-=10%)。

3.4 通用能力保留评测

在 MRCL 训练完成后,进一步在 10 个分布外多模态基准上评估预训练能力保留情况,包括 STEM(MMMU-Pro、MathVista、MathVision、MathVerse)、通用 VQA(RealworldQA、MMStar)、幻觉(POPE)、文档/图表理解(DocVQA、CharXiv)、定位(CountBenchQA)。


4. 资源与算力

论文明确说明:

  • GPU 型号:NVIDIA H100;
  • 配置:2B/4B LoRA 实验使用 1 张 GPU;2B/4B Full SFT 与 8B LoRA 使用 2 张 GPU;8B Full SFT 使用 4 张 GPU;所有 RL 实验使用 8 张 GPU
  • 关键超参:每 prompt 8 次 rollouts,采样温度 0.8,最大生成长度 2048(域内)/16384(域外评估);
  • 模型规模:Qwen3-VL-2B / 4B / 8B。

训练时长未在论文中明确披露,这是一个相对不足的信息。


5. 实验数量与充分性

实验规模较为充分:

  • 3 个模型规模 × 9 种方法 × 5 阶段持续训练 = 至少 135 组训练结果;
  • 提供了每个模型规模下各方法在 5 个阶段、5 个任务上的完整准确率矩阵(Tab. 8/9/10),便于细致分析;
  • 在 10 个分布外基准上对 3 个模型规模 × 6 种方法进行通用能力评估;
  • 提供 Pareto 前沿图(Fig. 1)、正则损失曲线(Fig. 4)、参数移动热力图(Fig. 3)以及 L1 vs L2 消融;
  • 详细的案例研究(Case Study)展示 CPO vs GSPO 在 Puzzle、We-Math2、Navigation、MedBookVQA 上的推理质量差异。

消融方面:包含 L1 vs L2 正则对比,但未对 top- 比例、 强度、回放策略等关键超参进行系统消融,亦未在更多模型系列(如 InternVL、LLaVA)上验证泛化性。


6. 主要结论与发现

1. RL 同样会灾难性遗忘:在 MRCL 新基准上,GRPO/GSPO 等 RL 方法在 5 阶段持续训练后出现严重的旧任务性能退化(如 Qwen3-VL-8B 上 GSPO 的 MFN 仅 61.79%,而 CPO 达 75.46%)。

2. GRPO 的当前任务 KL 不能抑制遗忘:GRPO*(带 的当前任务 KL)反而损害可塑性(Qwen3-VL-2B MFT 从 60.86 降至 53.72),且不能阻止旧任务漂移。

3. CPO 显著优于所有基线

  • Qwen3-VL-2B:CPO MFN = 57.82%,相比 GSPO 提升 9.18%;
  • Qwen3-VL-4B:CPO MFN = 71.56%,相比 GSPO 提升 17.82%;
  • Qwen3-VL-8B:CPO MFN = 75.46%,相比 GSPO 提升 13.67%;相比 Full SFT(43.99%)提升约 31.5%。

4. CPO 在保留通用能力方面同样优异:在 10 个域外基准上,CPO 在 8B 模型上平均得分 66.68%,显著高于 Base(59.71%)、GRPO(48.31%)、GSPO(52.51%),并在数学相关基准(如 MathVista 76.00、MathVision 51.61、MathVerse 57.51)上甚至超过预训练基模型,呈现正向迁移。

5. 良好的可扩展性:CPO 的优势随模型规模扩大而扩大,表明基于参数移动的正则化在大模型上更具可分辨性。

6. 案例分析:GSPO 在训练后期出现"认知坍塌"(答非所问、逻辑混乱),而 CPO 仍能保持结构化推理链(详见附录 F)。


7. 优点

1. 问题揭示与基准贡献:MRCL 通过精选 2025 年中后发布的任务、覆盖 5 种异质推理能力(医学、导航、数学、空间拼图、金融),有效避免了预训练污染问题,为持续后训练研究提供了更可靠的评测平台。

2. 理论严谨性:从 Pinsker 不等式 + 自回归 KL 链式分解推导出旧任务遗忘的紧致上界,将 EWC 的参数正则化思想与现代 RL 的策略优化形式化结合,理论动机清晰。

3. 方法实用性:相比 EWC 需要计算 Fisher 信息矩阵(高内存、高计算),CPO 仅需维护一个二元掩码与上界检查点,额外开销极小,适合大规模 VLM 后训练。

4. 统一框架:将"防止遗忘"问题统一为"约束旧任务行为 KL",并通过参数移动代理实现,避免了显式回放或额外模型组件。

5. 正迁移现象:CPO 在数学推理上甚至超过 Base 模型,提示参数移动正则可能过滤了噪声更新。

6. 多尺度验证:在 2B/4B/8B 三个模型规模上系统验证了方法的鲁棒性。


8. 不足与局限

1. 理论假设较强:Proposition 3.2 中 Fisher 排序一致性依赖 近似均匀的假设;当奖励-分数对齐 在参数间差异显著时,参数移动代理的排序可靠性可能下降,论文未给出经验性验证。

2. 超参敏感性与消融不足:top- 比例固定为 10%, 固定,未进行系统的超参敏感性分析 过小可能保护不足,过大则会抑制可塑性。

3. 任务序列单一:所有实验均使用相同的固定任务序列(MedBook → Navigation → We-Math → Puzzle → FinMME),未考察任务顺序敏感性(task order sensitivity),这在持续学习中是公认的关键挑战。

4. 数据隐私与分布外假设:CPO 假设历史数据完全不可用,但在实际场景中可能存在部分回放或合成旧样本的折衷方案;本文未与此类折衷策略对比。

5. 方法泛化性未充分验证:仅在 Qwen3-VL 系列上实验,未在 InternVL、LLaVA-OneVision 等其他 VLM 系列上验证;且仅覆盖视觉-语言模态,未扩展到纯 LLM 持续学习。

6. 训练时长与碳排放未报告:缺乏训练时长、能耗等可持续性指标,不利于复现成本评估。

7. 回放方法的公平性:与基于回放的方法(如 iCaRL、BERT-style replay)的直接对比缺失,但本文在引言中明确以"无回放"为核心卖点,故该省略有一定合理性。

8. 多模态特异性:基准任务以视觉为主,但参数移动正则本质与模态无关,未探索视觉编码器与语言解码器在正则强度上的差异化设计。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记