带可验证物理的强化学习:用连续奖励对LLM进行后训练
Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards
📝 TLDR
提出基于物理仿真可验证奖励的LLM强化学习后训练方法,以连续奖励信号提升物理推理能力。
🧭 速览
现有LLM求解偏微分方程仅依赖推理时提示与调试,未真正适配模型;而可验证奖励的强化学习多采用二元信号,丢失科学正确性的梯度信息。
提出RLVP后训练框架,采用混合验证器:硬性可执行性检查结合连续物理奖励,后者评估函数空间精度与PDE残差一致性,跨多种方程族训练单一策略。
在多类偏微分方程基准上,RLVP优于预训练基线与仅监督微调方案,显示连续物理奖励对求解器精度的提升作用。
RLVP将科学正确性的细粒度信号引入大语言模型代码生成,弥合了二元验证与物理准确性之间的鸿沟。
📊 论文图表(共 29 张)
展开查看 29 张图
TL;DR
这篇论文提出了 RLVP(带可验证物理的强化学习)框架,通过将 PDE 求解建模为代码生成任务,并用连续物理奖励信号对 LLM 进行后训练。与传统二值验证器不同,RLVP 采用混合验证器:硬性程序合法性检查确保代码可执行,而连续物理奖励则对解的精度进行打分。实验表明,经 RLVP 训练的小模型在 PDE 求解任务上能超越对前沿模型直接施加提示工程的效果,并展现出跨 PDE 族的零样本迁移能力。
研究背景与动机
偏微分方程是科学与工程建模的基石,从流体力学到电磁场、从金融衍生品定价到生物化学反应,PDE 无处不在。然而,构建可靠的数值求解器长期依赖专家知识:需要精心选择离散化格式、满足稳定性条件、设计恰当的边界处理方案。这一过程既耗时又费力,制约了科学计算的效率。
近年来,大型语言模型在代码生成和推理任务上展现出惊人能力,研究者开始尝试将 PDE 求解视为代码生成任务——让 LLM 编写求解器代码来获得数值解。这条路子的主流做法是在推理阶段做文章:通过精心设计的提示、调试、自优化或测试时缩放来提升生成质量。但这些方法都停留在"用好已有模型"层面,没有真正让模型自身去适应 PDE 求解这个特定领域。
与此同时,带可验证奖励的强化学习(RLVR)已成为代码生成和数学推理领域强大的后训练范式。典型做法是:验证器给出二值信号——代码能编译运行就算正确、测试通过就算正确。这种范式在代码修复或形式化证明场景很有效,但应用到科学计算时遇到一个根本性问题:科学正确性天然具有层级结构。两个求解器可能都能正常执行,但在解的精度上可能相差数个数量级。二值验证器把这些差异全部丢弃了,只关心"对不对",而忽视"有多对"。
这正是 RLVP 的切入点:设计一种连续奖励信号,既能处理程序合法性这类离散约束,又能捕捉 PDE 解的质量这类连续指标,让强化学习真正适配科学计算场景。
方法
RLVP 的核心创新在于其混合验证器设计。整体框架可以形式化为:给定一个 PDE 问题和一个 LLM 策略 ,策略生成一段求解器代码 ,验证器计算奖励 ,然后通过策略梯度更新策略。
混合验证器由两个互补的组件构成。第一组件是硬性程序合法性检查(hard program-validity checks),对应二值奖励 :代码必须能通过语法检查、成功编译(或被解释器接受)、并且运行时不出错。这一组件对应 PDE 求解的"可行性"——一个连运行都通不过的求解器毫无意义。
第二组件是连续物理奖励(continuous physics rewards),对应连续奖励 。这一组件才是 RLVP 的精髓所在。论文采用两个维度的物理指标:一是函数空间精度(function-space accuracy),即生成的数值解与参考解(或解析解)在离散范数下的接近程度;二是PDE 残差一致性(PDE-residual consistency),即数值解代入原方程后的残差大小。函数空间精度衡量"解得好不好",残差一致性衡量"是否真正满足方程约束",两者结合能全面刻画求解器质量。
最终奖励为两者的组合:。这里用乘法而非加法,隐含的语义是:物理奖励只在程序有效的前提下才有意义——一个物理上看起来完美但根本无法运行的代码应该得零分。
在训练数据上,RLVP 采用了多样化的 PDE 族进行统一后训练,包括双曲型方程(如交通流模型)、抛物型方程(如热传导方程)、椭圆型方程(如泊松方程和拉普拉斯方程)以及不可压缩流动系统(如纳维-斯托克斯方程的低雷诺数情形)。这种多样化训练的设计意图是让策略学习到可组合的数值原语——格式模板、时间步进策略、边界处理方法——以便在面对新的 PDE 时能灵活重组。
实验与结果
论文在多个维度上验证了 RLVP 的有效性。首先是与基线的对比:在涵盖多种 PDE 族的基准测试上,RLVP 后训练模型同时超越了预训练基线(未经后训练的原始 LLM)和监督微调基线(仅用标准有标签数据训练)。这是一个关键结果,说明强化学习信号确实能捕捉监督数据难以表达的物理约束。
其次是零样本迁移能力:将在部分 PDE 上训练得到的策略,直接应用于完全未见过的 PDE 类型,生成质量仍有显著提升。这说明模型学到的不是针对特定方程的记忆,而是跨 PDE 共享的数值方法知识。
最具说服力的实验是对比"小模型加 RLVP"与"大模型加提示工程"。论文报告,经 RLVP 后训练的较小规模 LLM,在分布内 PDE 求解任务上能够优于直接对前沿模型施加精心设计提示的结果。这一发现具有实际意义:提示工程的上限受限于基础模型能力,而 RLVP 后训练能让小模型通过专项适应来弥补规模差距。
更值得关注的是组合性证据(compositionality)。作者分析了生成代码的结构,发现训练好的策略并非机械地记忆训练集方程的求解器模板,而是将学到的模板、时间步进格式和边界处理原语打散重组,用于生成新 PDE 的求解器。例如,一个在 1D 对流方程上训练的策略,可能将其中学到的迎风格式和 Neumann 边界处理迁移到 2D 不可压缩流的生成代码中。这种组合能力是 RLVP 学到抽象数值知识而非过拟合训练集的直接体现。
讨论与可借鉴点
RLVP 展示了两个重要的方法论启示。第一,连续奖励信号在科学计算场景的重要性。二值验证器在代码修复这类"对/错"分明的任务上很有效,但科学推理的精髓在于精度——同样的方程、相似的代码,数值误差可能相差几个数量级。连续物理奖励能够保留这种精度差异,让策略有更细粒度的学习信号。
第二,跨问题族的统一后训练策略。与其分别为每种 PDE 类型训练专用模型,不如在多样化的 PDE 族上联合训练。多样化的训练数据促使模型学习到可迁移的数值原语,而非针对单一方程的特化记忆。
当前 RLVP 仍存在局限。首先,连续物理奖励的计算依赖参考解或解析解,对于没有ground truth的复杂实际问题,奖励信号本身可能难以获取。其次,论文聚焦于相对规范的 PDE 族,真实科学计算中的病态条件、非结构网格、自适应算法等场景尚未覆盖。再次,组合性证据目前还是观察性的,缺乏系统性的定量刻画。
这些局限也指向了未来研究方向:如何为无参考解的场景设计合适的奖励塑造(reward shaping)策略;如何处理更复杂的工程 PDE 系统;以及如何从机制上理解和促进模型对数值方法知识的组合泛化。RLVP 开辟了一条将强化学习真正适配科学计算场景的道路,其核心思路——连续奖励 + 多样化训练——值得在更广泛的科学 AI 后训练任务中借鉴。
摘要
偏微分方程(PDE)是科学与工程建模的基石,但构建可靠的数值求解器仍是一项劳动密集型工作,需要具备离散化格式、稳定性条件和边界处理方面的专业知识。近期研究开始将 PDE 求解视为大型语言模型(LLM)的代码生成任务,然而现有方法主要在推理阶段运作:依赖提示工程、调试、自优化与测试时缩放,而不是对模型本身进行自适应调整。与此同时,带可验证奖励的强化学习已成为代码和数学推理任务中一种强大的后训练范式,但其验证器通常是二值的:编译器能运行,或测试通过即视为正确。这类信号舍弃了科学正确性所具有的层级结构——两个求解器或许都能执行,但在求解精度上却可能相差数个数量级。在本文中,我们提出 RLVP(Reinforcement Learning with Verifiable Physics,带可验证物理的强化学习),一种面向多 PDE 求解器代码生成的强化学习后训练框架。RLVP 通过一种混合验证器来弥合这一可验证性鸿沟:硬性程序合法性检查确保可执行性,而连续物理奖励则对函数空间精度和 PDE 残差一致性进行打分。单一策略在涵盖双曲、抛物、椭圆以及不可压缩流动系统的多种 PDE 族上完成统一后训练。RLVP 在 PDE 基准上同时超越了预训练基线和仅监督基线,并在未见过的 PDE 上展现出零样本的改进迁移能力。我们证明,经 RLVP 后训练的小型 LLM 在分布内 PDE 求解器生成任务上,能够胜过对前沿模型直接施加提示的方法。训练所得的策略在数值模式上表现出组合性:它将在训练所用 PDE 上学到的模板、时间步进格式与边界处理原语重新组合,用于为未见过的 PDE 问题生成求解器。
Abstract
Partial differential equations (PDEs) are foundational to modeling in science and engineering, but constructing reliable numerical solvers remains labor-intensive, demanding expert knowledge of discretization schemes, stability conditions, and boundary treatments. Recent work has begun to frame PDE solving as a code-generation task for large language models (LLMs), yet existing approaches operate primarily at inference time: relying on prompting, debugging, self-refinement, and test-time scaling rather than adapting the model itself. In parallel, reinforcement learning with verifiable rewards has emerged as a powerful post-training paradigm for code and math reasoning, but its verifiers are typically binary: a compiler runs, or a test passes. Such signals discard the graded structure of scientific correctness, where two solvers may both execute and yet differ in solution accuracy by orders of magnitude. In this work, we introduce RLVP: Reinforcement Learning with Verifiable Physics, an RL post-training framework for multi-PDE solver code generation. RLVP addresses this verifiability gap with a hybrid verifier: hard program-validity checks ensure executability, while continuous physics rewards score function-space accuracy and PDE-residual consistency. A single policy is post-trained across diverse PDE families spanning hyperbolic, parabolic, elliptic, and incompressible-flow systems. RLVP improves over both pre-trained and supervised-only baselines on PDE benchmarks, and shows zero-shot improvement transfer to held-out PDEs. We show that a smaller LLM post-trained with RLVP can outperform prompting a frontier model on in-distribution PDE solver generation. The trained policy shows evidence of compositionality in numerical motifs: it recombines stencils, time-stepping schemes, and boundary-handling primitives learned from the PDEs used in training into generated solvers for unseen PDE problems.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。




























