GEOALIGN:用于鲁棒大语言模型强化学习的几何化轨迹筛选
GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning
📝 TLDR
在线强化学习用于大语言模型对齐时,常因奖励噪声出现训练不稳定。论文发现一种'方向不一致'失效模式:少量高奖励样本产生与批内主流偏好方向冲突的更新,导致高方差与不稳定。为此提出 GEOALIGN 插件,在同一提示内构造偏好对、学习在线投影器对齐隐藏状态的奖励位移方向,并利用角偏离检测异常 rollout 进行替换。实验在对话对齐与数学推理上均优于 PF-PPO、PAR、PODS、Seed-GRPO,并能降低训练振荡,表明隐空间方向一致性是有效的可靠性信号。
🧭 速览
在线强化学习对齐LLM时,高奖励rollout与批内主流偏好产生方向不一致,导致更新高方差和训练不稳定。
GEOALIGN在同一提示内构造偏好对,学习在线投影器集中奖励排序的位移方向,通过与批共识原型的角偏离检测并替换异常rollout。
在对话对齐和数学推理任务上,GEOALIGN最终性能优于PF-PPO、PAR、PODS、Seed-GRPO,并显著降低训练振荡。
隐空间方向一致性可作为在线LLM强化学习的有效可靠性信号,几何视角为rollout筛选提供轻量方案。
📊 论文图表(共 35 张)
展开查看 35 张图
TL;DR
GEOALIGN 针对大语言模型在线强化学习中因奖励噪声导致的训练不稳定问题,提出了一种轻量级的轨迹筛选插件。该方法通过在同一提示内构建偏好对并学习隐藏状态空间中的方向投影器,检测并替换那些与批次主流偏好方向不一致的高奖励样本。实验表明,在对话对齐和数学推理任务中,GEOALIGN 相比 PF-PPO、PAR、PODS、Seed-GRPO 等方法能显著提升最终性能并有效抑制训练振荡。
研究背景与动机
大语言模型的对齐训练是让模型输出符合人类偏好的关键步骤,而在线强化学习(Online Reinforcement Learning)是实现这一目标的主流范式之一。在这一范式下,模型不断与环境交互生成轨迹(rollout),根据奖励信号更新策略。然而,当奖励模型存在噪声或被错误指定时——这在实际应用中几乎是不可避免的——训练过程会表现出不稳定甚至发散的特征。
传统观点倾向于将这种不稳定性归因于[[奖励黑客]]现象或[[策略梯度方差]]过大。但这篇论文通过深入分析训练动态,发现了一个更为隐蔽的失效模式:方向不一致性(directional inconsistency)。具体而言,在同一批次的多个采样轨迹中,往往存在少数高奖励样本,它们在[[隐藏状态空间]]中诱导出的偏好方向与批次内大多数样本的共识方向产生显著冲突。这种冲突会导致策略更新方向在高方差的方向上大幅摆动,使得训练无法有效收敛。
这一发现具有重要的实践意义:以往的方法通常试图从整体上降低梯度方差或改进奖励估计,而论文指出,关键问题不在于方差本身的大小,而在于更新方向是否与真实偏好一致。这为解决训练不稳定性提供了一个全新的切入视角。
方法
GEOALIGN 的核心思路可以概括为三个依次递进的步骤:构造偏好对、学习方向投影、以及检测与替换不一致轨迹。
首先,在同一提示下采样多条轨迹后,GEOALIGN 在这些轨迹之间构建偏好对。这里的偏好对并非随机配对,而是根据轨迹的奖励排序有选择地组成。例如,假设某个提示生成了四条轨迹,奖励从高到低排序为 ,那么系统会构造 、 等偏好对。这种构造方式保证了每对偏好对中的两条轨迹确实存在偏好差异,为后续学习提供了有效的监督信号。
接下来是核心的方向投影器学习环节。论文假设:在隐藏状态空间中,每条轨迹从初始状态到终态的位移方向(即终态隐藏向量减去初始隐藏向量)应该按照奖励排序呈现一定的方向一致性。高奖励轨迹的位移方向与低奖励轨迹的位移方向之间存在某种系统性的对齐关系。GEOALIGN 在每个训练步骤中,通过这些偏好对学习一个线性投影器 ,使得经过投影后的位移方向能够更好地反映奖励排序。形式化地说,学习目标是最小化投影方向与基于奖励排序的期望方向之间的某种距离度量。这个投影器通过若干层线性变换实现,仅涉及前向传播和简单的反向传播,额外计算开销极小。
最后,论文利用学习到的投影器进行不一致轨迹的检测与修正。对于批次中的每条轨迹,计算其投影后的位移方向与批次共识原型(batch consensus prototype)之间的角度偏差。这里所说的共识原型,可以理解为批次内所有轨迹投影方向的加权平均,权重由奖励高低决定。如果某条高奖励轨迹的方向偏离共识原型超过设定阈值,系统就将其判定为方向不一致的异常样本,并从同提示下找到角度偏离较小且奖励相对合理的替代轨迹进行替换。这种替换策略保证了即使某些高奖励样本本身存在问题,也不会将错误的偏好方向引入策略更新。
整个 GEOALIGN 模块以插件形式集成到现有的[[策略优化]]框架中,不需要对底层算法做根本性修改。由于仅涉及前向传播和轻量级的投影器学习,其计算开销可以忽略不计,这使得它在大规模训练场景中具有良好的实用性。
实验与结果
论文在两类典型任务上验证了 GEOALIGN 的有效性:使用学习奖励模型进行的对话对齐,以及使用二元验证奖励的数学推理任务。前者模拟了真实场景中奖励模型可能存在噪声的情况,后者则考察了在明确但稀疏的奖励信号下的表现。
在对话对齐任务中,GEOALIGN 相比基线方法取得了显著的性能提升。具体而言,最终的对齐质量指标相较于 PF-PPO、PAR、PODS 等方法有明显优势,而训练曲线显示 GEOALIGN 有效抑制了训练过程中的振荡,使得策略性能能够更稳定地提升而非反复波动。在数学推理任务中,GEOALIGN 同样表现出色,在相同的训练步数下达到了更高的准确率,且整个训练过程更加平滑。
值得注意的是,论文还进行了消融实验来验证各组件的贡献。结果表明,方向投影器的学习、不一致检测的阈值选择以及替换策略的设计都对最终效果产生实质性影响。其中,投影器的存在使得系统能够将隐空间的位移方向映射到一个更适合区分偏好差异的子空间,而单纯的原始方向比较在很多情况下无法有效识别不一致样本。这印证了论文的核心假设:方向一致性的关键在于隐空间表示的对齐质量,而非原始特征空间的直接比较。
从训练稳定性角度看,GEOALIGN 对振荡的抑制效果尤为突出。传统方法在高奖励样本出现时容易产生过大的策略更新幅度,导致后续采样分布剧烈变化,形成恶性循环。而 GEOALIGN 通过及时检测并修正方向不一致的轨迹,阻断了这一负反馈链路,使得训练动态更加可控。
讨论与可借鉴点
GEOALIGN 的提出为在线大语言模型强化学习提供了一种新的可靠性信号维度:隐空间方向一致性。这一发现提示我们,在分析训练不稳定性时,不应仅关注梯度的统计量(如方差或范数),还应深入考察更新方向的语义结构。方向一致性之所以有效,可能是因为它捕捉了奖励信号与模型表示之间的结构性对应关系——即使单个样本的奖励可能有噪声,但这种结构对应在整体上仍是稳健的。
从方法论角度看,GEOALIGN 的插件式设计值得借鉴。不同于端到端的算法改造,插件化意味着更低的迁移成本和更强的通用性。无论是 PF-PPO、PAR 还是 GRPO 变体,只要涉及到批次内的轨迹比较与筛选,都可以考虑引入类似的方向一致性约束。这种“即插即用”的理念在推动研究成果落地方面具有重要价值。
当然,GEOALIGN 也存在一定的局限性。首先,方向投影器的学习依赖于批次内偏好对的数量和质量,当采样多样性不足时,投影器的泛化能力可能受限。其次,阈值的选择对最终效果有较大影响,而如何自适应地确定这一阈值仍是开放问题。此外,论文主要在相对简单的任务设定下验证,对于更加复杂的[[多目标优化]]或[[持续学习]]场景,方向一致性的有效性尚需进一步检验。
尽管如此,GEOALIGN 的核心思想——将隐空间方向一致性作为可靠性信号——为后续研究开辟了新的探索空间。未来的工作可以从投影器的非线性扩展、动态阈值机制、以及与其他稳定性技术的融合等角度展开,进一步提升在线强化学习在大语言模型对齐中的实用性和可靠性。
摘要
在线强化学习被广泛用于将大语言模型(LLMs)与奖励信号对齐,但在噪声或错误指定的奖励下训练可能不稳定。我们识别出一种被称为方向不一致性的失败模式:在同一批次内,一小部分高奖励轨迹在表示空间中诱导出的偏好方向与批次中大多数样本显著冲突,从而导致高方差和不稳定的更新。我们提出了 geoalign,一种用于迭代策略优化中轨迹筛选的轻量级即插即用模块。Geoalign(i)在同一提示内构建偏好对,(ii)在每个轨迹的隐藏状态上学习一个在线投影器以集中按奖励排序的位移方向,(iii)通过不一致轨迹与批次共识原型之间的角度偏差来检测它们,并使用同一提示内稳定的替代轨迹进行修正。Geoalign 仅涉及前向传播,几乎不增加额外开销。在使用学习奖励模型进行的对话对齐以及使用二元验证奖励进行的数学推理任务中,Geoalign 提升了最终性能并减少了训练振荡,性能优于 PF-PPO、PAR、PODS 和 Seed-GRPO。这些结果表明,潜在方向一致性可作为在线大语言模型强化学习中一种有效的可靠性信号。
Abstract
Online reinforcement learning is widely used to align large language models (LLMs) with reward signals, yet training can be unstable under noisy or misspecified rewards. We identify a failure mode we call directional inconsistency: within a batch, a small set of high-reward rollouts induces representation-space preference directions that sharply disagree with the batch majority, resulting in high-variance and destabilizing updates. We propose geoalign, a lightweight plug-in for rollout curation in iterative policy optimization. Geoalign (i) forms within-prompt preference pairs, (ii) learns an online projector on per-rollout hidden states to concentrate reward-ordered displacement directions, and (iii) detects directionally inconsistent rollouts via their angular deviation from a batch consensus prototype and rectifies them with within-prompt stable alternatives. Geoalign is forward-pass only and adds negligible overhead. Across dialogue alignment with a learned reward model and mathematical reasoning with binary verified rewards, Geoalign improves final performance and reduces training oscillation, outperforming PF-PPO, PAR, PODS, and Seed-GRPO. These results suggest latent directional consensus as an effective reliability signal for online LLM RL.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。


































