Oyster-II:面向大语言模型建设性安全对齐的强化学习方法
Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models
📝 TLDR
大语言模型难以同时兼顾安全性、有用性与可信度。传统拒答式对齐会过度屏蔽合法需求,而Oyster-I基于SFT的"建设性安全"在分布外场景泛化不足,并出现安全思维链过度泛化现象。Oyster-II采用Zero-RL范式与多阶段强化学习策略,系统性解决上述问题。实验显示其安全能力全面超越Qwen3-14B与Oyster-I。
🧭 速览
Oyster-I的SFT建设性安全对齐存在分布外安全泛化不足与安全思维链过度泛化两大缺陷,损害了有用性与用户体验。
提出Oyster-II框架,采用Zero-RL范式结合多阶段强化学习策略,实现响应导向的安全对齐。
在多个安全基准上全面超越Qwen3-14B与Oyster-I,跨规模性能接近Qwen3-Max和Qwen3.5-397B。
强化学习路线能有效兼顾安全与有用,验证了Zero-RL框架在建设性安全对齐上的可行性与扩展性。
📊 论文图表(共 13 张)
展开查看 13 张图
TL;DR
Oyster-II 是一项面向大语言模型安全对齐的强化学习方法,核心贡献在于采用 Zero-RL 范式替代此前 Oyster-I 中的监督微调策略,配合多阶段强化学习训练框架,系统性解决了建设性安全对齐在分布外场景泛化不足以及安全思维链过度泛化的问题。实验表明,Oyster-II 在多项安全基准测试上全面超越 Qwen3-14B 与 Oyster-I,并达到了与更大规模模型 Qwen3-Max 和 Qwen3.5-397B 可比的跨规模性能。
研究背景与动机
大语言模型在实际应用中面临的根本矛盾之一,是如何在确保内容安全的同时依然保持有用性与可信度。传统安全对齐策略多采用「拒答范式」——当模型检测到敏感或潜在有害的查询时,直接拒绝响应。这种策略在规避明确风险时效果尚可,但往往会过度保守,连那些本可以安全、建设性地回答的合法需求也被一并屏蔽。换言之,用户提出一个敏感但合理的询问,本意是寻求帮助或信息,模型却简单粗暴地以「对不起,我无法协助」告终,这显然不是最优的用户体验。
Oyster-I 在这一方向上做出了重要探索,提出了「建设性安全」的范式转换:不再是简单拒答,而是让模型学会对敏感查询进行深思熟虑的回应,在确保安全的前提下最大程度满足用户的真实意图。这一思路更具人性化,也更能发挥大语言模型作为知识工具的价值。然而,Oyster-I 基于[[监督微调]]的实现方案存在两个关键局限。
第一项局限是分布外泛化能力不足。SFT 本质上是在已有的「输入-输出」配对数据上进行模仿学习,模型学会的是训练数据中的固定响应模式。一旦用户提出的问题在措辞、场景或领域上偏离训练分布,模型的表现就可能大打折扣。安全场景尤其复杂多变,新的攻击手法、新的敏感话题不断涌现,依靠记忆训练数据来应对所有情况显然不可持续。
第二项局限更具独创性:安全[[思维链]]过度泛化。作者将这一现象描述为模型将安全导向的推理模式过度应用于本属良性的查询。就像一个人因为担心厨房刀具的危险而拒绝使用任何刀一样——过度谨慎反而损害了正常功能的发挥。在这一现象中,模型可能在回应一个完全正常的用户问题时,冗余地调用安全检查机制或进行不必要的风险评估,导致响应变得冗长、不自然,用户体验下降。
方法
面对上述两项局限,Oyster-II 的核心思路是「用强化学习替代监督微调」,并在此基础上引入 Zero-RL 范式与多阶段训练策略。这一选择的直觉在于:[[强化学习]]能够让模型通过与环境的交互学习决策策略,而非仅仅模仿固定输出;模型在奖励信号的引导下自主探索何时需要谨慎、何时可以直接回应,从而获得比 SFT 更强的泛化能力。
具体而言,Oyster-II 采用的 Zero-RL 范式允许模型在不依赖大量标注数据的情况下从零开始学习对齐策略。传统 RLHF(基于人类反馈的强化学习)需要昂贵的[[人类反馈]]数据来训练奖励模型,而 Zero-RL 则通过设计合理的奖励函数,使模型能够直接根据预设的奖励信号进行优化。这不仅降低了数据成本,更重要的是,奖励函数可以明确编码安全与有用性的权衡策略,避免 SFT 中「记忆泛化」导致的分布偏移问题。
多阶段强化学习策略是 Oyster-II 的另一关键设计。作者认为,安全对齐不是一个单一目标,而是一个需要分阶段处理的复合任务。在初期阶段,模型主要学习如何正确识别并处理各类敏感查询;在后续阶段,则逐步引入有用性维度的优化,使模型学会在确保安全的前提下最大化响应质量。这种分阶段策略避免了在训练早期就要求模型同时兼顾多重目标所带来的优化困难——类似于先教一个人掌握基本的交通安全规则,再逐步训练他在复杂路况下做出合理判断。
在奖励函数设计上,Oyster-II 综合考虑了安全性指标与有用性指标,并通过对抗性训练增强模型对分布外攻击的鲁棒性。这种设计使得模型不会简单地「学会拒答」或「学会泛答」,而是真正理解何时需要谨慎、何时可以放开。
实验与结果
实验部分在多个安全基准测试上对 Oyster-II 进行了系统评估,对比基线包括 Qwen3-14B、Oyster-I,以及更大规模的 Qwen3-Max 和 Qwen3.5-397B。结果显示,Oyster-II 在安全维度上实现了对 Qwen3-14B 与 Oyster-I 的全面超越。这一超越并非微弱的优势提升,而是具有统计显著性的实质性改进。
更值得注意的结果是跨规模可比性:参数量远小于 Qwen3.5-397B 的 Oyster-II,在安全任务上的表现与这一巨型模型可堪比拟。这一发现验证了「建设性安全」这一范式本身的有效性——正确的训练方法可以弥补规模上的差距。更进一步,它说明 Oyster-II 的多阶段强化学习策略确实帮助模型习得了超越 SFT 的泛化能力,使其能够在面对未在训练数据中见过的安全挑战时做出合理判断,而非依赖对特定样本的记忆。
实验还专门针对安全思维链过度泛化现象进行了消融分析。通过对比 Oyster-I 与 Oyster-II 在良性查询上的响应质量,可以观察到 Oyster-II 在保持同等安全水平的同时,有效缓解了过度谨慎的问题,响应更加自然流畅,用途性与用户体验显著提升。
讨论与可借鉴点
Oyster-II 的工作揭示了安全对齐研究中一个值得关注的方向转变:从「拒答」到「建设性回应」,从 [[SFT]] 到强化学习。这一转变背后的逻辑值得深思——当模型需要处理的场景复杂度超出固定响应的覆盖范围时,让模型学会「判断」比学会「回答」更具泛化潜力。
然而,这一方向也存在尚待解决的问题。首先,强化学习的训练稳定性与调参难度显著高于 SFT,如何在工业级应用中实现可靠部署仍需进一步探索。其次,奖励函数的设计本质上是对安全-有用性权衡的显式编码,这种权衡的最优点因应用场景而异,如何实现可配置的权衡策略值得研究。最后,Zero-RL 范式虽然降低了对标注数据的依赖,但对奖励函数设计的质量提出了更高要求——一旦奖励信号存在偏差,模型可能学到意料之外的行为。
从更宏观的视角看,这项工作对 [[大语言模型]] 安全领域的启示在于:安全不应被视为一个独立的约束条件,而应与有用性作为一体化的优化目标来对待。过度保守的安全策略在降低风险的同时也在削弱模型的价值,而 Oyster-II 所代表的建设性安全思路,为在风险与收益之间寻求更优平衡点提供了可行的技术路径。
摘要
大语言模型(LLMs)已在众多应用中展现出卓越的能力,然而同时确保其安全性、有用性与可信度仍是一项持续的挑战。传统的以拒绝为导向的对齐策略虽能缓解有害内容的生成,却难以系统性地满足用户的合理需求,往往拒绝提供那些本可以安全且建设性地回应敏感查询背后真实意图的信息。在 Oyster-I 所开创的建设性安全范式——即从一概拒绝转向深思熟虑的、面向回应的安全对齐——的基础上,我们识别出其基于监督微调(SFT)方案的两项关键局限:一是对分布外场景的安全泛化能力不足,二是我们称之为安全思维链(CoT)过度泛化的现象,即安全导向的推理模式被过度应用于良性查询,从而降低模型的有用性与用户体验。为应对这些局限,我们提出了 Oyster-II,一种基于强化学习(RL)的建设性安全对齐框架,采用 Zero-RL 范式并结合多阶段强化学习策略。在大量基准测试上的评估表明,Oyster-II 在安全维度上全面超越了 Qwen3-14B 及其前身 Oyster-I,并取得了与 Qwen3-Max 和 Qwen3.5-397B 可比的跨规模性能。
Abstract
Large language models (LLMs) have demonstrated remarkable capabilities across diverse applications, yet ensuring their simultaneous safety, helpfulness, and trustworthiness remains a persistent challenge. Conventional refusal-oriented alignment strategies mitigate harmful content generation but systematically fail to serve legitimate user needs, often withholding information that could safely and constructively address the underlying intent of sensitive queries. Building upon the constructive safety paradigm pioneered by Oyster-I, which moves beyond blanket refusal toward thoughtful, response-oriented safety alignment, we identify two critical limitations of its Supervised Fine-Tuning (SFT)-based scheme: insufficient safety generalization to out-of-distribution scenarios and a phenomenon we term safety chain-of-thought (CoT) over-generalization, wherein safety-oriented reasoning patterns are excessively applied to benign queries, degrading helpfulness and user experience. To address these limitations, we propose Oyster-II, a reinforcement learning (RL)-based constructive safety alignment framework that adopts a Zero-RL paradigm combined with a multi-stage reinforcement learning strategy.Evaluated across extensive benchmarks, Oyster-II comprehensively surpasses both Qwen3-14B and its predecessor Oyster-I on safety dimensions, achieving cross-scale performance comparable to Qwen3-Max and Qwen3.5-397B.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。












