arXiv 2607.18006v1 · 发布 2026-07-20

MADA-RL:面向紧凑模型参数高效推理的多智能体辩论感知强化学习

MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models

AUTHORS Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Zifeng Ding, Volker Tresp, Yunpu Ma
EVIDENCE 多智能体辩论感知强化学习框架,区分生成器与评论家角色
SCORE 0.9
GENERATED 2026-07-21 22:06:27 UTC

📝 TLDR

大语言模型推理能力强但训练成本高昂,紧凑模型(≤4B参数)在有限预算下受限严重。本文提出MADA-RL后训练框架,将紧凑模型划分为生成器与评判器两角色,仅通过LoRA微调少量参数,并设计反事实评判优势函数驱动评判器超越生成器共识。实验在五个数学推理基准上以全微调1/16的可训练参数将DeepSeek-R1-Distill-Qwen-1.5B准确率从39.9%提升至41.9%,处于准确率-参数帕累托前沿。

🧭 速览

动机

紧凑模型推理能力受限于训练预算高企,亟需参数高效的后训练方案以在多智能体辩论中实现角色专业化与目标化信用分配。

方法

将紧凑模型角色化为生成器与评判器,仅微调LoRA适配器;核心设计反事实评判优势,以生成器集成逐实例准确率作为动态基线,驱动评判器学习纠正错误。

结果

1.5B模型在五个数学推理基准上准确率从39.9%升至41.9%(+2.0,p<0.001),可训练参数仅全微调1/16,但弱于数据规模更大的DeepScaleR、STILL-3。

结论

反事实优势函数使评判器获得最高改进率,证明其学会纠正生成器错误而非简单模仿,为参数高效多智能体训练提供新的帕累托前沿方案。

📊 论文图表(共 6 张)

展开查看 6 张图

TL;DR

MADA-RL 提出一种将紧凑语言模型专业化分工为生成器与评论器角色的后训练框架,通过创新的反事实评论器优势函数引导评论器超越生成器共识进行改进,仅用 LoRA 微调即可实现 16 倍参数缩减。实验将 DeepSeek-R1-Distill-Qwen-1.5B 在五个数学推理基准上的准确率从 39.9% 提升至 41.9%,处于准确率-可训练参数的帕累托前沿。

研究背景与动机

大语言模型在多步逻辑推理任务上展现出卓越能力,但其训练成本往往令人望而却步——对于参数规模不超过 40 亿的紧凑模型而言,这一挑战尤为突出。研究者们试图从两条路径突破这一困境:一是强化学习路线,如 OpenAI o 系列和 DeepSeek-R1 所代表的范式,通过大规模强化学习信号提升推理能力,但这类方法通常需要全参数微调,计算开销巨大且训练过程不稳定;二是测试时计算扩展路线,包括链式思考、自我一致性、思维树以及多智能体辩论等技术,它们在推理阶段通过增加计算量换取更鲁棒的输出,但前期训练中往往引入显著的架构复杂性或额外开销。

现有方法存在一个关键缺陷:即使引入多智能体辩论机制,评论器(或称验证器)也容易陷入"模仿陷阱"——它学到的是复现生成器的正确答案,而非真正学会诊断和修正生成器的错误。这一问题的根源在于传统 [[强化学习]] 中的信用分配机制过于粗糙:评论器只能根据自身输出的绝对奖励进行优化,无法感知它相对于生成器的相对优势。当生成器恰好答对时,评论器即使做出等价的正确答案也无法获得正向激励;当生成器答错时,评论器即使纠正了错误也难以从均化的奖励信号中获知自己的贡献。

MADA-RL 的核心切入点正在于此:它不满足于让评论器学习"什么是正确答案",而是让评论器明确学习"相对于生成器,我还能做出什么增量贡献"。这是一个角色相关的目标,而现有方法缺乏相应的动态基线来支撑这种精细化的信用分配。

方法

MADA-RL 的整体框架建立在角色专业化的基础之上。给定同一个基础模型 DeepSeek-R1-Distill-Qwen-1.5B,研究者通过 LoRA 适配器将其实例化为两类角色截然不同的智能体:生成器在第一轮并行生成初始答案,评论器则在后续轮次中以问题与上一轮答案的拼接作为输入,产出经过审慎修订的答案。这种分工的设计直觉是:生成器负责发散探索、快速给出候选解,评论器负责收敛验证、仔细检查推理链条中的漏洞。

训练过程分为两个阶段。第一阶段,研究者将训练数据划分为三个不相交的子集,分别训练若干独立的生成器。这些生成器的奖励函数设计颇有意思:它采用准确率与长度奖励的加权组合,优先确保答案正确(系数为 2),同时惩罚过长输出以避免通过"短但错"的策略刷分。具体而言,准确率通过 LaTeX-to-SymPy 与 math-verify 工具进行符号级等价判定,长度奖励则根据当前答案在组内的相对长度计算出一个惩罚项,使得正确答案越长收益越低,错误答案越长惩罚越重。

第二阶段是 MADA-RL 的核心创新所在。研究者首先用第一阶段训练好的多个生成器组成集成,针对每个训练样本并行生成多个候选答案,由此构建出所谓的"辩论感知数据集"。这个数据集中隐含了生成器集成的逐题准确率信息。随后,研究者用这些数据训练评论器,但关键在于优势函数的设计。

传统 [[强化学习]] 中的优势函数通常定义为当前奖励减去一个基线,常见的选择是均值奖励归一化。然而,这种静态基线无法区分"评论器答对但生成器也对"与"评论器答对但生成器错了"这两种本质不同的情形。MADA-RL 提出的反事实评论器优势函数解决了这一问题:

其中 是生成器集成在该实例上的逐题平均准确率,它作为一个动态的、角色相关的基线。当评论器在生成器失败()的情况下答对,正确奖励 将产生 的优势;当评论器在生成器成功()的情况下答对,正确奖励 仅产生 的优势,因为生成器已经提供了正确答案。这一设计显式地奖励评论器做出"超越共识"的增量贡献,而非简单地复现正确答案。

在测试阶段,MADA-RL 采用轻量级的多轮辩论协议: 个生成器并行生成初始答案,随后 个评论器基于拼接后的多轮上下文进行修订,仅最后一轮的答案参与最终准确率统计。这种设计避免了引入摘要器等额外模型,保持了系统的简洁性。

实验与结果

研究者在五个数学推理基准上进行了全面评估:MATH-500、AIME 2024、AIME 2025、AMC-23 以及 Minerva-Math。基础模型统一使用 DeepSeek-R1-Distill-Qwen-1.5B(约 17.8 亿参数),训练数据为 Still-3-Preview-RL-Data 中的 29,925 道题目,划分为三个 7500 题的不相交子集用于训练不同生成器,另有 750 题作为共享验证集。LoRA 配置统一采用 rank=16、alpha=128 的设置,每个智能体可训练参数约为 1850 万,合计约 1.10 亿,仅为全参数微调的 1/16。

主实验结果清晰地展示了 MADA-RL 的效果:DeepSeek-R1-Distill-Qwen-1.5B 的平均准确率从基线的 39.9% 提升至 41.9%,提升幅度为 2.0 个百分点,统计检验显著()。这一改进使 MADA-RL 处于准确率-可训练参数的 [[帕累托前沿]],在所有评估模型中实现了最高的精度增益与可训练参数比。

值得注意的是,MADA-RL 逼近但未超越训练数据规模显著更大的基线方法。DeepScaleR(44.3%)和 STILL-3(43.1%)表现更强,但研究者通过将这两种方法以相同 LoRA 配置重新训练后发现:DSR-LoRA 仅达到 40.5%,S3-LoRA 仅达到 41.3%,均未超过 MADA-RL。这揭示了一个重要洞察——最强基线的优势主要来自训练数据规模,而非它们训练机制中不可通过 LoRA 保留的部分。

消融实验进一步隔离了各组件的贡献。去除辩论轮数带来最大幅度的下降(-5.2 点),表明多轮交互是性能的核心来源;缩小智能体规模导致 -2.6 点的下降;而反事实优势函数与智能体多样性的贡献方向一致,虽然未达到独立统计显著,但通过"评论器改进率"这一机制级指标,研究者发现反事实优势训练出的评论器实现了最高的改进率(19.6%),证明它确实学会了纠正而非模仿生成器的错误。

讨论与可借鉴点

MADA-RL 展示了一条在资源受限条件下提升紧凑模型推理能力的可行路径,其核心贡献——反事实评论器优势函数——提供了一种无需价值模型、无需回放缓冲、无需外部验证器的精细化 [[信用分配]] 机制。这种将"超越共识"显式建模为优化目标的思想,对于 [[参数高效微调]] 领域具有直接的借鉴价值。

然而,这项工作也存在局限性。在绝对准确率层面,MADA-RL 仍落后于在更大规模数据上训练的全参数微调方案,数据瓶颈是其主要限制因素。此外,研究未与训练免费的辩论或投票基线进行匹配推理预算下的对比,对于延迟敏感的部署场景,MADA-RL 每题生成约 33,818 个 token 的开销(约为单次推理的十倍)也是不可忽视的代价。在模型规模方面,当前仅评估了 1.5B 参数的单一模型,更大规模(4B 量级)的表现以及跨任务迁移能力仍有待探索。

从更宏观的角度看,MADA-RL 的设计哲学——通过角色专业化将复杂任务分解为可协作的子任务,并通过目标化的学习信号驱动各角色发挥独特价值——为未来多智能体系统的训练提供了有价值的范式参考。如何在保持参数效率的同时进一步缩小与大规模训练的差距,如何将辩论机制与更轻量的推理协议结合,以及如何将这种角色专业化思想推广到数学推理之外的其他复杂推理场景,都是值得持续探索的方向。

摘要

大型语言模型在推理任务上表现出色,但其训练成本往往过高——对于在有限预算下训练的紧凑模型(≤4B 参数)而言,这一挑战尤为突出。我们提出了 MADA-RL,一种后训练框架,将紧凑模型分别专门化为生成器与评论器角色,并通过辩论感知的学习信号对其进行训练,仅通过 LoRA 适配器微调少量参数。我们的核心贡献在于提出了一种反事实评论器优势函数:一种动态的、角色相关的基线,将评论器的优势重新定义为其奖励减去生成器集成在每个实例上的准确率。这显式地优化评论器,使其超越生成器共识进行改进,而非仅仅复现正确答案,从而相比静态的均值奖励归一化实现了更具针对性的信用分配。在部署阶段,这些专门化的智能体通过一个轻量级的多轮协议进行组合。在五个数学推理基准上,MADA-RL 将 DeepSeek-R1-Distill-Qwen-1.5B 模型的准确率从 39.9% 提升至 41.9%(+2.0 个百分点,p < 0.001),且所用可训练参数比全参数微调基线少 16 倍,使其处于准确率-可训练参数帕累托前沿上。它接近但未超越最强的基线(DeepScaleR、STILL-3),这些基线在显著更大的数据集上训练完成;我们直接分析了这一差距以及相应的推理时成本。一项受控研究隔离了 MADA-RL 收益的来源:反事实优势函数在所有评估模型中产生了最高的评论器改进率,表明训练后的评论器学会的是修正生成器的错误,而非模仿它们。

Abstract

Large language models achieve strong reasoning performance, but often at prohibitive training cost - a challenge that is especially acute for compact models ( parameters) trained under limited budgets. We introduce MADA-RL, a post-training framework that specializes compact models into generator and critic roles and trains them with a debate-aware learning signal, fine-tuning only a small subset of parameters via LoRA adapters. Our central contribution is a counterfactual critic advantage: a dynamic, role-conditioned baseline that redefines the critic's advantage as its reward minus the generator ensemble's per-instance accuracy. This explicitly optimizes critics to improve over generator consensus rather than to merely reproduce a correct answer, yielding more targeted credit assignment than static mean-reward normalization. At deployment, the specialized agents are composed in a lightweight multi-round protocol. Across five mathematical reasoning benchmarks, MADA-RL raises the accuracy of the DeepSeek-R1-Distill-Qwen-1.5B model from to ( points, ) using times fewer trainable parameters than fully fine-tuned baselines, placing it on the accuracy-trainable-parameter Pareto front. It approaches, but does not surpass, the strongest baselines (DeepScaleR, STILL-3), which are trained on substantially larger datasets; we analyse this gap and the associated inference-time cost directly. A controlled study isolates the source of MADA-RL's gains: the counterfactual advantage produces the highest critic improvement rate of any model evaluated, indicating that trained critics learn to correct generator errors rather than to imitate them.


论文详细总结(自动生成)

MADA-RL 论文总结

1. 核心问题与研究动机

大型语言模型(LLM)在多步逻辑推理任务上表现优异,但训练成本高昂——这一挑战对于参数规模 的紧凑模型在受限预算下尤为突出。现有研究面临三类局限:

  • 强化学习路线(如 OpenAI o 系列、DeepSeek-R1)通常需要全参数微调,计算开销大且训练不稳定;
  • 测试时计算扩展路线(CoT、Self-Consistency、ToT、多智能体辩论)虽然能在推理阶段增强鲁棒性,但前期工作往往引入显著计算开销或架构复杂性;
  • 现有 RL 与辩论的结合方法(如 MAPoRL、多智能体微调)多依赖学习验证器或共享梯度,引入额外协调开销。

本文旨在将多智能体辩论与参数高效强化学习结合,提出一个轻量化后训练框架,在紧凑模型上以最小可训练参数实现角色专业化与目标化信用分配。


2. 方法论

2.1 整体框架

MADA-RL 将同一基础模型(DeepSeek-R1-Distill-Qwen-1.5B)通过 LoRA 适配器实例化为两类角色:

  • 生成器(Generator):在第一轮并行生成初始答案;
  • 评论器(Critic):在后续轮次中以问题与上一轮答案拼接为输入,产出修订答案。

训练采用 GRPO(无价值模型、组内归一化策略优化)算法,分为两阶段:

1. 在不相交数据子集上独立训练若干生成器;

2. 用生成器集成产出的"辩论感知数据集" 训练评论器,使用反事实优势函数

2.2 测试时辩论协议

每轮推理包含: 个生成器并行生成 → 多轮 个评论器基于拼接输入修订 → 仅最后一轮答案参与准确率统计。协议设计简洁,避免引入摘要器等额外模型。

2.3 关键公式

生成器奖励(准确率 2:1 优先于长度):

其中 通过 LaTeX-to-SymPy + math-verify 做符号等价判定。

长度奖励(抑制冗长、避免通过"短但错"刷分):

反事实评论器优势(核心贡献):

其中 是生成器集成在该实例上的逐题平均准确率,作为动态、角色相关的基线。正优势奖励评论器在生成器失败时仍然答对;负优势惩罚其在生成器已对的情况下答错。该设计无需价值模型、回放缓冲或外部验证器,比静态均值奖励归一化提供更具针对性的信用分配。


3. 实验设计

3.1 训练数据与基础模型

  • 训练集:Still-3-Preview-RL-Data(29 925 道数学推理题),划分为 3 个不相交子集(每集 7500 题)+ 750 题共享验证集;
  • 基础模型:DeepSeek-R1-Distill-Qwen-1.5B 参数);
  • LoRA 配置:rank=16,,dropout=0.05;GRPO 组大小=4,采样温度=0.7,;batch size=16;学习率 ;AdamW()。

3.2 基准测试(Benchmark)

5 个数学推理基准:MATH-500AIME 2024AIME 2025AMC-23Minerva-Math

3.3 对比方法

10 个基线(同基础模型,公平对比):

  • 全参微调:DeepSeek-R1(基础蒸馏)、Still-3DeepScaleROpen-RS1/2/3Tina
  • 同方法 LoRA 重训(控制参数预算):Still-3-LoRADeepScaleR-LoRA

单智能体场景使用相同协议:3 生成器 + 3 评论器,2 轮辩论。

3.4 消融实验

  • 轮数(1 / 2 / 3 轮);
  • 智能体数量(1+1 / 2+2 / 3+3 对);
  • 智能体多样性(异构 vs 同构检查点);
  • 优势函数(反事实 vs 标准 GRPO);
  • 去除辩论协议(单智能体设置)。

4. 资源与算力

  • GPU:单张 NVIDIA H200(141 GB 显存);
  • 内存:32 GB 系统 RAM;
  • 操作系统:Red Hat Enterprise Linux 9.5;
  • 训练时长:文中未明确报告总训练时长或 GPU 小时数;
  • 可训练参数:MADA-RL 每个智能体 ,合计 (约全微调基线的 )。

5. 实验数量与充分性

  • 主实验:10 个模型 × 5 个基准 × 10 个随机种子 = 500 次推理评估;
  • 统计检验:Welch 双样本 t 检验,10 模型 45 对全配对显著性矩阵(附录表 9,无多重比较校正,标注为探索性);
  • 消融实验:5 类(轮数、规模、多样性、优势函数、单智能体),覆盖关键设计选择;
  • 指标维度:训练参数效率(gain/parameter)、推理 token 数、评论器改进率;
  • 公平性:与同方法 LoRA 重训基线对比,控制数据规模因素;统一推理协议下评估所有模型;评论器改进率作为机制级证据补充 t 检验不显著项。

实验设计总体较为严谨,但部分消融(如反事实优势、多样性)在 10 种子下未达统计显著,作者承认依赖机制级证据(评论器改进率)而非依赖准确率差异。


6. 主要结论与发现

  • 精度提升:DeepSeek-R1-Distill-Qwen-1.5B 准确率从 升至 +2.0 点,);
  • 参数效率:在所有评估模型中最大精度增益/可训练参数比,处于准确率-参数 Pareto 前沿;
  • 逼近但不超越:弱于数据规模显著更大的 DeepScaleR()和 Still-3();但二者的 LoRA 同方法重训(DSR-LoRA 、S3-LoRA )未超过 MADA,表明它们的优势来自数据规模而非 LoRA 不可保留的机制;
  • 核心机制:反事实优势训练出的评论器获得 最高评论器改进率 19.6\%,证明其学会纠正而非模仿生成器错误;
  • 辩论主导:去除轮数( 点)或缩小规模( 点)带来大且显著下降;反事实优势与多样性的边际贡献方向一致但未独立显著;
  • 依赖性:MADA 去掉辩论后下降幅度最大( 点),表明其训练强化了角色专业化而非单智能体推理能力。

7. 优点

  • 反事实优势函数作为动态角色相关基线,机制简洁、可解释,无需价值模型/验证器/回放缓冲;
  • LoRA + 角色专业化实现 16 倍参数缩减,配合 GRPO 训练稳定;
  • 统计严谨:10 种子 + Welch t 检验 + 全配对矩阵 + 95% CI,多角度支撑结论;
  • 因果归因清晰:通过评论器改进率这一机制级指标隔离收益来源,避免将增益简单归于"更多推理计算";
  • 公平对比:将最强基线重训为 LoRA 版本,揭示其优势本质是数据规模而非不可保留的训练机制;
  • 多维成本分析:同时报告训练参数、推理 token、参数效率比,避免单一指标误导。

8. 不足与局限

  • 精度上限受限:在数据规模上不敌 DeepScaleR、Still-3,绝对准确率仍逊于数据量充足的全微调方案;
  • 基线缺位:未与训练免费的辩论/投票/LLM-as-Judge 等基线在匹配推理预算下对比,因此无法断言同等测试时算力下一定优于强单模型;
  • 机制分析不足:未分析反事实优势的收敛性、梯度方差影响;
  • 统计局限:显著性检验基于 per-seed 平均准确率,未做 per-benchmark 配对检验、bootstrap 区间或多重比较校正;
  • 模型/任务覆盖窄:仅评估单一 1.5B 模型与数学基准;4B 规模、跨任务(科学推理、规划)迁移未测;
  • 推理延迟高:MADA 每题生成 token(3 生成器 + 3 评论器 × 2 轮),是单次推理的约一个数量级,对延迟敏感部署不友好;
  • 附录图数据:提供的 figures_json 仅含论文页面渲染图,未嵌入原文内嵌图,附录图示信息有限。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记