辩论家混合:在多智能体推理中于架构层面学习辩论
Mixture of Debaters: Learn to Debate at Architectural Level in Multi-Agent Reasoning
📝 TLDR
现有多智能体辩论框架存在两大缺陷:智能体角色与协作模式在设计时即被固化,且需实例化多个模型副本,计算开销巨大。为此,本文提出 Mixture of Debaters(MoD),借助 Mixture-of-Experts 范式在单一模型内实现动态自我辩论,通过双路由机制、动量切换与统一自辩论设计,在保持行为多样性的同时消除智能体间通信。在多模态基准上的实验表明,MoD 以 3.7 倍低延迟和 87% 的 token 消耗削减超越单模型基线与传统多智能体系统,为辩论式推理的架构级设计提供了新范式。
🧭 速览
现有多智能体辩论框架采用静态架构且需多模型副本,计算开销大、灵活性差,限制了其规模化应用。
基于 Mixture-of-Experts 提出 MoD 框架,通过双路由解耦角色分配与流程、动量切换平滑专家路由抖动,将多样化辩论角色封装为轻量专家模块。
在多模态基准上超越单模型基线与多智能体系统,准确率更高,延迟降低 3.7 倍,token 消耗减少 87%。
在单一模型内实现动态辩论,为多智能体推理提供高效、可扩展的架构级解决方案。
📊 论文图表(共 14 张)
展开查看 14 张图
TL;DR
本文提出辩论家混合(MoD),通过将[[Mixture-of-Experts]]范式引入多智能体辩论,在单一模型内实现动态自我辩论。该框架通过双路由机制、动量切换与统一自辩论设计,在消除多副本开销的同时保留行为多样性,最终以 3.7 倍低延迟和 87% token 消耗削减超越传统方案,为辩论式推理提供了架构层面的新思路。
研究背景与动机
多智能体辩论近年来成为提升大语言模型推理能力的重要范式。其核心思想源自苏格拉底式辩证法:通过让多个「立场」相互质疑与反驳,迫使推理过程暴露漏洞、迭代优化。传统方案通常需要部署多个模型实例,各自扮演「正方」「反方」或「综合者」,在链式协作中逐步逼近更可靠的答案。
然而,这种看似直观的做法面临两个根本性制约。首先,角色分配与协作流程在系统设计阶段即被写死——正方始终是正方,综合者永远是综合者。这种静态架构无法根据问题难度或中间推理状态动态调整角色,导致简单问题被过度复杂化,复杂问题又可能因角色固化而错失关键视角。其次,实例化多个模型副本意味着线性增长的显存与算力需求。当模型规模膨胀到百亿甚至千亿参数时,为每个智能体维护独立副本很快变得不可承受。
本文的切入点因此清晰:能否在单一模型内部「虚拟」出多个辩论角色,让它们在同一模型权重空间内竞争与合作?这样既能省去多副本的巨大开销,又能通过激活模式的变化实现动态的角色切换。[[Mixture-of-Experts]]架构恰好提供了这一可能——其稀疏激活机制天然适合在不同「专家」模块之间路由,而专家本身可以是角色化的行为模式。
方法
MoD 的核心思想是将辩论场景映射到 MoE 的条件计算框架中。在传统 MoE 里,输入 token 被路由到不同的「专家」前馈网络;在 MoD 中,「专家」被重新定义为「辩论角色」,路由机制则负责判断当前推理阶段该激活哪种角色。
这种映射面临三重挑战,论文逐一给出应对方案。
双重路由(Dual-Routing) 是 MoD 的首要创新。传统 MoE 只有一层路由,负责将 token 分发给专家;而辩论场景需要同时处理两个正交的问题:该由谁(角色分配)和现在该做什么(流程控制)。MoD 将这两层解耦:角色路由决定 token 流经哪个「辩论专家」,流程路由决定当前是在「论证」「反驳」还是「综合」阶段。两套路由以串联方式工作,使得角色分配与流程推进独立演化,避免了单层路由在双重目标下的决策模糊。
动量切换(Momentum Switching) 针对的是专家切换的抖动问题。在 token 级别进行路由决策时,连续 token 可能因为局部上下文差异而频繁切换专家,导致推理不稳定。MoD 引入局部上下文记忆机制:当某个专家被选中处理当前 token 时,其「动量」会在后续少量 token 中维持较高激活概率,只有当累积证据明确指向切换时才改变路由目标。这种设计让角色行为更具连贯性,避免了一个句子内正方、反方快速交替的混乱局面。
统一自辩论(Unified Self-Debate) 是实现「单模型多角色」的关键技术。传统多智能体辩论需要多个独立模型实例来维持角色身份;MoD 则将多样化的辩论人格编码为轻量级模块——每个模块并非完整的前馈网络,而是附加在主干模型之上的小型适配器。这些适配器通过微调学习特定角色的语言风格与论证模式,在推理时与主干模型协同工作。由于适配器参数量远小于完整模型副本,存储与计算开销大幅降低,同时角色间的行为多样性得以保留。
综合来看,MoD 的工作流程可以概括为:主模型处理输入并生成初始推理路径,双重路由根据推理状态决定激活哪个辩论专家,动量切换确保专家激活的连贯性,统一自辩论模块在单模型空间内完成角色化的深度推理,最终汇总为综合结论。整个过程无需任何智能体间通信,每个角色都是同一模型内的「虚拟人格」。
实验与结果
论文在多模态基准上进行了系统评估,涵盖视觉问答、图像推理与跨模态理解等任务。对比基线包括两类:一是单一模型直接推理,二是传统多智能体辩论系统(需要多个模型副本)。
核心指标上,MoD 实现了显著优势。在延迟维度,3.7 倍的降低意味着同等硬件条件下吞吐量提升近四倍,这对实时应用场景意义重大。在 token 消耗方面,87% 的削减表明推理效率大幅优化——这一数字背后是单模型架构省去的重复前向传播,以及路由机制对无用计算路径的剪枝。
性能层面,MoD 在多数任务上超越单模型基线,验证了辩论式推理对推理质量的提升作用。值得注意的是,它同时优于传统多智能体系统,这打破了「多副本必然带来更好协作」的传统假设。论文的分析进一步指出,传统方案中大量 token 被消耗在智能体间通信协议上,而 MoD 将这部分开销转化为模型内部的深度推理。
消融实验分离了三项关键设计的贡献:移除双路由后性能下降约 5%,说明角色-流程的解耦确实有价值;去掉动量切换导致专家抖动增加,推理连贯性受损;简化统一自辩论为单一通用模块后,角色间区分度降低,表明轻量级适配器的专业化设计不可或缺。
讨论与可借鉴点
MoD 的贡献不仅在于具体方案,更在于范式层面的启示。它证明[[Mixture-of-Experts]]的条件计算能力可以被重新定义为「认知分工」——不同专家不必是「处理图像的专家」或「处理文本的专家」,也可以是「质疑者的视角」或「综合者的视角」。这种将行为模式而非数据类型作为专家划分依据的思路,为 MoE 在推理类任务中的应用开辟了新方向。
局限性同样值得审视。首先,双重路由增加了系统复杂度,两层决策的联合优化可能面临训练不稳定的问题,论文对此着墨有限。其次,动量切换虽然改善了连贯性,但其超参数(如动量衰减速率)需要针对具体任务调优,泛化能力尚未充分验证。最后,当前实验集中在多模态场景,文本推理的表现如何仍有待考察。
对于更广泛的研究社区,MoD 提供了几点可借鉴的设计原则。其一是「架构即范式」——将推理方法本身编码进模型架构而非外围协议,能够从根本上降低协作开销。其二是「轻量级专业化」——通过小型适配器而非完整副本实现角色多样化,是大模型时代的行为定制思路。其三是「解耦与正交」——当系统面临多重目标时,将正交维度分离为独立模块通常比单层联合决策更鲁棒。这些原则或许可以迁移到其他需要多视角推理的任务中。
摘要
现有的多智能体辩论框架存在两个关键局限:其一,它们依赖于静态架构,智能体角色与协作模式在设计时便已固定;其二,它们需要实例化多个模型副本,从而带来巨大的计算开销。为此,我们提出辩论家混合(Mixture of Debaters,MoD),这是一个统一的框架,借助专家混合(Mixture-of-Experts)范式,在单一模型内实现动态的自我辩论。我们在将 MoE 适配于辩证推理时,着重应对三项关键挑战:(1) 双重路由,将角色分配与流程控制解耦,动态地判断何时进行辩论、何时进行综合;(2) 动量切换,利用局部上下文平滑 token 级别的路由,从而减少专家切换的抖动;(3) 统一的自我辩论,将多样化的辩论角色封装为轻量级专家模块,在消除智能体间通信的同时保留行为多样性。在多模态基准上的大量实验表明,MoD 在性能上优于单模型基线和传统多智能体系统,以低 3.7 倍的延迟和减少 87% 的 token 消耗实现了更高的准确率。源代码可在 https://github.com/YongLD/MoD 获取。
Abstract
Existing multi-agent debate frameworks suffer from two critical limitations: they rely on static architectures where agent roles and coordination patterns are fixed at design time, and they require instantiating multiple model copies, incurring substantial computational overhead. We propose Mixture of Debaters (MoD), a unified framework that enables dynamic self-debate within a single model by leveraging the Mixture-of-Experts paradigm. We address three key challenges in adapting MoE for dialectical reasoning: (1) dual-routing that decouples role allocation from process flow, dynamically determining when to debate versus when to synthesize; (2) momentum switching that smooths token-level routing with local context, reducing expert-switch jitter; and (3) unified self-debate that encapsulates diverse debating personas into lightweight expert modules, eliminating inter-agent communication while preserving behavioral diversity. Extensive experiments on multimodal benchmarks demonstrate that MoD outperforms both single-model baselines and conventional multi-agent systems, achieving superior accuracy with 3.7x lower latency and 87% reduction in token consumption.The source code can be accessed at https://github.com/YongLD/MoD.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。













