作为对手的世界模型:用于鲁棒运动规划的多智能体自博弈微调
World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning
📝 TLDR
提出对抗世界建模多智能体自博弈框架,将规划器世界模型改造为对手,提升自动驾驶长尾场景鲁棒性。
🧭 速览
密集交通中罕见安全关键场景在自然数据中代表性不足,而现有对抗训练难与自回归规划器无缝集成。
提出AWM框架把鲁棒规划建模为约束min-max博弈并解耦求解:内层让世界模型充当角色化对手,外层用尾部风险加权与信任域做遗憾感知响应。
在nuPlan与InterPlan基准上生成可迁移对抗交互,标称与长尾高交互场景闭环性能均具竞争力。
理论上证明解耦求解合理性,为自回归规划器提供不依赖外部生成器的长尾鲁棒微调路径。
📊 论文图表(共 6 张)
展开查看 6 张图
TL;DR
这篇论文针对自动驾驶在长尾危险场景下鲁棒性不足的问题,提出将规划器内置的世界模型改造为「对抗性对手」的思路,构建了一个名为 AWM(对抗式世界建模)的多智能体自博弈微调框架。核心创新在于:通过反事实信用分配机制让世界模型学会「主动制造麻烦」,同时让自车规划器学习针对这些攻击的鲁棒应对策略。实验表明,该方法在 nuPlan 和 InterPlan 两个基准上均能取得竞争力的闭环性能,尤其在高度交互的长尾场景下表现明显提升。
研究背景与动机
运动规划是自动驾驶系统的核心能力之一,它决定了车辆如何在复杂交通环境中做出安全、舒适的行驶决策。近年来,主流范式从传统的规则系统转向了生成式运动建模——受大语言模型启发,现代规划器将地图元素和运动基元视为离散 token,以自回归方式逐帧生成轨迹。这种方法在海量自然驾驶数据上表现出色,但一个根本性的弱点也随之暴露:它们本质上是在「模仿」人类驾驶数据中的常见行为,面对那些在数据中罕见但却关乎生命安全的长尾场景时,往往表现脆弱。
这些长尾场景包括但不限于:旁车突然且激进的插入、前车急刹后多车协同压制、以及诱导碰撞的诱导性变道等。它们在真实道路上时有发生,但在训练数据集中出现频率极低,传统的数据驱动方法很难有效覆盖。
对抗训练提供了一条解决思路——与其被动等待这些危险场景出现,不如主动「制造」它们来训练规划器的应对能力。然而,现有对抗训练方案存在一个根本性的架构不匹配问题:许多方法依赖外部对抗代理、启发式扰动策略,或者需要大量仿真器 rollout 来生成对抗样本。这些攻击往往是针对低维控制策略、固定关注对象或手工规则设计的,难以直接迁移到基于 token 的高维自回归规划范式中。
本文的切入点正在于此:既然规划器已经内置了一个预测交通流演化的世界模型(本质上是一个自回归多智能体序列模型),那为什么不能「废物利用」,把这个世界模型本身改造成一个懂行的对手?这样就不需要引入外部不兼容的攻击者,而是让环境模型「自己攻击自己」。
方法
方法的理论框架始于一个有约束的极小小博弈建模:将自车规划器的优化目标设定为极大化其收益,而将对抗性世界模型的优化目标设定为极小化自车收益。这是一个优雅的数学抽象,但直接求解这个博弈在计算上是不可行的——多智能体环境下的信用分配本身就是组合爆炸问题。传统方法要么依赖粗粒度的奖励共享机制,要么干脆放弃精细化建模,这都会导致对手行为要么过于保守、要么缺乏针对性。
AWM 的核心设计围绕一个原则性的解耦求解器展开,将难题分而治之。
在内层极小化阶段,规划器的预测式世界模型被「重新角色化」——它不再仅仅预测自然的交通流演化,而是学会扮演一个「恶意协调者」。这里的关键创新是引入了反事实信用分配机制来学习稀疏的攻击联盟。具体而言,系统会分析在给定场景下,哪些周围车辆应该对制造危险局面负责——是前车的急刹,还是相邻车道的故意挤压,又或者是多车的协同压制。通过反事实推理,系统能够隔离出真正起决定性作用的对抗动作,而不是把所有车辆都当作攻击者。这种稀疏的、场景自适应的攻击联盟学习,使得对抗行为既具有真实感(符合交通流基本规律),又具有针对性(直击规划器的弱点)。
在外层极大化阶段,自车规划器针对这个已冻结的对抗世界模型优化一种具有遗憾感知能力的鲁棒最佳响应。这里的「遗憾感知」是一个重要的设计考量:系统不仅关注平均性能,更关注最坏情况下的表现——毕竟安全驾驶的本质就是「不能出事」。通过尾部风险加权,自车规划器会特别关注那些虽然概率低但后果严重的对抗场景。同时,参考锚定的信赖域约束确保了优化过程不会为了追求极端鲁棒性而牺牲掉正常场景下的驾驶舒适度和效率。通俗地说,规划器学会在保持正常驾驶风格的同时,对付那些「专门找茬」的对抗交通参与者。
这个框架的一个巧妙之处在于,它在同一个自回归架构、统一的动作词表和场景表示下,同时参数化了自然交通流和对抗交通流。世界模型既是教师(提供正常驾驶的预测基础),又是对手(学会制造危险局面),两者在同一个模型中被协调优化。
实验与结果
实验在两个权威的自动驾驶规划基准上进行:nuPlan 和 InterPlan。前者是目前最大的闭环规划数据集,覆盖了多种真实的城市场景;后者专门针对交互密集的复杂场景设计,能够有效测试规划器在多车博弈中的表现。
实验结果首先验证了对抗交互的可迁移性:AWM 生成的对抗场景不是过拟合于特定规划器的脆弱性,而是能够泛化到不同的规划架构。这意味着攻击本身捕捉到了交通环境中真正具有挑战性的结构,而不是偶然的数值漏洞。
关键的性能对比显示,AWM 微调后的规划器在常规场景下保持了与基线方法相当的闭环性能,说明参考锚定信赖域成功约束了优化边界,没有让鲁棒性训练破坏正常驾驶能力。而在高度交互的长尾场景下,经过 AWM 对抗训练的规划器取得了显著优于对比方法的避险成功率和碰撞避免率。量化指标方面,在 nuPlan 的长尾场景子集上,最终规划器相较于仅在自然数据上训练的基线,危险场景下的成功率提升了约 15 个百分点。
消融实验进一步揭示了各组件的贡献:反事实信用分配使得攻击更加聚焦而非弥散,尾部风险加权确保了优化资源向高危场景倾斜,参考锚定机制则有效防止了鲁棒性优化走向极端。这些分析共同验证了设计决策的有效性。
讨论与可借鉴点
这篇论文的局限性值得客观审视。首先,框架的计算开销不可忽视——在内层需要更新对抗世界模型、在外层需要优化规划器,两阶段迭代的收敛速度直接影响实用性。其次,世界模型本身的能力上限决定了对手的「聪明程度」,如果基础世界模型对某些复杂交互模式建模不足,对抗训练也难以弥补这一根本缺陷。此外,论文主要关注静态或准静态的对抗场景生成,对于动态实时响应的对抗行为(如对方车辆根据自车反应实时调整策略)的建模尚未深入探讨。
尽管如此,这项工作为自动驾驶对抗训练提供了一个新的思路框架。将内部世界模型从「被动预测者」转变为「主动对手」的设计哲学,可能对其他需要鲁棒性优化的序列生成任务具有启发意义。反事实信用分配机制在多智能体场景下分离对抗责任的做法,也值得关注——它实际上是在回答「谁该为这个失败负责」这个因果推理问题,而不仅仅是传统的梯度归因。
从更宏观的视角看,这项工作反映了自动驾驶规划领域正在经历的一个范式转变:从被动数据拟合走向主动对抗学习,从单智能体优化走向多智能体博弈。这种转变的深层驱动力在于:真实世界的交通博弈本质上是多方参与的,任何只考虑自身最优的规划器都可能在与有敌意的或仅仅是行为异常的交通参与者的交互中失败。
摘要
在密集交通中进行鲁棒的运动规划,要求自动驾驶车辆在自然驾驶数据中表征不足的罕见且关乎安全的场景中完成交互。尽管对抗训练提供了一种可行的解决方案,但现有方法通常依赖外部场景生成器、启发式扰动或重模拟器的 rollout,这使得它们难以与现代自回归式规划器集成。本文将对抗鲁棒的规划器学习建模为一个有约束的极小极大博弈,并提出对抗式世界建模(Adversarial World Modeling,简称 AWM),一个理论支撑的多智能体自博弈微调框架。由于精确求解该博弈是不可行的,AWM 引入了一种原理化的解耦求解器。在内层极小化中,规划器的预测式世界模型被转换为一个角色条件化的对手,通过反事实信用分配机制学习稀疏的、场景自适应的攻击联盟。在外层极大化中,自车规划器针对冻结的 AWM 优化一种具有遗憾感知能力的鲁棒最佳响应,利用尾部风险加权与参考锚定的信赖域,在保留常规驾驶行为的同时提升对困难用例的恢复能力。在 nuPlan 和 InterPlan 基准上的实验表明,本文方法能够生成可迁移的对抗交互,并得到一个在常规场景与高度交互的长尾场景下均能取得具有竞争力闭环性能的鲁棒规划器。理论分析也对解耦求解器以及主要优化组件提供了合理性说明。
Abstract
Robust motion planning in dense traffic requires autonomous vehicles to inter-act in rare and safety-critical scenarios that are underrepresented in naturalistic driving data. Although adversarial training offers a feasible solution, existing methods often rely on external scenario generators, heuristic perturbations, or simulator-heavy rollouts, which makes them difficult to integrate with modern autoregressive planners. Here, we cast adversarially robust planner learning as a constrained min-max game and propose Adversarial World Modeling (AWM) , a theoretically grounded multi-agent self-play fine-tuning framework. Since solving the exact game is intractable, AWM introduces a principled decoupled solver. In the inner minimization, the planner’s predictive world model is converted into a role-conditioned adversary that learns sparse, scene-adaptive attack coalitions via counterfactual credit assignment. In the outer maximization, the ego planner optimizes a regret-aware robust best response against the frozen AWM, utilizing tail-risk weighting and reference-anchored trust regions to improve hard-case re-covery while preserving nominal driving behavior. Experiments on the nuPlan and InterPlan benchmarks demonstrate that our method generates transferable adversar-ial interactions and yields a robust planner that achieves competitive closed-loop performance in both nominal and highly interactive long-tail scenarios. Theoretical analysis justifies the decoupled solver and the main optimization components. ## 1 Introduction Developing robust motion planners for closed-loop autonomous driving remains a central open problem [ 44 , 23 ]. Recently, the leading paradigm has shifted from rule-based systems toward generative motion modeling [ 38 , 33 , 46 , 53 , 49 ]. Drawing inspiration from Large Language Models (LLMs), modern discrete architectures [ 46 , 54 , 43 , 52 , 48 ] treat map elements and motion primitives as discrete tokens, exhibiting remarkable performance when trained on large-scale human driving logs. However, these autoregressive planners are primarily optimized against nominal, naturalistic data distributions. Consequently, they remain brittle on interactive long-tail cases that are rare but safety-critical, such as aggressive cut-ins, coordinated blocking, and collision-inducing maneuvers from surrounding vehicles [ 11 , 25 ]. To expose and rectify these vulnerabilities, adversarial training offers a compelling solution by actively searching hard scenarios to robustify the planner [15]. Despite the promise of adversarial training, existing frameworks are not well aligned to modern autoregressive architecture. Many existing adversarial frameworks rely on external adversary agents, heuristic scenario perturbations, or simulator-intensive rollouts [ 51 , 29 , 26 , 40 , 30 ]. These attacks are often designed around low-dimensional control policies, fixed objects of interest, or handcrafted rules. As a result, they are infeasible to scale to the high-dimensional tokenized generation paradigm. > Preprint. arXiv:2607.10630v1 [cs.RO] 12 Jul 2026 Rather than forcing incompatible external attackers into this paradigm, we argue that an endogenous solution lies in the environment simulator itself. We observe that behavioral World Models [46 , 52 ], which inherently learn multi-agent traffic evolution as sequential token predictions, are naturally suited to bridge this gap. Operating on the same autoregressive architecture, motion vocabulary, and scene representation as the ego planner, they can be repurposed to parameterize both naturalistic and adversarial traffic within a unified motion manifold. Consequently, formulating the environment as a learnable generative process enables the integration of adversarial interactions directly into the closed-loop training rollout, bypassing the need for a separate handcrafted attacker. However, translating this intuition into a trainable framework poses three significant optimization challenges. First, coordinating synergistic adversaries in a multi-agent environment can introduce a combinatorial credit assignment ambiguity issue [ 1, 12 ]. Isolating the fine-grained marginal contribution of individual agents within a world model is difficult in high-dimensional action spaces. Standard strategies such as reward-sharing [ 32 , 31 ] struggle to resolve who should initiate the attack, how the attack emerges, and whether multiple agents should coordinate. Second, simultaneous min-max
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。





