arXiv 2607.17560v1 · 发布 2026-07-20

强化学习:从算法到基础模型

Reinforcement Learning: From Algorithms To Foundation Models

AUTHORS Zihan Ding
EVIDENCE 论文系统研究强化学习算法、多智能体博弈及基础模型中的RL
SCORE 0.9
GENERATED 2026-07-28 22:02:11 UTC

📝 TLDR

强化学习正从单智能体扩展到博弈多智能体与基础模型时代。本文研究两类方向:博弈中多智能体强化学习的均衡与策略交互,以及将预训练生成模型作为世界模型或策略用于决策与规划。论文提出了扩散世界模型、视频生成与交互式视频世界模型等方法,涵盖博弈均衡和长序列建模。整体构建了目标驱动的序贯决策统一视角。

🧭 速览

动机

经典强化学习面向单一智能体与固定环境,但智能行为需应对策略性交互、不确定性与高维世界,亟需扩展到博弈多智能体及结合预训练基础模型的丰富决策框架。

方法

博弈侧研究零和博弈、大规模视频游戏及一般和博弈中的均衡与策略学习;基础模型侧提出扩散世界模型、用于高效视频生成的强化学习、将生成模型作为策略类,以及交互式视频世界模型与带记忆的长时架构。

结果

论文形成了一套在博弈与生成模型场景下兼具理论分析与实证验证的工作,展示了扩散世界模型在规划与控制中的可行性,以及策略化生成对视频与决策质量的提升。

结论

论文提出一个统一视角:将强化学习视为复杂序贯领域中的目标驱动自适应,连接博弈决策、环境建模与新兴基础模型能力,扩展了智能行为原理的内涵。

📊 论文图表(共 106 张)

展开查看 106 张图

TL;DR

这篇博士论文从两条主线重新审视了强化学习:一条延续经典的多智能体博弈方向,探索纳什均衡与策略交互;另一条则面向基础模型时代,将扩散模型、视频生成与记忆架构引入世界模型与策略学习中。论文的核心贡献在于提出了“目标驱动的序贯决策”这一统一视角,将策略博弈与生成式建模纳入同一框架。

研究背景与动机

经典强化学习以单智能体在固定环境中的长期累积奖励最大化为目标,其理论基石是马尔可夫决策过程(MDP)与贝尔曼方程。在这一范式下,智能体通过与环境交互学习最优策略,核心挑战在于探索与利用的平衡以及函数逼近的稳定性。

然而,现实中的智能行为远不止于此。当智能体置身于多智能体环境时,个体收益不再仅由自身行为决定,还取决于他人的策略选择——这将问题推向博弈论的领域。在竞争性场景(如双人零和博弈)中,需要找到稳健的策略以应对对手的最坏情况;在合作或一般和场景中,则要处理协调、信任与信息不对称等问题。大规模电子游戏(如即时战略游戏)更将这一挑战推向极致:状态空间巨大、决策时序长、多方动态博弈且部分可观测。

与此同时,人工智能正经历基础模型(foundation model)时代的范式转变。预训练的生成模型——尤其是扩散模型与视频生成模型——展现了强大的世界表征能力。一个自然的问题是:能否将这些结构化先验注入强化学习,让智能体“站在巨人的肩膀上”而非从零试错?扩散模型可以学习环境动力学,视频生成模型可以预测未来观测,而记忆机制则可能解决长序列建模中的漂移问题。

这篇论文的出发点,正是将强化学习置于更广阔的视野中:从博弈中的策略交互到生成式基础模型的能力融合,构建一个目标驱动的自适应统一框架。

方法

论文的方法论分为两条相互呼应但相对独立的脉络。

博弈中的多智能体强化学习部分从双人零和马尔可夫博弈出发,将其建模为两方策略的交替优化问题。论文引入纳什均衡作为解概念:一方策略在对手策略固定时的最佳响应与对方策略的纳什差距为零。在此基础上,论文探索了纳什Q-learning的迭代框架,将贝尔曼更新中的贪婪选择替换为纳什均衡求解,使智能体能够在竞争环境中学习稳健策略。对于大规模设定,论文引入平均场博弈(Mean-Field Game)视角:当智能体数量庞大时,个体决策受群体平均策略影响,通过聚合与个体策略的耦合条件近似大群体均衡。进一步地,面对部分可观测的一般和博弈,论文采用公共信念状态追踪历史信息,并在带记忆的Actor-Critic框架下联合学习对手策略推断与自身策略优化。

基础模型时代的强化学习部分则将生成模型作为核心工具。扩散世界模型继承了扩散模型的噪声去除架构:前向过程逐步加噪,反向过程由神经网络学习去噪,论文将其应用于状态转移预测——给定当前状态与动作,模型生成下一时刻的状态分布,从而支持基于模型的规划与模型预测控制(Model Predictive Control)。视频生成与强化学习的结合体现在两个层面:一是将扩散采样过程本身视为可优化的对象,通过奖励信号微调采样轨迹,使生成的视频在内容质量、动作一致性等维度对齐目标;二是将视频生成模型作为交互式世界模型的条件生成器,构建 形式的条件分布,其中目标条件 引导生成方向,动作 则直接塑造未来观测,实现“动作即未来”的可控生成。论文还探索了将策略本身参数化为生成模型(扩散策略),以支持高维连续动作空间中的多模态行为分布。长程建模的挑战则通过记忆机制缓解——记忆库或循环隐状态帮助模型维持跨时间步的一致性表征。

两条脉络共享的核心洞察是:强化学习的本质是目标驱动的序贯自适应,无论是博弈中通过均衡计算实现的策略适应,还是通过生成模型实现的世界表征与规划,其底层逻辑都指向“如何利用结构化信息达成目标”。

实验与结果

论文的实验覆盖了博弈与基础模型两条任务线。

在多智能体博弈部分,论文在双人零和博弈基准上验证了纳什Q-learning相较于标准Q-learning的优越性:当对手策略变化时,基于纳什均衡的策略展现出更强的鲁棒性,纳什差距(Nash Gap)显著低于最佳响应基线。在大规模电子竞技设定中(如类星际争霸的微观控制任务),纳什Q-learning与最佳响应迭代的混合方法在胜率上超过了固定策略对手,但论文也坦承在开放域一般和博弈中的收敛性仍有不足。平均场博弈的实验验证了群体策略聚合的有效性:当智能体数量增加时,个体策略趋近于群体平均策略的预测,且该近似在中等规模群体(数十个智能体)时质量可接受。

在基础模型部分,扩散世界模型在具身规划任务(如机器人控制仿真环境)上的样本效率优于无模型的深度强化学习方法——这符合预期,因为基于模型的规划可以通过想象 rollout 减少真实交互次数。视频生成RL的实验表明,经过奖励信号微调后,生成视频在人类偏好的成对比较中显著优于未微调基线,尤其在动作一致性与任务相关性维度。生成式策略类在多模态行为分布的学习上展现出优势:当最优策略本质上是多峰的(如同一任务存在多种等效解法)时,扩散策略能够捕获这种多样性,而传统高斯策略倾向于收敛到单一模态。交互式视频世界模型的实验聚焦于定性分析:给定当前帧、动作序列与文本目标,模型生成的未来帧序列在短时域(数秒内)保持了合理的动态一致性,但随着时间延长,动作与观测之间的因果联系逐渐模糊,这与记忆机制的容量限制直接相关。

整体而言,实验设计合理、覆盖面广,但受博士论文体例限制,部分子工作的实验规模与统计显著性细节(如置信区间、多随机种子数量)披露有限。

讨论与可借鉴点

这篇论文的贡献不仅在于提出了具体方法,更在于构建了一个概念性的统一框架:将强化学习视为“目标驱动的序贯自适应”,无论问题形式是博弈竞争还是生成规划,核心都是利用结构化信息(均衡条件、生成先验)来实现目标。

然而,这一框架也存在局限。在博弈部分,纳什均衡的存在性虽然有理论保证,但在实际大规模问题中的计算可行性与收敛稳定性仍是开放问题;平均场博弈的近似假设在智能体数量有限且交互密集时会失效。在基础模型部分,扩散世界模型的推理延迟限制了实时控制的应用场景;视频世界模型的长程一致性仍未解决,记忆机制只是缓解而非根治;生成式策略与强化学习的结合虽然前景广阔,但奖励黑客(reward hacking)的风险也随之增加——当生成模型过度迎合奖励信号时,可能产生语义合理但物理上不可行的行为。

对于后续研究而言,这篇论文提供了几个值得深挖的方向:一是将博弈论视角与大规模语言模型结合,探索多智能体在语言层面的策略交互;二是将世界模型从视频预测扩展到更结构化的表示(如因果图、符号规划),以提升长程推理的可靠性;三是设计更鲁棒的评估体系,尤其是针对生成质量与决策正确性的联合评测。当前生成式人工智能与决策智能的交叉正在加速,这篇论文恰逢其时地为这一趋势提供了方法论层面的系统梳理。

摘要

强化学习(RL)为在显式目标下的序贯决策提供了一个框架。在其经典形式中,强化学习研究智能体应如何行动以在动态环境中最大化长期回报。在更丰富的设定中,问题超出了单个智能体与固定环境的范畴:智能行为可能需要策略性交互、对不确定性的适应,以及对高维世界的推理。本论文从两个视角研究强化学习:博弈中的算法与基础模型时代的强化学习。

第一部分聚焦于博弈中的多智能体强化学习。它考察在竞争性和一般和环境中,激励、策略与均衡概念如何相互作用,涵盖双人零和博弈、大规模电子游戏以及具有一般结构的多玩家设定。这些工作研究了多智能体系统中的学习以及强化学习方法在交互环境中的行为。第二部分研究结合生成模型与基础模型的强化学习,其动机在于先验知识可以丰富序贯决策。预训练的生成模型与学习到的世界模型可作为表征工具与结构化先验,用于规划、控制和策略优化。本论文发展了基于扩散模型的世界模型,研究了用于高效视频生成的强化学习,探索了作为策略类的生成模型,并研究了交互式视频世界模型,其中动作塑造未来观测。它还通过具有记忆的架构处理长程建模问题。综上,这些贡献呈现了强化学习作为复杂序贯领域中目标驱动适应的统一视角。从策略博弈到生成式世界模型,本论文凸显了强化学习如何将决策、环境建模与新兴的基础模型能力联系起来,为理解智能行为背后的原理提供了更广阔的视角。

Abstract

Reinforcement learning (RL) provides a framework for sequential decision making under explicit objectives. In its classical form, RL studies how an agent should act to maximise long-term reward in a dynamic environment. In richer settings, the problem extends beyond a single agent and fixed environment: intelligent behavior may require strategic interaction, adaptation to uncertainty, and reasoning over high-dimensional worlds. This thesis studies RL from two perspectives: algorithms in games and RL in the era of foundation models. The first part focuses on multi-agent RL in games. It examines how incentives, policies, and equilibrium concepts interact in competitive and general-sum environments, spanning two-player zero-sum games, large-scale video games, and multi-player settings with general structure. These works investigate learning in multi-agent systems and the behavior of RL methods in interactive environments. The second part studies RL with generative and foundation models, motivated by the idea that prior knowledge can enrich sequential decision making. Pretrained generative models and learned world models serve as representation tools and structured priors for planning, control, and policy optimization. The thesis develops diffusion-based world models, investigates RL for efficient video generation, explores generative models as policy classes, and studies interactive video world models in which actions shape future observations. It also addresses long-horizon modeling through architectures with memory. Together, these contributions present a unified view of RL as objective-driven adaptation in complex sequential domains. From strategic games to generative world models, the thesis highlights how RL connects decision making, environment modeling, and emerging foundation-model capabilities, offering a broader perspective on the principles underlying intelligent behavior.


论文详细总结(自动生成)

论文总结:强化学习——从算法到基础模型

1. 核心问题与整体含义

经典强化学习(RL)面向单智能体 + 固定环境的序贯决策,但真实智能行为往往超出该范式:

  • 策略性交互:在多人博弈中,个体收益不仅取决于自身策略,还取决于对手/协作者策略,需要均衡分析。
  • 高维世界与不确定性:决策依赖于对未来长时序演化的推理,需要结构化先验与表征。
  • 基础模型时代的扩展:大模型时代下,生成式先验(扩散、视频生成)能否作为世界模型、策略类或规划器,从而将RL从"试错学习"扩展为"目标驱动的自适应"。

论文围绕两条主线展开:

1. 博弈中的多智能体强化学习(双人零和、大规模电子竞技、一般和与部分可观测设定);

2. 基础模型时代的强化学习(扩散世界模型、视频生成RL、生成式策略、交互式视频世界模型、长时记忆架构)。

整体目标:在统一视角下把RL定位为复杂序贯领域中的目标驱动自适应,连接博弈决策、环境建模与新兴基础模型能力。


2. 方法论

2.1 经典RL基础

  • MDP建模,策略
  • Bellman算子压缩性
  • 值迭代 / Q-学习更新
  • 策略梯度定理(含基线):
  • 确定性策略梯度

2.2 多智能体博弈部分

  • 双人零和马尔可夫博弈:值函数 ,其中 分别为两方策略;
  • 最佳响应与纳什均衡
  • 极小极大等价性
  • Nash Q-learning 迭代:
  • Mean-Field Game(MFG):策略集合 ,个体受群体平均策略影响;通过聚合群体策略 与个体策略 的耦合,给出大群体极限下的均衡条件:
  • 一般和与部分可观测博弈(POMG):使用公共信念状态 与对手的策略历史推断,并在带记忆的Q网络/参与者-评价者(Actor-Critic)框架下联合学习。

2.3 基础模型时代的RL

  • 扩散世界模型(Diffusion World Model):前向过程

反向过程参数化为 ,可用于规划与控制中的状态预测。

  • 视频生成的RL:以扩散模型作为生成器,使用奖励信号微调采样过程,使生成视频在内容、流畅度等指标上对齐任务目标;典型更新:
  • 生成式策略类:将策略 参数化为条件生成模型(扩散/流匹配),支持连续高维动作空间与多模态行为分布。
  • 交互式视频世界模型:条件化未来帧生成为 ,其中 为文本/目标条件, 直接改变生成轨迹,形成"动作塑造未来观测"的闭环。
  • 长时记忆架构:通过记忆库、上下文检索或循环隐状态缓解扩散/视频模型在长序列上的一致性问题。

3. 实验设计

  • 场景与基准
  • 多智能体部分涵盖双人零和博弈大规模电子竞技(如StarCraft类微观控制/Dota类大规模对战)一般和博弈部分可观测多智能体任务
  • 基础模型部分在视频生成基准具身规划/控制仿真环境以及条件扩散世界模型上做评估。
  • 对比方法:与经典深度RL基线(DQN/PPO等)、已有纳什/相关均衡求解方法、MFG近似算法,以及无条件扩散生成、条件VAE世界模型、Transformer-based视频世界模型等基础模型基线对比。
  • 评测指标:胜率/纳什差距、累计奖励、视频质量(FID/IS/FVD等指标的合理子集)、规划任务成功率与长程一致性。

4. 资源与算力

  • 论文给出部分关键超参数(如 、学习率 等),但正文中未明确报告GPU型号、数量与总训练时长
  • 可推断使用:扩散/视频模型训练通常需要多卡A100级别GPU集群,DQN类对照实验累计约 步更新。
  • 详细算力账单(GPU小时数、能耗、墙钟时间)未给出,这在系统级博士论文中属于常见披露缺失。

5. 实验数量与充分性

  • 实验规模:覆盖多条任务线(零和博弈→一般和→MFG/POMG)与多种生成任务(扩散世界模型、视频生成、生成式策略、交互式视频世界模型)。
  • 消融:在基础模型部分,通常会针对扩散步数 、记忆长度、奖励权重、目标条件形式等进行消融。
  • 充分性评估
  • 优点:覆盖面广(理论分析 + 实证),方法主线明确;
  • 局限:受论文体例限制,每个子工作的实验规模可能相对有限,与单一方法的大规模深度RL论文相比,复现所需的统计显著性细节与多随机种子数量披露不一定完整。
  • 客观与公平性:主要结论基于统一任务族的相对比较,但基础模型类方法的评测依赖生成质量指标,存在评测偏差(如FVD对帧间动态不敏感)。

6. 主要结论与发现

  • 统一视角:RL可被理解为"复杂序贯领域中目标驱动的自适应",不论是博弈中的均衡学习,还是生成模型驱动的规划/控制。
  • 博弈侧:纳什Q-learning与最佳响应迭代在大规模零和博弈中有效;MFG视角可在一般和设定下近似大群体均衡;POMG下带记忆的Actor-Critic有助于处理对手策略的不完全可观测性。
  • 基础模型侧
  • 扩散世界模型作为规划器在样本效率上具竞争力;
  • RL微调扩散采样能显著提升生成视频与下游决策质量;
  • 生成式策略类支持多模态行为分布,在高维动作空间优于参数化高斯策略;
  • 交互式视频世界模型通过动作条件化生成未来观测,实现"动作即未来"的可控生成;
  • 引入记忆机制可缓解长程漂移与不一致性。
  • 整体结论:RL与生成式基础模型具有深度互补性,前者提供目标/反馈信号,后者提供表征/先验/世界模型。

7. 优点与亮点

  • 覆盖面与统一性:单篇论文系统串联多智能体博弈→基础模型RL两大方向,是难得的"综述式研究"型博士论文。
  • 理论-实证结合:从Bellman压缩、纳什/相关均衡存在性到MFG均衡条件分析,再到算法实证,层次清晰。
  • 方法新颖性
  • 首次系统探索扩散模型作为世界模型/策略类
  • 提出交互式视频世界模型框架,将生成模型直接置于决策回路;
  • MFG与POMG中的均衡学习给出可操作的算法模板。
  • 写作规范:符号一致、结构清晰,便于跨领域读者阅读。

8. 不足与局限

  • 算力披露不足:未给出明确的GPU资源、训练时长与碳排,难以评估方法的实际部署成本。
  • 实验统计严谨性:部分子工作可能未充分报告多随机种子、置信区间、显著性检验等细节。
  • 评测偏差:视频/生成质量依赖FVD/IS/FID等指标,对长时动态一致性的捕捉有限。
  • 泛化与可扩展性
  • 纳什Q-learning在大规模一般和博弈中理论收敛性仍弱;
  • 扩散世界模型与视频世界模型在超长序列下的推理延迟与一致性仍是开放问题;
  • 基础模型与RL结合易受奖励黑客(reward hacking) 影响,需更鲁棒的奖励设计。
  • 应用限制:交互式视频世界模型对算力要求高,难以直接落地到实时控制;MFG假设在大群体近似下成立,对小群体精细交互建模能力有限。
  • 复现性:缺少统一的代码仓库与训练协议,跨子工作的超参数表分散在不同章节,复现门槛较高。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记