arXiv 2606.29222v1 · 发布 2026-06-28

CORE 规划器:未知环境下面向上下文记忆的强化学习机器人导航

CORE Planner: Contextual-memory Oriented Reinforcement-learning in Unknown Environments for Robot Navigation

AUTHORS Jintao Kong, Zhihao Zhang, Weihuang Chen, Liming Chen, Zhongyu Guo, Shuaiyu Liu, Hongbin Sun
EVIDENCE 面向未知环境机器人导航的强化学习
SCORE 0.8
CATEGORIES TASK rl
GENERATED 2026-07-04 21:40:51 UTC

📝 TLDR

在未知环境中自主导航需兼顾高效探索与泛化部署,但传统规划依赖人工规则,学习式方法环境记忆有限且难实现仿真到真实迁移。本文提出CORE Planner,将稀疏可视图结构化表征与Transformer强化学习结合,引入上下文记忆机制缓解局部最优问题。实验显示该方法在多种环境中稳定超越传统FAR Planner与学习式基线,路径更短、复杂场景增益更显著,并在真实场景中无需人工干预即完成导航,验证了零样本迁移的可行性。

🧭 速览

动机

传统规划方法依赖手工设计规则,学习式方法存在环境记忆有限与仿真到真实迁移困难的问题。

方法

采用稀疏可视图结构化建模环境,结合Transformer网络进行整体感知,并引入基于图的稀疏化与上下文记忆机制。

结果

较传统FAR Planner缩短路径13%,较学习式基线最多缩短48%,复杂环境中增益更大。

结论

仅基于图像环境训练即实现零样本仿真到真实迁移,在真实场景中可无人工干预完成自主导航。

📊 论文图表(共 19 张)

展开查看 19 张图

TL;DR

本文提出 CORE 规划器,通过将稀疏可视图的结构化表征与 Transformer 强化学习框架相结合,引入上下文记忆机制解决未知环境下的机器人导航问题。该方法在多种仿真环境中稳定超越传统 FAR Planner 和学习式基线,路径缩短最高达 48%,并在真实场景中实现了无需微调的零样本仿真到真实迁移。

研究背景与动机

未知环境自主导航是机器人领域的核心挑战之一,其本质在于机器人必须在没有先验地图的情况下同时完成探索与路径规划。这看似矛盾的需求使得该问题在学术研究和实际应用中都具有相当的难度——机器人需要在逐步感知环境的过程中做出导航决策,既不能盲目探索导致效率低下,也不能因信息不足而在局部区域陷入困境。

传统方法在这一问题上已经取得了显著进展,其中 FAR Planner 是一个代表性工作,它通过在线构建稠密栅格地图并结合快速搜索算法实现导航。然而这类方法存在几个固有局限:稠密栅格地图的计算复杂度随环境规模快速膨胀,在大规模或复杂场景中难以保证实时性;此外,人工设计的规则难以应对千变万化的真实环境,尤其在存在动态障碍物或非结构化地形时表现不稳定。

与此同时,基于强化学习的端到端方法试图让机器人直接从原始感知输入中学习导航策略,这种方式在理论上具有更强的泛化潜力。但实际情况是,纯学习的方案往往只能捕捉到训练环境中的表层模式,环境记忆能力有限——当机器人进入一个与训练分布差异较大的新场景时,性能会急剧下降。更关键的是,学习式方法从仿真环境到真实世界的迁移一直是困扰该领域的难题:仿真器中的纹理、光照、物理规律与真实世界存在细微却致命的差异,直接部署往往导致策略失效,需要大量的人工微调才能勉强工作。

CORE 规划器的核心动机正是要弥合传统方法与学习方法之间的鸿沟。一方面,研究者希望保留传统规划中结构化的环境表征方式,因为可视图这类表示天然地编码了空间可达性与约束关系,不依赖于具体的纹理或颜色;另一方面,他们希望借助强化学习的自适应性来超越手工规则,在感知受限的情况下做出更优决策。正是在这一交叉点上,CORE 规划器应运而生。

方法

CORE 规划器的设计哲学可以概括为「以结构化表征为骨,以注意力机制为魂」。具体而言,它采用稀疏可见性图作为环境的核心表征,这一选择背后有着深思熟虑的考量。在传统方法中,稠密栅格地图将整个可通行空间离散化为均匀网格,每个格子都需要存储和更新状态,当环境规模增大时内存占用和计算开销呈平方级增长。而可见性图只保留环境中关键位置之间的连接关系——那些可以直接「看见」而不被障碍物遮挡的点作为节点,从一个节点沿直线移动到另一个节点而不碰撞的边作为连接。这种稀疏化的图结构大幅削减了需要处理的数据量,同时保留了导航所需的本质空间结构信息。

然而,仅有图结构本身并不足以指导决策,机器人还需要理解「当前看到的环境信息意味着什么」。这是 CORE 规划器引入 Transformer 网络的原因。在给定当前局部观测和目标位置的情况下,机器人需要判断自己处于图的哪个位置、周围有哪些可用的边、下一步应该朝哪个方向移动。这些决策之间存在复杂的依赖关系:下一步的选择会影响未来的感知输入,而未来的感知又会反过来影响后续决策。Transformer 的自注意力机制恰好能够建模这种长距离依赖,它允许网络在做出决策前「审视」整个上下文信息,而不是像传统递归网络那样只能隐式地依赖隐藏状态传递信息。

这里的核心创新在于上下文记忆机制。当机器人仅依赖当前局部感知时,它很容易在视野受限的环境中陷入局部最优——例如走进一条死胡同后发现无路可走,不得不折返。这种现象的根本原因在于缺乏对「曾经去过哪里、那里是什么情况」的全局记忆。CORE 规划器的上下文记忆机制允许机器人维护一个关于已访问区域及其环境特征的记忆库,在决策时不仅考虑当前感知,还参考历史经验。具体实现上,这个记忆库以键值对的形式组织,当前决策问题转化为一个查询过程:机器人问自己「基于我曾经见过的环境信息和现在的目标,什么样的行动最可能带我到达目的地」。这种设计使得网络能够主动避免重复探索已知的无效区域,同时引导机器人向更可能包含通往目标路径的方向前进。

图稀疏化方法与上下文记忆机制相辅相成。直接使用原始可见性图可能在复杂环境中仍然包含过多节点,导致 Transformer 的计算复杂度不必要地升高。CORE 规划器引入的图稀疏化方法在保持关键连通性信息的前提下剪去冗余边,使得无论环境规模如何扩大,模型的计算开销都能维持在可控范围内。这一设计对于将方法拓展到真实世界的复杂场景至关重要。

整个系统以强化学习的方式端到端训练。机器人接收第一人称视角的深度图像或 RGB 图像作为输入,这些图像首先被编码为紧凑的特征向量,然后与目标位置信息一起送入 Transformer 网络。网络输出一个关于动作的分布,典型的动作空间包括前进、左转、右转等离散命令。奖励函数设计鼓励机器人尽快到达目标、惩罚碰撞和原地徘徊,同时利用上下文记忆机制提供的信号帮助网络学习何时「记住」某个区域、何时「忽略」某个区域。经过在多样化仿真环境中的训练后,CORE 规划器展现出惊人的泛化能力。

实验与结果

实验部分系统地验证了 CORE 规划器在多个维度上的性能提升。研究团队构建了涵盖不同复杂度级别的仿真环境,包括简单的单房间场景、多房间结构的建筑环境、以及包含大量障碍物的迷宫式空间。这些环境在障碍物分布、房间连通性、空间尺度等方面各有特点,能够全面评估导航方法的鲁棒性。

与基线方法的对比结果清晰地呈现出 CORE 规划器的优势。在传统方法方面,FAR Planner 作为当前最先进的基于稠密地图的规划器之一,被选为主要对比对象。结果显示,CORE 规划器的平均行进距离比 FAR Planner 减少了 13%,这个数字乍看不大,但在导航任务中意味着机器人少走了相当可观的弯路。值得注意的是,在更复杂的环境中这个优势进一步放大——当障碍物密度增加或房间结构变得更加曲折时,传统方法的性能下降明显,而 CORE 规划器凭借其结构化表征和上下文记忆能够更好地应对这些挑战。

与基于学习的方法相比,CORE 规划器的优势更为显著,最多实现了 48% 的路径长度缩减。这一结果揭示了纯学习式方法的根本问题:它们在训练环境中可能表现尚可,但一旦测试环境与训练分布存在差异,性能就会急剧衰退。CORE 规划器通过将 Transformer 的通用表示能力与可见性图的结构化先验相结合,既避免了完全依赖手工特征,又能利用环境结构的规律性,因此能够在未见过的场景中保持稳定表现。

仿真到真实的迁移实验是本研究的一大亮点。研究团队在完全基于仿真图像训练之后,直接将训练好的策略部署到真实机器人上,无需任何微调或域自适应处理。真实世界的环境包含不同的光照条件、地板纹理、家具摆放——这些因素在仿真器中从未出现过。CORE 规划器成功地在这些真实场景中完成了导航任务,充分证明了其零样本迁移能力。这背后的原因可以追溯到方法本身的设计选择:可见性图只编码几何拓扑信息而不依赖于特定纹理,Transformer 学到的是关于「空间关系」的抽象概念而非「某个特定墙面的颜色」,因此当纹理和颜色发生变化时,这些核心知识依然有效。

讨论与可借鉴点

CORE 规划器为机器人导航领域提供了一条值得深思的技术路径。它成功证明了「结构化表征 + 深度学习」这一范式在机器人学中的巨大潜力,而这一范式的核心洞见是:让神经网络学习「推理」而非「记忆」。传统端到端学习的问题在于模型容易过拟合到训练数据的表层统计规律,而 CORE 通过引入可视图这一领域特定的表示,强制网络在一种更有意义的表征空间中进行推理,从而获得了更好的泛化能力。

该工作的一个重要启示是关于「上下文记忆」的设计思路。在许多需要长期规划的强化学习任务中,智能体常常面临「短期记忆丰富、长期记忆缺失」的问题。CORE 规划器的记忆机制不是简单地存储所有历史观测,而是主动地决定「什么值得记住」以及「如何利用记住的信息做决策」,这种选择性注意力的思想可以迁移到其他领域,比如长时间跨度的任务规划、多机器人协作等。

当然,现有工作也存在一定的局限性。首先,上下文记忆的计算开销会随着任务时间跨度的增长而增加,如何设计更高效的记忆更新策略值得进一步探索。其次,当前的可见性图构建假设静态环境,在动态障碍物频繁出现的场景中可能需要在线更新图结构。此外,零样本迁移虽然在实验中得到了验证,但真实世界场景的多样性意味着未来需要更大规模的真实环境测试来建立更稳固的信心。

对于更广泛的研究社区而言,CORE 规划器的设计原则具有超越机器人导航的参考价值。它提醒我们,在将深度学习应用于物理世界的任务时,不应盲目追求「端到端」的简洁性,而应根据领域知识精心设计输入输出的结构化表示,让神经网络在她擅长的「复杂模式建模」环节发挥作用,同时让她在她不擅长的「理解物理约束」环节得到结构化先验的辅助。这种「让专业的人做专业的事」的分工思想,或许正是未来通用机器人系统的设计哲学之一。

摘要

在未知环境中的自主导航要求机器人在没有先验地图的情况下进行探索,同时高效地到达预定义目标。尽管该领域已取得一定进展,但大多数现有工作仍然依赖传统规划方法与人工设计的规则,而基于学习的方法则常常面临环境记忆有限以及仿真到真实环境(sim-to-real)迁移困难的问题。为克服这些局限性,我们提出了一种面向上下文记忆的强化学习(CORE)规划器,用于未知环境下的机器人导航。所提出的 CORE 规划器有效融合了传统方法与基于学习方法的核心优势。具体而言,我们的方法采用稀疏可见性图进行结构化环境表征,从而降低稠密栅格地图的计算开销,并使用 Transformer 网络实现整体性的环境理解,从而显著提升导航效率。此外,我们引入了一种基于可见性图的图稀疏化方法与一种上下文记忆机制,缓解了局部最优问题,并提升了大规模场景下的计算性能。最后,我们的方法在仅基于图像化环境进行训练后即可实现零样本的仿真到真实环境迁移,无需微调。实验结果表明,CORE 规划器在多种具有代表性的环境中始终优于包括传统 FAR Planner 在内的最先进方法以及所有基于学习的基线方法,相较于传统 FAR Planner 减少了 13% 的行进距离,相较于基于学习的基线方法最多减少了 48%,且在更复杂的环境下提升更为显著。在真实场景中,CORE 能够在无需人工干预的情况下成功完成导航,展现了零样本的仿真到真实环境迁移能力。代码已开源于 https://github.com/BBD00/core_planner。

Abstract

Autonomous navigation in unknown environments requires a robot to efficiently reach a predefined goal while exploring without prior maps. Although progress has been made in this area, most existing works still rely on traditional planning methods with hand-crafted rules, while learning-based methods often suffer from limited environmental memory and challenges in simulation-to-real (sim-to-real) transfer. To overcome these limitations, we propose a Contextual-memory Oriented Reinforcement-learning (CORE) planner for robot navigation in unknown environments. The proposed CORE planner effectively combines the core advantages of traditional and learning-based methods. Specifically, our method uses a sparse visibility graph for structured environment representation, reducing the computational overhead of dense grid maps, and employs a Transformer network to achieve a holistic environmental understanding, thereby significantly improving navigation efficiency. Moreover, we introduce a visibility graph-based graph sparsification method and a contextual memory mechanism, which alleviates local optima and enhances computational performance in large-scale scenes. Finally, our approach achieves zero-shot sim-to-real transfer after training solely on image-based environments, requiring no fine-tuning. Experimental results show that CORE Planner consistently outperforms state-of-the-art methods, including the traditional FAR Planner and all learning-based baselines, across representative environments, reducing travel distance by 13\% over traditional FAR Planner and by up to 48\% relative to learning-based baselines, with larger gains observed in more complex environments. In real-world scenarios, CORE successfully navigates without human intervention, showcasing zero-shot sim-to-real transfer. Code is available at https://github.com/BBD00/core_planner.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记