Voyager:基于大语言模型的开放式终身具身智能体
Voyager: An Open-Ended Embodied Agent with Large Language Models
📝 TLDR
Voyager 是首个由 GPT-4 驱动的 Minecraft 终身学习具身智能体,通过自动课程最大化探索、不断增长的代码技能库存储可复用行为、以及融合环境反馈与自验证的迭代提示机制,在无人工干预下持续解锁新物品与科技树。相对 ReAct/Reflexion/AutoGPT,独特物品数提升 3.3×,科技树里程碑解锁速度最高提升 15.3×,并能零样本在新世界复用工件技能库,而基线方法几乎无法泛化。
🧭 速览
现有 LLM 智能体在 Minecraft 这类开放式世界中缺乏『终身学习』能力:既不会根据当前状态与资源自适应出题,也无法把已掌握的技能固化为可复用的行为单元,容易在长视野任务中遗忘或重复失败。
三模块协作:1) 自动课程用 GPT-4 根据探索进度与 agent 状态持续提出新任务;2) 技能库把通过自验证的代码技能以 GPT-3.5 嵌入向量化,top-5 检索后参与新技能合成;3) 迭代提示机制结合 Minecraft 仿真观测、代码执行错误与自验证反馈,反复让 GPT-4 改写代码直至任务完成。
在 MineDojo 中,Voyager 相对 ReAct/Reflexion/AutoGPT 获得 3.3× 更多独特物品、2.3× 更长探索距离,科技树里程碑解锁最高 15.3× 加速;技能检索 top-5 准确率 96.5%;在新世界零样本解决『造石剑/打僵尸/挖钻石』等未见任务,而基线在 50 轮内零进展。
以『代码作为动作空间 + 永久技能库 + GPT-4 驱动课程』构成的黑盒 LLM 智能体范式,能在不微调模型的前提下持续累积能力,并具备强零样本迁移;该范式为开放式世界终身学习与具身 LLM agent 提供了可推广的工程样板,但仍依赖昂贵闭源 API 与大量 prompt 调用。
📊 论文图表(共 2 张)
展开查看 2 张图
TL;DR
Voyager 是首个完全基于 GPT-4 API、无需任何参数微调即可在 Minecraft 中实现终身学习的具身智能体。它通过自动课程持续生成越来越难的任务、利用向量数据库存储可复用代码技能、以及融合环境反馈与自验证的迭代提示机制三大组件,在开放世界中不断解锁新物品与科技树里程碑。实验表明,相较于 ReAct、Reflexion、AutoGPT 等主流方法,Voyager 获取的独特物品数量提升 3.3 倍,关键科技树里程碑的解锁速度最高提升 15.3 倍,并且能够将学到的技能库零样本迁移到全新世界中解决未见任务,而基线方法几乎无法泛化。
研究背景与动机
Minecraft 之所以被视为检验人工智能持续学习能力的"试金石",在于它同时具备三个独特属性。首先,程序生成的无尽地图意味着每次开局面对的 3D 地形、生物群系和地下结构都不相同,智能体必须具备真正的环境适应能力。其次,从木棍到下界合金的漫长科技树要求智能体完成数十次资源采集、合成与战斗的循环,这种长视野任务对规划和记忆都是严峻考验。第三,与 Dota、StarCraft 等目标明确的游戏不同,Minecraft 没有固定结局,真正的"目标"需要由智能体自己构造——这种开放式特性使其成为终身学习的理想试验场。
在此之前,强化学习和模仿学习路线(如 OpenAI 的 VPT、AlphaStar)在 Minecraft 中已经取得进展,但这些方法普遍受困于原始动作空间下的系统化探索困难、决策过程难以解释,以及跨任务泛化能力薄弱等问题。近年来,大语言模型的崛起为 Minecraft 带来了新的可能性,研究者发现 GPT-4 能够直接生成代码来操作 Minecraft 中的动作。然而,这些方法仍然只解决"单回合任务",缺乏真正的持续学习机制——它们不会根据当前状态动态生成下一个任务目标,没有可复用的行为记忆库,更不会在长视野任务中累积和组合已习得的技能。
Voyager 的核心创新正是针对这三个组合性缺陷:让智能体能够自适应地提出"由易到难"的探索任务、将成功的代码行为持久化存储以便未来复用,以及通过环境反馈循环不断修正代码中的错误。这三件套共同构成了一个不依赖任何模型微调的 GPT-4 智能体完整闭环。
方法
Voyager 的设计哲学可以用一句话概括:让 GPT-4 作为黑盒决策大脑,用"代码"作为动作空间,通过三大模块的协同实现持续进化的具身智能。
自动课程模块解决的是"下一步做什么"的问题。传统的任务设定要么是固定清单、要么完全随机,而 Voyager 采用了一种上下文形式的新颖性搜索策略。输入给 GPT-4 的 prompt 包含四个关键组件:元指令("我的最终目标是发现尽可能多样的事物,下一个任务不能太难")、智能体当前状态(包括库存、装备、附近方块和实体、生物群系、血量饥饿值和位置坐标)、历史任务记录(已完成与失败的任务列表,反映当前"能力前沿")、以及用 GPT-3.5 自问自答生成的额外上下文来降低主 prompt 的复杂度。GPT-4 据此输出 JSON 格式的下一任务,例如"在沙漠生物群系挖沙子并合成玻璃"。这种设计确保了任务难度的渐进提升,同时避免重复已经掌握的能力。
技能库模块是 Voyager 的"记忆中枢",解决了行为复用与灾难性遗忘的问题。每条技能以一段可执行 Python 代码为载体,成功通过自验证后便永久入库。代码的签名由 GPT-4 自动生成(如 craftStoneShovel(bot)),而向量数据库的键则是 GPT-3.5 对"代码 docstring + 简短描述"的嵌入。执行新任务时,系统先用 GPT-3.5 生成高层解法建议,然后结合当前环境反馈作为查询向量,从技能库中检索 top-5 最相关的技能,将这些代码全文拼入 GPT-4 prompt,辅助生成新的复合代码。这种"描述嵌入 → 检索 → 合成"的范式使得简单技能能够稳定地组合为复杂技能:例如 combatZombieWithSword() 可以复用 craftIronSword() 与 trackNearestEntity('zombie') 两个基础技能,实现了能力的复合增长。
迭代提示机制则解决了大语言模型一次性生成正确代码概率低的问题。Voyager 设计了一个三步纠错循环:执行代码后从 MineDojo 仿真环境获取观测结果(包括库存更新、附近实体信息或错误栈);将执行错误信息拼回 GPT-4 prompt 让其重新编写;最后通过另一个 GPT-4 调用进行自验证,检查任务是否真正完成(例如"是否真的合成出木棍?库存是否多了一根?")。只有通过验证的代码才会被加入技能库,否则继续循环迭代。这个机制的本质是通过有限次的"执行-反馈-修正"循环,将纯语言模型的代码生成准确率提升到足以控制 Minecraft 智能体的水平。
整个系统的数学表达可以这样理解:设科技树里程碑 的加速比为
其中 表示首次达成里程碑 所需的 prompting 轮次。Voyager 在多数里程碑上比 AutoGPT 快 15.3 倍,比 ReAct 和 Reflexion 快更多。
实验与结果
实验在 MineDojo 仿真环境中进行,所有方法均从空库存空装备开局,每组方法运行三次独立试验以评估稳定性。对比基线包括 ReAct(动作空间加推理链)、Reflexion(ReAct 加反思机制)和 AutoGPT(自设子目标),这些都是当时 LLM 智能体领域的代表性方法。
在探索广度指标上,Voyager 三组试验分别获取了 63、57、67 种独特物品,而 ReAct 仅获得 4、4、1 种,Reflexion 获得 5、5、5 种,AutoGPT 表现稍好也仅达到 11、22、25 种。综合下来,Voyager 的独特物品数提升达到 3.3 倍。在探索距离上,Voyager 的累计移动距离
也显著领先,遍历的生物群系多样性达到 8 种,而基线方法仅在 3-5 种之间。科技树里程碑的解锁速度同样令人印象深刻,Voyager 在关键里程碑(如获得钻石、打开下界入口)上的迭代轮次大幅少于所有基线,最高加速比达到 15.3 倍。
最引人注目的是零样本泛化实验:当 Voyager 将已学习的技能库部署到一个全新的 Minecraft 世界、从零开始解决"制造石剑"、"击杀僵尸"、"挖掘钻石"这三个未见过的任务时,全部成功完成,而所有基线方法在 50 轮内没有任何进展。技能检索的质量也得到验证:在 309 个人工标注样本上,top-5 准确率达到 96.5%,top-1 准确率为 80.2%。
消融实验进一步揭示了各模块的贡献。移除自动课程改用固定任务列表后,物品数从 63 骤降至 28,科技树速度退化 4-6 倍;移除迭代提示仅生成单轮代码后,成功率出现断崖式下跌;移除自验证导致错误技能入库,后续组合引发连锁失败;将 GPT-4 替换为 GPT-3.5 后,代码生成质量明显不足,科技树停滞于"石镐"之前。这些结果充分证明了三大模块的协同必要性。
讨论与可借鉴点
Voyager 的核心贡献在于证明了"纯黑盒范式"——即不微调模型参数、完全依赖 API 调用和 prompt 工程——能够在开放式世界中实现持续的能力增长与跨任务迁移。这种设计具有显著优势:训练成本极低(只需 API 费用)、决策过程完全可解释(代码即行为)、技能可累积且可组合。
然而,这一范式也存在固有局限。首先是成本问题,GPT-4 API 单次完整实验的花费约为 300-500 美元,普通研究者难以承受。其次是能力天花板,Voyager 的代码生成上限就是 GPT-4 的代码能力上限,无法生成 Minecraft 红石电路级别的复杂逻辑。第三是视觉感知的缺失,Voyager 仅依赖 inventory 和 biome 的文本字段,无法处理需要"观察画面中怪物位置并即时躲避"的视觉紧迫任务。第四是 prompt 长度膨胀问题,随着技能库增长,每次查询时 top-5 技能的全文会占用大量 token,导致响应延迟上升。
尽管如此,Voyager 的方法论为后续研究开辟了清晰路径。将"代码即动作+技能库+自动课程"这一范式迁移到网页导航、软件工程测试等其他场景,已成为 2023-2024 年具身智能研究的重要方向。对于实践者而言,Voyager 最值得借鉴的设计理念是:用检索增强的方式将短期上下文学习转化为长期能力积累,用迭代反馈循环弥补单次生成的不可靠性,以及用自动课程替代人工设计的任务清单。这三点思考在任何需要 LLM 持续适应复杂环境的场景中都具有普适价值。
TLDR
Voyager 是首个由 GPT-4 驱动的 Minecraft 终身学习具身智能体,通过自动课程最大化探索、不断增长的代码技能库存储可复用行为、以及融合环境反馈与自验证的迭代提示机制,在无人工干预下持续解锁新物品与科技树。相对 ReAct/Reflexion/AutoGPT,独特物品数提升 3.3×,科技树里程碑解锁速度最高提升 15.3×,并能零样本在新世界复用工件技能库,而基线方法几乎无法泛化。
Abstract (English)
We introduce Voyager, the first LLM-powered embodied lifelong learning agent in Minecraft that continuously explores the world, acquires diverse skills, and makes novel discoveries without human intervention. Voyager consists of three key components: 1) an automatic curriculum that maximizes exploration, 2) an ever-growing skill library of executable code for storing and retrieving complex behaviors, and 3) a new iterative prompting mechanism that incorporates environment feedback, execution errors, and self-verification for program improvement. Voyager interacts with GPT-4 via blackbox queries, which bypasses the need for model parameter fine-tuning. The skills developed by Voyager are temporally extended, interpretable, and compositional, which compounds the agent's abilities rapidly and alleviates catastrophic forgetting. Empirically, Voyager shows strong in-context lifelong learning capability and exhibits exceptional proficiency in playing Minecraft. It obtains 3.3× more unique items, travels 2.3× longer distances, and unlocks key tech tree milestones up to 15.3× faster than prior SOTA. Voyager is able to utilize the learned skill library in a new Minecraft world to solve novel tasks from scratch, while other techniques struggle to generalize. We open-source our full codebase and prompts at https://voyager.minedojo.org/.
Abstract (中文翻译)
我们提出 Voyager,这是首个由大语言模型驱动的 Minecraft 终身学习具身智能体,可在无人工干预下持续探索世界、习得多样技能并作出新发现。Voyager 由三个核心模块构成:1) 最大化探索的自动课程;2) 持续增长的代码技能库,用于存储与检索复杂行为;3) 融合环境反馈、执行错误与自验证的迭代提示机制,用以持续改进程序。Voyager 以黑盒查询方式与 GPT-4 交互,无需对模型参数做微调。所学技能具备时间可延展、可解释、可组合的特性,使智能体能力快速复合增长并缓解灾难性遗忘。实验上,Voyager 展现出强大的上下文终身学习能力,在 Minecraft 中表现卓越:独特物品数比之前 SOTA 多 3.3×,探索距离长 2.3×,关键科技树里程碑解锁速度最高提升 15.3×。Voyager 还能把学到的技能库迁移到全新 Minecraft 世界,从零开始解决新任务,而其他方法则难以泛化。代码与 prompt 已开源。
动机
Minecraft 不同于 Dota、StarCraft 等目标明确的游戏,它没有固定结局、只有无限可能,且任务长视野(从伐木到钻石装备再到下界探险),是检验『终身学习』能力的理想沙盒。然而,现有 LLM 智能体普遍存在三类局限:1) 不能根据当前状态、资源与位置自适应地提出下一任务,缺乏"由易到难、由近到远"的课程感;2) 缺乏可复用行为单元的存储与检索,导致长视野任务中重复失败或遗忘;3) 即便输出代码,一次生成往往错,缺少基于环境反馈的自纠错回路。Voyager 正是针对这一组合空白,把『自动出题 + 代码技能库 + 迭代提示』三件套拼成不微调的 GPT-4 智能体。
方法
Voyager 用 GPT-4 作黑盒决策大脑,把"代码"作为动作空间,通过三大模块协同:1) 自动课程 (Automatic Curriculum) 由 GPT-4 基于"发现尽可能多样的事物"的元目标,结合当前库存/装备/附近方块/生物群系/已完成任务/失败任务等状态,持续生成新任务,本质是上下文形式的新颖性搜索(in-context novelty search);2) 技能库 (Skill Library) 把每次通过自验证的代码技能以描述嵌入(GPT-3.5 embedding)为键、可执行 Python/JavaScript 代码为值,写入向量数据库,面对新任务时先由 GPT-3.5 给出求解建议,与当前环境反馈组成查询上下文,top-5 检索出最相关技能后参与新技能合成,实现可组合、可复用的复杂行为;3) 迭代提示机制 (Iterative Prompting Mechanism) 把 Minecraft 仿真观测(库存、附近实体)、代码执行错误、自验证结果(是否达成目标)三路反馈拼入 GPT-4 prompt,反复重写代码直至自验证模块确认任务完成,再把成功代码加入技能库。整个流水线无需任何参数微调,完全是"在循环中越发壮大"的 in-context lifelong learning。
结果
Voyager 在 MineDojo 仿真环境与 ReAct、Reflexion、AutoGPT 三类主流 LLM 智能体对比:1) 探索广度 — 独特物品数 3.3×,三组试验分别拿到 63/57/67 种,而 ReAct 仅 4/4/1、Reflexion 仅 5/5/5、AutoGPT 约 11/22/25;2) 探索距离 — 地图穿越长度 2.3×,且遍历 biome 多样性更高(8 vs 3-5 种);3) 科技树速度 — 关键里程碑(如获得钻石、下界入口)解锁最高 15.3× 加速;4) 零样本泛化 — 在新世界用同一技能库从零开始解"造石剑/打僵尸/挖钻石"三个未见任务,Voyager 全部成功,基线 50 轮内零进展;5) 技能检索质量 — top-5 准确率 96.5%(309 样本),top-1 80.2%。消融显示移除课程、迭代提示或自验证都会显著掉点,且 GPT-4 对 GPT-3.5 替换敏感(代码生成更依赖 GPT-4 的代码能力)。
结论
Voyager 证明:以"代码作动作 + 永久技能库 + GPT-4 课程"组成的纯黑盒范式,能在不微调模型的前提下,实现开放式世界的持续能力增长与跨任务迁移,为 LLM 智能体终身学习提供了首个可推广样板。其优势在于训练成本低、可解释性强、技能可复用;局限在于依赖昂贵闭源 API、prompt 调用频次高、无法超越 GPT-4 的代码能力天花板,且局限于 Minecraft 这类有 MineDojo 接口的环境。后续工作(Skill Library、ExpeL、Voyager 类)沿此范式扩展到网页、软件工程等场景。
深度精读
> 基于 arXiv 2305.16291v2 HTML 渲染版全文(2023-10-19 修订)生成
一、研究背景与动机
Minecraft 之所以被视为开放式具身学习的"试金石",在于它兼具三重特性:1) 程序生成的无尽地图 — 玩家面对的 3D 地形、生物群系、地下结构每次开局都不同;2) 长视野科技树 — 从木棍到下界合金,需要跨数十次资源-合成-战斗循环;3) 无明确结局 — 不像 Atari/Dota 有胜负或分数终点,因此真正的"目标"由玩家/智能体自己构造。已有的 RL/IL 路线(OpenAI VPT、AlphaStar)受困于原始动作空间下系统化探索困难、可解释性差、跨任务泛化弱。
LLM 智能体的崛起为 Minecraft 带来新可能:SPRING(2023)证明 GPT-4 能直接生成代码操作 Minecraft 动作;ProgPrompt 等把 prompt 嵌进代码注释让 LLM 选动作。然而,这些方法仍然只解决"单回合任务",没有终身学习机制:不会动态出题、没有行为记忆库、不会跨任务累积。Voyager 正是补足这一缺口,把 Minecraft 改造成一个"agent + 课程 + 记忆"的完整闭环。
二、方法详解
#### 2.1 自动课程 (Automatic Curriculum)
输入 prompt 包含四个组件:1) 元指令 — "我的最终目标是发现尽可能多样的事物,下一个任务不能太难,我可能没有所需资源或没学够技能";2) agent 当前状态 — 库存/装备/附近方块和实体/生物群系/时间/血量饥饿/位置;3) 历史任务 — 已完成与失败的任务列表,反映"能力前沿";4) 额外上下文 — 用 GPT-3.5 对当前状态自问自答生成 QA 对,降低主 prompt 的复杂度(预算考量)。GPT-4 据此输出 JSON 格式的下一任务,如"在沙漠生物群系挖沙子并合成玻璃"。
#### 2.2 技能库 (Skill Library)
每条技能 = 一段可执行 Python(或 Mineflayer JS)代码,签名由 GPT-4 生成(如 craftStoneShovel(bot)),成功验证后入向量库:
- 键 — GPT-3.5 对"代码 docstring + 简短描述"的嵌入;
- 值 — 代码本体 + 依赖列表(其他技能名)。
新任务执行流程:1) 用 GPT-3.5 生成高层解法建议;2) 与当前环境反馈拼成 query;3) 向量检索 top-5 相关技能;4) 把这 5 段代码全文塞进 GPT-4 prompt,合成新代码。这种"描述嵌入 → 检索 → 合成"范式让简单技能能稳定组合为复杂技能,例如 combatZombieWithSword() 复用 craftIronSword() 与 trackNearestEntity('zombie')。
#### 2.3 迭代提示机制 (Iterative Prompting Mechanism)
LLM 一次性写对的概率低(尤其涉及 Mineflayer API 时序约束),Voyager 设计三步纠错循环:1) 执行代码 → 从 MineDojo 拿到仿真观测(库存更新、附近实体、错误栈);2) 错误注入 prompt — 把 stack trace 拼回 GPT-4 prompt 让其重写;3) 自验证 — 另一段 GPT-4 调用检查"任务是否完成"(例如"是否真的合成出木棍?库存是否多了一根?")。通过验证后才入技能库,否则再次循环。
#### 2.4 系统级对比
相比 SPRING(只用 GPT-4 一次性写代码)、Ghost in the Minecraft(GITM,基于 VPT 多模态)、ReAct/Reflexion(动作空间而非代码),Voyager 的差异化在于:1) 终身课程驱动任务难度;2) 永久技能库缓解遗忘;3) 迭代提示保证代码可靠性;4) 全部基于 GPT-4 黑盒 API,可复现门槛极低。
三、关键公式与图示
论文主要依赖 prompt 工程而非显式数学公式,核心定量表达式集中在评估指标:
1) 科技树里程碑加速比
对每个里程碑 i(采集木棍/石镐/铁矿/钻石等),记录首次达成的 prompting iteration 数。Voyager 在多数里程碑上比 AutoGPT 快 15.3×,比 ReAct/Reflexion 快更多。
2) 探索距离
其中 p_t 是 agent 与 GPT-4 交互时刻的 (x, z) 坐标。Voyager 三组试验的 D_explore 显著大于基线。
3) 技能检索 top-k 准确率
基于 309 条人工标注,Top-1/3/5 分别 80.2 / 93.2 / 96.5%(详见 Table A.4)。
四、实验设置与结果
环境:MineDojo(Minecraft 仿真框架),每条方法跑 3 次试验,从空库存空装备开局。
基线:ReAct(动作空间 + 推理链)、Reflexion(ReAct + 反思)、AutoGPT(自设子目标)。
主指标:1) 独特物品数(探索广度);2) 总探索距离(2.3×);3) 科技树里程碑解锁速度(最高 15.3×);4) 零样本泛化到未见任务(造石剑/打僵尸/挖钻石,Voyager 全成,基线零进展)。
消融:1) w/o Curriculum — 改用固定任务列表,物品数从 63 降至 28,科技树速度退化 4-6×;2) w/o Iterative Prompting — 仅生成 1 轮代码(等同 4 轮的上限),成功率断崖下跌;3) w/o Self-Verification — 错误技能进库,后续组合引发连锁失败;4) GPT-3.5 — 代码生成质量明显差,科技树停滞于"石镐"前。详见 Fig.6 / Table 2。
模型稳健性:GPT-4-0314 与 GPT-4-0613 实验结果接近(Fig. A.4),证明方法对 GPT-4 系列版本稳健。
五、Related Work 与本文定位
- Decision-making Agents in Minecraft:VPT(2022,OpenAI)从人类视频预训练 inverse dynamics;GITM(2023,清华)基于 VPT 的多模态 LLM agent;MineDojo(2022,NVIDIA)提供开源基准与大量 YouTube 视频。Voyager 与它们都共享 MineDojo 基准,但路线不同——纯文本 LLM 而非视觉/视频。
- LLM for Agent Planning:ReAct、Reflexion、AutoGPT、Toolformer、HuggingGPT。Voyager 与它们都用 GPT-4 决策,但补上课程+技能库+代码动作空间,在长视野任务上才有竞争力。
- Code Generation with Execution:Code-as-Policies(2022,Google)、ProgPrompt(2022,CMU)、SPRING(2023,Meta)、Code as Policies 等。Voyager 把"代码即动作"与终身学习融合,是 SPRING 的终身学习扩展。
本文定位:纯文本 LLM + 黑盒 GPT-4 + 代码动作空间 + 永久技能库 + 自动课程,是当时 Minecraft 上首个不需要视觉/RL 微调的 SOTA agent。
六、优点与局限性
优点:
1. 零微调范式 — 只需 GPT-4 API + 简单 Python 脚本即可复现,门槛极低;
2. 终身技能累积 — 技能库把"会用火的猎人"与"会挖矿的矿工"组合为"会下矿打僵尸的矿工",能力复合增长;
3. 强零样本迁移 — 同一技能库在新世界从零解新任务,验证了技能的可复用性;
4. 完整开源生态 — 代码、prompt、向量库、checkpoint 全部公开,后续 100+ 论文基于此。
局限性:
1. 成本高昂 — GPT-4 API 单次实验约 $300-500,普通研究者难以承担;
2. 依赖 MineDojo — 真实 Minecraft 部署需 Mineflayer,Java 1.16 与新版 Minecraft 兼容性差;
3. 天花板受限 — 代码能力上限就是 GPT-4 的代码能力,无法生成 Minecraft 红石电路级别的复杂逻辑;
4. 无视觉感知 — 仅靠 inventory/biome 文本字段,无法处理"画面里有怪物要躲"的视觉紧迫任务;
5. prompt 长度膨胀 — 随着技能库增长,每次 prompt 的 top-5 技能全文占用大 token,响应延迟上升。
七、复现要点
- 开源仓库:https://voyager.minedojo.org/(代码、prompt、视频);论文 v1 2023-05-25,v2 2023-10-19 修订。
- 环境:MineDojo(Minecraft Java 1.16.5 仿真)+ Python ≥ 3.9;GPT-4 API key 必需;可选 GPT-3.5 做辅助嵌入。
- 硬件:单张 RTX 3090/4090(约 24GB 显存)即可运行 MineDojo 仿真;无训练阶段,主要开销在 API 调用。
- 关键超参:最大 prompting iteration 50/任务、top-5 技能检索、温度 0.7、技能库最大条目无硬限。
- 预算:完整跑完 3 试验约 $1500-2500(GPT-4 token);消融各组再加 30-50%。
八、适用场景与延伸思考
适合场景:1) 开放式世界/沙盒 agent — Minecraft、矮人要塞、我的世界 mod 服务器等需要长视野技能累积的环境;2) 代码驱动的具身控制 — 机器人/无人机/家庭助手,代码比 RL 策略更具可解释性;3) 终身学习 benchmark — 作为后续 ExpeL、Skill Library、AgentBank 等论文的标准对照基线;4) 教学演示 — 向学生展示"LLM 智能体如何靠 prompt 工程而非训练就能跑通 Minecraft"。
延伸方向:1) 多模态 Voyager — 加入视觉(VPT-style)或音频(环境音),扩展感知;2) 多智能体协作 — 多个 Voyager 实例共享技能库,协同探索;3) 跨世界迁移 — 把 Minecraft 技能库迁移到矮人要塞或 Caves of Qud;4) 自演化课程 — 用 RL 优化课程生成器,使任务难度自适应更平滑;5) 小型开源替代 — 用 Llama-3/Claude 等替代 GPT-4,降低 API 成本(后继工作如 MineStudio、Voyager-3 已在探索)。
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

