arXiv 2607.06563v1 · 发布 2026-07-07

基于声学的具身人机交互:一种用于空间数据物理化的 AcoustoBots 多智能体强化学习方法

Embodied Human-Robot Interaction via Acoustics: A MARL Approach with AcoustoBots for Spatial Data Physicalization

AUTHORS Shiqi Liu, Narsimlu Kemsaram, Prateek Mittal, Pengyuan Wei, Sriram Subramanian
EVIDENCE 基于MADDPG的多智能体强化学习用于机器人协作
SCORE 0.9
CATEGORIES TASK mas
GENERATED 2026-07-08 21:42:23 UTC

📝 TLDR

传统数据物理化多为静态、脱离真实环境,难以表达具身空间动态。论文提出 AcoustoBots 平台,将 TurtleBot3 搭载 8×8 超声相控阵,以悬浮粒子高度(1–10 cm)编码城市标量数据。采用 MADDPG 多智能体强化学习进行避碰导航,并结合 GS-PAT 声学控制器维持运动中的悬浮稳定。实验在 4 m × 3 m 缩比英国地图上验证,单机器人任务成功率 90%,双机器人协作 80%。该工作证明了声悬浮可作为具身人机交互中机器人介导的可瞥见空间信息呈现方式。

🧭 速览

动机

传统数据物理化静态且脱离真实环境,难以传达具身空间动态并有效吸引用户参与。

方法

TurtleBot3 搭载 8×8 超声相控阵悬浮粒子编码数据,MADDPG 控制避碰导航,GS-PAT 控制器维持运动中高度稳定。

结果

4 m×3 m 缩比英国地图实验,单机器人成功率 90%,双机器人协作 80%,运动中悬浮稳定且无明显碰撞。

结论

声悬浮可作为机器人介导的可瞥见空间信息呈现方式,服务于具身人机交互与空间分析。

📊 论文图表(共 10 张)

展开查看 10 张图

TL;DR

AcoustoBots 将声悬浮技术与移动机器人结合,让悬浮粒子的高度随机器人位置实时编码城市空间数据。平台采用 MADDPG 多智能体强化学习实现避碰导航,配合高更新率的 GS-PAT 声学控制器在运动中维持悬浮稳定。在 4 m × 3 m 缩比英国地图实验中,单机器人任务成功率达 90%,双机器人协作达 80%,初步证明了声悬浮作为具身人机交互中可瞥见空间信息呈现方式的可行性。

研究背景与动机

数据物理化(data physicalization)旨在通过物理形式让抽象数据"可触摸、可感知",从而帮助人们更直观地理解空间分布与统计规律。传统方法多依赖静态雕塑、3D 打印模型或桌面投影,这些形式虽然直观,却存在两个根本性局限:其一,它们无法表达数据随时间或空间位置变化的动态特性;其二,这些物理形态往往脱离真实使用环境,观察者难以将看到的物理量与自己所在的空间建立联系。这在需要传达"具身空间动态"的场景中尤为突出——比如城市规划中的交通流量分布、城区噪声热力图、人口密度变迁等。

现有研究虽已探索投影 AR、可穿戴触觉反馈甚至无人机编队显示等交互式数据可视化手段,但在"让数据自己移动到用户面前"这一维度上仍缺乏有效方案。如何将空间数据的编码与移动机器人结合,使其具备可自主导航、在运动中保持稳定输出、并能协同覆盖大范围区域的能力,成为一个有趣且尚未被充分探索的问题。

AcoustoBots 的切入点正在于此:利用超声波相控阵产生的声辐射力悬浮粒子,通过控制粒子的悬浮高度直接编码标量数据,而机器人本体携带这套装置自主移动。观察者无需借助任何屏幕或头显,只需"瞥一眼"悬浮粒子的高低,就能感知当前区域的数值大小。

方法

AcoustoBots 的核心设计围绕一条闭环的感知–显示–动作回路展开。整套系统分为三个层次:移动执行层由 TurtleBot3 差速底盘承载朝上的 8×8 超声相控阵,负责将机器人移动到任意目标位置;显示层通过相控阵产生的声辐射力在阵列正上方悬浮一个粒子,其高度 与该位置的城市标量值线性对应;控制层则由两套算法协同工作,分别保证导航决策的最优性与悬浮控制的实时性。

导航策略采用基于 MADDPG 的[[多智能体强化学习]]方法。MADDPG 是针对多智能体环境下连续动作控制设计的经典算法,天然适合双机器人协作避碰这类场景。系统采用集中训练、分散执行(CTDE)的范式:在训练阶段,每个智能体的 Critic 网络能够访问全局状态 与所有智能体的联合动作,学习准确的价值函数

而在执行阶段,每个 Actor 仅依赖自身观测 输出动作,无需通信即可实现分布式控制。奖励函数设计兼顾"快速抵达目标"与"避免碰撞"两个目标,通过惩罚项引导策略习得避碰意识。

悬浮稳定性的维持则交由 GS-PAT 声学控制器负责。该控制器基于 Gerchberg–Saxton 算法的相位恢复原理,在每个控制周期内计算 64 个换能器的激励相位,使[[相控阵]]在指定三维坐标处形成稳定声阱。控制器以远高于底盘运动控制频率的更新率运行,确保当机器人移动到新位置时,悬浮阱能够迅速重新定位,粒子高度随之更新到目标值而不发生跌落或剧烈漂移。

整个闭环的运转逻辑如下:PhaseSpace 运动捕捉系统提供机器人精确定位,定位信息转换为各机器人的观测输入,MADDPG Actor 依据观测输出速度指令,底盘运动导致位姿变化,GS-PAT 控制器重新计算相位维持悬浮阱并更新粒子高度,观察者通过粒子高度读取当前区域的数据值。感知、显示、动作三者形成紧密耦合的闭环。

实验与结果

实验环境搭建在 4 m × 3 m 的室内空间,以缩比英国地图为场景底板,各地标对应真实城市的地理位置。实验中使用的城市标量数据为基于真实属性的合成场,包括人口密度、噪声水平等维度。

单机器人城际遍历任务要求机器人从起点依次访问多个目标城市,考验其在简单环境下的导航可靠性与悬浮稳定性。双机器人协作覆盖任务则将地图分为两个区域,两台 AcoustoBots 分别负责一片区域的遍历,额外增加了多智能体协调与避碰的复杂度。

实验采用 PhaseSpace 运动捕捉系统提供毫米级定位,相比机器人自带的轮式里程计,这套方案能够消除打滑与累积漂移对实验结果的干扰,保证了多机器人实验的可重复性。每种模式各进行 10 次试验。

结果显示,在运动过程中悬浮粒子始终保持稳定悬挂,未发生明显跌落或失控漂移;粒子高度随机器人位置呈现连续的空间相关变化,高度渲染与目标标量值的映射关系一致。单机器人模式下任务成功率达 90%,双机器人协作模式下为 80%,两种模式下的碰撞次数均维持在较低水平。这些数据表明,MADDPG 策略在避碰导航上表现可靠,而 GS-PAT 控制器能够在机器人持续运动的情况下稳定维持声悬浮。

讨论与可借鉴点

从实验结果来看,AcoustoBots 初步验证了声悬浮与移动机器人结合用于[[数据物理化]]的可行性,为[[具身人机交互]]提供了一种"一瞥即懂"的物理信息呈现思路。系统设计的亮点在于真正实现了感知–显示–动作的物理闭环:机器人移动本身既是导航行为,也是数据采样的空间遍历,而悬浮高度的实时变化本身就是环境对用户的直接反馈,无需任何屏幕或显示设备介入。

然而,当前工作仍有明显的局限性值得指出。实验规模偏小,每种模式仅 10 次试验且缺乏统计显著性检验,难以支撑更强的一般性结论;论文未设置消融实验,因此无法量化 MADDPG 与 GS-PAT 各自对整体性能的贡献占比;作为面向人机交互的系统,缺少受试者研究与主观评价指标,对于"用户能否正确理解悬浮高度所编码的数据含义"、"这种方式相比屏幕可视化是否真的更有效"等核心问题尚未回答。

从更宽泛的角度看,这项工作为空间数据的具身化呈现开辟了一条新路径。其核心思想——让数据"长腿走到用户面前"——可以拓展至其他物理化媒介与移动平台的组合。例如,将悬浮粒子替换为可调节亮度的光源、或与无人机平台结合实现室外三维数据场遍历,都是值得探索的方向。但这类方案也面临共同的工程挑战:悬浮高度的分辨率受限于声学原理、展示范围受限于相控阵尺寸与功率,对于面向大众展示的场馆级应用还需要进一步 miniaturization 与鲁棒性提升。

摘要

传统的数据物理化往往是静态的,且与真实环境脱节,限制了其在传达具身空间动态与吸引用户方面的能力。为解决这一局限,我们提出了 AcoustoBots——一个移动式声悬浮数据物理化平台,由 TurtleBot3 机器人搭载朝上的 8×8 超声相控阵。每个阵列悬浮一个粒子,其高度(1–10 厘米)对一个本地城市标量值进行编码,例如人口密度、噪声或交通。一种基于多智能体深度确定性策略梯度(MADDPG)算法的 MARL(多智能体强化学习)策略,采用集中训练、分散执行的方式,选择具有避碰意识的导航动作;而一个高更新率的 Gerchberg–Saxton 相控换能器阵列(GS-PAT)声学控制器则维持悬浮阱的稳定性,并在运动过程中更新阵列相位以实现所指令的高度。这构成了一条闭环的感知–显示–动作回路。我们在 4 m × 3 m 的英国缩比地图上评估了单机器人城际遍历与双机器人协作覆盖,使用基于 PhaseSpace 的定位系统以保证多机器人实验的可重复性。结果表明,在运动过程中悬浮稳定,且高度渲染随位置呈现一致的位置相关变化;在每种模式下进行的 10 次试验中,单机器人与双机器人模式的任务成功率分别为 90% 和 80%,且碰撞次数较低。上述结果支持将声悬浮作为一种简单、一瞥即得的、机器人介导的通信线索,用于空间分析中的具身人机交互。

Abstract

Traditional data physicalization is often static and disconnected from real environments, limiting its ability to convey embodied spatial dynamics and engage users. To address this limitation, we present AcoustoBots, a mobile acoustophoretic data-physicalization platform in which TurtleBot3 robots carry upward-facing 8 x 8 ultrasonic phased arrays. Each array levitates a particle whose height (1-10 cm) encodes a local urban scalar value, such as population density, noise, or traffic. A MARL (Multi-Agent Reinforcement Learning) policy based on the Multi-Agent Deep Deterministic Policy Gradient (MADDPG) algorithm, with centralized training and decentralized execution, selects collision-aware navigation actions, while a high-rate Gerchberg-Saxton-Phased Array of Transducers (GS-PAT) acoustic controller maintains trap stability and updates array phases to achieve the commanded height during motion. This creates a closed perception-display-action loop. We evaluate single-robot city-to-city traversal and dual-robot cooperative coverage on a 4 m x 3 m scaled UK map using PhaseSpace-based localization for repeatable multi-robot trials. Results show stable in-motion levitation and consistent, location-dependent height rendering, with task success rates of 90% and 80% for the single and dual-robot regimes, respectively, over 10 trials per regime, and low collision counts. These findings support acoustophoretic levitation as a simple, glanceable, robot-mediated communication cue for embodied human-robot interaction in spatial analytics.


论文详细总结(自动生成)

AcoustoBots:基于声学与 MARL 的具身空间数据物理化平台论文总结

1. 核心问题与研究动机

传统数据物理化(data physicalization)方法存在两大固有局限:

  • 静态性:多以固定雕塑、3D 打印模型或桌面投影等形式呈现,无法表达空间数据的时间演化与具身尺度。
  • 环境脱节:与真实地理空间分离,使用者难以将物理形态映射回"自己所处的环境",导致参与度低、难以"一瞥即懂"(glanceable)。

论文由此提出核心问题:能否借助移动机器人 + 声悬浮技术,将空间数据以"具身、可漫游、可交互"的方式物理化呈现,并服务于空间分析与具身人机交互(HRI)。


2. 方法论

2.1 整体架构:闭环感知–显示–动作回路

AcoustoBots 平台主要由三层组成:

1. 移动执行层:TurtleBot3 差速底盘,搭载朝上的 8×8 超声相控阵(Phased Array of Transducers, PAT)。

2. 显示层:每个阵列通过声辐射力悬浮一个粒子,悬浮高度

对应当前地理位置的城市标量值(人口密度、噪声、交通流量等)。

3. 控制层:MADDPG 用于导航决策,GS-PAT 用于维持悬浮稳定。

2.2 关键技术细节

(1) MADDPG 多智能体强化学习

  • 采用集中训练、分散执行(CTDE)范式;
  • 每一智能体的 Actor 仅基于自身观测 输出连续动作
  • Critic 在训练时访问全局状态 与联合动作 ,学习价值函数
  • 奖励函数鼓励"快速抵达目标"并对碰撞施加惩罚,从而获得避碰感知(collision-aware)的导航策略。

(2) GS-PAT 声学控制器

  • 基于 Gerchberg–Saxton (GS) 算法的反向传播相位恢复,在每个控制周期内计算 64 个换能器的激励相位,使阵列在指定三维坐标 处形成稳定声阱;
  • 高更新率(隐含明显高于机器人运动控制频率),使得机器人在移动过程中悬浮粒子高度仍能被动态跟踪,而不发生跌落或漂移。

(3) 闭环流程


3. 实验设计

  • 场景:室内搭建 4 m × 3 m 缩比英国地图,地标对应地理空间中的城市节点。
  • 数据集:使用合成的、基于真实英国城市属性(人口密度等)的标量场,作为各位置应显示的高度映射。
  • 基准对比:文中**未与传统的静态数据物理化方法或非 MARL 的路径规划方法(如经典反应式避障、A\*+人工势场)进行直接对比**。
  • 多机器人定位:采用 PhaseSpace 运动捕捉系统提供毫米级定位,保证实验可重复。
  • 任务模式
  • 单机器人城际遍历:从起点城市依次访问多个目标城市;
  • 双机器人协作覆盖:两台 AcoustoBots 协同覆盖不同区域。

4. 资源与算力

论文未在所提供文本中明确报告

  • 使用的 GPU 型号与数量;
  • 训练时长(episode 数、wall-clock time);
  • 是否使用仿真预训练再到实物迁移;
  • 推理算力开销。

这一点为可改进之处:MARL 实验的算力与训练成本对可复现性影响显著,应予以披露。


5. 实验数量与充分性

  • 每种模式(单 / 双机器人)进行了 10 次试验,共 20 次;
  • 评估指标包括:任务成功率碰撞次数
  • 还报告了悬浮稳定性与"位置相关的渲染一致性"。

充分性评价

  • 优点:使用 PhaseSpace 提供客观定位、对成功率与碰撞次数进行了量化。
  • 不足:
  • 样本量偏小(每模式仅 10 次),显著性检验不足;
  • 缺乏基线对比(无消融,如"无 MADDPG 改用传统避障"、"无 GS-PAT 改开环悬浮"),难以归因性能到具体模块;
  • 缺乏人类用户研究——论文宣称服务"具身 HRI",但未给出用户主观评价(NASA-TLX、易用性、注意力等)。

6. 主要结论与发现

  • 在 4 m × 3 m 缩比地图上,运动过程中悬浮保持稳定,未发生显著跌落;
  • 粒子高度随机器人位置呈现空间相关的连续变化,验证了"高度编码空间数据"的有效性;
  • 任务成功率:单机器人模式 90%,双机器人协作模式 80%,且碰撞数较低;
  • 据此,论文认为声悬浮可作为一种"一瞥即懂、机器人介导"的通信线索,适用于空间分析场景下的具身人机交互。

7. 优点与亮点

  • 跨学科创新:将声悬浮(acoustophoresis)、移动机器人与 MARL 融合在同一物理化任务中,思路新颖;
  • 真正闭环:感知(定位)→ 显示(GS-PAT 高度控制)→ 动作(MADDPG 导航)形成三段式闭环,物理量(粒子高度)成为环境反馈;
  • CTDE 范式选择合理:MADDPG 在小规模(2 机器人)连续动作避碰问题上兼顾效果与可训练性;
  • 可重复性考量:使用 PhaseSpace 而非里程计,提升多机器人实验的可信度;
  • 应用场景聚焦:明确指向空间分析与城市数据这一尚未被机器人 + 数据物理化覆盖的领域。

8. 不足与局限

  • 悬浮范围受限:高度仅 1–10 cm,展示分辨率与视觉冲击力有限,大型场馆中难以被远距离观察;
  • 专用硬件依赖:8×8 超声相控阵列价格昂贵、阵列较大,限制平台可扩展性;
  • 场景尺度小:仅 4 m × 3 m 室内,且依赖遮光/低噪等实验室条件;
  • 缺乏基线与消融:无法判断 MADDPG 与 GS-PAT 各自分担多少性能提升;
  • 样本规模小:每模式 10 次试验,未做统计显著性检验;
  • 无用户评估:作为面向 HRI 的系统,缺少受试者研究与主观指标,存在"声称应用但未验证"的偏差风险;
  • 算力与训练细节不透明:妨碍他人复现与对比;
  • 城市数据是合成标量:未讨论真实数据噪声、缺失或动态更新下的鲁棒性;
  • 双机器人策略较简单:仅验证了"协作覆盖"的成功率,未分析冲突消解、通信开销、队形保持等更深层多智能体问题。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记