ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Zero-WAM:基于人类视频的上下文世界-动作建模,用于开放式任务泛化

Zero-WAM:基于人类视频的上下文世界-动作建模,用于开放式任务泛化 26年8月来自蚂蚁集团Robbyant和港科技大学的论文“Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization”。零样本跨任务泛化即策略必须执行训练过程中从未见过的操作任务仍然是机器人学习的核心挑战。在大语言模型中只需在上下文中指定新任务即可执行该任务而无需任何参数更新。这种上下文学习ICL形式将泛化问题转化为任务指定问题。为了实现跨任务泛化将这种范式引入机器人操作领域并论证操作的自然任务指定方式是人类视频与语言不同它提供关于预期任务演化的丰富视觉线索。Zero-WAM一种因果视频动作模型它通过遵循上下文中的人类视频指导来执行未见过的任务。为了解决任务丰富的配对人机数据稀缺的问题提出一种自动流程将任务采样的机器人轨迹转换为语义匹配的人类视频从而生成 HumanGen 数据集该数据集包含 8600 个任务的 74200 个人机 ICL 对。为了进行模型训练进一步引入了上下文未来片段预测IFP目标该目标抑制从已见任务中学习的捷径并强制策略从视频提示中提取任务信息。在 RoboTwin 2.0 仿真中Zero-WAM 在七个未见任务上取得 47.0% 的平均成功率比最强的视频动作基线模型提高 29.5 个百分点。在真实场景评估中它能够根据人类视频的指导泛化到涉及多物体场景、长距离操作和细粒度插入等未见任务配置。如图1所示Zero-WAM概述。Zero-WAM能够根据上下文相关的人类视频提示或语言指令预测机器人未来的视频和可执行动作。人类视频指令基于任务采样的机器人轨迹大规模生成并结合任务平衡的机器人视频-动作预训练语料库。在未见过的模拟任务和复杂的真实世界任务上验证Zero-WAM的有效性。零样本机器人任务泛化需要一个能够迁移到未见过的任务的指令接口以及涵盖多样化任务动态的训练数据而不仅仅是增加机器人轨迹的数量。作为工程基础首先通过在任务级别对公开的机器人预训练数据进行重采样整理出任务多样化的视觉辅助VA数据。基于相同的任务级别采样引入上下文相关的人类视频生成流程将任务采样的机器人视频转换为人类视频指令。生成的人类-机器人指令组合构成HumanGen其中包括预训练指令组合外部、预训练指令组合内部、仿真指令组合和真实世界指令组合。图2总结这种数据构成以及用于生成HumanGen数据的流程。1. 任务多样化的视频动作数据任务多样化的VA数据来自公开的机器人视频动作VA预训练数据集包括AgiBot [23]、InternData-A1 [24]、Open-X-Embodiment [4]、RoboCOIN [25] 和 RoboMIND [26]。这些源数据集与LingBot-VA [11] 使用的公开VA预训练数据集相同。尽管这些数据集包含大量的机器人轨迹和广泛的任务覆盖范围但许多轨迹来自对同一任务的重复远程操作。直接使用原始分布会导致预训练过度受到冗余轨迹的影响从而阻碍模型充分利用源数据集中已有的任务多样性。通过将每个数据集重新划分为任务来解决这个问题其中每个任务由操作动作和目标对象的组合定义。任务标签在可用时从原始数据集元数据中获取或在元数据不足时从机器人轨迹中解析。然后从每个任务中抽取有限数量的轨迹抽样范围根据每个源数据集的任务内多样性进行调整。在五个源数据集中在每个训练周期中抽取超过 6000 个任务和约 40 万条相应的机器人轨迹。这种均衡的视频-动作语料库能够有效地将通用领域的视频生成模型适配到自回归机器人视频-动作模型。2 上下文中的人机视频生成流程人机视频演示通过视觉状态变化直接传达任务语义比机器人演示更容易获取并且不依赖于测试时使用的机器人实例。因此扩展任务丰富的人机上下文学习对是实现跨任务泛化的有效途径。手动收集此类配对的人机动作数据非常困难尤其是在需要高任务多样性时成本更是高得令人难以承受。因此从机器人预训练语料库出发再次按照所述方法在任务层面采样轨迹。这提供一系列带有可执行动作标注的机器人视频。然后引入一个上下文相关的人类视频生成流程将这些机器人轨迹转换为具有相同任务语义的人类操作视频。为了增加人机 ICL 对中视觉对齐的多样性生成的人类视频在保持相同任务语义的前提下包含了背景、视角、环境风格、物体实例和物体位置等方面的变化。图 2 所示的下半部分展示用于生成人类视频指令的上下文相关人类视频生成流程。对于每个采样的机器人视频首先使用 VLMGemini 3.1 Pro [27] 或 Qwen 3.6-Plus [28]进行任务分析。VLM 提取任务层面的信息包括任务名称、初始物体状态、物体状态变化和最终物体状态。它还会生成一个图像编辑提示将机器人视频的第一帧转换为人类操作场景的初始观察图像。通过该图像编辑提示注入上述视觉对齐变化同时保持任务语义。给定机器人的第一帧和图像编辑提示图像编辑模型Nano Banana 2 [29] 或 Qwen-Image-2.0 [30]会生成相应任务的初始人类观察图像。然后用 VLM 处理该编辑后的人类观察图像以及提取的物体状态信息生成一个视频生成提示描述人手应如何操作物体以完成任务。该提示被发送到视频生成模型Wan 2.7 [31] 或 Kling AI 3.0 [32]以合成人类操作视频。最后VLM 评估每个生成的视频的任务语义保持性和物理合理性并将合格的人类视频与其原始机器人轨迹配对作为 ICL 样本。3. 上下文人机交互数据集HumanGen 是一个包含一系列人机交互指令对的集合这些指令对是通过上下文人机视频生成流程生成的。每个指令对包含一个生成的人类视频指令及其对应的机器人轨迹该轨迹包含可执行的动作。HumanGen 按数据来源分为预训练 ICL外部、预训练 ICL内部、仿真 ICL 和真实世界 ICL。遵循与任务多样化 VA 数据集相同的任务多样化采样原则源机器人视频按任务而非原始轨迹频率进行采样从而避免 ICL 数据被少数任务的重复执行所主导。预训练 ICL外部。该子集由与任务多样化 VA 数据集相同的五个公开机器人视频动作数据集构建而成AgiBot [23]、InternData-A1 [24]、Open-X-Embodiment [4]、RoboCOIN [25] 和 RoboMIND [26]。这些数据集涵盖多种机器人形态、场景和物体包括超过45种机器人形态。从每个数据集中按任务采样机器人轨迹并使用上下文相关的人类视频生成流程将其转换为语义匹配的人类视频。具体而言从AgiBot数据集中采样3354个任务和6660条轨迹从InternData-A1数据集中采样261个任务和12515条轨迹从Open-X-Embodiment数据集中采样438个任务和9290条轨迹从RoboCOIN数据集中采样512个任务和6513条轨迹以及从RoboMIND数据集中采样了497个任务和6210条轨迹。总而言之预训练ICL外部包含5062个任务和41188个人机ICL对。对于此子集有意地使人机视频之间的视觉对齐方式多样化强制改变场景环境、桌面背景、物体实例和物体位置并平衡第一人称和第三人称视角。由于任务语义在这些视觉变化中得以保留模型能够学习到不受场景、物体和视角变化影响的人机任务对应关系从而提高其对视觉多样化 ICL 提示的鲁棒性。预训练 ICL内部。为了进一步扩大任务覆盖范围从内部机器人数据集中按任务对机器人轨迹进行采样。该子集涵盖多种机器人形态例如双手 Franka 和 Galaxea R1 Pro包含 3,522 个任务和 30,247 对人机 ICL。在使用上下文相关的人类视频生成流程为该子集生成相应的人类视频时降低第三人称视角的比例并减少场景、物体和物体位置变化的频率。这在保持任务多样性的同时生成更多视觉上对齐的ICL样本。仿真ICL。为了支持仿真中的跨任务评估为50个RoboTwin任务[22]生成ICL数据。该子集包含2500个ICL样本每个任务50个样本。其中43个任务用于训练后评估2150个训练样本其余7个任务作为未见过的任务用于零样本跨任务评估。真实世界ICL。真实世界ICL包含在双手Franka评估模型上收集的人机交互对。它包含252个人机ICL对涵盖评估中使用的三个真实世界任务系列120对来自30个物体到容器放置训练任务组合96对来自16个三物体顺序操作训练任务组合以及36对用于双桌腿插入任务。该子集用于后训练以便模型能够拟合用于跨任务评估的评估机器人的运动学数据。与现有数据集的比较。表 1 将 HumanGen 与现有的任务级人机配对数据集进行了比较。统计数据来自其官方论文。与以往依赖人工收集人类数据的数据集不同HumanGen 使用上下文相关的人类视频生成流程从机器人轨迹自动生成语义匹配的人类视频从而能够可扩展地构建人机 ICL 对。HumanGen 还整合了多个数据源公共数据、内部数据、仿真数据和真实世界数据涵盖了更多机器人实例包含来自第一人称和第三人称视角的人类数据以及具有不同视觉对齐程度的配对数据。最重要的是HumanGen 包含更广泛的任务覆盖范围这是实现零样本跨任务泛化的关键因素。在零样本跨任务操作中机器人必须在不进行微调的情况下执行一项全新的任务。利用世界-动作模型WAM来实现这一能力该模型基于大规模人机交互ICL对和任务平衡的机器人视频动作数据进行预训练在部署时Zero-WAM 使用语言指令或人类视频演示作为任务规范来驱动未见过任务的执行。继 LingBot-VA 之后通过将双向文本/图像到视频生成模型 Wan-2.2-TI2V-5B [36] 转换为上述因果视频动作策略实现 Zero-WAM。基于此框架Zero-WAM 特有的组件包括将人类视频作为上下文任务规范以及上下文未来片段预测。1 以人类视频作为任务规范对于一个未见过的任务用语言完整地描述期望的行为通常很困难而且指令必须进一步融入策略从未观察到的任务动态中。因此采用人类视频作为上下文任务规范直接呈现期望的动态在部署时一段演示未见过任务的人类视频作为指令。为了教会策略遵循此界面用 HumanGen 数据集进行训练。该数据集通过在任务级别对源机器人轨迹进行采样构建而成。每个语义匹配的配对包含一个生成的人类视频 h作为视觉任务规范及其对应的机器人轨迹提供监督式的未来视频和动作片段。由于人类视频和配对的机器人轨迹在具身性、视角、背景和物体位置上可能存在差异模型必须学习任务级别的对应关系而不是简单地复制人类视频中的动作。在训练过程中对人类视频片段、机器人视频片段和动作片段的token化表示应用教师强制注意力掩码。人类视频 h 被添加到机器人轨迹之前作为机器人视频预测的前缀记忆。对于下一个机器人动作片段的预测动作Transformer根据机器人领域历史和预测的下一个机器人视频片段按照逆动力学分解来预测ai1。它并不直接关注人类视频hh所传达的任务语义已被吸收到预测的下一个机器人视频片段中因此动作解码简化为标准的逆动力学。因此动作预测条件与标准的机器人视频动作训练条件保持一致。在训练过程中动作上下文中的 xi1是在教师强制下下一个机器人视频片段的真实值在推理过程中它被视频 Transformer 生成的视频片段所替换。RoPE [37] 偏移用于 ICL 人类视频。ICL 人类视频和多视角机器人视频由同一个 VAE 编码器编码因此共享同一个视觉潜空间。在token序列中通过高度轴 RoPE 坐标来区分 ICL 人类视频和机器人视频机器人视频的潜值保持其原始坐标而人类视频的潜值则沿高度轴偏移一定值。令 (q,y,x) 表示视觉潜值的时间、垂直和水平坐标令 H_mv 表示多视角机器人视频潜布局的高度。RoPE的偏移将人类视频的潜值置于机器人视频潜值的坐标范围之外从而防止 ICL 人类视频和机器人视频在同一序列中交互时出现表示混淆。2 上下文未来片段预测对于上下文样本模型应从人类视频 h 中推断任务演化过程并将其迁移到机器人领域。然而在对已见任务进行教师强制训练时通常可以通过外推最近的机器人历史 (x≤i) 来预测下一个机器人视频片段。这形成一个捷径使得模型无需学习使用上下文人类视频即可降低训练损失。当模型在未见任务上进行评估时这种捷径会导致模型继续依赖机器人历史并在需要 ICL 信号来指定新任务时未能充分利用该信号。为了克服这种捷径借鉴 Next Forcing [14] 的多片段预测方法引入上下文未来片段预测 (IFP)一个仅用于训练的辅助目标要求模型根据当前的机器人视频表示预测多个步长的未来机器人视频片段。IFP 基于主分支生成的当前机器人视频表示进行操作。IFP 损失将上述定义的流匹配目标应用于每个步长目标其中 w_k 表示第 k 个未来视频​​块目标的损失权重。重要的是IFP模块并非直接以人类视频提示h为条件。它们获取任务信息的唯一途径是通过φi1该函数是在主机器人视频Transformer与上下文中的人类视频交互后提取的。如果IFP模块直接以h为条件辅助分支就可以学习一个独立的、以人类视频为条件的未来预测器而无需强制主机器人视频Transformer对上下文中的任务信息进行编码由于IFP模块在推理阶段被移除因此部署的策略将无法从辅助监督中获益。因此我们仅以φi1为条件来约束IFP从而使未来损失能够监督主分支生成的当前机器人视频表示。多个未来片段以时间步长并行预测这增加了预测难度同时在训练过程中不会引入未来片段预测之间的时间依赖性。3 训练与推理训练数据混合。用任务多样化的 VA 数据集和 HumanGen 数据集的混合数据来训练 Zero-WAM 模型任务多样化的 VA 数据集提供多样化的机器人领域视频动作动态而 HumanGen 数据集提供基于可执行机器人动作的人类视频任务规范。这两个数据集的抽取采用采样权重而非与原始数据集大小成比例。对于动作片段预测在动作空间中使用类似的流匹配目标函数。对于 HumanGen 样本视频预测以 c {h, l} 为条件并结合上下文未来片段预测 (IFP) 进行增强。动作损失仍然以 l 为条件因为动作 Transformer 并不直接关注人类视频。推理。在测试阶段IFP模块被移除Zero-WAM支持两种任务规范模式。在仅语言模式下模型基于文本指令进行判断即c l。在ICL模式下人类视频被编码一次其token被缓存为前缀内存因此模型基于c {h, l}进行判断其中语言指令l是可选的。在两种模式下模型首先生成下一个机器人视频块然后解码对齐的动作块。1 实现实现细节。参照 LingBot-VA [11]从 Wan-2.2-TI2V-5B [36] 中实例化 Zero-WAM并将图像到视频的生成骨干网络转换为因果视频-动作模型。视频 Transformer 遵循 Wan-2.2 骨干网络隐藏维度为 d_v 3072包含 30 个 Transformer 层。动作 Transformer 使用隐藏维度 d_a 3072参数从视频分支初始化并通过 MoT 架构与视频 Transformer 连接。两个视频流均使用 RoPE 位置编码ICL 人类视频的高度轴 RoPE 偏移量设置为 ∆H 32。用 Wan-2.2 VAE 将机器人视频和人类视频编码为潜表示。语言指令使用 T5 [38] 进行编码。 IFP 模块预测 K 4 个未来机器人视频片段时间步长 s 2。相应的未来预测损失权重为 (w_1, …, w_4) (0.5, 0.25, 0.15, 0.15)。训练细节。用定义的流匹配视频损失、动作损失和 IFP 损失来训练 Zero-WAM 模型。用 AdamW 优化器 [39]峰值学习率为 1 × 10⁻⁴权重衰减为 0.01。在预训练期间以 1:5 的采样比例抽取任务多样化的 VA 数据和 HumanGen 数据。对于非 ICL 样本以 0.1 的概率丢弃语言指令。对于 ICL 样本以 0.1 的概率丢弃 ICL 人类视频潜信息并将语言指令的 dropout 值从 Wan-2.2 的默认值 0.1 提高到 0.4从而降低模型从人类视频指令中学习时对语言的依赖性。在预训练期间机器人视频块大小从 1 到 4 随机采样。预训练耗时 15,360 个 GPU 小时。与 LingBot-VA 类似每个 GPU 将不同 token 长度的样本打包成一个序列并使用注意力掩码来隔离不同的样本这在将每个 GPU 的最大 token 长度控制在 160K 以内的同时提高了训练吞吐量。推理细节。预训练的 Zero-WAM 支持两种推理模式。在仅语言模式下模型仅基于语言指令进行学习不依赖 ICL 人类视频视频 CFG 的尺度设置为 5。在 ICL 模式下模型基于 ICL 人类视频进行学习并禁用语言指令。用尺度为 5 的 ICL 无分类器引导 [40]。对于这两种模式推理块大小固定为 2动作 CFG 缩放比例设置为 1.0。2 仿真实验设置。在 RoboTwin 2.0 仿真 [22] 的干净设置下评估零样本跨任务泛化能力。RoboTwin 2.0 包含 50 个双手操作任务每个任务有 50 条机器人轨迹。对于每条轨迹使用提出的上下文人类视频生成流程生成相应的人类视频指令从而构成 HumanGen 数据集的仿真 ICL 子集。为了评估跨任务泛化能力将 RoboTwin 2.0 按任务级别划分43 个任务用于训练后训练7 个任务作为未见任务保留用于评估因此这些评估任务在训练期间不会作为机器人演示出现。未见任务包括将物体放在秤上、盖章、打开微波炉、将订书机移动到垫子上、将面包放入篮子、放置空杯子和堆叠三个积木。如图 3 所示这些任务涵盖了对未知物体和目标容器的抓取和放置任务、对未知关节物体的操作以及对未知长距离物体的操作。训练。在 RoboTwin 2.0 上用基于 Task-diverse VA 数据和 HumanGen 上下文数据预训练的检查点初始化 Zero-WAM 模型。用 64 个 GPU 进行 4000 个训练后步骤的训练。在训练后阶段以 2∶10∶3 的比例联合采样 Task-diverse VA、HumanGen 和 RoboTwin 数据。与预训练一样每个 GPU 打包多个样本最多可达 16 万个 token。基线。在相同的跨任务协议下将训练结果与两个视频动作基线进行比较。由于 Zero-WAM 是从 Wan-2.2 初始化的构建一个直接基于 Wan 的基线模型该模型从 Wan-2.2-TI2V-5B 初始化采用相同的 MoT 因果视频动作框架并且仅在已观测的 43 个 RoboTwin 任务上进行训练。将此基线模型称为 WAN-Action。还将其与领先的视频动作模型 LingBot-VA 进行比较使用其已发布的预训练检查点并在相同的已观测任务上进行后训练。两个基线模型在后训练期间均仅使用已观测任务的机器人视频动作轨迹遵循标准的跨任务设置 [41]。评估。所有实验均在三个随机种子上进行评估。对于每个种子在仿真中对每个未观测的任务运行 100 次闭环展开并计算任务成功率。最终结果报告三个种子上的平均值和标准差。对于人机视频条件化的变体任务由生成的人类视频指令指定对于仅语言的变体任务仅由文本指定。3 真实世界实验在一台真实的双臂 Franka 机器人上验证 Zero-WAM 的有效性。评估三类任务物体到容器的放置、三个物体的顺序操作以及双桌腿插入。对于每类任务收集一小部分已见过的机器人任务演示以使策略适应真实机器人的运动学特性同时保留待评估的任务配置。在测试阶段Zero-WAM 仅基于人类视频指令进行训练不包含任何语言指令并在真实机器人上执行未见过的任务配置而 LingBot-VA 基线则配备了详细的文本任务描述。物体到容器的放置。机器人必须抓取一个物体并使用单臂操作或双臂协调将其放入目标容器中。从 30 种物体-容器组合的训练中收集了 120 个已见过的任务演示以使策略适应 Franka 机器人。保留一部分物体和容器用于评估因此每个测试配置都包含至少一个在机器人训练演示中未出现的物体或容器。Zero-WAM 的成功率达到 53.3%而语言条件化的 LingBot-VA 的成功率为 43.3%。三物体顺序操作。此任务评估策略是否能够遵循指定长时域操作顺序的人类视频。场景包含多个物体和容器每个测试片段会根据人类视频指令随机选择三个物体。从 16 种训练任务组合中收集 96 个演示并收集相应的人类视频指令。在测试时人类视频会以任意顺序操作三个物体包括未出现的物体和容器Zero-WAM 的成功率达到 33.3%显著优于 LingBot-VA 的 10.0% 成功率。双桌腿插入任务。此任务测试精细的人机视频任务指令。任务要求将两条桌腿插入桌面底座上的指定孔中视频中会明确指出哪条桌腿的颜色应该插入哪个目标孔。仅收集36个针对此精确插入设置的演示视频。测试时视频中会明确指出两条桌腿的目标孔机器人必须按照视频中的指示完成插入。尽管精确物理插入的难度限制了绝对成功率但Zero-WAM在未见过的插入配置上均能成功而LingBot-VA则完全失败。机器人能够成功地将任务指令定性地迁移到具有未见过颜色和类型的桌腿和桌面底座上这进一步表明与仅依靠语言相比机器人能够更可靠地遵循人机视频指令中精细的任务指令。
返回列表