ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

具身智能论文学习14:π0.5: a Vision-Language-Action Model with Open-World Generalizatio

具身智能论文学习14:π0.5: a Vision-Language-Action Model with Open-World Generalizatio 第一部分基本收录情况项目内容论文全名π0.5​: a Vision-Language-Action Model with Open-World Generalization中文译名《π0.5​具有开放世界泛化能力的视觉—语言—动作模型》模型读法Pi-oh-five可译作“派零点五”正式会议The 9th Conference on Robot Learning会议简称CoRL 2025论文类型Oral论文会议时间2025年9月27日至30日会议地点韩国首尔COEX会展中心正式论文集Proceedings of Machine Learning ResearchPMLR卷号Volume 305正式页码17—40正式出版日期2025年10月7日作者团队Physical IntelligencearXiv编号arXiv:2504.16054上传版本正式版本已经收入CoRL 2025论文集是PMLR第305卷第17—40页的Oral论文基础模型继承π0​以PaliGemma类VLM为基础视觉语言骨干SigLIP约400MGemma约2.6B动作专家约300M参数动作生成FAST离散动作预训练Flow Matching连续动作后训练移动机器人数据约400小时移动数据环境数约100个家庭环境控制频率50Hz主要评估未参与训练的新厨房、新卧室和真实家庭第二部分解决的问题1π0.5在π0的基础上的改进π0​预训练VLMAction ExpertFlow Matching连续动作而π0.5​继续解决怎样让VLA进入完全没有参与训练的新家庭环境完成长时程家务任务​它没有抛弃π0​的动作专家和Flow Matching而是在π0​之上增加更多类型的异构训练数据离散FAST动作与连续Flow动作的混合训练模型内部的高层语义子任务预测针对陌生家庭环境的移动机器人后训练。2离散动作与连续动作各有优势离散FAST动作适合大规模预训练训练效率高但推理时需要自回归生成难以满足实时连续控制。Flow Matching适合生成连续动作块但从训练初期就完全使用Flow Matching计算效率和语言能力保持可能不如离散Token预训练。所以核心逻辑是FAST负责“好训练”​ Flow Matching负责“好推理、连续控制”因此π0.5​要把两者结合Pre-training 用离散 FAST→Post-training/推理 加 Flow Matching​第三部分“开放世界泛化”π₀.₅ 所说的Open-world generalization并不是简单更换物体颜色、背景或桌面摆放而是直接把机器人部署到训练阶段完全没有出现过的厨房和卧室中面对新的房间布局、物体实例甚至未见物体类别并完成多阶段家庭操作任务。论文中的真实家庭任务通常持续2–5 分钟完整清理厨房或卧室的演示可达到10–15 分钟。需要注意的是新环境并不意味着所有底层技能都是全新的。抓取、放置、整理衣物等操作往往已经在其他环境或其他机器人数据中出现过π₀.₅ 真正要泛化的是如何在新的场景、物体和任务组合中识别当前情况并把已有技能重新组合成正确的长时程行为。Figure 2直观展示了 π₀.₅ 的开放世界泛化能力机器人被直接部署到一个训练阶段从未出现过的新厨房仅根据“关闭橱柜”“把物品放入抽屉”“擦掉污渍”“把餐具放入水槽”等高层指令就能够完成多阶段家务任务。在执行过程中π₀.₅ 会先根据当前场景预测下一项语义子任务再由低层 Action Expert 生成对应的连续动作因此既能在陌生环境中决定“下一步做什么”又能实际完成精细操作。核心不是“π₀.₅ 会分层控制”而是“分层推理 异构数据训练使它能把已有技能重新组合起来在完全陌生的真实场景中完成长时程任务”。第四部分π0.5​详细内容1π₀.₅ 的核心训练与推理框架π₀.₅ 的整体流程可以概括为异构数据预训练→移动机器人 Post-training→High-Level Subtask→Continuous Action Chunk​第一阶段是 Pre-training先学“广泛能力”。π₀.₅ 将移动机器人、其他机器人、高层子任务以及 Web 多模态数据等大量数据统一用于训练其中机器人动作使用FAST 离散 Action Token表示模型以标准自回归 next-token prediction 的方式学习文本、视觉语义和机器人动作。目的不是适配某一台机器人而是先获得广泛的视觉语义、语言理解、机器人操作和跨环境泛化能力。论文这一阶段训练 280k gradient steps。第二阶段是 Post-training。模型进一步针对家庭移动操作进行适配并加入随机初始化的Action Expert使用 Flow Matching 学习连续 Action Chunk同时继续保留 next-token prediction以维持文本和高层语义预测能力。因此 π₀.₅ 实际结合了FAST 离散动作训练与Flow Matching 连续动作生成两种表示。同一份真实 Action Chunk在 Post-training 时被做成了两种不同表示、两条并行训练支路。假设训练数据中的真实动作块是①第一条支路把它用 FAST 离散化然后 VLM 用自回归 next-token prediction 学这一支主要保留 π₀.₅ 的 token-based 训练能力。②第二条支路则不经过 FAST直接把同一个连续动作块加噪然后交给 Action Expert“速度/方向场”同时走两条训练支路最终 loss后训练结束后π₀.₅ 确实同时学会了两套“动作表示/预测能力”FAST AR预测离散 Action Tokens​和Action Expert Flow Matching生成连续 Action Chunkπ₀.₅ 的 Pre-training 是用大量异构机器人 Web 数据学习通用能力Post-training 用更贴近家庭移动操作的数据进一步专门化模型加入 Flow Matching Action Expert让它能够输出实时连续动作第三阶段推理时采用 High-Level → Low-Level 的两层过程。模型先根据当前观测和总体任务预测下一项语义子任务例如从“clean the bedroom”得到“pick up the pillow”随后再由 Action Expert 根据该子任务生成连续 Action Chunk。高层负责决定“接下来做什么”低层负责决定“具体怎么动”。高层文本子任务使用 AR 生成而低层机器人动作只通过 Flow Matching 生成连续 Action Chunk。训练时保留两种动作学习方式部署时选择更适合实时控制的 Flow Matching。Figure 1展示了π0.5​的整体研究思路。图左侧是非低层动作形式的多模态监督包括高层子任务命令、物体检测数据以及图像描述、视觉问答和目标定位等Web多模态数据图右侧则是机器人动作数据包括真实家庭中的移动机器人、固定机器人、实验室机器人以及Open X-Embodiment等通用机器人数据。这些来源不同、标注形式不同的数据共同用于训练中间的π0.5​视觉—语言—动作策略。模型内部同时具备高层语义预测、低层动作控制和Action Expert最终能够在没有出现在训练数据中的新家庭中直接部署执行整理卧室、清理厨房等持续10—15分钟的多阶段任务。该图强调π0.5​的核心突破并非单纯扩大目标机器人数据规模而是通过异构数据之间的知识迁移获得环境、物体和任务层面的广泛泛化能力。2π₀.₅的输入、输出与概率分解模型输入包括以及总体语言任务​不同摄像头图像机器人本体状态总体命令例如“整理卧室”。模型需要输出两类结果高层语义子任务低层连续动作块​。论文将联合分布写为对完整推理过程的概率建模前半部分表示根据总体任务和当前场景决定下一项子任务。后半部分表示根据当前场景和子任务生成具体动作。例如“整理厨房”模型先生成“拿起盘子”然后生成双臂、底盘和升降机构的连续动作。整体流程为3预训练VLM与Action Expertπ0.5​沿用π0​的专家结构主体由预训练 VLM 和约 300M 参数的 Action Expert 组成。其中VLM 由 SigLIP 视觉编码器和 Gemma 语言模型构成负责处理图像、语言以及高层语义信息例如场景理解、Web 视觉语言任务和子任务文本预测Action Expert 则专门处理机器人连续动作用于在 Flow Matching 中根据当前观测、机器人状态和带噪动作预测动作流场。两部分并不是完全独立的模型而是在同一 Transformer 框架中通过注意力交换信息同时针对文本、图像和连续动作采用不同的编码方式及专家参数。因此VLM 更偏向于回答“场景是什么、下一步做什么”Action Expert 则负责“具体怎么动”。与 π₀ 不同的是π₀.₅预训练阶段并不使用连续动作 Action Expert而是先将机器人动作通过 FAST 转换为离散 Token与语言和视觉任务一起进行自回归 next-token prediction到了 Post-training 阶段才加入随机初始化的 Action Expert并通过 Flow Matching 学习连续 Action Chunk。这样既利用 FAST 提高大规模预训练效率又保留 Flow Matching 在实际机器人控制中的连续、快速动作生成能力。4联合损失细节真实动作块记为随机噪声为在动作和噪声之间构造插值其中接近纯噪声接近真实动作。按照论文采用的时间方向约定Action Expert学习预测对应的速度场。联合损失可以简化写成其中这里的是交叉熵损失函数。后训练中推理时先自回归输出子任务文本再在该子任务条件下执行10次Flow去噪或积分得到连续动作块。5两阶段训练的具体配置第一阶段预训练第一阶段为 Pre-training共训练 280k 个 gradient steps。π₀.₅ 在大规模异构数据上进行统一的 next-token prediction包括普通文本、高层子任务、目标框以及经过 FAST 编码的离散动作 Token使模型先获得较广泛的视觉、语言、语义决策和机器人动作表示能力。预训练阶段以SigLIP约400M参数的视觉编码器和Gemma约2.6B参数的语言模型组成预训练VLM并将语言子任务、FAST离散动作、开放词汇图像描述和目标框统一表示为Token通过不同的任务提示进行自回归下一Token预测。第二阶段后训练第二阶段为 Post-training共继续训练 80k steps并加入随机初始化的 Action Expert。这一阶段重点面向家庭移动操作进行专门化同时联合保留 next-token prediction 和 Flow Matching以学习连续 Action Chunk。论文中 Flow Matching loss 的权重设为 α10并对机器人数据筛选成功且长度低于阈值的轨迹。后训练阶段在预训练VLA基础上加入约300M参数的Action Expert模型首先根据“整理卧室”等高层指令生成“拿起枕头”等语义子任务再将该子任务作为低层命令输入动作专家由动作专家从噪声开始通过Flow Matching生成连续动作序列。因此π0.5​实现了“离散Token负责高效规模化预训练连续Flow动作负责实时精细控制”的混合训练路线。6六种异构数据来源Figure 4 展示了 π₀.₅ 使用的六类数据来源MM移动机器人多环境数据、ME多环境固定机器人数据、CE实验室跨具身数据、HL高层语义子任务、WDWeb 多模态数据以及 VI口头语言示范。其中机器人数据主要提供可迁移的操作技能和不同环境经验HL 与 VI 用于学习“下一步做什么”的高层子任务决策WD 则补充开放词汇、物体语义和视觉理解能力。缩写数据类型主要作用MM移动机器人多环境数据学习目标移动平台和家庭任务ME固定机器人多环境数据增加真实家庭场景多样性CE实验室跨具身数据增加任务与机器人技能多样性HL高层语义子任务数据学习任务分解和下一步决策WD多模态Web数据学习物体语义和开放词汇知识VI人类口头指令示范学习适合低层策略执行的子任务命令训练阶段对这些数据的使用并不完全相同。Pre-training联合使用 MM、ME、CE、HL 和 WD以尽可能扩大机器人具身、环境和语义知识的覆盖范围Post-training则更加聚焦家庭移动操作保留 MM、ME、HL 和 WD并新增 VI 数据同时去掉实验室 CE 数据。目标是把预训练获得的广泛能力进一步专门化到真实家庭中的长时程移动操作。7实验移动双臂平台与端到端动作控制Figure 5 展示了实验使用的两种移动双臂机器人平台。两者均配备双 6-DoF 机械臂、平行夹爪、全向移动底盘、躯干升降机构以及 4 路 RGB 相机整体状态与动作空间为 18 或 19 维。高层子任务推理使用前向、后向和两路腕部共 4 路图像而低层动作控制主要使用前向和两路腕部图像。控制端保持了较强的端到端特性π₀.₅ 直接以50 Hz输出机械臂、夹爪、躯干和移动底盘的控制目标并通过 Action Chunking 一次预测一段未来动作底层仅使用简单 PD 控制器进行跟踪没有额外加入轨迹规划或碰撞检测模块。Figure 5展示了论文实验中使用的两种移动双臂机器人平台。两个平台均配备前向、后向和两个腕部摄像头共四路RGB图像机器人具有两条6自由度机械臂每条机械臂还配备一个1自由度夹爪底部采用3自由度全向移动底盘并具有1—2自由度躯干升降机构。模型同时控制两条机械臂的关节或目标位姿、两个夹爪、底盘移动速度以及升降机构使总状态和动作空间达到18或19维。高层推理可使用全部四路相机判断整体场景和下一子任务低层控制则重点使用前向相机和腕部相机完成精细操作。第五部分实验效果1实验设置与评价指标①研究的5个问题论文重点研究五个问题能否在全新的真实家庭中完成复杂任务泛化能力是否随训练环境数量增加而提高每一种协同训练数据到底有什么作用相比π0​提升来自哪里高层子任务推理是否真的必要②环境设置包括未参与训练的模拟厨房未参与训练的模拟卧室三个真实家庭中的厨房三个真实家庭中的卧室。模拟房间用于可控定量比较真实家庭用于最终现实泛化验证。③四项标准任务Dishes in Sink将4件餐具放入水槽最高8分。Items in Drawer拿起物体、打开抽屉、放入物体、关上抽屉最高4分。Laundry in Basket找到衣物、抓起并完全放入洗衣篮最高3分。Make the Bed整理毯子并摆放两个枕头最高5分。指标是完成步骤所获得分数占最高分的比例​因此图中的80%通常表示平均完成了约80%的任务步骤不一定表示80%的完整任务全部成功。标准比较通常每项任务评估10次四项任务合计约40次真实机器人rollout。Figure 6展示了π0.5​的两类测试环境。左侧为专门搭建的模拟厨房和模拟卧室用于在可控、可重复的条件下进行模型比较、数据规模实验和消融实验右侧为真实家庭中的厨房和卧室用于检验模型在真实布局、家具、光照、背景和物体变化下的最终泛化能力。所有这些测试环境均没有参与模型训练因此实验考察的不是对已见场景的记忆而是机器人能否将从其他家庭、其他机器人和Web数据中获得的知识迁移到新的空间和物体组合中。2新家庭真实机器人实验Figure 7 展示了 π₀.₅ 在训练阶段从未出现过的真实家庭中的执行结果。机器人只接收诸如“把物品放入抽屉”“把餐具放入水槽”“把衣物放入洗衣篮”这样的总体任务随后自主预测“打开抽屉→拿起物体→放入抽屉→关闭抽屉”等高层子任务并生成对应的低层连续动作。右侧结果显示各任务平均进度约为65%95%与 Mock Environment 中的表现整体接近说明π₀.₅ 能够把训练得到的视觉语义、高层决策和操作技能迁移到未见过的真实家庭。Figure 7展示了π0.5​在三个未参与训练的真实家庭中的执行过程和定量结果。左侧依次给出了将物品放入抽屉、将餐具放入水槽以及将衣物放入洗衣篮的示例轨迹蓝色文字表示模型在每个阶段预测的高层子任务例如“拉开抽屉”“拿起夹子”“将夹子放入抽屉”和“关闭抽屉”。右侧柱状图报告每项任务在10次实验中的平均任务进度真实家庭中的结果大致处于65%—95%之间且与模拟家庭中约80%-90%的表现处于相近范围。这表明模型能够在新家庭中自主生成合理的子任务序列并连续完成导航、抓取、放置和重复操作多个物体等多阶段行为3环境数量与泛化能力Figure 8研究训练地点数量对新环境任务泛化的影响。作者在基本保持训练样本量一致的情况下将训练地点从3 个增加到 104 个平均 Task Progress 总体由约14% 提升到 86%。虽然中间存在波动但整体趋势表明真正重要的不只是采集更多数据而是让数据覆盖更多不同环境。当训练地点达到 104 个时模型在未见测试家庭中的表现已经接近直接使用测试家庭数据训练的域内基线。Figure 9进一步说明这种环境多样性也会提升语言和物体泛化。随着训练地点增加无论是训练中出现过的物体类别还是未见过的新类别Follow Rate 和 Success Rate 都总体提高其中 OOD 物体提升更慢说明“理解应该操作哪个新物体”与“真正成功完成抓取放置”仍存在差距。4协同训练的贡献数据消融与 π₀ 对比Figure 10–11 对不同训练数据进行消融。在总体家庭操作任务中移除 CE实验室跨具身数据或 ME多环境机器人数据都会使性能明显下降同时移除二者下降最严重说明来自不同机器人和环境的操作经验是物理技能泛化的重要来源。相比之下移除 WDWeb 数据对总体 Task Progress 的影响并不显著但在 OOD 物体的语言跟随与操作成功率上下降明显说明Web 数据主要补充开放词汇和物体语义而机器人数据主要提供“如何真正完成操作”的物理经验。Figure 10考察不同协同训练数据对新家庭总体任务表现的贡献。完整π0.5​在四项模拟家庭任务上的平均任务进度约为79%移除Web数据后的结果约为72%与完整模型的差异不具有统计显著性p0.385。然而移除实验室跨具身数据CE后性能下降到约51%移除多环境固定机器人数据ME后下降到约53%同时移除CE和ME后进一步下降到约40%三组差异均达到p0.001。这说明对整理床铺、餐具放置和抽屉操作等总体物理任务而言来自其他机器人、其他环境和其他任务的动作经验是泛化的主要来源Web数据的作用则更集中体现在未见物体识别和高层语义推理上。Figure 11将数据消融进一步细分为域内和域外物体上的语言跟随率与操作成功率。对训练中出现过的物体类别完整模型与移除Web数据的模型表现接近说明常见物体可以主要通过机器人数据学习但在未见物体类别上完整模型的语言跟随率和成功率均约为94%移除Web数据后分别下降到约80%和74%表明Web数据提供的开放词汇物体知识对于识别新类别十分重要。移除CE或ME数据后域内和域外的跟随率与成功率均明显下降同时移除两类跨机器人数据时域外成功率仅约33%。因此Web数据主要补充“物体是什么、语言指的是谁”的语义知识而跨具身机器人数据主要补充“识别目标后怎样可靠抓取和操作”的物理技能。Figure 12 进一步与 π₀ 进行比较。仅采用FAST 离散动作训练 Flow Matching 连续动作生成的 π₀-FASTFlow 已明显优于原始 π₀说明这种混合动作训练方式本身更加有效但完整 π₀.₅ 在四项任务上仍保持最佳表现说明其提升并不能只归因于 FASTFlow还来自高层语义监督、Web 知识以及异构机器人数据的协同训练。原始 π₀ 即使延长训练到 300k steps 仍未追上也进一步体现了 FAST Token 预训练的训练效率优势。Figure 12比较了完整π0.5​、π0​-FASTFlow以及不同训练步数的原始π0​。完整π0.5​在餐具入水槽、物品入抽屉、衣物入洗衣篮和整理床铺四项任务上分别达到约91%、85%、80%和58%的平均任务进度均为所有方法中最高。仅采用FAST离散预训练和Flow连续后训练、但不加入高层语义和Web数据的π0​-FASTFlow已经明显优于原始π0​说明混合动作训练本身有效然而它仍在四项任务上落后于完整π0.5​表明模型的进一步提升来自高层子任务、Web知识和完整异构数据协同训练而不能只归因于动作表示的改变。原始π0​即使训练至300k步整体仍显著低于两种FASTFlow路线也说明离散动作Token预训练具有更高的训练效率。5高层推理消融Figure 13 验证了高层语义信息对 π₀.₅ 的贡献。完整 π₀.₅ 同时进行高层子任务预测和低层动作生成取得最佳表现即使推理时取消显式子任务生成Implicit HL只要训练阶段仍使用高层子任务数据性能依然保持较高说明高层语义监督本身就能改善模型表示而不仅仅是提供一个显式规划步骤。相反完全去掉 HL、VI 或 WD 后性能均明显下降表明高层子任务数据、语言示范和 Web 语义知识共同支撑了长时程决策。此外零样本 GPT-4 高层规划和 Human HL 都没有超过完整 π₀.₅。这里不应理解为“π₀.₅ 的规划能力超过人类”更合理的结论是高层子任务不仅要语义正确还要与模型自身低层策略能够执行的技能和训练分布匹配。Figure 13评估了高层语义子任务预测在π0.5​中的作用。完整模型同时使用高层和低层推理平均任务进度约为79%取得最佳结果。Implicit HL在训练中保留高层子任务数据但推理时不显式生成子任务仍达到约71%与完整模型的差异为p0.144未达到统计显著水平这说明高层语义监督即使不在推理时显式输出也能够改善模型内部表示。相比之下完全移除高层数据、移除口头指令VI或移除Web数据后性能均下降到约60%左右。使用零样本GPT-4作为外部高层规划器仅达到约58%人类提供子任务约为63%均低于完整模型说明高层命令不仅要语义合理还必须与低层策略的训练分布和可执行技能相匹配。第六部分论文的主要创新和局限性1主要创新创新1将FAST离散预训练与Flow连续后训练结合FAST负责高效规模化Flow负责实时连续控制创新2同一个VLA完成高层与低层推理不再必须使用两个完全独立的模型而是同一模型先输出语义子任务再输出连续动作。创新3系统验证跨机器人知识迁移其他固定机器人和实验室机器人数据显著提高了目标移动机器人在陌生家庭中的表现。创新4评估真正未参与训练的真实家庭相比只更换桌面物体或背景该实验包含新厨房、新卧室、新家具和多分钟长时程任务。2主要局限性① 高层语义推理High-Level reasoning 仍然会跑偏例如机器人在收东西时可能比如总体任务是“把桌上的东西都收进抽屉”理想的高层子任务应该是打开抽屉→拿物体→放入抽屉→继续拿下一个物体→最后关抽屉但 π₀.₅ 有时可能变成打开抽屉→放东西→关抽屉​→又打开抽屉​→继续放东西也就是说它每次都能根据当前画面预测一个“看起来合理”的下一步但整个长任务的全局进度管理还不够稳定。论文原话就是高层 subtask inference 有时容易被干扰例如在收纳物品时会反复关闭和打开抽屉。说明 高层子任务策略 high-level subtask policy 还没有真正稳定的长时程状态管理。② 部分可观测性 Partial observability 仍然很难例如机械臂挡住 spill 后模型可能“忘了”那里还有东西需要擦。论文明确把 partial observability 作为问题。③ 上下文 / 记忆 Context / Memory 还很弱论文自己明确说模型 context 比较有限加入更丰富的上下文信息 richer context 和 记忆 memory可能让它处理跨房间导航、记住物体存放位置等任务。例如去厨房拿杯子 ↓ 走到卧室 ↓ 回来 ↓ “刚才杯子在哪里”这种任务需要Memory​而不仅仅是 Current Observation​④ Prompt 仍比较简单论文也明确承认π0.5 当前处理的 prompt 相对简单更复杂的用户偏好和指令仍需要更丰富的 annotation。3π0.5 → GR00T N1π₀.₅ 主要研究“机器人到了陌生环境还能不能完成任务”下一篇 GR00T N1 则进一步研究“如何让更复杂的人形机器人通过一个通用模型学习和执行多种任务”。π₀.₅ 关心的是机器人换了一个没见过的地方还会不会干活GR00T N1 关心的是能不能让更复杂的人形机器人用一个通用模型学会很多种任务比如 π₀.₅ 研究的是机器人以前没见过这个厨房但还能不能完成“把盘子放进水槽、整理房间”重点是环境变了机器人还能不能泛化​而 GR00T N1 这句话想表达的是不只考虑机械臂或移动双臂机器人而是考虑有手臂、腿、躯干等更多自由度的人形机器人希望一个模型能够控制这种更复杂的身体去完成很多不同任务。重点变成机器人身体更复杂任务更多模型还能不能通用​
返回列表