ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Embodied Perceptron架构深度剖析:EmbodiedScan多模态融合的终极解密

Embodied Perceptron架构深度剖析:EmbodiedScan多模态融合的终极解密 Embodied Perceptron架构深度剖析EmbodiedScan多模态融合的终极解密【免费下载链接】EmbodiedScan[CVPR 2024 NeurIPS 2024] EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI项目地址: https://gitcode.com/gh_mirrors/em/EmbodiedScan当机器人不再看一张图片而是用彩色相机 深度相机 语音指令同时感知世界时多模态3D感知就成了通往具身智能的关键桥梁。EmbodiedScan正是为这一目标而生的开源项目其核心基线框架Embodied Perceptron 架构堪称多模态融合的教科书级实现。本文将以通俗易懂的方式为你深度剖析这套架构的设计精髓解读它如何在真实室内场景中实现 3D 目标检测、3D 视觉定位与语义占用预测三大任务。先认识数据EmbodiedScan 数据集凭什么全能想要理解架构必须先了解它脚下的数据。EmbodiedScan 是 CVPR 2024 收录的多模态、自我中心ego-centric3D 感知数据集与基准规模相当惊人5000 次场景扫描覆盖真实室内环境100 万张自我中心 RGB-D 视图彩色图 深度图100 万条语言提示把人话与 3D 场景对齐16 万 3D 定向框横跨760 类别部分与 LVIS 对齐80 个常见类别的密集语义占用标注数据源自 ScanNet、3RScan、Matterport3D 等经典数据集并经过统一重标注让第一人称视角 语言指令的具身场景理解成为可能。值得一提的是项目还发布了基于 ARKitScenes 的 EmbodiedScan v2 beta进一步扩充了原始标注的覆盖面。上图清晰展示了数据集的四大特色真实场景采集RGB-D 图像序列、自我中心探索轨迹、多模态 3D 感知任务以及海量的语言-视觉对齐提示。架构总览Embodied Perceptron 如何打通看听说Embodied Perceptron 的输入极具弹性——任意数量视角的 RGB-D 序列加上自然语言文本。它采用多编码器 双解码器的经典设计各司其职稀疏 3D 编码器Sparse 3D Encoder基于稀疏卷积网络MinkResNet把点云体素化为多层级稀疏特征 V1→V42D 图像编码器2D Image Encoder基于 ResNet 提取多尺度图像特征 F1→F4文本编码器Text Encoder基于 RoBERTa 将语言提示编码为文本特征VL 融合视觉-语言融合将三维、图像与文本特征对齐融合密集解码器Dense Decoder输出语义占用Occupancy与 3D 检测框稀疏解码器Sparse Decoder输出 3D 视觉定位结果这套架构的精妙之处在于密集 同构稀疏融合图像特征以稠密方式为每个体素/点补充纹理语义而 3D 稀疏特征则保持几何拓扑结构两者在同一坐标系下高效对齐最终支撑起从粗到细的多任务预测。三大核心任务检测、定位、占用一个不落Embodied Perceptron 在两条基准线基础 3D 感知任务与语言接地任务上均展现了出色能力 多视图 3D 目标检测输入多视角 RGB-D 序列模型直接输出带 9 自由度位置、尺寸、朝向的 3D 框类别覆盖 284 类。多视图版 AP0.25 达15.22连续流版更高达17.83。核心检测器实现位于embodiedscan/models/detectors/sparse_featfusion_single_stage.py的SparseFeatureFusionSingleStage3DDetector对应配置见configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py。 3D 视觉定位Visual Grounding给定一句指令如找到离柜台最近、离椅子最远且位于烤面包机前面的桌子模型要在整个场景中精准框出目标。基线满配版本 AP0.25 达36.78加入复杂提示训练后提升至39.26。定位器SparseFeatureFusion3DGrounderembodiedscan/models/detectors/sparse_featfusion_grounder.py利用 Transformer 解码器embodiedscan/models/layers/ground_transformer/decoder.py做跨模态注意力并通过GroundingHead中的ContrastiveEmbed对比模块embodiedscan/models/dense_heads/grounding_head.py将查询特征与文本 token 对齐打分。 语义占用预测模型预测整个空间的语义体素占用多视图版 mIoU21.28连续版22.92。预测器EmbodiedOccPredictor位于embodiedscan/models/detectors/embodied_occ.py融合头则复用了点级融合模块。融合的奥秘PointFusion 如何让图像与点云同频共振多模态融合是整个架构最核心的技术点其秘密藏在embodiedscan/models/layers/fusion_layers/point_fusion.py中point_sample / batch_point_sample先把 3D 点通过内外参投影到图像坐标系再用grid_sample双线性采样对应位置的图像特征实现每个点都带上图像信息PointFusion 模块对图像特征做 lateral 卷积降维后与点云特征分别过线性层最后逐元素相加 ReLU完成融合实现几何与纹理的强强联合这种以点为中心的融合方式天然支持任意视图数量——多视角图像分别投影采样再取有效均值这正是 Embodied Perceptron 对输入弹性要求的答案。数据预处理则由Det3DDataPreprocessorembodiedscan/models/data_preprocessors/data_preprocessor.py统一完成图像归一化、填充与点云体素化。快速上手从安装到跑通第一个模型如果你是新手跟着下面三步就能让 Embodied Perceptron 跑起来克隆仓库并安装依赖git clone https://gitcode.com/gh_mirrors/em/EmbodiedScan后执行python install.py all一键安装全部依赖含 MinkowskiEngine 与 PyTorch3D准备数据参照data/README.md的指引下载并组织数据集训练与推理运行python tools/train.py configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py --work-dirwork_dirs/mv-3ddet训练检测模型再用python tools/test.py配合tools/eval_script.py完成评估官方还提供了demo/demo.ipynb交互式演示与embodiedscan/visualizer/可视化工具让你能直观看到模型在真实扫描上的检测与定位效果非常适合入门学习。总结为什么说它是多模态 3D 感知的终极范本Embodied Perceptron 架构用一套统一框架优雅地解决了感知 语言理解的组合问题稀疏 3D 编码保持几何、密集图像融合补充语义、Transformer 跨模态对齐承接语言。无论你是想做具身智能研究、3D 视觉定位还是单纯想学习多模态融合的最佳实践EmbodiedScan 都是一座值得深挖的宝库。现在就去克隆体验吧下一个看得懂人话的机器人也许就出自你的手中【免费下载链接】EmbodiedScan[CVPR 2024 NeurIPS 2024] EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI项目地址: https://gitcode.com/gh_mirrors/em/EmbodiedScan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表