ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

浙大高飞团队两篇新作:死胡同规避与追逃自博弈,两种无人机技术演进方向

浙大高飞团队两篇新作:死胡同规避与追逃自博弈,两种无人机技术演进方向 「拓展无人机自主飞行的能力边界」目录01 DPNet预判看不见的死胡同实现主动规避而非事后补救行业固有路线的短板02 AgilePE自博弈强化学习端到端无人机追逃对抗03 两套系统定位、边界与行业位置04 写在最后浙江大学高飞团队近期发布两篇工作DPNet面向静态复杂环境通过轻量网络预判视场外的死胡同结构生成虚拟障碍屏障让规划器主动绕开陷阱机载50Hz高频重规划AgilePE面向动态对抗场景基于优先虚拟自博弈PFSP完成端到端追逃强化学习直接输出底层总推力机体角速度指令仿真训练完零样本迁移真实无人机涌现出侧翼包抄、侧向震荡躲闪等博弈战术。两篇工作分别覆盖「环境驱动的安全导航」和「对手驱动的对抗博弈」均不依赖实机标注微调把感知预测、规划、仿真‑实机迁移完整打通代表小型自主无人机两套不同的技术演进路线。01 DPNet预判看不见的死胡同实现主动规避而非事后补救行业固有路线的短板传统应对死胡同的方案分为两类但都属于事后反应式处理一类是被困之后执行后退、旋转等恢复机动飞行轨迹被打断任务连续性被破坏另一类维护高精度全局拓扑地图寻找备选路径但建图计算开销巨大还会累积位姿漂移不适合算力有限的微型无人机。图| DPNet解决的问题有限局部感知下的死胡同失效问题也有部分工作学习预测未知区域占据、前沿边界但大多目标是稠密重建探索计算开销高不会专门针对死胡同这种凹形危险结构做定向处理。死胡同不需要完整重建整个未知空间只需要拿到三件极简信息死胡同是否存在、相对距离、方位角就足够约束规划器。DPNet 沿着任务导向最小预测这个思路不做全场景重建只聚焦死胡同 hazard 预测。论文在贡献声明中明确写道据我们所知这是首个针对视觉无人机导航显式处理主动死胡同规避的工作。整套系统由三部分构成双分支死胡同预测网络、虚拟障碍屏障生成、死胡同感知的轨迹库碰撞检测。1双分支轻量预测网络RGB分支、深度分支两套编码器分别提取语义特征和几何结构特征特征拼接融合之后分两个输出头掩码头输出二值掩码标记死胡同像素区域深度头回归对应区域距离逐像素相乘之后只保留死胡同区域的有效深度。网络训练完全依靠仿真自动标注数据集不需要人工打标签。算法依据内角点、外角点的可见几何规则自动生成真值掩码区分“可推断”和“歧义不可推断”样本规避标签噪声。RGB编码器复用DINOv3预训练权重并冻结权重只微调深度分支这一非对称微调策略是实现sim‑zero‑shot的关键防止网络过拟合仿真纹理。图| DPNet系统整体框架总览2虚拟障碍屏障生成网络输出的死胡同像素投影到三维空间取最小预测深度构建平行于图像平面的平面虚拟障碍再通过MLS点云上采样生成致密点云和原始深度点云融合成统一的局部障碍物点云。这个虚拟屏障并不是真实物理物体是给规划器的“警示墙”阻止轨迹驶入死胡同入口。3死胡同感知的轨迹筛选与重进入抑制DPNet基于预计算运动基元轨迹库做碰撞检测融合虚拟障碍后的点云做碰撞校验把所有会撞上虚拟屏障的轨迹直接剪枝。这里存在一个特殊工程问题无人机飞过去之后死胡同离开视场虚拟屏障消失贪心规划器会又选一条折返冲回死胡同的轨迹。论文新增平滑一致性代价项惩罚航向角突变抑制“二次闯入”陷阱。图| 普通碰撞检测与死胡同感知碰撞检测对比仿真设置简单分为简单、困难两个等级对比EGO‑Planner、Primitive‑Planner、Faster三套主流本地规划器。简单场景DPNet成功率100%困难场景依然保持99%成功率对比基线Faster平均飞行时间缩短25%左右。基线方案要么撞毁要么触发后退恢复机动飞行距离和耗时显著增加。机载Jetson Orin NX完整流水线稳定50Hz运行网络推理仅9.2ms点云后处理2.4ms轨迹规划5.1ms完全满足微型无人机高速导航实时约束。图| 有限局部感知条件下的算法基准对比真实室内实验表明DPNet可以区分真正死胡同和中间存在可通行缺口的“形似死胡同”不会错误设置虚拟屏障允许无人机正常穿过开口通道。图| 真实世界导航实验02 AgilePE自博弈强化学习端到端无人机追逃对抗如果说DPNet要对抗的是静态环境陷阱AgilePE要面对的是会主动博弈的智能对手。追逃对抗是零和博弈追踪方需要把目标保持在机载视锥内并且缩短距离逃逸方要飞出对方视场拉大战术距离。传统方案的痛点微分博弈HJI方程高自由度四旋翼动力学下面临维度爆炸很难用于真实敏捷机动MPC模型预测控制极度依赖对手运动的精准预测对手战术变化则性能暴跌现有强化学习追逃大多输出航路点、速度这类中间指令受中间规划层限制无法释放无人机全部机动能力朴素自博弈训练存在严重策略震荡、灾难性遗忘对抗策略不断循环无法沉淀稳健战术仿真到真机鸿沟推力延迟、机体速率滞后、传感器噪声仿真训练策略经常真机直接失控。AgilePE完整框架分为三块端到端敏捷控制子系统、双边对抗训练子系统、硬件对齐仿真部署子系统。图| AgilePE整体框架包含三大子系统1端到端CTBR底层指令输出策略网络直接把观测映射到底层控制指令总推力三轴机体角速度CTBR抛弃航路点、中间轨迹规划模块神经网络可以直接调用飞行器完整机动包络。奖励函数综合追踪博弈目标、超速惩罚、边界惩罚、防撞惩罚、指令平滑项。平滑奖励是真机零样本部署的关键抑制高频抖动指令。图| 1v1无人机追逃博弈任务定义2层级化对抗自博弈训练Naive‑SP → FSP → PFSP论文对比了三级自博弈训练范式朴素自博弈Naive‑SP最新追踪者和最新逃逸者互相对抗。缺点非平稳环境训练后期容易出现策略单边崩塌逃逸方学不出有效防御战术。FSP虚拟自博弈维护历史对手策略池训练的时候均匀采样历史对手缓解震荡但采样没有区分对手难度。PFSP优先虚拟自博弈本文核心创新采样概率和历史对抗失败率挂钩训练优先选择最难对付的历史对手相当于自动课程学习加速高级战术涌现同时保留历史策略池防止灾难性遗忘。图| FSP与PFSP的交叉评估收益矩阵交叉评估收益PFSP训练出来的追踪者对全部历史版本逃逸者保持82%以上视场内捕获率会自发涌现dash‑and‑flank侧翼包抄、距离管控、侧向震荡躲闪这类人类可理解的博弈战术。权衡优先采样困难对手会带来战术特化面对简单脚本对手性能会轻微下降但对演化对抗对手鲁棒性大幅提升。3硬件对齐仿真‑实机迁移管线不使用普通物理引擎接触求解器采用RK4四阶积分直接积分机体位姿显式建模推力45ms延迟、机体角速度30ms延迟叠加推力、机体速率乘性噪声大量域随机化质量、气动、延迟参数让策略在训练阶段就适应硬件带来的非理想特性做到零样本迁移真机不需要微调。真实飞行动捕环境下部署在Jetson Orin NX策略推理运行60Hz复现仿真里的包抄、侧向躲闪战术。图| 真实追逃实验长曝光光轨图红蓝分别代表追踪机、逃逸机轨迹03 两套系统定位、边界与行业位置在整个微型无人机自主智能的技术谱系上DPNet属于感知‑预测‑规划路线的延伸不去做完整稠密重建坚持“任务导向最小预测”给传统本地规划增加预判能力兼容现有运动基元规划栈工程落地门槛相对低。它解决的是传统局部规划“近视”问题规划器只能看到眼前几米DPNet帮它“多看一眼拐角后面的危险”但是只针对凹形死胡同这一类特定危险结构。AgilePE属于端到端强化学习对抗智能路线绕开传统规划、微分博弈让战术机动从对抗交互中涌现代价是当前依赖完整状态观测如果要完全脱离动捕后续需要接入视觉感知模块。两篇工作共同的亮点训练全部可以在仿真完成真机不需要重新采集数据和微调这对于小型无人机非常关键——真机高速机动实验炸机风险高硬件损耗成本昂贵。04 写在最后DPNet和AgilePE代表小型自主无人机两个重要的技术方向一个面向环境带来的危险用轻量感知预测弥补传感器视场的局限性改良传统规划系统追求安全可靠的A‑B点导航另一个面向对手带来的博弈用对抗强化学习挖掘飞行器机动极限让无人机学会复杂战术对抗。两者都贯彻了“仿真大规模生成数据真机零样本部署”的思路降低高风险真机试飞的依赖。但也留下共同的待解命题把两套能力融合——在充满障碍物的真实物理世界无人机既要预判环境死胡同又要和动态对手开展博弈这也是未来空中具身智能值得探索的方向。参考文献1、DPNet: Efficient Dead‑End Prediction and Avoidance for Vision‑Based UAV Navigation (arXiv:2608.16640)2、AgilePE: Autonomous UAV Pursuit‑Evasion via Self‑Play Reinforcement Learning (arXiv:2608.14135)
返回列表