中科院动态拓扑感知赋能具身导航!DGNav:突破视觉语言导航的粒度刚性难题

发布:2026/3/16 | 类别:人工智能 | 作者:Jiankun Peng, Jianyuan Guo, Ying Xu, Yue Liu, Jiashuang Yan, Xuanwei Ye, Houhua Li, Xiaoming Wang | 机构:中国科学院空天信息创新研究院,中国科学院大学电子电气与通信工程学院,香港城市大学计算机科学系 | 参考文献

现有VLN-CE拓扑规划方法的粒度刚性是核心瓶颈,固定几何阈值导致地图表示与环境复杂度脱节,静态几何边权重则引发导航近视,降低指令贴合度。 提出的DGNav框架通过场景感知自适应策略实现了图粒度的动态调控,解决了简单区域计算冗余与复杂区域节点稀疏的矛盾;通过多模态动态图Transformer融合视觉、语言、几何信息重构边权重,有效抑制拓扑噪声,提升了路径规划对语言指令的贴合度。 大量实验验证了DGNav在R2R-CE和RxR-CE数据集上的优越性,相比端到端和传统显式地图方法,在导航精度、效率、泛化能力上均表现更优,且在导航效率和安全探索之间达到了最优权衡。 动态拓扑感知机制是解决VLN-CE问题的有效方向,显式空间记忆结合多模态语义推理,即使在大模型时代,仍为VLN-CE提供了不可替代的鲁棒性保障。

附件列表