arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 14047 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 14047 篇

2603.14807 2026-07-28 cs.CV cs.RO 版本更新 81%

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

HiMemVLN:通过分层记忆系统增强开源零样本视觉-语言导航的可靠性

Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出HiMemVLN,通过分层记忆系统提升开源零样本视觉-语言导航的可靠性,解决导航遗忘问题,实现实验环境下的性能提升。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00288 2026-07-28 cs.RO cs.CV 版本更新 81%

UAV-ON: A Benchmark for Open-World Object Goal Navigation with Aerial Agents

UAV-ON:用于空中智能体的开放世界目标导航基准测试

Jianqiang Xiao, Yuexuan Sun, Yixin Shao, Boxi Gan, Rongqiang Liu, Yanjin Wu, Weili Guan, Xiang Deng

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 介绍用于空中智能体开放世界目标导航的UAV-ON基准测试,含14个环境及1270个目标对象,通过实例级指令编码。实现多种基线方法评估,结果凸显空中导航和语义目标基础的复合挑战,推动复杂环境下无人机可扩展自主性研究。

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21964 2026-07-27 cs.RO cs.AI 新提交 81%

ACME: A Multi-Cultural, Multi-Embodiment Social-Navigation Dataset

ACME:一个多文化、多实体的社会导航数据集

Shashank Rao Marpally, Allan Wang, Atharva Ghotavadekar, Renato Alexandre Ribeiro, Nhat Le, Pilar Bachiller-Burgos, Pranav Goyal, Subham Agrawal, Yasuhiro Nitta, Howard Ziyu Han, Daeun Song, Masaki Kuribayashi, Kohei Uehara, Xiyue Wang, Yangzhe Kong, Duc M. Nguyen, Amirreza Payandeh, Gerardo Pérez-González, Alejandro Torrejón-Harto, Jeeho Ahn, Tisha Jain, Andrew Stratton, Elvin Yang, Jorge de Heuvel, Nico Ostermann-Myrau, Sai Anudeep Sajja, Mithilya Raj, Daisuke Sato, Gaston Rouquette, Nikolas Martelaro, Maki Sugimoto, Hironobu Takagi, Chieko Asakawa, Maren Bennewitz, Aaron Steinfeld, Xuesu Xiao, Christoforos Mavrogiannis, Harold Soh

机构 * School of Computing, National University of Singapore(新加坡国立大学计算学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究针对现有社会导航数据集缺乏文化等多样性的问题,引入ACME数据集,通过多国多地多机器人实体大规模收集数据,提供多种数据便于学习与预测,经分析其能捕捉更具挑战场景及更广泛行人行为。

Comments 24 Pages, 19 Figures, Submitted to IJRR on June 29th 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14514 2026-07-27 cs.CV cs.AI 版本更新 81%

VTM-Nav: Harnessing Cross-Episode Experience for Object-Goal Navigation with Hierarchical Visual-Topological Memory

VTM-Nav:用于跨情节对象目标导航的分层视觉拓扑记忆

Xiaoran Xu, Yupeng Wu, Tianyu Xue, Yifan Xu, Xuanran Dong, Xiaoshan Yang, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉科学学院) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 研究跨情节对象目标导航问题,提出无训练的VLM导航框架\method,其带有分层视觉拓扑记忆,通过粗到细匹配检索经验,在三个基准测试中性能最佳,证明跨数据集结构化视觉拓扑经验复用有效且鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12291 2026-07-27 cs.RO cs.CV 版本更新 81%

OpenNavMap: Multi-Session Appearance-Based Topometric Mapping for Scalable Visual Navigation

OpenNavMap: 无需结构的拓扑制图通过大规模协作定位

Jianhao Jiao, Changkun Liu, Jingwen Yu, Boyi Liu, Qianyi Zhang, Yue Wang, Dimitrios Kanoulas

机构 * Robot Perception and Learning Lab, Intelligent Robotics, Department of Computer Science, University College London(机器人感知与学习实验室,智能机器人,计算机科学系,伦敦大学学院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) Institute of Robotics and Automatic Information System, Nankai University(机器人与自动信息系统研究所,南开大学) College of control science and engineering, Zhejiang University(控制科学与工程学院,浙江大学) AI Centre, Department of Computer Science, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 OpenNavMap通过大规模协作定位实现无需结构的拓扑制图,利用3D几何模型进行按需重建,实现高精度的子图对齐和全局一致性。

Comments 21 pages, 20 figures, https://rpl-cs-ucl.github.io/OpenNavMap_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18042 2026-07-24 cs.CV cs.AI 版本更新 81%

Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation

行动前预测:基于未来状态条件的视觉语言导航

Lingfeng Zhang, Zhanguang Zhang, Liheng Ma, Tongtong Cao, Yingxue Zhang

机构 * Noah’s Ark Lab, 2012 Labs, Huawei(诺亚方舟实验室,2012实验室,华为)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 研究视觉语言导航中标准行为克隆问题,提出FSC-VLN方法,通过添加未来查询令牌并经训练后移除的目标分支将其隐藏状态与未来视觉嵌入对齐,实验表明该方法在R2R val-unseen上提升了相关指标。

Comments 9 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01043 2026-07-24 cs.RO cs.AI 版本更新 81%

DART-VLN: Test-Time Memory Decay and Anti-Loop Regularization for Discrete Vision-Language Navigation

DART-VLN:离散视觉语言导航的测试时记忆衰减与反循环正则化

Shaoheng Zhang, Zhichen Li, Jie Mei

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出无需训练的测试时控制框架DART-VLN,通过记忆衰减和反循环正则化改善离散视觉语言导航的局部回溯和历史证据过时问题,提升路径效率与导航性能。

Comments Accepted by the 2026 IEEE International Conference on Systems, Man, and Cybernetics (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18336 2026-07-24 cs.RO cs.CV 版本更新 81%

Enhancing Glass Surface Reconstruction via Depth Prior for Robot Navigation

通过深度先验增强玻璃表面重建以提升机器人导航

Jiamin Zheng, Jingwen Yu, Guangcheng Chen, Hong Zhang

机构 * Shenzhen Key Laboratory of Robotics and Computer Vision(机器人与计算机视觉深圳重点实验室) Southern University of Science and Technology(南方科技大学) CKS Robotics Institute(CKS机器人研究院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种无需训练的框架,利用深度基础模型作为结构先验,结合鲁棒的局部RANSAC对齐方法,融合原始传感器深度数据,从而避免错误的玻璃测量污染,恢复准确的度量尺度,并引入新的RGB-D数据集用于玻璃区域的几何真实值。

Comments 9 pages, 8 figures, Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19695 2026-07-23 cs.RO cs.CV 新提交 81%

NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation

NavVerse:在连续机器人模拟中对室内到室外的具身导航进行基准测试

Junzhe Wu, Yue Hu, Zeyu Han, Po-Hsun Chang, Yinan Dong, Behrad Rabiei, Maani Ghaffari

机构 * University of Michigan(密歇根大学) Tsinghua University(清华大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究针对机器人在连续场景中从室内到室外的导航问题,引入NavVerse基准,涵盖多种场景和任务。通过可执行接口用多指标评估智能体,零样本实验显示当前智能体在跨上下文导航上差距大,适应是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19288 2026-07-22 cs.CV cs.RO 新提交 81%

No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation

无需训练,飞行更佳:用于无人机导航的测试时缩放视觉语言模型

Feinan Cheng, Dongliang Xu, Wenli Nong, Zhiheng Zhang, Ang Liu, Tianyu Wang, Yue Yao

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究如何将测试时缩放应用于无人机视觉语言导航,通过迭代细化和多标准评分函数,无需额外训练,使冻结模型自我校正,生成更准确可靠飞行计划,实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15875 2026-07-22 cs.RO cs.AI 版本更新 81%

Fly0: Persistent Metric Anchoring for Zero-Shot Aerial Vision-Language Navigation

Fly0: 解耦语义定位与几何规划以实现零样本空中导航

Zhenxing Xu, Yihong Lu, Weidong Bao, Zhengqiu Zhu, Jingxuan Zhou, Zhichuang Wang, Ji Wang, Lihua Liu, Wei He

机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) National University of Defense Technology(国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) Information Support Force Engineering University(信息支援力量工程大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 Fly0通过解耦语义推理与几何规划,实现零样本空中导航,提升导航成功率和减少导航误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18200 2026-07-21 cs.RO cs.AI 新提交 81%

Learning Adaptive Safety Margins for Visual Navigation

学习用于视觉导航的自适应安全裕度

Junyi Hu, Shuaihang Yuan, Geeta Chandra Raju Bethala, Anthony Tzes, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 研究针对室内机器人视觉导航中安全裕度校准问题,提出上下文条件安全评论家方法,通过分解的三个互补项学习自适应间隙偏好排序扩散提议,经训练和提炼后在导航任务中表现出色,还能转移到人形机器人。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17574 2026-07-21 cs.RO cs.AI 新提交 81%

Predictive Training with Latent Imagination for Visual Quadruped Navigation

基于潜在想象的视觉四足导航预测训练

Yancheng Zhu, Wanli Ma, Chen Han, Irvin Haozhe Zhan, Bingfeng Qin, Yixin Xu

机构 * Anker Spatial Perception Lab(安克空间感知实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 研究有腿机器人在动态环境中导航问题,核心方法是用辅助预测器和正则化增强反应式导航主干进行预测训练,主要贡献是提高导航成功率、降低碰撞率并实现零样本模拟到现实的迁移。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00931 2026-07-21 cs.RO cs.CV 81%

VL-Nav: Neuro-Symbolic Reasoning-based Vision-Language Navigation

VL-Nav: 一种基于神经符号的方法用于基于推理的视觉语言导航

Yi Du, Taimeng Fu, Zhipeng Zhao, Shaoshu Su, Zitong Zhan, Qiwei Du, Zhuoqun Chen, Bowen Li, Chen Wang

机构 * Spatial AI & Robotics Lab, University at Buffalo, USA(美国布法罗大学空间人工智能与机器人实验室) Robotics Institute, Carnegie Mellon University, USA(卡内基梅隆大学机器人研究所)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出VL-Nav,一种结合神经推理与符号引导的视觉语言导航系统,通过任务规划和探索系统提升机器人在复杂环境中的导航能力,实验证明其在室内和室外场景中均取得较高成功率。

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15974 2026-07-20 cs.RO cs.CV 新提交 81%

Embodied Active Learning under Limited Annotation and Navigation Budget for Object Detection

在有限标注和导航预算下用于目标检测的具身主动学习

Hadrien Crassous, Mohamed Yassine Kabouri, Minahil Raza, Joni Pajarinen, Riad Akrour

机构 * LAAS-CNRS, Universite de Toulouse, CNRS(法国国家科学研究中心图卢兹分部LAAS、图卢兹大学、法国国家科学研究中心) Department of Electrical Engineering and Automation at Aalto University(阿尔托大学电气工程与自动化系)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究在机器人导航和标注预算有限时,如何让目标检测器适应未知环境。核心方法是利用空间一致性选择样本重训检测器,实验表明该方法能在无外部监督下选图,相同预算下适应结束时检测精度最高。

Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09815 2026-07-17 cs.RO cs.CV 版本更新 81%

RASR: Range-Aware Scale Recovery for Metric UAV Navigation

RASR:用于度量无人机导航的距离感知尺度恢复

Hongtao Liang, Xinyu Shao, Chenxu Wang, Yiyao Wan, Jiahuan Ji, Fangwei Ye, Fuhui Zhou, Qihui Wu

机构 * College of Electronic and Information Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学电子信息工程学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Noah Ark Lab, Huawei(华为诺亚方舟实验室) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化工程学院) College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究在GNSS信号阻断时无人机精确最后一米导航问题,提出RASR方法,将尺度恢复核心与校准模块分离,核心压缩几何成描述符并全局校准,校准模块进行残差校正和对齐,在PairUAV评估中取得较好结果。

Comments 5 pages, 4 figures. Technical report for the UAVM 2026 PairUAV Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13110 2026-07-16 cs.LG cs.AI eess.SP 新提交 81%

A Hybrid Mamba for Audio-Visual Navigation

用于视听导航的混合曼巴

Yi Wang, Yinfeng Yu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对视听导航骨干网络多年未变的问题,提出Samba,用曼巴状态编码器取代传统GRU,构建音频曼巴编码器,实验表明其泛化性能出色,能提升导航成功率,以低成本解锁更强能力,为范式演进提供途径。

Comments Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems and Man and Cybernetics 2026 (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13072 2026-07-16 cs.RO cs.AI eess.SP 新提交 81%

HRO: Hierarchical Room-to-Object Framework for Zero-Shot Object Goal Navigation with Large Language Models

HRO:用于基于大语言模型的零样本目标导航的分层房间到物体框架

Luyuan Jia, Yinfeng Yu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 针对零样本目标导航问题,提出LLM驱动的分层房间到物体(HRO)框架,引导智能体粗到细探索导航至目标物体,实验表明该框架在Gibson和HM3D数据集上优于现有基于LLM的方法。

Comments Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems, Man, and Cybernetics 2026 (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01531 2026-07-16 cs.AI cs.LG 版本更新 81%

OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration for ARC-AGI-3

OPINE-World:基于本体错误优先的交互式探索的程序化世界建模

David Courtis, Wenhao Li, Scott Sanner

机构 * University of Toronto(多伦多大学)

专题命中 具身导航 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出OPINE-World,一种在线交互学习面向对象的程序化世界模型的LLM智能体,通过本体错误度量引导探索,在ARC-AGI-3基准上无需逐游戏训练即解决20/25个游戏,动作效率达78.4。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12811 2026-07-15 cs.RO cs.AI 新提交 81%

PixelLoop: Shortcut Topological Navigation with Pixel-Level Loops

PixelLoop:具有像素级环路的捷径拓扑导航

Sarthak Chittawar, Vansh Garg, Aditya Vadali, Krish Pandya, Rohit Jayanti, Sourav Garg, Madhava Krishna

机构 * Robotics Research Center, IIIT-Hyderabad(国际信息技术学院海得拉巴分校机器人研究中心)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 研究拓扑映射和导航中环路闭合作用,提出PixelLoop方法在像素空间引入环路闭合,充当密集拓扑捷径,经模拟实验和真实机器人部署验证,相比基线在成功率和SPL上有显著提升,为拓扑视觉导航提供基础。

Comments 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS); 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00025 2026-07-14 cs.RO cs.AI 版本更新 81%

FLYNN: Robust Neural Network for Robot Navigation using Fly Brain Topology

FLYNN:使用果蝇大脑拓扑结构的鲁棒机器人导航神经网络

Benquan Wang, Jingdao Chen

机构 * Mississippi State University(密西西比州立大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出基于果蝇大脑连接组的循环神经网络FLYNN,用于视觉导航,在分布外数据和感官缺失下表现鲁棒,优于手工网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08408 2026-07-10 cs.CV cs.AI 新提交 81%

Track2Map: Online Deformable SLAM with Motion-Aware Pose Optimization in Robotic Surgery

Track2Map:机器人手术中具有运动感知姿态优化的在线可变形同步定位与地图构建

Tianyi Song, Sierra Bonilla, Xinwei Ju, Evangelos Mazomenos, Danail Stoyanov, Adam Schmidt, Omid Mohareri, Sophia Bano, Francisco Vasconcelos

机构 * University College London(伦敦大学学院) Intuitive Surgical, Inc.(直观外科公司)

专题命中 具身导航 :robotic(title,abstract);分类 cs.AI、cs.CV

AI总结 针对机器人手术中3D重建问题,提出Track2Map在线3D高斯点云融合流程,能联合优化相机轨迹与场景表示。引入轨迹锚定变形初始化及利用轨迹统计稳定优化,实验显示其相比其他方法在重建质量和相机轨迹上有改进。

Comments Accepted at MICCAI 2026. This is the submitted version prior to peer review. The final authenticated version will be available on SpringerLink

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08359 2026-07-10 cs.RO cs.AI 新提交 81%

FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation

FSD-VLN:用于空中长距离视觉语言导航的快慢双系统建模

Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma, Huihui Zhou, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology(中国科学院深圳先进技术研究院) Peking University(北京大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 研究空中长距离视觉语言导航问题,提出FSD-VLN快慢双系统架构,将语义推理与低延迟飞行命令解耦,通过两个异步分支及时间感知自适应优化器实现,实验表明该方法提升导航成功率,减少推理延迟和运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23571 2026-07-10 cs.LG cs.AI 版本更新 81%

StateLinFormer: Stateful Training Enhancing Long-term Memory in Navigation

StateLinFormer:基于状态训练增强导航中的长期记忆

Zhiyuan Chen, Yuxuan Zhong, Fan Wang, Bo Yu, Pengtao Shao, Shaoshan Liu, Ning Ding

机构 * Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人社会研究院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.LG

AI总结 StateLinFormer通过状态化训练机制提升导航任务的长期记忆能力,实验显示其在MAZE和ProcTHOR环境中优于传统模型。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05240 2026-07-10 cs.RO cs.CV 版本更新 81%

StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling

StreamVLN:通过快慢上下文建模实现流式视觉与语言导航

Meng Wei, Chenyang Wan, Xiqian Yu, Tai Wang, Yuqiang Yang, Xiaohan Mao, Chenming Zhu, Wenzhe Cai, Hanqing Wang, Yilun Chen, Xihui Liu, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07357 2026-07-09 cs.RO cs.AI 新提交 81%

HumAIN: Human-Aware Implicit Social Robot Navigation

HumAIN:人类感知的隐式社交机器人导航

Daeun Song, Nhat Le, Jeffrey Chen, Mohammad Nazeri, Amirreza Payandeh, Rohan Chandra, Reuth Mirsky, Ross Mead, Ling Xiao, Xuesu Xiao

机构 * Ewha Womans University(梨花女子大学) George Mason University(乔治梅森大学) University of Virginia(弗吉尼亚大学) Tufts University(塔夫茨大学) Semio(Semio公司) Hokkaido University(北海道大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 研究提出HumAIN框架,通过知识蒸馏将隐式社交线索融入机器人导航规划。利用基于Transformer的教师模型学习强大表示,蒸馏到轻量级学生模型。实验表明该方法能有效提升轨迹预测指标,在资源受限平台实现类人导航意识。

Comments 8 pages, 4 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05765 2026-07-08 cs.CV cs.RO 新提交 81%

Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator

Image2Sim:通过生成神经模拟器扩展具身导航

Zihan Wang, Seungjun Lee, Yinghao Xu, Gim Hee Lee

机构 * National University of Singapore(新加坡国立大学) HKUST(香港科技大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究针对具身导航缺乏优质交互环境的问题,提出Image2Sim实时神经模拟框架,通过解耦3D空间锚定与观察合成构建环境,能大规模生成相关数据,训练的导航模型在基准测试中有提升且可迁移,为具身导航提供实用训练基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03792 2026-07-07 cs.RO cs.CV 新提交 81%

From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation

从视觉语言导航中的区域到达到实例级定位

Xiangyu Shi, Ruoxi Yang, Wei Tao, Jiwen Zhang, Yanyuan Qiao, Qi Wu

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) Ruyi Dynamics(如意动力) Fudan University(复旦大学) Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士洛桑联邦理工学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究视觉语言导航中当前评估协议局限,提出‘最后3米定位差距’及指标,构建REALM模块和REVERIE - AIM数据集,可减少过早终止,提升定位精度和视觉定位成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03349 2026-07-07 cs.LG cs.AI 新提交 81%

PedestrianDiffusion: Multimodal Generative Denoising and Dense State Estimation for Inertial Navigation

行人扩散:用于惯性导航的多模态生成去噪和密集状态估计

I-Hao Lu, Dongsoo Han

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.LG

AI总结 针对消费级惯性导航受MEMS随机噪声限制问题,提出PedestrianDiffusion框架,将密集6D状态估计转化为连续条件去噪过程,引入零样本语义条件机制,用ODE求解器提升性能,在多基准测试中达先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26946 2026-07-07 cs.CV cs.RO 版本更新 81%

Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation

三步导航:一种用于零样本视觉-语言导航的分层全局-局部规划器

Wanrong Zheng, Yunhao Ge, Laurent Itti

机构 * University of Southern California(南加州大学) NVIDIA Research(NVIDIA研究)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出三步导航方法,通过全局-局部分层规划解决零样本视觉-语言导航中的漂移和低成功率问题,无需梯度更新或微调,实现最先进的性能。

Comments Accepted to AISTATS 2026. Code: https://github.com/ZoeyZheng0/3-step-Nav

Journal ref Proceedings of the 29th International Conference on Artificial Intelligence and Statistics (AISTATS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏