arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 14047 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 14047 篇

2602.19315 2026-04-16 cs.RO cs.AI 81%

Online Navigation Planning for Long-term Autonomous Operation of Underwater Gliders

长期自主运行的水下滑翔机在线导航规划

Victor-Alexandru Darvariu, Charlotte Z. Reed, Jan Stratmann, Bruno Lacerda, Benjamin Allsup, Stephen Woodward, Elizabeth Siddle, Trishna Saeharaseelan, Owain Jones, Dan Jones, Tobias Ferreira, Chloe Baker, Kevin Chaplin, James Kirk, Ashley Iceton-Morris, Ryan D. Patmore, Jeff Polton, Charlotte Williams, Christopher D. J. Auckland, Rob A. Hall, Alexandra Kokkinaki, Alvaro Lorenzo Lopez, Justin J. H. Buck, Nick Hawes

机构 * Oxford Robotics Institute(牛津机器人研究所) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Optiver(Optiver公司) Stateful Robotics(Stateful Robotics公司) National Oceanography Centre(国家海洋研究中心) School of Environmental Sciences, University of East Anglia(东安格利亚大学环境科学学院) Scottish Association for Marine Science(苏格兰海洋科学协会)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于蒙特卡洛树搜索的在线导航规划方法,通过物理信息模拟器生成样本,实现水下滑翔机在不确定环境下的自主规划,提升任务持续时间和路径长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12208 2026-04-15 cs.RO cs.AI 81%

Unveiling the Surprising Efficacy of Navigation Understanding in End-to-End Autonomous Driving

揭示端到端自动驾驶中导航理解的惊人效能

Zhihua Hua, Junli Wang, Pengfei LI, Qihao Jin, Bo Zhang, Kehua Sheng, Yilun Chen, Zhongxue Gan, Wenchao Ding

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Didi Chuxing(滴滴出行) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出SNG框架,通过真实导航模式高效表示全局导航信息,结合导航路径与分步信息,提升自动驾驶的全局与局部规划能力,实现无需辅助损失函数的高精度导航建模。

Comments 8 pages, 6 figures. ICRA 2026. Code available at https://fudan-magic-lab.github.io/SNG-VLA-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05467 2026-04-14 cs.CV cs.CL cs.RO 81%

MerNav: A Highly Generalizable Memory-Execute-Review Framework for Zero-Shot Object Goal Navigation

MerNav:一种高度可泛化的记忆-执行-审查框架用于零样本物体目标导航

Dekang Qi, Shuang Zeng, Xinyuan Chang, Feng Xiong, Shichao Xie, Xiaolong Wu, Mu Xu

机构 * Amap, Alibaba Group(高德,阿里巴巴集团) Xi’an Jiaotong University(西安交通大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出MerNav框架,通过记忆、执行和审查模块提升视觉语言导航任务中的成功率和泛化能力,在多个数据集上均取得显著提升。

Comments 9 pages, 2 figures, 5 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09604 2026-04-14 cs.AI cs.LG 81%

LLMs for Text-Based Exploration and Navigation Under Partial Observability

基于部分可观测性的文本基于探索与导航中的大型语言模型

Stephan Sandfuchs, Maximilian Melchert, Jörg Frochte

机构 * AKIS -- Interdisciplinary Institute for Applied AI and Data Science Ruhr(AKIS——鲁尔跨学科应用人工智能与数据科学研究所) Bochum University of Applied Sciences(波鸿应用科学大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大型语言模型在部分可观测环境下作为纯文本控制器的可行性,评估了九种不同LLM在探索和导航任务中的表现,发现推理调优模型在导航任务中表现更可靠,但效率仍低于理想路径。

Comments 15 pages, (to be published Springer Lecture Notes of the Institute for Computer Sciences, Social Informatics and Telecommunications Engineering [LNICST] )

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08883 2026-04-13 cs.RO cs.AI 81%

HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigation

HTNav:一种具有分层结构的混合导航框架用于城市空域视觉-语言导航

Chengjie Fan, Cong Pan, Zijian Liu, Ningzhong Liu, Jie Qin

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出HTNav框架,结合模仿学习与强化学习,通过分层决策机制提升复杂城市环境中的导航精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02826 2026-04-13 cs.LG cs.AI 81%

From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity

从导航到细化:通过Oracle速度揭示基于流的扩散模型的两阶段本质

Haoming Liu, Jinnuo Liu, Yanhao Li, Liuyang Bai, Yunkai Ji, Yuanhe Guo, Shenji Wan, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(上海纽约大学数据科学中心) New York University(纽约大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析基于流的扩散模型的边际速度场,揭示其两阶段训练目标,解释了模型在早期阶段的全局布局生成和后期阶段的细节记忆行为,为模型设计和算法改进提供了指导。

Comments Accepted to CVPR 2026 (Findings track); 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20549 2026-04-10 cs.CV cs.RO 81%

Deep Learning-Powered Visual SLAM Aimed at Assisting Visually Impaired Navigation

基于深度学习的视觉SLAM:辅助视障导航

Marziyeh Bamdad, Hans-Peter Hutter, Alireza Darvishy

机构 * Institute of Computer Science, ZHAW School of Engineering(苏黎世应用科技大学工程学院计算机科学研究所) Department of Informatics, University of Zurich(苏黎世大学信息学系)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出SELM-SLAM3框架,结合SuperPoint和LightGlue提升特征提取与匹配鲁棒性,在低纹理、运动模糊等挑战性条件下实现更精确的定位与跟踪,提升视障导航可靠性。

Comments 8 pages, 7 figures, 4 tables. Published in the Proceedings of the 20th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applications (VISIGRAPP 2025), VISAPP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05351 2026-04-10 cs.RO cs.CV 81%

AnyImageNav: Any-View Geometry for Precise Last-Meter Image-Goal Navigation

AnyImageNav: 任意视角几何用于精确最后一步图像目标导航

Yijie Deng, Shuaihang Yuan, Yi Fang

机构 * NYUAD Center for Artificial Intelligence and Robotics (CAIR)(纽约大学阿布扎比分校人工智能与机器人中心) New York University Abu Dhabi, Electrical Engineering(纽约大学阿布扎比分校电气工程系) Embodied AI and Robotics (AIR) Lab, NYU Abu Dhabi(纽约大学阿布扎比分校具身人工智能与机器人实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出AnyImageNav,通过语义到几何的级联方法实现精确6自由度相机姿态恢复,提升导航成功率和定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13086 2026-04-10 cs.RO cs.AI 81%

NaviSplit: Dynamic Multi-Branch Split DNNs for Efficient Distributed Autonomous Navigation

NaviSplit:动态多分支分割DNNs用于高效分布式自主导航

Timothy K Johnsen, Ian Harshbarger, Zixia Xia, Marco Levorato

机构 * University of California Irvine(加利福尼亚大学尔湾分校)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出NaviSplit框架,通过动态多分支DNN实现高效自主导航,减少数据传输量并提升导航精度。

Comments 6 pages, 3 figures

Journal ref 2024 IEEE 25th International Symposium on a World of Wireless, Mobile and Multimedia Networks (WoWMoM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05529 2026-04-09 cs.AI cs.RO 81%

Before We Trust Them: Decision-Making Failures in Navigation of Foundation Models

在我们信任之前:基础模型导航决策中的失败

Jua Han, Jaeyoon Seo, Jungbin Min, Sieun Choi, Huichan Seo, Jihie Kim, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 研究发现基础模型在导航任务中存在显著决策失败,需更细致评估以理解其局限性。

Comments Corrected author order in metadata; manuscript changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18525 2026-04-09 cs.RO cs.CV 81%

Splatblox: Traversability-Aware Gaussian Splatting for Outdoor Robot Navigation

Splatblox:面向户外机器人导航的可通行性感知高斯点绘制

Samarth Chopra, Jing Liang, Gershom Seneviratne, Yonghan Lee, Jaehoon Choi, Jianyu An, Stephen Cheng, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 Splatblox通过融合RGB图像和LiDAR点云,构建了具有几何和语义信息的可通行性感知ESDF,实现户外复杂环境下的实时自主导航,实验表明其在可通行性判断和路径规划方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26788 2026-04-08 cs.RO cs.CV 81%

ReMemNav: A Rethinking and Memory-Augmented Framework for Zero-Shot Object Navigation

ReMemNav:一种重新思考和记忆增强的零样本物体导航框架

Feng Wu, Wei Zuo, Wenliang Yang, Jun Xiao, Yang Liu, Xinhua Zeng

机构 * Fudan University(复旦大学) Tongji University(同济大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 ReMemNav通过整合全景语义先验和事件记忆,改进了零样本物体导航中的空间推理和决策,提升了成功率和探索效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02318 2026-04-03 cs.RO cs.CV 81%

Stop Wandering: Efficient Vision-Language Navigation via Metacognitive Reasoning

停止游荡:通过元认知推理实现高效的视觉-语言导航

Xueying Li, Feng Lyu, Hao Wu, Mingliu Liu, Jia-Nan Liu, Guozi Liu

机构 * Central South University(中南大学) Nanjing University(南京大学) State Grid Hubei Electric Power Research Institute(国网湖北省电力有限公司电力科学研究院) Dongguan University of Technology(东莞理工学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出MetaNav,通过整合空间记忆、历史感知规划和反思修正,提升视觉-语言导航的效率与鲁棒性,实验显示其在多个基准上表现优异,减少了20.7%的VLM查询。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24212 2026-04-02 cs.RO cs.CV 81%

RANGER: A Monocular Zero-Shot Semantic Navigation Framework through Visual Contextual Adaptation

RANGER:通过视觉上下文适应的单目零样本语义导航框架

Ming-Ming Yu, Yi Chen, Börje F. Karlsson, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 RANGER通过视觉上下文学习实现零样本语义导航,无需依赖深度和姿态信息,利用3D基础模型和视觉语言模型提升任务效率与环境适应性。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16518 2026-03-31 cs.RO cs.AI 81%

DIV-Nav: Open-Vocabulary Spatial Relationships for Multi-Object Navigation

DIV-Nav: 多物体导航中的开放词汇空间关系

Jesús Ortega-Peimbert, Finn Lukas Busch, Timon Homberger, Quantao Yang, Olov Andersson

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出DIV-Nav系统,通过分解复杂空间约束为简单物体查询、计算语义信念图交集以及利用LVLM验证,实现基于开放词汇空间关系的多物体导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26859 2026-03-31 cs.CV cs.AI eess.IV 81%

Beyond Textual Knowledge-Leveraging Multimodal Knowledge Bases for Enhancing Vision-and-Language Navigation

超越文本知识的多模态知识库用于增强视觉-语言导航

Dongsheng Yang, Yinfeng Yu, Liejun Wang

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing(丝绸之路多语言认知计算联合国际研究实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出BTK框架,通过整合环境特定文本知识与生成图像知识库,提升视觉-语言导航中的语义 grounding 和跨模态对齐,实验表明在R2R和REVERIE数据集上性能显著提升。

Comments Main paper (37 pages). Accepted for publication by the Information Processing and Management,Volume 63,Issue 6,September 2026,104766

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20804 2026-03-24 cs.CV cs.RO 81%

Does Peer Observation Help? Vision-Sharing Collaboration for Vision-Language Navigation

同伴观察有助于吗?面向视觉语言导航的视觉共享协作

Qunchao Jin, Yiliao Song, Qi Wu

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学) Responsible AI Research Centre(负责任人工智能研究中心)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出Co-VLN框架,研究同伴观察对视觉语言导航的影响,通过共享感知记忆扩展接收场,验证了在R2R基准下两种方法中性能的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08935 2026-03-24 cs.RO cs.CV 81%

Expand Your SCOPE: Semantic Cognition over Potential-Based Exploration for Embodied Visual Navigation

拓展你的SCOPE:基于潜在探索的语义认知用于具身视觉导航

Ningnan Wang, Weihuang Chen, Liming Chen, Haoxuan Ji, Zhongyu Guo, Xuchong Zhang, Hongbin Sun

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出SCOPE框架,通过利用前沿信息驱动潜在探索,提升具身视觉导航中的决策质量与目标相关性,实验表明其在准确性和泛化能力上优于现有方法。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20353 2026-03-24 cs.CV cs.RO eess.IV eess.SP 81%

Scene Representation using 360° Saliency Graph and its Application in Vision-based Indoor Navigation

基于360°显著性图的场景表示及其在基于视觉的室内导航中的应用

Preeti Meena, Himanshu Kumar, Sandeep Yadav

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种360°显著性图表示方法,用于提升场景表示效率和室内导航性能,通过编码视觉、上下文、语义和几何信息,提高场景定位和导航准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08157 2026-03-24 cs.RO cs.AI cs.MA 81%

Risk-Bounded Multi-Agent Visual Navigation via Iterative Risk Allocation

基于迭代风险分配的有界多智能体视觉导航

Viraj Parimi, Brian C. Williams

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出风险有界多智能体路径规划框架,通过动态分配风险预算提升多智能体在高风险环境中的导航效率与安全性。

Comments Published at ICAPS '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12696 2026-03-20 cs.RO cs.CV 81%

HaltNav: Reactive Visual Halting over Lightweight Topological Priors for Robust Vision-Language Navigation

HaltNav: 基于轻量拓扑先验的反应式视觉停止用于鲁棒视觉-语言导航

Zihui Yu, Pingcong Li, Bichi Zhang, Sören Schwertfeger

机构 * SIST, ShanghaiTech University(上海科技大学信息与通信科学核心平台,上海科技大学) Key Laboratory of Intelligent Perception and Human-Machine Collaboration(智能感知与人机协同重点实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出HaltNav框架,结合轻量拓扑先验与局部探索能力,通过反应式视觉停止机制提升视觉-语言导航的鲁棒性,实验表明其在复杂环境下的表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17712 2026-03-19 cs.RO cs.CV 81%

AERR-Nav: Adaptive Exploration-Recovery-Reminiscing Strategy for Zero-Shot Object Navigation

AERR-Nav:面向零样本物体导航的自适应探索-恢复-回忆策略

Jingzhi Huang, Junkai Huang, Haoyang Yang, Haoang Li, Yi Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出AERR-Nav框架,通过自适应探索-恢复-回忆策略和自适应探索状态,解决零样本物体导航中探索与利用的平衡问题,在HM3D和MP3D基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13698 2026-03-19 cs.RO cs.AI 81%

SAATT Nav: a Socially Aware Autonomous Transparent Transportation Navigation Framework for Wheelchairs

SAATT Nav:面向轮椅的社交感知自主透明交通导航框架

Yutong Zhang, Shaiv Y. Mehra, Bradley S. Duerstock, Juan P. Wachs

机构 * Edwardson School of Industrial Engineering, Purdue University(帕克大学工业工程学院) Weldon School of Biomedical Engineering, Purdue University(帕克大学生物医学工程学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出SAATT导航框架,通过整合大语言模型实现社交感知与决策透明,提升轮椅用户的导航安全性与信任度。

Comments 8 pages, 4 figures, 2 tables, 1 algorithm. Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17236 2026-03-19 cs.RO cs.CV 81%

Neural Radiance Maps for Extraterrestrial Navigation and Path Planning

神经辐射图用于外星导航和路径规划

Adam Dai, Shubh Gupta, Grace Gao

机构 * Stanford University(斯坦福大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出利用神经辐射场构建地图,用于自主导航中的路径规划,通过整合局部和全局信息,实现更高效的路径规划。

Comments Published in the Proceedings of the ION GNSS+ 2023 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17229 2026-03-19 cs.RO cs.CV 81%

Visual SLAM with DEM Anchoring for Lunar Surface Navigation

基于数字高程模型锚定的月球表面视觉SLAM

Adam Dai, Guillem Casadesus Vila, Grace Gao

机构 * Stanford University(斯坦福大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种结合学习特征检测与DEM全局约束的视觉SLAM系统,用于月球表面长距离导航,通过引入高程和表面法线因素缓解长期漂移问题。

Comments Accepted to IEEE Aerospace Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17056 2026-03-19 cs.CV cs.LG 81%

DesertFormer: Transformer-Based Semantic Segmentation for Off-Road Desert Terrain Classification in Autonomous Navigation Systems

DesertFormer:基于Transformer的语义分割用于自动驾驶导航系统中的沙漠地形分类

Yasaswini Chebolu

机构 * Department of Computer Science \& Engineering (AI \& ML) Gayatri Vidya Parishad College of Engineering for Women Visakhapatnam, India

专题命中 具身导航 :navigation(title,abstract);分类 cs.CV、cs.LG

AI总结 DesertFormer基于SegFormer B2与层次化Mix Transformer(MiT-B2)架构,针对沙漠地形的低对比度、强光照变化和稀疏植被挑战,实现10类生态意义地形分类,提升地面机器人与自动驾驶车辆的安全路径规划能力。

Comments 10 pages, 6 figures, 3 tables. Preprint also available on Zenodo (DOI: 10.5281/zenodo.19053085)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09506 2026-03-19 cs.CV cs.RO 81%

Context-Nav: Context-Driven Exploration and Viewpoint-Aware 3D Spatial Reasoning for Instance Navigation

Context-Nav: 基于上下文的探索与视点感知的3D空间推理用于实例导航

Won Shik Jang, Ue-Hwan Kim

机构 * Department of AI Convergence(人工智能融合系)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 Context-Nav通过上下文驱动的探索和视点感知的3D空间推理,提升实例导航任务的性能,无需特定任务训练,实现最先进的结果。

Comments Accepted to CVPR 2026. Code is available at https://github.com/AutoCompSysLab/ContextNav

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16166 2026-03-18 cs.RO cs.CV 81%

SignNav: Leveraging Signage for Semantic Visual Navigation in Large-Scale Indoor Environments

SignNav:利用标识信息在大规模室内环境中实现语义视觉导航

Jian Sun, Yuming Huang, He Li, Shuqi Xiao, Shenyan Guo, Maani Ghaffari, Qingbiao Li, Chengzhong Xu, Hui Kong

机构 * Faculty of Science and Technology, University of Macau(澳门大学科技学院) Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出SignNav任务,通过解读标识信息进行语义导航,构建LSI-Dataset并提出START模型,实现端到端决策,达到80%的成功率和0.74 NDTW。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18188 2026-03-17 cs.CV cs.AI 81%

\textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation

NaVIDA:基于逆动力学增强的视觉-语言导航

Weiye Zhu, Zekai Zhang, Xiangchen Wang, Hewei Pan, Teng Wang, Tiantian Geng, Rongtao Xu, Feng Zheng

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 NaVIDA通过引入逆动力学监督,增强视觉动态建模,提升导航稳定性与一致性,实验表明其在参数更少的情况下表现优于现有方法。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14276 2026-03-17 cs.CV cs.AI 81%

All-day Multi-scenes Lifelong Vision-and-Language Navigation with Tucker Adaptation

全天多场景终身视觉-语言导航与Tucker适应

Xudong Wang, Gan Li, Zhiyu Liu, Yao Wang, Lianqing Liu, Zhi Han

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出Tucker适应方法,解决视觉-语言导航在多场景下的持续学习问题,通过高阶张量分解实现知识解耦,提升长期部署灵活性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏