arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 14066 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 14066 篇

2207.13791 2026-07-22 cs.RO cs.CV cs.HC cs.LG 67%

Learning to Assess Danger from Movies for Cooperative Escape Planning in Hazardous Environments

学习从电影中评估危险以进行合作逃离规划在危险环境中

Vikram Shree, Sarah Allen, Beatriz Asfora, Jacopo Banfi, Mark Campbell

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出利用电影数据训练机器人评估危险,结合多模态信息提升人机合作逃离效率。

Comments 8 pages, 8 figures Accepted for publication at 2022 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11834 2026-07-15 cs.CV cs.AI cs.RO cs.SY eess.IV eess.SY 67%

Recent Advances in Transformer and Large Language Models for UAV Applications

Transformer及大语言模型在无人机应用中的最新进展

Hamza Kheddar, Yassine Habchi, Mohamed Chahine Ghanem, Mustapha Hemis, Dusit Niyato

机构 * LSEA Laboratory, Department of Electrical Engineering, University of Medea, 26000, Algeria(里塞阿实验室,电气工程系,梅迪亚大学,阿尔及利亚) Institute of Technology, University Centre Salhi Ahmed, Naama, Algeria(技术研究所,萨利哈·阿赫迈德大学中心,纳马,阿尔及利亚) Cybersecurity Institute, Department of Computer Science, University of Liverpool, L69 3BX, Liverpool, UK(网络安全研究所,计算机科学系,利物浦大学,英国) LCPTS Laboratory, University of Sciences(LCPTS实验室,科学大学) College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore.(数据科学,南洋理工大学,新加坡)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文综述了Transformer及大语言模型在无人机应用中的最新进展,包括分类、混合模型、强化学习和大语言模型的应用,以及精准农业和自主导航等新兴应用。

Journal ref ACM Computing Surveys, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07737 2026-07-10 cs.RO cs.CV cs.LG 新提交 67%

SASGeo: Stability-Aware Semantic Map Localization for GNSS-Denied UAVs -- A Framework and Synthetic Proof of Concept

SASGeo:用于全球导航卫星系统受限无人机的稳定性感知语义地图定位——一个框架和合成概念验证

Natalia Trukhina, Vadim Vashkelis

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 研究针对全球导航卫星系统受限无人机的定位问题,提出SASGeo语义地图定位框架,结合多种技术,指定具体模型并进行合成概念验证。在随机检索试验中,全局语义描述符召回率58.6%,空间语义匹配变体为94.5%-95.5%。该框架能在扰动下区分位置,为后续研究提供方向。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07370 2026-07-10 cs.RO cs.AI cs.HC cs.LG 新提交 67%

Behavior Foundations for Quadruped Robots: ABot-C0 Technical Report

四足机器人的行为基础:ABot-C0技术报告

Xufeng Zhao, Fuzhi Yang, Jianhui Chen, Li Gao, Zhang Meng, Jie Gao, Yao Zheng, Congyang Zhao, Tianxiong Lv, Menglin Yang, Minqi Gu, Yaru Zhao, Wenyu Liu, Honglin Han, Shihui Su, Zixiao Tang, Liu Liu, Mu Xu, Yang Cai, Wenbin Tang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 该研究聚焦四足机器人运动控制,提出ABot-C0通用系统,构建数据金字塔生成运动片段,训练流匹配通用策略展示跟踪缩放定律,采用特定框架推动全地形遍历运动,经实验验证其能让四足机器人迈向产品级行为智能。

Comments Abot-C0 project page will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18999 2026-07-10 cs.RO cs.AI cs.CV 版本更新 67%

OREN: Octree Residual Network for Real-Time Euclidean Signed Distance Mapping

OREN:八叉树残差网络用于实时欧几里得符号距离映射

Zhirui Dai, Qihao Qian, Tianxing Fan, Nikolay Atanasov

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电子与计算机工程系)

专题命中 具身导航 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 OREN结合八叉树插值的显式先验和神经网络回归的隐式残差,实现高效且可微的非截断SDF重建,优于现有方法的准确性和效率。

Comments Accepted to IEEE/RSJ International Conference Intelligent Robots & Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01836 2026-07-10 cs.RO cs.AI cs.LG 67%

Multi-vessel Interaction-Aware Trajectory Prediction and Collision Risk Assessment

多 vessel 交互感知的轨迹预测与碰撞风险评估

Md Mahbub Alam, Jose F. Rodrigues-Jr, Gabriel Spadon

机构 * Faculty of Computer Science, Dalhousie University, Halifax, Canada(计算机科学学院,达尔豪斯大学,加拿大哈利法克斯) Computer Science Department, University of São Paulo, São Carlos, Brazil(计算机科学系,圣保罗大学,巴西萨昂卡尔)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出基于 transformer 的多 vessel 轨迹预测框架,结合碰撞风险分析,提升海上态势感知与安全决策

Journal ref arXiv preprint arXiv:2509.01836, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00316 2026-07-02 eess.SP 新提交 67%

Evolving Intelligent Complex Systems via Intellicise Networks: Architecture, Technologies, and Pathways

通过智能网络演化智能复杂系统:架构、技术与路径

Ping Zhang, Rui Meng, Xiaodong Xu, Song Gao, Zixuan Huang, Yaheng Wang, Yinqiu Liu, Ruichen Zhang, Yiming Liu, Kaiwen Yu, Yaping Sun, Han Meng, Haonan Tong, Huishi Song, Qianqian Yang, Shuoyao Wang, Lexi Xu, Qinghe Du, Geng Sun, Jiawen Kang, Gang Wu, Yiqing Zhou, Haixia Zhang, Zesong Fei, Aimin Hao, Ming Li

专题命中 具身导航 :embodied AI(abstract);embodied agent(abstract)

AI总结 本文提出基于智能网络的跨域智能通信网络架构,融合信息论、系统论等理论,通过语义提取、意图理解、生成式AI等技术,实现复杂系统的自配置与自优化,并给出具身智能通信案例。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16016 2026-06-30 cs.CV cs.AI cs.RO eess.IV 67%

FlatLands: Generative Floormap Completion From a Single Egocentric View

FlatLands: 从单个视角生成地板地图完成

Subhransu S. Bhattacharjee, Dylan Campbell, Rahul Shome

机构 * School of Computing, The Australian National University, Canberra, Australia(澳大利亚国立大学计算机学院,堪培拉,澳大利亚)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出FlatLands数据集和基准,用于单视角鸟瞰图地板完成。通过27万次真实室内场景观测,提供对齐的观测、可见性、有效性及真实BEV地图,支持分布内和分布外评估,比较多种模型并提出端到端的RGB到地板地图管道。

Comments In Proceedings of the European Conference of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23798 2026-06-23 cs.CV cs.AI cs.LG 交叉投稿 67%

A geometric and deep learning reproducible pipeline for monitoring floating anthropogenic debris in urban rivers using in situ cameras

一种基于几何和深度学习的可复现流水线,用于利用原位摄像头监测城市河流中的漂浮人为碎片

Gauthier Grimmer, Romain Wenger, Clément Flint, Germain Forestier, Gilles Rixhon, Valentin Chardon

机构 * LIVE UMR 7362 CNRS, University of Strasbourg(LIVE UMR 7362 CNRS,斯特拉斯堡大学) Centre Inria de l’Université de Lorraine(里昂大学的Inria中心) Technical University of Munich, Campus Heilbronn(慕尼黑技术大学海因斯贝格校区) IRIMAS UR 7499, University of Haute-Alsace(阿尔萨斯大学IRIMAS UR 7499) Data Science and Artificial Intelligence (DSAI), Monash University(莫纳什大学数据科学与人工智能(DSAI))

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出结合几何模型与深度学习的框架,利用固定摄像头连续量化监测城市河流漂浮碎片,并评估不同模型在复杂环境下的精度与速度,通过投影几何实现碎片尺寸估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03040 2026-06-19 cs.RO cs.AI cs.LG 版本更新 67%

PiDR: Physics-Informed Inertial Dead Reckoning for Autonomous Platforms

PiDR:面向自主平台的物理信息惯性航位推算

Arup Kumar Sahoo, Itzik Klein

机构 * Autonomous Navigation and Sensor Fusion Lab (ANSFL)(自主导航与传感器融合实验室(ANSFL)) Hatter Department of Marine Technologies(海洋技术系) Charney School of Marine Sciences(海洋科学学院) University of Haifa(海法大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出PiDR框架,将惯性导航原理作为物理信息残差融入网络训练,在纯惯性导航中减少轨迹漂移,在移动机器人和水下自主航行器数据集上定位精度提升超29%。

Comments 11 pages and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18698 2026-06-18 cs.RO cs.AI cs.LG 新提交 67%

Leveraging Energy Features for Surface Classification with Deep Learning: A Comparative Analysis Across Three Independent Datasets

利用能量特征进行基于深度学习的表面分类:三个独立数据集的比较分析

Alexander Belyaev, Oleg Kushnarev

专题命中 具身导航 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究评估能量特征作为表面分类的独立或辅助模态的可行性,在三个数据集上比较多种深度学习架构,发现CNN性能最优,纯能量特征准确率85-90%,与惯性特征结合可达96-99%,且能量特征可稳定提升1-2%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00917 2026-06-09 cs.RO cs.CV cs.LG 版本更新 67%

A Survey on Deep Multi-Task Learning in Connected Autonomous Vehicles

联网自动驾驶车辆中深度多任务学习综述

Jiayuan Wang, Farhad Pourpanah, Q. M. Jonathan Wu, Ning Zhang

机构 * Department of Electrical and Computer Engineering, University of Windsor(温莎大学电气与计算机工程系) Department of Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程系)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 综述联网自动驾驶车辆中深度多任务学习,涵盖感知、预测、规划、控制及V2X通信与资源管理,分析现有方法优缺点并指出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07233 2026-06-08 cs.CV cs.LG cs.RO 新提交 67%

Does Appearance Help? A Systematic Study of Image-Based Re-Identification in Online 3D Multi-Pedestrian Tracking

外观有帮助吗?在线3D多行人追踪中基于图像的重识别系统研究

Eduardo Borges, Luís Garrote, Urbano J. Nunes

机构 * Institute of Systems and Robotics, Department of Electrical and Computer Engineering, University of Coimbra(系统与机器人研究所,电气与计算机工程系,科英布拉大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 系统研究轻量级投影框架下图像重识别在在线3D多目标追踪中的作用,提出级联匹配策略以在低延迟下恢复遮挡轨迹并防止身份切换。

Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06618 2026-06-08 cs.RO cs.AI cs.LG 新提交 67%

ChronoForest: Closed-Loop Multi-Tree Diffusion Planning for Efficient Bridge Search and Route Composition

ChronoForest: 用于高效桥接搜索和路线组合的闭环多树扩散规划

Jungmin Seo, Jaesik Park

机构 * Seoul National University(首尔国立大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对仅依赖短程离线轨迹进行长程路线规划的问题,提出ChronoForest系统,通过锚链树扩散规划器和在线多树协调器实现局部桥接搜索与全局路线重解,在OGBench和哈密顿路线组合基准上显著提升成功率和效率。

Comments 40 pages, 4 figures, 7 tables, 3 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11014 2026-06-08 cs.RO cs.AI cs.CV 版本更新 67%

MatterDoor: Sampling Zero-shot Spatio-semantic Priors using Generative Models

MatterDoor: 使用生成模型采样零样本空间语义先验

Subhransu S. Bhattacharjee, Hao Lu, Dylan Campbell, Rahul Shome

机构 * School of Computing, Australian National University(澳大利亚国立大学计算机学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对机器人通过门缝观察时场景结构缺失的问题,提出MatterDoor方法,利用预训练生成模型(VLM引导外推、单目深度估计、语义分割)采样隐藏房间的语义3D点云先验,在Matterport3D基准上验证了零样本空间语义先验的有效性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.01068 2026-06-04 cs.RO cs.AI cs.LG cs.SY eess.SY 67%

Efficient and Safe Exploration in Deterministic Markov Decision Processes with Unknown Transition Models

在未知转移模型的确定性马尔可夫决策过程中实现高效且安全的探索

Erdem Bıyık, Jonathan Margoliash, Shahrouz Ryan Alimo, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Jet Propulsion Laboratory(喷气推进实验室) California Institute of Technology(加州理工学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种安全探索算法,通过利用Lipschitz连续性确保在探索过程中不访问危险状态,该算法在确定性马尔可夫决策过程中提供了确定性的安全保证,并通过模拟导航任务验证了其性能。

Comments Proceedings of the American Control Conference (ACC), July 2019. The first two authors have equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.11898 2026-06-04 cs.RO cs.CV cs.LG cs.SY eess.SY 67%

Perceptual Attention-based Predictive Control

基于感知注意力的预测控制

Keuntaek Lee, Gabriel Nakajima An, Viacheslav Zakharov, Evangelos A. Theodorou

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出了一种新的信息处理架构,用于安全的深度学习视觉导航系统,通过模型预测控制(MPC)、卷积神经网络(CNNs)和不确定性量化方法,实现基于感知注意力的预测控制算法,提高了系统对不安全状况的快速检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.11683 2026-06-04 stat.ML cs.CV cs.LG cs.RO cs.SY eess.SY stat.AP 67%

Outlier-Robust Spatial Perception: Hardness, General-Purpose Algorithms, and Guarantees

抗异常的空域感知:难度、通用算法和保证

Vasileios Tzoumas, Pasquale Antonante, Luca Carlone

专题命中 具身导航 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文研究了空域感知中异常数据的影响,提出了一种通用算法来有效去除异常,并提供了对算法性能的理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.04696 2026-06-04 cs.RO cs.AI cs.LG cs.SY eess.SY 67%

Efficient Model Identification for Tensegrity Locomotion

高效 tensegrity 机器人运动的模型识别

Shaojun Zhu, David Surovik, Kostas E. Bekris, Abdeslam Boularias

机构 * Department of Computer Science, Rutgers University(计算机科学系,罗格斯大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种高效方法,利用物理引擎和贝叶斯优化框架,用于识别高维顺应性tensegrity机器人中的未知机械参数,提升运动控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.08668 2026-06-04 eess.SY cs.SY 67%

Real-time optimal control via Deep Neural Networks: study on landing problems

基于深度神经网络的实时最优控制:着陆问题研究

Carlos Sánchez-Sánchez, Dario Izzo

专题命中 具身导航 :navigation(abstract);robotic(abstract)

AI总结 本文研究利用深度神经网络实现着陆任务的实时最优控制,通过训练网络获得接近最优的着陆策略,为设计能处理多种初始状态的实时控制系统提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.09041 2026-06-04 math.NA cs.NA 67%

Solution of constrained mechanical multibody systems using Adomian decomposition method

使用Adomian分解法求解约束机械多体系统

Brahim Benhammouda

专题命中 具身导航 :robotics(abstract);robotic(abstract)

AI总结 本文提出一种高效求解欧拉-拉格朗日方程的新方法,无需复杂变换或降阶,通过求解线性代数方程组实现,用于求解平面双连机器人系统示例。

详情

展开后加载摘要…

URL PDF HTML 收藏
1410.1465 2026-06-04 eess.SY cs.SY 67%

The invariant extended Kalman filter as a stable observer

不变扩展卡尔曼滤波作为稳定的观测器

Axel Barrau, Silvère Bonnabel

专题命中 具身导航 :robotics(abstract);navigation(abstract)

AI总结 本文研究了当IEKF作为确定性非线性观测器用于李群上的连续时间系统时的收敛性,证明了其在特定条件下局部稳定性,并通过实例展示其优于传统EKF的鲁棒性。

Comments This paper is going to be submitted for publication in IEEE Transactions on Automatic Control

详情

展开后加载摘要…

URL PDF HTML 收藏
0901.3977 2026-06-03 math.OC cs.NA math.AP math.NA 67%

An efficient method for multiobjective optimal control and optimal control subject to integral constraints

多目标最优控制及积分约束下最优控制的高效方法

Ajeet Kumar, Alexander Vladimirsky

专题命中 具身导航 :navigation(abstract);robotic(abstract)

AI总结 提出一种基于扩展状态空间和增广Hamilton-Jacobi-Bellman PDE的高效数值方法,利用新维度上的因果性(特征曲线单调性)通过半拉格朗日推进法逼近不连续粘性解,解决多准则最优控制和积分约束下的单准则最优控制问题。

Comments The final version accepted by J. Comp. Math. : 41 pages, 14 figures. Since the previous version: typos fixed, formatting improved, one mistake in bibliography corrected

Journal ref Journal of Computational Mathematics 28/4: 517-551 (2010)

详情

展开后加载摘要…

URL PDF HTML 收藏
1211.1690 2026-06-03 cs.RO cs.CV cs.LG cs.SY eess.SY 67%

Learning Monocular Reactive UAV Control in Cluttered Natural Environments

学习在杂乱自然环境中进行单目反应式无人机控制

Stephane Ross, Narek Melik-Barkhudarov, Kumar Shaurya Shankar, Andreas Wendel, Debadeepta Dey, J. Andrew Bagnell, Martial Hebert

机构 * Institute for Computer Graphics and Vision(计算机视觉研究所) Graz University of Technology(格拉茨技术大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文使用单目相机和模仿学习训练控制器,使小型四旋翼飞行器能在自然森林环境中以1.5m/s速度自主避障导航。

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01277 2026-06-02 cs.RO cs.AI cs.CV cs.SY eess.IV eess.SY 67%

DeepIPCv3: Event-Aware Multi-Modal Sensor Fusion for Sudden Pedestrian Crossing Avoidance

DeepIPCv3: 面向突发行人穿越避让的事件感知多模态传感器融合

Oskar Natan, Andi Dharmawan, Aufaclav Zatu Kusuma Frisky, Jazi Eko Istiyanto, Jun Miura

机构 * Department of Computer Science and Electronics, Universitas Gadjah Mada(计算机科学与电子系,加雅马达大学) Department of Computer Science and Engineering, Toyohashi University of Technology(计算机科学与工程系,东福士大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出DeepIPCv3框架,通过Transformer交叉模态注意力融合LiDAR点云与DVS事件流,实现突发行人穿越场景下的高反应性避让,在自定义多模态数据集上达到最优轨迹与控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18197 2026-05-19 cs.RO cs.AI cs.CV 67%

RGB-only Active 3D Scene Graph Generation for Indoor Mobile Robots

仅RGB的主动3D场景图生成用于室内移动机器人

Giorgia Modi, Davide Buoso, Giuseppe Averta, Daniele De Martini

机构 * Mobile Robotics Group (MRG)(移动机器人小组) Visual and Multimodal Applied Learning Lab (VANDAL)(视觉与多模态应用学习实验室)

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出了一种仅使用RGB输入的主动3D场景图生成方法,通过统一感知与规划的结构化表示,解决了传统方法对专用传感器的依赖问题,并在Replica数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18184 2026-05-19 cs.RO cs.AI cs.CV 67%

Fixed External Cameras as Common Prior Maps for Active 3D Scene Graph Generation

固定外部摄像头作为主动3D场景图生成的共同先验地图

Giorgia Modi, Davide Buoso, Giuseppe Averta, Daniele De Martini

机构 * Mobile Robotics Group (MRG)(移动机器人组) Visual and Multimodal Applied Learning Lab (VANDAL)(视觉与多模态应用学习实验室)

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出利用固定外部RGB摄像头作为共同先验地图,以实现主动、渐进式的3D场景图生成,通过融合机器人 onboard 摄像头和固定外部摄像头的数据,提高场景理解的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17327 2026-05-19 cs.RO cs.AI cs.CV 67%

Efficient Feature-Free Initialization for Monocular Visual-Inertial Systems Using a Feed-Forward 3D Model

为单目视觉-惯性系统使用前馈3D模型实现高效的特征-free初始化

Yuantai Zhang, Jiaqi Yang, Huajian Zeng, Changhao Chen, Haoang Li, Liang Li, Dezhen Song, Xingxing Zuo

机构 * MBZUAI(马克斯·普朗克人工智能研究所) HKUST (GZ)(香港科技大学(广州)) Zhejiang University(浙江大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出了一种无需视觉特征跟踪的初始化框架,利用前馈3D模型预测的点云,从而提高了单目视觉-惯性导航系统的初始化可靠性与效率,实验表明其初始化成功率超过90%且数据需求显著减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16391 2026-05-19 eess.SP cs.AI cs.LG cs.RO 67%

Overcoming the Intrinsic Performance Limitations of MEMS IMU via Diffusion-Based Generative Learning

通过扩散生成学习克服MEMS惯性测量单元的固有性能限制

Jiarui Lv, Feng Zhu, Xiaohong Zhang

机构 * School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) Hubei Luojia Laboratory, Wuhan University(湖北珞珈实验室) Chinese Antarctic Center of Surveying and Mapping, Wuhan University(中国极地测绘南极科考中心)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出基于扩散的生成学习框架,利用低成本IMU数据生成高保真虚拟IMU数据,提升定位和姿态估计性能,并在空中测绘中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12674 2026-05-14 cs.AI cs.LG cs.RO 67%

Revealing Interpretable Failure Modes of VLMs

揭示视觉语言模型的可解释性故障模式

Isha Chaudhary, Vedaant V Jain, Kavya Sachdeva, Sayan Ranu, Gagandeep Singh

机构 * UIUC(伊利诺伊大学香槟分校) Kumo AI IIT Delhi(德里印度理工学院)

专题命中 具身导航 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出REVELIO框架,通过系统性探索揭示VLMs在自动驾驶和室内机器人领域中的可解释性故障模式,发现模型在空间定位和安全威胁识别上的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏