arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 14074 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 14074 篇

2505.18134 2026-05-18 cs.AI cs.CL cs.CV 62%

VideoGameBench: Can Vision-Language Models complete popular video games?

VideoGameBench: 能否让视觉-语言模型完成流行视频游戏?

Alex L. Zhang, Thomas L. Griffiths, Karthik R. Narasimhan, Ofir Press

机构 * Princeton University(普林斯顿大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 VideoGameBench通过10款经典游戏测试视觉-语言模型在无辅助信息下的实时游戏完成能力,发现前沿模型受推理延迟限制,仅能完成极少量游戏内容。

Comments 10 pages, 38 pages including supplementary

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13741 2026-05-14 cs.RO cs.CV 62%

LEXI-SG: Monocular 3D Scene Graph Mapping with Room-Guided Feed-Forward Reconstruction

LEXI-SG:基于房间引导前馈重建的单目3D场景图映射

Christina Kassab, Hyeonjae Gil, Matías Mattamala, Ayoung Kim, Maurice Fallon

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 LEXI-SG是首个仅使用RGB相机输入的开放词汇3D场景图密集映射系统,通过语义先验分割场景为房间,实现可扩展的密集映射。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12255 2026-05-13 cs.AI cs.CY cs.LG 62%

Why Conclusions Diverge from the Same Observations: Formalizing World-Model Non-Identifiability via an Inference

结论为何从相同观察中分歧:通过推理正式化世界模型非识别性

Toru Takahashi

机构 * Human Informatics and Systems Laboratory, Doshisha University, Kyoto, Japan(大阪大学人文学与系统实验室,京都,日本) Linked Open Data Initiative, NPO, Tokyo, Japan(开放数据倡议,东京,日本) Keio Research Institute at SFC, Fujisawa, Japan(庆应义塾大学SFC研究所, Fujisawa,日本) Stroly Inc., Kyoto, Japan(Stroly公司,京都,日本)

专题命中 具身导航 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在相同观察下推理结论分歧的本质,提出非识别性是推理学习的固有属性,而非对方认知缺陷。通过θ-级和W-级非识别性分析,揭示了推理框架对数据暴露和模型学习的影响,并关联深度表示学习与监管辩论案例。

Comments 12 pages, 2 figures, 1 table. Extended English version of a paper accepted for presentation at JSAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18780 2026-05-13 cs.RO cs.LG 62%

DreamPolicy: A Unified World-model Policy for Scalable Humanoid Locomotion

DreamPolicy: 一种统一的世界模型策略用于可扩展的人形机器人运动

Yahao Fan, Tianxiang Gui, Kaiyang Ji, Shutong Ding, Chixuan Zhang, Yifeng Xu, Ke Yang, Jiayuan Gu, Jingyi Yu, Jingya Wang, Ye Shi

机构 * ShanghaiTech University(上海科技大学) InstAdapt

专题命中 具身导航 :world model(abstract);分类 cs.RO、cs.LG

AI总结 DreamPolicy通过整合离线数据与扩散式世界模型,实现单一策略掌握已知和未知地形。其地形感知世界模型能生成物理合理的未来轨迹,作为动态目标指导策略,避免手动奖励工程。实验表明,DreamPolicy在未知和复合地形上性能优于基线38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10269 2026-05-12 cs.CV cs.RO 62%

Increasing the Efficiency of DETR for Maritime High-Resolution Images

提升DETR在海上高分辨率图像中的效率

Tinsae Yehuala, Hao Cheng, Ville Lehtola

机构 * Dept. of Earth Observation Science, ITC Faculty, University of Twente(地球观测科学系,ITC学院,特文特大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种基于Vision Mamba的改进DETR模型,通过特征金字塔网络和token剪枝提升海上目标检测的效率与精度。

Comments Accepted to IEEE ITSC 2026. Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses. DOI to be added upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12982 2026-05-12 cs.RO cs.AI cs.SE 62%

Out of Distribution Detection in Self-adaptive Robots with AI-powered Digital Twins

具有AI驱动数字孪生的自适应机器人中的分布外检测

Erblin Isaku, Hassan Sartaj, Shaukat Ali, Beatriz Sanguino, Tongtong Wang, Guoyuan Li, Houxiang Zhang, Thomas Peyrucain

机构 * Simula Research Laboratory(Simula研究实验室) University of Oslo(奥斯陆大学) Norwegian University of Science and Technology(挪威科学技术大学) PAL Robotics(PAL机器人)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于数字孪生的ODiSAR方法,用于自适应机器人中检测分布外行为,通过Transformer模型和不确定性量化实现高检测性能,提供可解释性支持自适应调整。

Comments 15 pages, 4 figures, 3 tables

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09317 2026-05-12 cs.CL cs.CV cs.LG 62%

Mem-W: Latent Memory-Native GUI Agents

Mem-W: 基于潜在记忆的原生GUI代理

Guibin Zhang, Yaohui Ling, Fanci Meng, Kun Wang, Shuicheng Yan

机构 * LV-NUS Lab(LV-NUS实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.CV、cs.LG

AI总结 Mem-W通过将记忆作为连续上下文的一部分,改进GUI代理的长期任务执行能力,实验证明其在多个导航基准测试中提升了性能,最高提升达+30.0。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07924 2026-05-11 cs.LG cs.AI cs.CL 62%

Trajectory as the Teacher: Few-Step Discrete Flow Matching via Energy-Navigated Distillation

轨迹作为教师:通过能量导航蒸馏实现少步离散流匹配

Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Manuel R. Ciosici, Yizhe Zhang, Irina Belousova

机构 * The Ohio State University(俄亥俄州立大学) Apple(苹果公司)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TS-DFM方法,通过能量导航蒸馏减少离散流匹配的训练步骤,实现更高效的文本生成,实验表明其在生成质量与速度上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19788 2026-05-11 cs.AI cs.LG 62%

Benchmarking World-Model Learning with Environment-Level Queries

用环境级查询评估世界模型学习

Archana Warrier, Dat Nguyen, Michelangelo Naim, Moksh Jain, Yichao Liang, Karen Schroeder, Cambridge Yang, Joshua B. Tenenbaum, Sebastian Vollmer, Kevin Ellis, Zenna Tavares

机构 * Basis Research Institute DFKI GmbH Harvard University Universit\'e de Montr\'eal \& Mila - Quebec AI Institute University of Cambridge Massachusetts Institute of Technology Cornell University

专题命中 具身导航 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WorldTest协议,通过环境级查询评估智能体是否学习到支持多种环境属性的模型,通过AutumnBench验证人类在网格世界环境中的表现优于前沿模型。

Comments 34 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02526 2026-05-08 eess.SY cs.LG cs.RO cs.SY 62%

Many-vs-Many Missile Guidance via Virtual Targets

多方对多方导弹制导的虚拟目标方法

Marc Schneider, Walter Fichter

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出利用生成正常流轨迹预测器的虚拟目标进行多方对多方导弹制导,通过概率预测分布而非确定性预测,提升拦截概率。

Comments Subsequent investigations showed that the proposed method does not generalize beyond the specific scenario considered in this manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00059 2026-05-04 cs.RO cs.AI 62%

Dynamic-TD3: A Novel Algorithm for UAV Path Planning with Dynamic Obstacle Trajectory Prediction

动态TD3:一种用于无人机路径规划的新型算法,具有动态障碍轨迹预测

Wentao Chen, Jingtang Chen, Mingjian Fu, Tiantian Li, Youfeng Su, Wenxi Liu, Yuanlong Yu

机构 * Wentao Chen(文涛 岑) Jingtang Chen(敬堂 陈) Mingjian Fu(明健 Fu) Tiantian Li(田田 李) Youfeng Su(友峰 苏) Wenxi Liu(文溪 刘) Yuanlong Yu(元龙 于)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出动态TD3算法,通过将导航建模为约束马尔可夫决策过程,结合自适应轨迹关系进化机制和物理感知门控卡尔曼滤波,提升无人机在动态障碍环境中的安全性和效率。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27450 2026-05-01 cs.RO cs.AI 62%

RAY-TOLD: Ray-Based Latent Dynamics for Dense Dynamic Obstacle Avoidance with TDMPC

RAY-TOLD: 基于射线的任务导向潜在动力学用于密集动态障碍物避障与TDMPC

Seungho Han, Seokju Lee, Jeonguk Kang

机构 * School of Electrical Engineering, Hanyang University(翰阳大学电气工程学院) Mechatronics, Systems and Control Lab (MSC Lab), Department of Mechanical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(机械工程系,韩国科学技术院(KAIST)机电系统与控制实验室(MSC实验室)) Samsung Research, Samsung Electronics(三星研究所,三星电子)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出RAY-TOLD,结合物理基础MPPI的鲁棒性与强化学习的长视界,通过LiDAR中心的潜在动力学模型实现动态障碍物避障,提升导航可靠性与安全性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26582 2026-04-30 cs.CV cs.AI 62%

Star-Fusion: A Multi-modal Transformer Architecture for Discrete Celestial Orientation via Spherical Topology

星融合:一种多模态变换器架构,通过球面拓扑实现离散天体定向

May Hammad, Menatallh Hammad

机构 * Department of Aerospace Informatics, Julius-Maximilians-Universität Würzburg(航空航天信息学系,乌尔姆-马克斯-普朗克大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Star-Fusion架构,通过球面拓扑分类解决天体定向问题,采用球面K-means聚类和多模态融合策略,实现高精度和高效定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22875 2026-04-29 cs.CV cs.AI 62%

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

SketchVLM:视觉语言模型可以注释图像以解释思路并引导用户

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(阿伯拉罕大学) Adobe Research(Adobe研究)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 SketchVLM通过生成可编辑的SVG叠加图提升视觉推理和绘图任务的准确性与注释质量,实现高达28.5%的精度提升和1.48倍的注释质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24127 2026-04-28 cs.LG cs.AI 62%

Leveraging Human Feedback for Semantically-Relevant Skill Discovery

利用人类反馈进行语义相关的技能发现

Maxence Hussonnois, Thommen George Karimpanal, Santu Rana

机构 * A 2 I 2 , Deakin University, Geelong, Australia(A2I2,德金大学,澳大利亚格里尔镇) School of IT, Deakin University, Geelong, Australia(信息学院,德金大学,澳大利亚格里尔镇)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SRSD方法,通过人类反馈的语义标签提升技能的语义多样性与相关性,实验表明其在导航和运动环境中有效发现相关行为。

Comments Accepted at the 28th International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04503 2026-04-28 cs.CV cs.RO 62%

U-ViLAR: Uncertainty-Aware Visual Localization for Autonomous Driving via Differentiable Association and Registration

U-ViLAR:基于可微关联和注册的不确定性感知视觉定位

Xiaofan Li, Zhihao Xu, Chenming Wu, Zhao Yang, Yumeng Zhang, Jiang-Jiang Liu, Haibao Yu, Fan Duan, Xiaoqing Ye, Yuan Wang, Shirui Li, Xun Sun, Ji Wan, Jun Wang

机构 * Baidu Inc.(百度公司)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 U-ViLAR通过可微关联和注册方法,提升自动驾驶中视觉定位的鲁棒性和精度,实验表明其在多种定位任务中表现优异。

Comments Vision Localization, Autonomous Driving, Bird's-Eye-View

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09520 2026-04-27 q-bio.NC cs.AI cs.RO 62%

How attention simplifies mental representations for planning

注意力如何简化心理表征以促进规划

Jason da Silva Castanheira, Nicholas Shea, Stephen M. Fleming

机构 * Department of Experimental Psychology, University College London(伦敦大学实验心理学系) Institute of Philosophy, School of Advanced Study, University of London(伦敦大学哲学研究所) Max Planck UCL Centre for Computational Psychiatry and Ageing Research, University College London(伦敦大学Max Planck UCL计算精神病学与衰老研究中心) Canadian Institute for Advanced Research (CIFAR), Brain, Mind and Consciousness Program(加拿大高级研究研究院(CIFAR)脑、心智与意识项目)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 研究探讨了空间注意力如何影响心理表征的简化过程,发现注意力的自然轮廓能提升规划效率,且个体差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21291 2026-04-24 cs.CV cs.AI 62%

Exploring the Role of Synthetic Data Augmentation in Controllable Human-Centric Video Generation

探索合成数据增强在可控人类中心视频生成中的作用

Yuanchen Fei, Yude Zou, Zejian Kang, Ming Li, Jiaying Zhou, Xiangru Huang

机构 * Hunan University(湖南大学) Westlake University(西湖大学) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Sun Yat-Sen University(中山大学)

专题命中 具身导航 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 本文研究合成数据对可控人类视频生成的影响,提出基于扩散的框架实现细粒度控制,并通过实验揭示合成与真实数据的互补作用,为高效选择合成样本提升视频真实感提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08277 2026-04-24 cs.RO cs.LG 62%

X-IONet: Cross-Platform Inertial Odometry Network for Pedestrian and Legged Robot

X-IONet:跨平台惯性里程计网络用于行人和四足机器人

Dehan Shen, Changhao Chen

机构 * Intelligent Transportation Thrust, The Hong Kong University of Science and Technology (Guangzhou)(科技大学(广州)智能交通研究组) Intelligent Transportation Thrust and Artificial Intelligence Thrust, The Hong Kong University of Science and Technology (Guangzhou)(科技大学(广州)智能交通研究组和人工智能研究组) Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(科技大学新兴交叉领域研究部)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 X-IONet通过单IMU实现跨平台惯性里程计,采用规则专家选择模块和双阶段注意力架构,提升四足机器人和行人导航的精度与鲁棒性。

Comments RA-L Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18627 2026-04-22 cs.CV cs.RO 62%

Vision-Based Human Awareness Estimation for Enhanced Safety and Efficiency of AMRs in Industrial Warehouses

基于视觉的人类意识估计以提高工业仓库中自主移动机器人(AMRs)的安全性和效率

Maximilian Haug, Christian Stippel, Lukas Pscherer, Benjamin Schwendinger, Ralph Hoch, Angel Gaydarov, Sebastian Schlund, Thilo Sauter

机构 * Fraunhofer Austria Research GmbH(弗劳恩霍夫奥地利研究有限公司) Computer Vision Lab(计算机视觉实验室) Digital Factory Vorarlberg GmbH(数字工厂沃尔夫斯堡有限公司) Institute of Computer Technology(计算机技术研究所)

专题命中 具身导航 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种实时视觉方法,利用单个RGB摄像头估计AMR的人类意识,通过3D人体姿态提升和头部姿态估计确定人类位置和视线锥,从而判断人类是否意识到AMR,提升工业环境中的安全性和效率。

Comments 5 pages, 2 figures

Journal ref 2025 IEEE 30th International Conference on Emerging Technologies and Factory Automation (ETFA), Porto, Portugal, 1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09775 2026-04-22 cs.AR cs.AI cs.DC cs.LG 62%

MIST: A Co-Design Framework for Heterogeneous, Multi-Stage LLM Inference

MIST:一种用于异构、多阶段LLM推理的联合设计框架

Abhimanyu Rajeshkumar Bambhaniya, Hanjiang Wu, Suvinay Subramanian, Sudarshan Srinivasan, Souvik Kundu, Amir Yazdanbakhsh, Midhilesh Elavazhagan, Madhu Kumar, Minlan Yu, Arijit Raychowdhury, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Google(谷歌) Intel(英特尔) Intel Labs(英特尔实验室) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学) Infravana

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 MIST是一种用于异构、多阶段LLM推理的联合设计框架,通过模拟不同请求阶段和复杂硬件层次,优化硬件-软件协同设计,解决LLM推理中的配置空间导航和跨厂商PD配置问题。

Comments Inference System Design for Multi-Stage AI Inference Pipelines. 11 Pages, 10 Figues, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18126 2026-04-21 cs.RO cs.CV 62%

Chatting about Conditional Trajectory Prediction

关于条件轨迹预测的讨论

Yuxiang Zhao, Wei Huang, Haipeng Zeng, Huan Zhao, Yujie Song

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团)

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出CiT方法,通过跨时间域意图交互实现轨迹预测,结合自身运动与社交交互信息,提升预测精度并集成机器人运动规划模块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17846 2026-04-21 cs.CV cs.AI 62%

AI Approach for MRI-only Full-Spine Vertebral Segmentation and 3D Reconstruction in Paediatric Scoliosis

基于AI的MRI-only全脊柱椎体分割及3D重建在儿童脊柱侧弯中的应用

Nathasha Naranpanawa, Maree T. Izatt, Robert D. Labrom, Geoffrey N. Askin, J. Paige Little

机构 * Biomechanics and Spine Research Group, School of Mechanical, Medical, and Process Engineering, Faculty of Engineering, Queensland University of Technology(生物力学与脊柱研究组,机械、医学与过程工程学院,工程学院,昆士兰理工大学) Centre for Biomedical Technologies, School of Mechanical, Medical and Process Engineering, Faculty of Engineering, Queensland University of Technology(生物医学技术中心,机械、医学与过程工程学院,工程学院,昆士兰理工大学) Orthopaedics Department, Queensland Children’s Hospital(骨科部门,昆士兰儿童医院)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出一种AI框架,通过GAN将低剂量CT转换为MRI图像,结合已有MRI数据训练U-Net模型,实现全脊柱3D重建,提升分割精度并缩短处理时间,支持无辐射的脊柱侧弯评估。

Comments Presented at 2026 Spine Society of Australia 37th Annual Scientific Meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02008 2026-04-21 cs.LG cs.AI 62%

Temporal Representations for Exploration: Learning Complex Exploratory Behavior without Extrinsic Rewards

时间表示用于探索:在没有外在奖励的情况下学习复杂探索行为

Faisal Mohamed, Catherine Ji, Benjamin Eysenbach, Glen Berseth

机构 * Mila-Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Princeton University(普林斯顿大学)

专题命中 具身导航 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于时间对比表示的探索方法,通过优先选择不可预测未来结果的状态,实现复杂探索行为的学习,无需外在奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19237 2026-04-21 cs.AI cs.RO 62%

Sensorimotor Self-Recognition in Multimodal Large Language Model-Driven Robots

多模态大语言模型驱动机器人中的躯体自我识别

Iñaki Dellibarda Varela, Pablo Romero-Sorozabal, Diego Torricelli, Gabriel Delgado-Oleas, Jose Ignacio Serrano, Maria Dolores del Castillo Sobrino, Eduardo Rocon, Manuel Cebrian

机构 * Center for Automation and Robotics(自动化与机器人中心) University of Azuay(阿祖亚大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文研究多模态大语言模型通过躯体运动经验发展自我识别能力,展示机器人在环境感知、自我识别和预测意识方面的表现,揭示感觉整合对最小自我的影响及记忆协调机制。

Comments 16 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10261 2026-04-20 cs.AI cs.CL cs.LG 62%

The Amazing Agent Race: Strong Tool Users, Weak Navigators

令人惊叹的智能体竞赛:强大的工具使用者,薄弱的导航者

Zae Myung Kim, Dongseok Lee, Jaehyung Kim, Vipul Raheja, Dongyeop Kang

机构 * University of Minnesota Twin Cities(明尼苏达大学双城分校) Yonsei University(延世大学) Grammarly

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AAR基准测试,通过有向无环图谜题评估智能体的导航与工具使用能力,发现线性基准无法检测到导航失误问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13248 2026-04-16 cs.RO cs.AI 62%

GeoVision-Enabled Digital Twin for Hybrid Autonomous-Teleoperated Medical Responses

基于GeoVision的混合自主-远程医疗响应数字孪生

Parham Kebria, Soheil Sabri, Laura J Brattain

机构 * Electrical and Computer Engineering / North Carolina A\&T State University / Greensboro, USA(电气与计算机工程 / 北卡罗来纳A&T州立大学 / 格里诺伯格,美国) Urban Digital Twin Lab, School of Modeling Simulation and Training / University of Central Florida / Orlando, USA(城市数字孪生实验室,建模模拟与培训学院 / 中央佛罗里达大学 / 奥兰多,美国) Department of Internal Medicine / College of Medicine, University of Central Florida / Orlando, USA(内科学系 / 医学院,中央佛罗里达大学 / 奥兰多,美国)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于GeoVision的混合自主-远程医疗响应数字孪生架构,通过实时同步的数字孪生系统提升医疗响应的 situational awareness 和决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14755 2026-04-16 cs.RO cs.LG cs.SY eess.SY 62%

Robust Verification of Controllers under State Uncertainty via Hamilton-Jacobi Reachability Analysis

通过汉密尔顿-雅可比可达性分析实现感知控制器的鲁棒验证

Albert Lin, Alessandro Pinto, Somil Bansal

机构 * Stanford University(斯坦福大学) NASA Jet Propulsion Laboratory(美国宇航局喷气推进实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出RoVer-CoRe框架,利用汉密尔顿-雅可比可达性分析对感知系统进行鲁棒验证,通过整合控制器、观测函数和状态估计模块,实现对非线性、非凸、学习驱动等复杂系统的安全性和性能验证。

Comments Accepted to the 8th Annual Learning for Dynamics & Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09533 2026-04-14 cs.CV cs.AI 62%

COXNet: Cross-Layer Fusion with Adaptive Alignment and Scale Integration for RGBT Tiny Object Detection

COXNet:跨层融合与自适应对齐与尺度整合用于RGBT微小目标检测

Peiran Peng, Tingfa Xu, Liqiang Song, Mengqi Zhu, Yuqiang Fang, Jianan Li

机构 * Beijing Institute of Technology(北京理工大学) National Astronomical Observatories, Chinese Academy of Sciences(中国科学院国家天文台) National Key Laboratory of Space Target Awareness, Space Engineering University(航天工程大学空间目标感知全国重点实验室) Key Laboratory of Photoelectronic Imaging Technology and System, Ministry of Education of China(教育部光电成像技术与系统重点实验室) Chongqing Innovation Center, Beijing Institute of Technology(北京理工大学重庆创新中心) China North Vehicle Research Institute(中国北方车辆研究所)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出COXNet框架,通过跨层融合模块、动态对齐与尺度精修模块及优化标签分配策略,提升RGBT多模态微小目标检测的鲁棒性,在RGBTDronePerson数据集上实现3.32%的mAP50提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04564 2026-04-07 cs.RO cs.CV 62%

Visual Prompt Based Reasoning for Offroad Mapping using Multimodal LLMs

基于视觉提示的越野制图推理使用多模态大语言模型

Abdelmoamen Nasser, Yousef Baba'a, Murad Mebrahtu, Nadya Abdel Madjid, Jorge Dias, Majid Khonji

机构 * Khalifa University(哈利法大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种零样本方法,利用SAM2进行环境分割和多模态大语言模型(VLM)进行可行驶区域推理,通过整合分割图像和原始图像实现越野制图推理,无需专门地形模型。

详情

展开后加载摘要…

URL PDF HTML 收藏