arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-11-25 至 2025-11-25 共收录 80 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 人机交互与遥操作 2 篇

2511.19396 2025-11-25 cs.SD cs.AI cs.CV 62%

Real-Time Object Tracking with On-Device Deep Learning for Adaptive Beamforming in Dynamic Acoustic Environments

基于设备深度学习的实时目标跟踪用于动态声学环境中的自适应波束成形

Jorge Ortigoso-Narro, Jose A. Belloch, Adrian Amor-Martin, Sandra Roger, Maximo Cobos

机构 * Department of Electronic Technology, Universidad Carlos III de Madrid, Spain(电子技术系,卡洛斯三世大学,西班牙) Department of Signal Theory and Communications, Universidad Carlos III de Madrid, Spain(信号理论与通信系,卡洛斯三世大学,西班牙) Department of Computer Science, Universidad de Valencia, Spain(计算机科学系,瓦伦西亚大学,西班牙)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出了一种结合深度学习跟踪与波束成形的嵌入式系统,用于在动态声学环境中实现精确的声音源定位和定向音频采集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19815 2025-11-25 cs.RO 57%

ReactEMG: Stable, Low-Latency Intent Detection from sEMG via Masked Modeling

ReactEMG: 通过掩码建模实现从sEMG信号稳定、低延迟的意图检测

Runsheng Wang, Xinyue Zhu, Ava Chen, Jingxi Xu, Lauren Winterbottom, Dawn M. Nilsen, Joel Stein, Matei Ciocarlie

机构 * Department of Mechanical Engineering, Columbia University in the City of New York(机械工程系,哥伦比亚大学纽约市分校) Department of Computer Science, Columbia University in the City of New York(计算机科学系,哥伦比亚大学纽约市分校) Department of Rehabilitation and Regenerative Medicine, Columbia University Irving Medical Center(康复与再生医学系,哥伦比亚大学伊万杰琳医学中心)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO

AI总结 ReactEMG通过掩码建模实现从sEMG信号稳定、低延迟的意图检测,适用于可穿戴机器人和假肢系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人数据与评测 13 篇

2511.02162 2025-11-25 cs.RO cs.AI cs.HC 84%

Text to Robotic Assembly of Multi Component Objects using 3D Generative AI and Vision Language Models

通过3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装

Alexander Htet Kyaw, Richa Gupta, Dhruv Shah, Anoop Sinha, Kory Mathewson, Stefanie Pender, Sachin Chitta, Yotto Koga, Faez Ahmed, Lawrence Sass, Randall Davis

机构 * Massachusetts Institute of Technology (MIT)(麻省理工学院) MIT(麻省理工学院) Google DeepMind(谷歌DeepMind) Google, Paradigms of Intelligence(谷歌、范式智能) Autodesk Research(Autodesk研究) MIT Mechanical Engineering(麻省理工学院机械工程系) MIT Architecture(麻省理工学院建筑系) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 机器人数据与评测 :robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出利用3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装,通过多模态推理分解生成网格并优化组件分配。

Comments Accepted to NeurIPS 2025, Conference on Neural Information Processing Systems, Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19430 2025-11-25 cs.CV 79%

Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution

烹饪与清洁同时进行:教授并行任务执行的具身智能体

Dingkang Liang, Cheng Zhang, Xiaopeng Xu, Jianzhong Ju, Zhenbo Luo, Xiang Bai

专题命中 机器人数据与评测 :embodied agent(title);embodied AI(abstract);分类 cs.CV

AI总结 GRANT通过结合语言理解、3D定位和效率优化,实现并行任务调度,提升智能体在复杂环境中的任务执行效率。

Comments Accepted to AAAI 2026 (Oral). The code is available at \url{https://github.com/H-EmbodVis/GRANT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17656 2025-11-25 cs.MA cs.LG cs.RO 73%

Multi-Agent Coordination in Autonomous Vehicle Routing: A Simulation-Based Study of Communication, Memory, and Routing Loops

多智能体在自动驾驶路径规划中的协调:基于仿真的通信、记忆与路径循环研究

KM Khalid Saifullah, Daniel Palmer

机构 * Department of Computer Science(计算机科学系) The College of Wooster(沃斯特学院)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO、cs.LG

AI总结 本研究通过引入对象内存管理(OMM)有效解决了多智能体自动驾驶中的路径循环问题,显著降低了平均旅行时间和等待时间,证明了持久共享内存对动态环境中多智能体协调的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00392 2025-11-25 cs.CV 70%

RefDrone: A Challenging Benchmark for Referring Expression Comprehension in Drone Scenes

RefDrone:一种针对无人机场景中指称表达理解的挑战性基准

Zhichao Sun, Yepeng Liu, Zhiling Su, Huachao Zhu, Yuliang Gu, Yuda Zou, Zelong Liu, Gui-Song Xia, Bo Du, Yongchao Xu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.CV

AI总结 RefDrone提出了一种针对无人机场景中指称表达理解的挑战性基准,通过RDAgent和NGDINO方法提升了多目标和无目标情况下的识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05592 2025-11-25 cs.RO cs.CV cs.LG cs.SY eess.SY 69%

Learning to Drive Anywhere with Model-Based Reannotation

基于模型的重新标注:学习在任何地方驾驶

Noriaki Hirose, Lydia Ignatova, Kyle Stachowicz, Catherine Glossop, Sergey Levine, Dhruv Shah

机构 * Department of Electrical Engineering and Computer Sciences , University of California, Berkeley, CA USA(电气工程与计算机科学系,加州大学伯克利分校) Toyota Motor North America, Inc(丰田北美公司) Department of Electrical and Computer Engineering, Princeton University(电气与计算机工程系,普林斯顿大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV、cs.LG;robotics(journal_ref)

AI总结 本文提出基于模型的重新标注框架,利用被动数据训练出高效导航策略,实现机器人在复杂环境中的长距离稳健导航。

Comments 9 pages, 8 figures, 6 tables

Journal ref IEEE Robotics and Automation Letters 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17664 2025-11-25 cs.LG cs.CV cs.CY 62%

CubeletWorld: A New Abstraction for Scalable 3D Modeling

CubeletWorld: 一种可扩展3D建模的新抽象

Azlaan Mustafa Samad, Hoang H. Nguyen, Lukas Berg, Henrik Müller, Yuan Xue, Daniel Kudenko, Zahra Ahmadi

机构 * L3S Research Center(L3S研究所以) Leibniz University Hannover(汉诺威莱布尼茨大学) University of Tennessee at Chattanooga(田纳西大学查塔努加分校) PLRI Medical Informatics Institute(医学信息学研究所) Hannover Medical School(汉诺威医学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV、cs.LG

AI总结 CubeletWorld通过离散3D网格空间单元实现可扩展的城市建模,提升隐私保护和跨区域通用性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01119 2025-11-25 cs.CV cs.RO 62%

Leverage Cross-Attention for End-to-End Open-Vocabulary Panoptic Reconstruction

利用交叉注意力实现端到端的开放词汇全景重建

Xuan Yu, Yuxuan Xie, Yili Liu, Haojian Lu, Rong Xiong, Yiyi Liao, Yue Wang

机构 * Zhejiang University(浙江大学) Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出PanopticRecon++,通过新颖的交叉注意力机制实现端到端开放词汇全景重建,结合可学习3D高斯和最优线性分配,提升3D和2D分割重建性能。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18983 2025-11-25 cs.CV 57%

UMCL: Unimodal-generated Multimodal Contrastive Learning for Cross-compression-rate Deepfake Detection

UMCL: 单模生成多模对比学习用于跨压缩率深度伪造检测

Ching-Yi Lai, Chih-Yu Jian, Pei-Cheng Chuang, Chia-Ming Lee, Chih-Chung Hsu, Chiou-Ting Hsu, Chia-Wen Lin

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 UMCL通过单模生成多模对比学习,提升跨压缩率深度伪造检测的鲁棒性和准确性。

Comments 24-page manuscript accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02595 2025-11-25 cs.RO 57%

Extremum Seeking Controlled Wiggling for Tactile Insertion

极值寻求控制的触觉插入振动

Levi Burner, Pavan Mantripragada, Gabriele M. Caddeo, Lorenzo Natale, Cornelia Fermüller, Yiannis Aloimonos

机构 * Department of Electrical and Computer Engineering, University of Maryland, College Park(电气与计算机工程系,马里兰大学学院公园分校) Department of Computer Science, University of Maryland, College Park(计算机科学系,马里兰大学学院公园分校) Istituto Italiano di Tecnologia, Via San Quirico, 19 D, Genova, Italy(意大利理工学院,圣奎里科路19D号,热那亚,意大利) University of Maryland Institute for Advanced Computer Studies, University of Maryland, College Park(马里兰大学高级计算机研究 institute)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于触觉反馈的极值寻求控制方法,用于提高机器人插入任务的鲁棒性和成功率。

Comments 8 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18173 2025-11-25 cs.CV 57%

EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses

EgoControl: 通过3D全身姿态实现可控的目视视频生成

Enrico Pallotta, Sina Mokhtarzadeh Azar, Lars Doorenbos, Serdar Ozsoy, Umar Iqbal, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔人工智能与机器学习研究所) NVIDIA(NVIDIA公司)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 EgoControl通过3D全身姿态控制生成高质量的目视视频,实现对动作的精细控制,推动具身AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18088 2025-11-25 cs.RO 57%

A Unified Multi-Dynamics Framework for Perception-Oriented Modeling in Tendon-Driven Continuum Robots

为腱驱动连续机器人感知导向建模设计的统一多动态框架

Ibrahim Alsarraj, Yuhao Wang, Abdalla Swikir, Cesare Stefanini, Dezhen Song, Zhanchi Wang, Ke Wu

机构 * Robotics Department, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed大学人工智能研究院机器人部门) Hefei National Research Center for Physical Sciences at the Microscale, University of Science and Technology of China (USTC)(中国科学技术大学微尺度物理科学国家级研究中心)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种统一的多动态框架,用于腱驱动连续机器人中基于内在动态的感知建模与交互解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13404 2025-11-25 cs.LG 57%

SWIR-LightFusion: Multi-spectral Semantic Fusion of Synthetic SWIR with Thermal IR (LWIR/MWIR) and RGB

SWIR-LightFusion: 多光谱合成SWIR与热红外(LWIR/MWIR)及RGB的语义融合

Muhammad Ishfaq Hussain, Ma Van Linh, Zubia Naz, Unse Fatima, Yeongmin Ko, Moongu Jeon

机构 * GIST(韩国全南大学) Kyungpook National University(庆尚国立大学) KISTI(韩国科学技术院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 本文提出SWIR-LightFusion框架,通过合成SWIR图像融合LWIR、RGB多模态数据,提升恶劣环境下的场景理解能力。

Journal ref Cluster Computing (Springer) as Volume 29, Issue 1, Article 48, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02387 2025-11-25 cs.RO cs.SY eess.SY 57%

RGBSQGrasp: Inferring Local Superquadric Primitives from Single RGB Image for Graspability-Aware Bin Picking

RGBSQGrasp: 从单张RGB图像推断局部超二次曲面原语以实现抓取感知的托盘拾取

Yifeng Xu, Fan Zhu, Ye Li, Sebastian Ren, Xiaonan Huang, Yuhao Chen

机构 * University of Michigan(密歇根大学) University of Waterloo(滑铁卢大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University College London(伦敦大学学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 RGBSQGrasp通过单目RGB图像推断抓取姿态,利用超二次曲面原语提升托盘拾取任务的抓取稳定性和适应性。

Comments 8 pages, 6 figures, IROS2025 RGMCW Best Workshop Paper

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他机器人 5 篇

2511.18293 2025-11-25 cs.RO 79%

AIA-UltraNeRF:Acoustic-Impedance-Aware Neural Radiance Field with Hash Encodings for Robotic Ultrasound Reconstruction and Localization

AIA-UltraNeRF:具有哈希编码的声学阻抗感知神经辐射场用于机器人超声重建与定位

Shuai Zhang, Jingsong Mu, Cancan Zhao, Leiqi Tian, Zhijun Xing, Bo Ouyang, Xiang Li

机构 * School of Management, Hefei University of Technology(合肥工业大学管理学院) First Affiliated Hospital of University of Science and Technology of China(中国科学技术大学第一附属医院) Department of Ultrasound Diagnosis, the Second Xiangya Hospital of Central South University(中南大学湘雅医学院第二医院超声诊断科) Intelligent Ultrasound Division of VINNO Technology Co., Ltd.(VINNO技术有限公司智能超声事业部) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 其他机器人 :robotic(title,abstract);分类 cs.RO

AI总结 AIA-UltraNeRF通过引入声学阻抗感知和哈希编码技术,提升机器人超声重建与定位的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18386 2025-11-25 cs.CV 57%

SegSplat: Feed-forward Gaussian Splatting and Open-Set Semantic Segmentation

SegSplat: 用于快速前馈3D重建与丰富开放词汇语义理解的框架

Peter Siegel, Federico Tombari, Marc Pollefeys, Daniel Barath

机构 * ETH Zürich(苏黎世联邦理工学院) Google(谷歌) Microsoft(微软)

专题命中 其他机器人 :robotic(abstract);分类 cs.CV

AI总结 SegSplat通过单次传递实现高效3D重建与开放集语义分割,无需每场景优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17608 2025-11-25 cs.RO physics.optics 57%

Robot joint characterisation and control using a magneto-optical rotary encoder

使用磁光旋转编码器进行机器人关节特性和控制

Yunlong Guo, John Canning, Zenon Chaczko, Gang-Ding Peng

专题命中 其他机器人 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于磁光效应的旋转编码器,用于高精度机器人关节特性检测与控制,具有高扫速和高分辨率的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17588 2025-11-25 cs.OH cs.ET 50%

Synthesis of mass-spring networks from high-level code descriptions

从高级代码描述合成质量-弹簧网络

Parisa Omidvar, Marc Serra-Garcia

专题命中 其他机器人 :robotic(abstract)

AI总结 本文提出了一种基于代码的合成方法,通过机械描述语言和大语言模型设计具有智能功能的质量-弹簧系统,实现了迷宫穿越机器人和可编程锁的构建。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08395 2025-11-25 cs.AR 50%

DRACO: Co-design for DSP-Efficient Rigid Body Dynamics Accelerator

DRACO:面向DSP高效刚体动力学加速器的协同设计

Xingyu Liu, Jiawei Liang, Yipu Zhang, Linfeng Du, Chaofang Ma, Hui Yu, Jiang Xu, Wei Zhang

专题命中 其他机器人 :robotic(abstract)

AI总结 DRACO通过三种创新设计,实现了高效刚体动力学加速器,显著提升吞吐量和降低延迟,适用于高自由度机器人系统。

详情

展开后加载摘要…

URL PDF HTML 收藏