arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-11-24 至 2025-11-24 共收录 28 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 9 篇

2511.17199 2025-11-24 cs.CV 88%

VLA-4D: Embedding 4D Awareness into Vision-Language-Action Models for SpatioTemporally Coherent Robotic Manipulation

VLA-4D: 将4D意识嵌入视觉-语言-动作模型中以实现时空一致的机器人操作

Hanyu Zhou, Chuanhao Ma, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.CV

AI总结 VLA-4D通过4D意识增强视觉-语言-动作模型,实现时空一致的机器人操作,提升动作执行的空间平滑性和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13428 2025-11-24 cs.RO 83%

VLM-SFD: VLM-Assisted Siamese Flow Diffusion Framework for Dual-Arm Cooperative Manipulation

VLM-SFD:基于视觉语言模型的双臂协作操作Siamese流扩散框架

Jiaming Chen, Yiyu Jiang, Aoshen Huang, Yang Li, Wei Pan

机构 * Department of Computer Science, The University of Manchester(计算机科学系,曼彻斯特大学) School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 VLM-SFD通过双编码器-解码器架构和视觉语言模型,提升双臂协作操作的模仿学习效率与泛化能力。

Comments Accepted by IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19660 2025-11-24 cs.RO cs.SY eess.SY 83%

Perception, Control and Hardware for In-Hand Slip-Aware Object Manipulation with Parallel Grippers

手持滑动感知物体操控的感知、控制与硬件

Gabriel Arslan Waltersson, Yiannis Karayiannidis

机构 * Department of Electrical Engineering, Chalmers University of Technology, Sweden(电气工程系,查尔姆斯理工大学,瑞典) Department of Automatic Control, Lund University, Sweden(自动控制系,隆德大学,瑞典)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于传感器的夹具,用于实现滑动感知的在手操控,通过四个控制器有效提升了对平面物体的操控能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17366 2025-11-24 cs.RO cs.CV 73%

METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model

METIS:多源自体训练用于集成的灵巧视觉-语言-动作模型

Yankai Fu, Ning Chen, Junkai Zhao, Shaozhe Shan, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 METIS通过多源自体训练构建集成的视觉-语言-动作模型,提升灵巧操作的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08636 2025-11-24 cs.LG cs.CV 62%

Birds look like cars: Adversarial analysis of intrinsically interpretable deep learning

鸟类看起来像汽车:对内在可解释深度学习的对抗分析

Hubert Baniecki, Przemyslaw Biecek

机构 * University of Warsaw(华沙大学) Warsaw University of Technology(华沙技术大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 本文研究了内在可解释深度学习模型的对抗性风险,通过原型操纵和后门攻击揭示其不可解释性,并探讨了提升模型鲁棒性和对齐性的必要性。

Comments Accepted by Machine Learning

Journal ref Machine Learning (2025) 114:284

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16709 2025-11-24 cs.CR cs.AI 57%

AutoBackdoor: Automating Backdoor Attacks via LLM Agents

AutoBackdoor: 通过LLM代理自动化后门攻击

Yige Li, Zhe Li, Wei Zhao, Nay Myat Min, Hanxun Huang, Xingjun Ma, Jun Sun

机构 * Singapore Management University(新加坡管理大学) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 AutoBackdoor通过LLM代理自动化后门攻击,实现高效触发器生成和毒化数据构建,验证了对抗防御的脆弱性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16699 2025-11-24 cs.CL cs.AI 57%

Detecting and Steering LLMs' Empathy in Action

检测和引导大语言模型的同理心行为

Juan P. Cadile

机构 * Department of Philosophy University of Rochester(哲学系罗切斯特大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 研究通过对比提示检测和引导大语言模型的同理心行为,发现不同模型在引导效果和鲁棒性上存在差异。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06767 2025-11-24 eess.IV cs.CV 57%

DIMA: DIffusing Motion Artifacts for unsupervised correction in brain MRI images

DIMA: 通过扩散模型实现脑部MRI图像的无监督运动伪影校正

Paolo Angella, Luca Balbi, Fabrizio Ferrando, Paolo Traverso, Rosario Varriale, Vito Paolo Pastore, Matteo Santacesaria

机构 * MaLGa Center, DIMA, University of Genoa(马尔加中心、DIMA、热那亚大学) DIBRIS, University of Genoa(DIBRIS、热那亚大学) Esaote S.p.A.(埃萨奥特公司)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 DIMA通过扩散模型实现脑部MRI图像的无监督运动伪影校正,无需配对数据,具有更好的泛化能力。

Comments 7 pages, 5 figures, 7 tables

Journal ref IEEE Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16811 2025-11-24 cs.CL 50%

From Representation to Enactment: The ABC Framework of the Translating Mind

从表征到实践:翻译心智的ABC框架

Michael Carl, Takanori Mizowaki, Aishvarya Raj, Masaru Yamada, Devi Sri Bandaru, Yuxiang Wei, Xinyue Ren

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出翻译心智的ABC框架,强调翻译是动态整合情感、行为和认知过程的实践活动,而非静态对应操作。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 8 篇

2511.17225 2025-11-24 cs.RO cs.AI cs.CV 85%

TP-MDDN: Task-Preferenced Multi-Demand-Driven Navigation with Autonomous Decision-Making

TP-MDDN:任务优先的多需求驱动导航与自主决策

Shanshan Li, Da Huang, Yu He, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institution(上海创新机构)

专题命中 具身导航 :navigation(title,abstract);embodied AI(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 TP-MDDN通过引入任务优先的多需求驱动导航与自主决策系统,提升复杂任务下的导航性能与环境理解能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17375 2025-11-24 cs.RO cs.GT 80%

Vector Cost Behavioral Planning for Autonomous Robotic Systems with Contemporary Validation Strategies

向量成本行为规划用于自主机器人系统的当代验证策略

Benjamin R. Toaz, Quentin Goss, John Thompson, Seta Boğosyan, Shaunak D. Bopardikar, Mustafa İlhan Akbaş, Metin Gökaşan

机构 * Michigan State University(密歇根州立大学) Embry-Riddle Aeronautical University(艾姆伯-理德航空大学) City College of New York(纽约市立大学) Istanbul Technical University(伊斯坦布尔技术大学)

专题命中 具身导航 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出了一种基于向量成本双矩阵博弈的自主机器人行为规划方法,结合XAI和SEMBAS技术,通过对比标量加权和方法,展示了在多目标优化和敏感性分析中的优越性能。

Comments Technical report associated with submission to Journal of Intelligent & Robotic Systems, currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06182 2025-11-24 cs.RO 79%

OpenVLN: Open-world Aerial Vision-Language Navigation

OpenVLN: 开放世界空中视觉语言导航

Peican Lin, Gan Sun, Chenxi Liu, Fazeng Li, Weihong Ren, Yang Cong

机构 * School of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院) State Key Laboratory of Robotics, Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所机器人重点实验室) State Key Laboratory of Robotics and System, School of Mechanical Engineering and Automation, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)机械工程与自动化学院机器人与系统重点实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 OpenVLN通过强化学习和长视距规划器提升无人机在复杂空中环境中的长视距导航能力。

Comments Content: 8 pages 4 figures, conference paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16805 2025-11-24 cs.HC 78%

Scene Awareness While Using Multiple Navigation Aids in AR Search

在AR搜索中使用多种导航辅助工具的场景意识

Radha Kumaran, You-Jin Kim, Emily Machniak, Shane Dirksen, Junhyung Yoon, Tom Bullock, Barry Giesbrecht, Tobias Höllerer

专题命中 具身导航 :navigation(title,abstract)

AI总结 本研究探讨了在AR搜索中使用多种导航辅助工具对场景意识的影响,发现导航辅助工具的使用会降低物体回忆能力,强调了可适应界面在移动AR中的重要性。

Comments Poster Summary, 2 pages. Presented at the 2025 IEEE International Symposium on Mixed and Augmented Reality (ISMAR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17497 2025-11-24 cs.RO 74%

HALO: High-Altitude Language-Conditioned Monocular Aerial Exploration and Navigation

HALO:高海拔语言条件化单目空中探索与导航

Yuezhan Tao, Dexter Ong, Fernando Cladera, Jason Hughes, Camillo J. Taylor, Pratik Chaudhari, Vijay Kumar

机构 * GRASP Laboratory, University of Pennsylvania(宾夕法尼亚大学GRASP实验室)

专题命中 具身导航 :navigation(title);分类 cs.RO

AI总结 HALO通过单目相机与GPS/IMU实现高海拔环境的实时度量-语义映射与导航,支持多任务自主探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13278 2025-11-24 cs.CV 57%

SF-Recon: Simplification-Free Lightweight Building Reconstruction via 3D Gaussian Splatting

SF-Recon: 无需简化轻量级建筑重建 via 3D 高斯点划法

Zihan Li, Tengfei Wang, Wentian Gan, Hao Zhan, Xin Wang, Zongqian Zhan

机构 * School of Geodesy(测绘学院) Geomatics, Wuhan University, China PR.(测绘学、武汉大学)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 SF-Recon 通过 3D 高斯点划法直接重建轻量级建筑模型,无需后期简化,实现高效且结构忠实的建筑网格生成。

Comments This paper has been submitted to the 2026 ISPRS Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11893 2025-11-24 cs.RO 57%

DynoSAM: Open-Source Smoothing and Mapping Framework for Dynamic SLAM

DynoSAM:动态SLAM的开源平滑与建图框架

Jesse Morris, Yiduo Wang, Mikolaj Kliniewski, Viorela Ila

机构 * Australian Centre For Robotics (ACFR)(澳大利亚机器人中心) School of Aerospace, Mechanical and Mechatronic Engineering (AMME)(航空航天、机械与机电工程学院) University of Sydney(悉尼大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 DynoSAM通过整合动态和静态信息,提供高效的动态SLAM解决方案,实现精确的运动估计和多种下游应用。

Comments 20 pages, 10 figures. Submitted to T-RO Visual SLAM SI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02441 2025-11-24 cond-mat.dis-nn cond-mat.stat-mech math-ph math.MP 50%

On the supra-linear storage in dense networks of grid and place cells

关于网格细胞和位置细胞密集网络中超线性存储的研究

Adriano Barra, Martino S. Centonze, Michela Marra Solazzo, Daniele Tantari

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出一个两层模型,通过位置细胞与网格细胞的相互作用,展示其在三维空间中导航和识别的能力,证明了超线性存储的可行性。

Comments 39 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 2 篇

2511.17481 2025-11-24 cs.CV 79%

Counterfactual World Models via Digital Twin-conditioned Video Diffusion

通过数字孪生条件的视频扩散实现反事实世界模型

Yiqing Shen, Aiza Maksutova, Chenjia Li, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 CWMDT通过构建数字孪生和应用大语言模型,实现反事实世界模型,提升对视频正向模拟的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16567 2025-11-24 cs.CV 57%

POMA-3D: The Point Map Way to 3D Scene Understanding

POMA-3D:点地图方式的3D场景理解

Ye Mao, Weixun Luo, Ranran Huang, Junpeng Jing, Krystian Mikolajczyk

机构 * Imperial College London(伦敦帝国学院)

专题命中 具身推理 :navigation(abstract);分类 cs.CV

AI总结 POMA-3D通过点地图实现3D场景理解,结合自监督学习和多视角对齐策略,提升3D任务表现。

Comments 11 pages, 6 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 1 篇

2511.17304 2025-11-24 q-fin.CP 50%

Law-Strength Frontiers and a No-Free-Lunch Result for Law-Seeking Reinforcement Learning on Volatility Law Manifolds

法律强度前沿与在波动率法律流形上寻求法律的强化学习的无免费午餐结果

Jian'an Zhang

专题命中 模仿学习与强化学习 :world model(abstract)

AI总结 本文研究了在波动率法律流形上强化学习的法律强度权衡及无免费午餐问题,通过实验揭示法律寻求RL在波动率建模中的局限性。

Comments 61 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 2 篇

2511.17401 2025-11-24 cs.RO cs.HC 57%

Feasibility of Embodied Dynamics Based Bayesian Learning for Continuous Pursuit Motion Control of Assistive Mobile Robots in the Built Environment

基于具身动力学的贝叶斯学习在辅助移动机器人连续追击运动控制中的可行性

Xiaoshan Zhou, Carol C. Menassa, Vineet R. Kamat

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO

AI总结 本文提出基于具身动力学的贝叶斯学习方法,有效提升辅助移动机器人在复杂环境中的连续追击运动控制性能。

Comments 37 pages, 9 figures, and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13955 2025-11-24 cs.HC cs.ET 50%

Biologically Inspired Predictive Coding TCN-Transformer for Anticipatory Human-Robot Interaction in Shared Physical Spaces

生物启发的预测编码 TCN-Transformer 用于共享物理空间中的人机交互前瞻性

Xiaoshan Zhou, Carol C. Menassa, Vineet R. Kamat

专题命中 人机交互与遥操作 :navigation(abstract)

AI总结 本研究提出了一种生物启发的 TCN-Transformer 架构,通过解码 EEG 信号预测人类运动意图,实现共享空间中的人机交互前瞻性。

Comments 45 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 5 篇

2408.15511 2025-11-24 cs.RO cs.AI 81%

AeroVerse: UAV-Agent Benchmark Suite for Simulating, Pre-training, Finetuning, and Evaluating Aerospace Embodied World Models

AeroVerse:用于模拟、预训练、微调和评估航空航天具身世界模型的UAV-Agent基准套件

Fanglong Yao, Yuanchang Yue, Youzhi Liu, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology(TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所目标认知与应用技术重点实验室)

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 AeroVerse是一个用于模拟、预训练、微调和评估航空航天具身世界模型的基准套件,包含多个数据集和评估指标,旨在推动航空航天具身智能的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03135 2025-11-24 cs.CV cs.RO 79%

Mask2IV: Interaction-Centric Video Generation via Mask Trajectories

Mask2IV: 通过遮罩轨迹实现以交互为中心的视频生成

Gen Li, Bo Zhao, Jianfei Yang, Laura Sevilla-Lara

专题命中 机器人数据与评测 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 Mask2IV通过遮罩轨迹实现以交互为中心的视频生成,提供灵活的交互控制和高真实感的视频生成。

Comments AAAI 2026. Project page: https://reagan1311.github.io/mask2iv

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08708 2025-11-24 cs.RO cs.AI cs.CV 75%

PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly

PhyBlock:通过3D积木组装实现物理理解和规划的渐进性基准

Liang Ma, Jiajun Wen, Min Lin, Rongtao Xu, Xiwen Liang, Bingqian Lin, Jun Ma, Yongxin Wang, Ziming Wei, Haokun Lin, Mingfei Han, Meng Cao, Bokui Chen, Ivan Laptev, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Shenzhen Campus of Sun Yat-sen University(孙中山大学深圳校区) Spatialtemporal AI(时空人工智能) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 PhyBlock通过3D积木组装任务评估VLMs在物理理解和规划能力,揭示其在复杂任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17269 2025-11-24 cs.CV cs.AI 62%

Range-Edit: Semantic Mask Guided Outdoor LiDAR Scene Editing

Range-Edit: 基于语义掩码的户外激光雷达场景编辑

Suchetan G. Uppur, Hemant Kumar, Vaibhav Kumar

机构 * GeoAI4Cities Lab(GeoAI4Cities实验室) IISER Bhopal(印度比哈尔理工学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 Range-Edit通过语义掩码指导生成高质量的激光雷达点云,提升自动驾驶系统的鲁棒性与泛化能力。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16807 2025-11-24 cs.CV cs.AI 62%

Mesh RAG: Retrieval Augmentation for Autoregressive Mesh Generation

Mesh RAG: 用于自回归网格生成的检索增强

Xiatao Sun, Chen Liang, Qian Wang, Daniel Rakita

机构 * Yale University(耶鲁大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 Mesh RAG通过检索增强方法提升自回归网格生成的效率和质量,实现快速生成与增量编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他机器人 1 篇

2511.16898 2025-11-24 cs.RO cs.SY eess.SY 70%

Single-Pixel Tactile Skin via Compressive Sampling

单像素触觉皮肤 via 压缩采样

Ariel Slepyan, Laura Xing, Rudy Zhang, Nitish Thakor

专题命中 其他机器人 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 单像素触觉皮肤通过压缩采样实现高效触觉信息重建,支持自适应重建和快速接触定位,适用于机器人和人机接口的大规模触觉智能。

Comments 24 pages, 6 main figures, 6 supplemental figures

详情

展开后加载摘要…

URL PDF HTML 收藏