arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-01-21 至 2026-01-21 共收录 23 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 23 篇

2507.10672 2026-01-21 cs.RO cs.CV 90%

Vision Language Action Models in Robotic Manipulation: A Systematic Review

视觉语言动作模型在机器人操作中的应用:系统综述

Muhayy Ud Din, Waseem Akram, Lyes Saad Saoud, Jan Rosell, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS), Khalifa University, United Arab Emirates(卡利法大学自主机器人系统中心(KUCARS)、卡利法大学、阿拉伯联合酋长国) Institute of Industrial and Control Engineering (IOC), Universitat Politecnica de Catalunya, Spain(工业与控制工程研究所(IOC)、巴塞罗那技术大学、西班牙)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文综述了视觉语言动作模型在机器人操作中的应用,分析了102个模型、26个数据集和12个模拟平台,探讨了多模态对齐和可扩展预训练等关键挑战。

Comments submitted to annual review in control

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13232 2026-01-21 cs.RO 84%

MATTERIX: toward a digital twin for robotics-assisted chemistry laboratory automation

MATTERIX:迈向机器人辅助化学实验室自动化数字孪生

Kourosh Darvish, Arjun Sohal, Abhijoy Mandal, Hatem Fakhruldeen, Nikola Radulov, Zhengxue Zhou, Satheeshkumar Veeramani, Joshua Choi, Sijie Han, Brayden Zhang, Jeeyeoun Chae, Alex Wright, Yijie Wang, Hossein Darvish, Yuchi Zhao, Gary Tom, Han Hao, Miroslav Bogdanovic, Gabriella Pizzuto, Andrew I. Cooper, Alán Aspuru-Guzik, Florian Shkurti, Animesh Garg

机构 * University of Toronto(多伦多大学) Acceleration Consortium(加速联盟) Vector Institute(向量研究所) University of Liverpool(利物浦大学) University of Salento(萨勒诺大学) NVIDIA Canadian Institute for Advanced Research(NVIDIA加拿大高级研究机构) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人数据与评测 :robotics(title,comments);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 MATTERIX通过多尺度仿真和模块化引擎,实现机器人辅助化学实验室的数字孪生,加速工作流程开发并减少现实实验依赖。

Comments Darvish, K., Sohal, A., Mandal, A. et al. MATTERIX: toward a digital twin for robotics-assisted chemistry laboratory automation. Nat Comput Sci (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13556 2026-01-21 cs.RO 79%

LogicEnvGen: Task-Logic Driven Generation of Diverse Simulated Environments for Embodied AI

LogicEnvGen: 基于任务逻辑的多样化模拟环境生成用于具身AI

Jianan Wang, Siyang Zhang, Bin Li, Juan Chen, Jingtao Qi, Zhuo Zhang, Chen Qian

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室) School of Artifical Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 机器人数据与评测 :embodied AI(title,abstract);分类 cs.RO

AI总结 LogicEnvGen通过任务逻辑驱动生成多样化模拟环境,提升智能体在不同环境中的适应性和鲁棒性评估性能。

Comments 19 pages, 15 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12993 2026-01-21 cs.RO 79%

Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization

Being-H0.5:面向跨躯体泛化的以人为本的机器人学习规模化

Hao Luo, Ye Wang, Wanpeng Zhang, Sipeng Zheng, Ziheng Xi, Chaoyi Xu, Haiweng Xu, Haoqi Yuan, Chi Zhang, Yiqing Wang, Yicheng Feng, Zongqing Lu

机构 * BeingBeyond Team(BeingBeyond 团队)

专题命中 机器人数据与评测 :robot learning(title);robotic(abstract);分类 cs.RO

AI总结 Being-H0.5通过以人为本的学习范式和统一动作空间,实现了在不同机器人平台间的跨躯体泛化,结合混合流框架和流形保持门控,达到模拟和现实中的高性能表现。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12010 2026-01-21 cs.CV 79%

SMc2f: Robust Scenario Mining for Robotic Autonomy from Coarse to Fine

SMc2f: 从粗到细的机器人自主性鲁棒场景挖掘

Yifei Chen, Ross Greer

机构 * Department of Computer Science at Xi’an University of Technology(西安理工大学计算机科学系) department of Computer Science & Engineering at the University of California, Merced(加州大学默塞德分校计算机科学与工程系)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.CV

AI总结 SMc2f通过从粗到细的流程,利用视觉语言模型和文本-轨迹对比学习提升机器人场景挖掘的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11328 2026-01-21 cs.HC 78%

ProjecTA: A Semi-Humanoid Robotic Teaching Assistant with In-Situ Projection for Guided Tours

ProjecTA:一种配备现场投影的半人形教学助手用于导览

Hanqing Zhou, Yichuan Zhang, Zihan Zhang, Wei Zhang, Chao Wang, Pengcheng An

专题命中 机器人数据与评测 :robotic(title,abstract)

AI总结 ProjecTA通过现场投影与手势协调,减少认知负荷并提升学习体验,为移动学习提供新的设计方向。

Comments 35 pages, 12 figures, 2 appendixes, 3 supplementary meterials, to appear at ACM CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12895 2026-01-21 cs.CV cs.LG 76%

TwoHead-SwinFPN: A Unified DL Architecture for Synthetic Manipulation, Detection and Localization in Identity Documents

TwoHead-SwinFPN:一种统一的深度学习架构,用于身份文档中的合成操纵、检测和定位

Chan Naseeb, Adeel Ashraf Cheema, Hassan Sami, Tayyab Afzal, Muhammad Omair, Usman Habib

机构 * IBM Germany(IBM德国分公司) FAST NUCES(FAST努赛斯大学) Askolay Pakistan(Askolay巴基斯坦)

专题命中 机器人数据与评测 :manipulation(title);分类 cs.CV、cs.LG

AI总结 TwoHead-SwinFPN通过双头架构和Swin Transformer结合FPN与Unet解码器,实现身份文档中合成操纵的高效检测与定位,具有高精度和计算效率。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12012 2026-01-21 cs.RO 74%

Model selection and real-time skill assessment for suturing in robotic surgery

机器人手术中缝合技能的模型选择与实时评估

Zhaoyang Jacopo Hu, Alex Ranne, Alaa Eldin Abdelaal, Kiran Bhattacharyya, Etienne Burdet, Allison M. Okamura, Ferdinando Rodriguez y Baena

机构 * Department of Mechanical Engineering, Imperial College London(帝国理工学院机械工程系) Department of Computing, Imperial College London(帝国理工学院计算机系) Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) Intuitive Surgical, Inc.(Intuitive Surgical公司) Department of Bioengineering, Imperial College London(帝国理工学院生物工程系)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO

AI总结 本研究通过多模态深度学习模型实时评估机器人手术缝合技能,证明融合模型在预测准确性上优于单模态模型,并展示了高技能数据对模型泛化能力的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17853 2026-01-21 cs.RO cs.AI 73%

AnyTask: an Automated Task and Data Generation Framework for Advancing Sim-to-Real Policy Learning

AnyTask: 一种用于推进仿真到现实策略学习的任务和数据生成框架

Ran Gong, Xiaohan Zhang, Jinghuan Shang, Maria Vittoria Minniti, Jigarkumar Patel, Valerio Pepe, Riedana Yan, Ahmet Gundogdu, Ivan Kapelyukh, Ali Abbas, Xiaoqiang Yan, Harsh Patel, Laura Herlant, Karl Schmeckpeper

机构 * Robotics and AI Institute(机器人与人工智能研究所)

专题命中 机器人数据与评测 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 AnyTask通过自动化框架结合GPU仿真与基础模型,生成多样化任务和机器人数据,提升仿真到现实策略学习的效率与效果。

Comments 28 pages, 25 figures. The first four authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13801 2026-01-21 cs.RO 70%

HoverAI: An Embodied Aerial Agent for Natural Human-Drone Interaction

HoverAI: 一种用于自然人-无人机交互的具身空中代理

Yuhua Jin, Nikita Kuzmin, Georgii Demianchuk, Mariya Lezina, Fawad Mehboob, Issatay Tokmurziyev, Miguel Altamirano Cabrera, Muhammad Ahsan Mustafa, Dzmitry Tsetserukou

机构 * Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Skolkovo Institute of Science and Technology(斯克尔科沃信息科技研究所)

专题命中 机器人数据与评测 :robotics(abstract);embodied agent(abstract);分类 cs.RO

AI总结 HoverAI通过结合无人机移动、视觉投影和对话式AI,实现了人-无人机自然交互的具身代理,提升了空间感知与社交响应能力。

Comments This paper has been accepted for publication at LBR HRI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12560 2026-01-21 cs.AI cs.MA 70%

Agentic Artificial Intelligence (AI): Architectures, Taxonomies, and Evaluation of Large Language Model Agents

代理型人工智能(AI):架构、分类及大语言模型代理的评估

Arunkumar V, Gangadharan G. R., Rajkumar Buyya

机构 * University College of Engineering, Anna University(安娜大学工程学院) National Institute of Technology Tiruchirappalli(Tiruchirappalli 国家理工学院) School of Computing and Information Systems University of Melbourne(墨尔本大学计算机与信息系统学院)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.AI

AI总结 本文探讨了代理型人工智能的架构、分类及评估,提出统一分类框架,分析从线性推理到原生推理模型的转变,并指出未来研究方向以提升自主系统的可靠性。

Comments 28 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18793 2026-01-21 cs.RO 70%

Genie Centurion: Accelerating Scalable Real-World Robot Training with Human Rewind-and-Refine Guidance

Genie Centurion:通过人类 rewind-and-refine 指导加速可扩展的现实世界机器人训练

Wenhao Wang, Jianheng Song, Chiming Liu, Jiayao Ma, Siyuan Feng, Jingyuan Wang, Yuxin Jiang, Kylin Chen, Sikang Zhan, Yi Wang, Tong Meng, Modi Shi, Xindong He, Guanghui Ren, Yang Yang, Maoqing Yao

专题命中 机器人数据与评测 :robot policy(abstract);robotic(abstract);分类 cs.RO

AI总结 Genie Centurion 通过人类 rewind-and-refine 指导提升现实世界机器人训练效率,实现高任务成功率和低成本数据收集

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13142 2026-01-21 cs.CV cs.AI cs.CL 62%

TVWorld: Foundations for Remote-Control TV Agents

TVWorld: 电视遥控的基石

Zhantao Ma, Quanfeng Lu, Shuai Zhong, Dahai Yu, Ping Luo, Michael K. Ng

机构 * The University of Hong Kong(香港大学) Hong Kong Baptist University(香港 Baptist 大学) TCL Corporate Research (Hong Kong) Co., Ltd(TCL 香港企业研究有限公司)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 TVWorld提出了一种基于图的电视导航抽象,开发了TVWorld-N和TVWorld-G两个基准测试,通过拓扑感知训练框架TVTheseus实现了68.3%的成功率,超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13096 2026-01-21 cs.RO cs.CV 62%

LLM-VLM Fusion Framework for Autonomous Maritime Port Inspection using a Heterogeneous UAV-USV System

基于异构无人机-水下机器人系统的LLM-VLM融合框架用于自主港口检测

Muhayy Ud Din, Waseem Akram, Ahsan B. Bakht, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS)(卡利法大学自主机器人系统中心(KUCARS)) Khalifa University(卡利法大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出基于LLM和VLM的融合框架,利用异构无人机-水下机器人系统实现自主港口检测,通过符号规划与语义检测提升检测效率和安全性。

Comments submitted in AEJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13304 2026-01-21 cs.CV 57%

CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning

CausalSpatial: 一个用于以对象为中心的因果空间推理的基准

Wenxin Ma, Chenlong Wang, Ruisheng Yuan, Hao Chen, Nanru Dai, S. Kevin Zhou, Yijun Yang, Alan Yuille, Jieneng Chen

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 CausalSpatial提出一个基准测试,评估模型在因果空间推理中的能力,揭示当前MLLMs在3D场景中处理‘如果’问题的不足,并提出COW模型以改进基于物理现实的推理。

Comments Code is available: https://github.com/CausalSpatial/CausalSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13250 2026-01-21 cs.RO 57%

Diffusion-based Inverse Model of a Distributed Tactile Sensor for Object Pose Estimation

基于扩散的分布式触觉传感器逆模型用于物体姿态估计

Ante Marić, Giammarco Caroleo, Alessandro Albini, Julius Jankowski, Perla Maiolino, Sylvain Calinon

机构 * Idiap Research Institute(Idiap研究机构) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Oxford Robotics Institute(牛津机器人研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本文提出基于扩散模型的分布式触觉传感器逆模型,用于在无视觉数据情况下提高物体姿态估计的精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10521 2026-01-21 cs.CV 57%

BikeActions: An Open Platform and Benchmark for Cyclist-Centric VRU Action Recognition

BikeActions: 一个面向骑行者的VRU动作识别开放平台和基准

Max A. Buettner, Kanak Mazumder, Luca Koecher, Mario Finkbeiner, Sebastian Niebler, Fabian B. Flohr

机构 * Munich University of Applied Sciences(慕尼黑应用科学大学) Intelligent Vehicles Lab (IVL)(智能车辆实验室)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 BikeActions通过多模态数据集和开放平台,提升骑行者意图识别的准确性和研究的可扩展性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12796 2026-01-21 cs.RO 57%

Contact-Aware Neural Dynamics

接触感知神经动力学

Changwei Jing, Jai Krishna Bandi, Jianglong Ye, Yan Duan, Pieter Abbeel, Xiaolong Wang, Sha Yi

机构 * UC San Diego(圣迭戈大学) Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于接触信息的神经动力学模型,通过利用现实数据改进仿真到现实的对齐,提升状态预测和策略优化的准确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00332 2026-01-21 cs.AI cs.CE 57%

When Hallucination Costs Millions: Benchmarking AI Agents in High-Stakes Adversarial Financial Markets

当幻觉成本百万:在高风险对抗性金融市场中基准测试AI代理

Zeshi Dai, Zimo Peng, Zerui Cheng, Ryan Yihe Li

机构 * Surf AI, Cybertino Lab(Surf AI,Cybertino 实验室) Princeton University(普林斯顿大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 CAIA基准测试揭示了AI在对抗性金融市场中的能力缺口,指出当前模型在面对虚假信息和不可逆决策时表现不佳,强调对抗鲁棒性对可信AI的重要性。

Comments 15 pages, 5 figures, 4 tables; Accepted to AAAI 2026 (AI-4-Finance Workshop - Oral, top 10%); In submission to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00442 2026-01-21 cs.RO cs.SY eess.SY nlin.AO 57%

Decentralised, Self-Organising Drone Swarms using Coupled Oscillators

去中心化且自组织的无人机群使用耦合振荡器

Kevin Quinn, Cormac Molloy, Harun Šiljak

机构 * EEE Department Trinity College Dublin Dublin, Ireland(电子工程系 三一学院都柏林 爱尔兰)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出利用耦合振荡器实现去中心化且自组织的无人机群,提升灵活性和适应性,同时增强弹性和扩展性。

Comments Accepted for 2025 8th International Balkan Conference on Communications and Networking (Balkancom)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13876 2026-01-21 cs.CL 50%

Pedagogical Alignment for Vision-Language-Action Models: A Comprehensive Framework for Data, Architecture, and Evaluation in Education

为视觉-语言-动作模型的教育对齐:一个全面的框架,用于数据、架构和教育中的评估

Unggi Lee, Jahyun Jeong, Sunyoung Shin, Haeun Park, Jeongsu Moon, Youngchang Song, Jaechang Shim, JaeHwan Lee, Yunju Noh, Seungwon Choi, Ahhyun Kim, TaeHyeon Kim, Kyungtae Joo, Taeyeong Kim, Gyeonggeon Lee

机构 * Chosun University(全州大学) Seoul National University(首尔国立大学) Korea Institute for Curriculum and Evaluation(韩国课程评价院) Nanyang Technological University(南洋理工大学)

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 本文提出教育VLA框架,通过四个组件实现轻量级模型的教育对齐,提升科学教育中的任务表现和解释生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12652 2026-01-21 cs.CY 50%

Ethical Risks in Deploying Large Language Models: An Evaluation of Medical Ethics Jailbreaking

大语言模型部署中的伦理风险:医疗伦理“ Jailbreak”评估

Chutian Huang, Dake Cao, Jiacheng Ji, Yunlou Fan, Chengze Yan, Hanhui Xu

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文评估了大语言模型在医疗伦理领域面临的安全风险,发现七种主流模型在对抗测试中表现不一,其中Claude-Sonnet-4-Reasoning表现最稳健,而其他五种模型几乎全部失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11554 2026-01-21 math.OC 50%

A Generalized Waist Problem: Optimality Condition and Algorithm

一般化的腰问题:最优性条件与算法

Triloki Nath, Manohar Choudhary, Ram K. Pandey

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 本文提出了一种一般化的腰问题,通过闭合多边形曲线连接凸集以最小化距离之和,并推导了最优性条件和收敛的投影子梯度下降算法。

详情

展开后加载摘要…

URL PDF HTML 收藏