arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-01-13 至 2026-01-13 共收录 82 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 5 篇

2409.14178 2026-01-13 cs.LG 57%

FlowRL: Flow-Augmented Few-Shot Reinforcement Learning for Semi-Structured Sensor Data

FlowRL: 用于半结构化传感器数据的流增强少样本强化学习

Mohammad Pivezhandi, Abusayeed Saifullah

机构 * Wayne State University(韦恩州立大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 FlowRL 通过生成高质量合成数据提升少样本强化学习的样本效率和策略鲁棒性,有效应用于半结构化传感器数据场景。

Comments 13 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 人机交互与遥操作 2 篇

2601.01705 2026-01-13 cs.RO cs.AI 87%

Explicit World Models for Reliable Human-Robot Collaboration

显式世界模型以实现可靠的人机协作

Kenneth Kwok, Basura Fernando, Qianli Xu, Vigneshwaran Subbaraju, Dongkyu Choi, Boon Kiat Quek

专题命中 人机交互与遥操作 :world model(title,abstract);embodied AI(abstract,comments);embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 本文提出通过构建显式世界模型来实现可靠的显式人机协作,强调动态模糊的人机交互需求。

Comments Accepted to AAAI-26 Bridge Program B10: Making Embodied AI Reliable with Testing and Formal Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03576 2026-01-13 cs.RO cs.AI 62%

Multi-User Personalisation in Human-Robot Interaction: Resolving Preference Conflicts Using Gradual Argumentation

人机交互中的多用户个性化:通过渐进论证解决偏好冲突

Aniol Civit, Antonio Andriella, Carles Sierra, Guillem Alenyà

机构 * Institut de Robòtica i Informàtica Industrial(机器人与信息技术研究所) CSIC-UPC(西班牙国家科研学院-巴塞罗那理工大学) Institut d’Investigació en Intel·ligència Artificial(人工智能研究所) IIIA-CSIC(人工智能研究所-西班牙国家科研学院)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出MUP-QBAF框架,通过渐进论证解决多用户人机交互中的偏好冲突,提供透明且情境敏感的冲突解决方法。

Comments Preprint submitted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人数据与评测 14 篇

2505.18472 2026-01-13 cs.RO 83%

ManiFeel: Benchmarking and Understanding Visuotactile Manipulation Policy Learning

ManiFeel:视觉-触觉操作策略学习的基准测试与理解

Quan Khanh Luu, Pokuang Zhou, Zhengtong Xu, Zhiyuan Zhang, Qiang Qiu, Yu She

机构 * Purdue University(普渡大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 ManiFeel通过提供视觉-触觉操作任务的基准测试,系统研究了监督策略学习,揭示了触觉反馈在提升操作性能中的关键作用,并为未来研究提供了可靠的基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22200 2026-01-13 cs.RO 79%

EnvoDat: A Large-Scale Multisensory Dataset for Robotic Spatial Awareness and Semantic Reasoning in Heterogeneous Environments

EnvoDat:一种大规模多感官数据集,用于机器人空间感知和异构环境中的语义推理

Linus Nwankwo, Bjoern Ellensohn, Vedant Dave, Peter Hofer, Jan Forstner, Marlene Villneuve, Robert Galler, Elmar Rueckert

机构 * Chair of Cyber-Physical System, Montanuniversität Leoben, Austria(智能物理系统系,莱布恩矿业大学,奥地利) Theresianische Militarakademie, Austria(特里西亚军事学院,奥地利) Chair of Subsurface Engineering, Montanuniversität Leoben, Austria(地下工程系,莱布恩矿业大学,奥地利)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 EnvoDat是一个大规模多感官数据集,用于提升机器人在复杂异构环境中的空间感知和语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07375 2026-01-13 cs.CL 78%

GROKE: Vision-Free Navigation Instruction Evaluation via Graph Reasoning on OpenStreetMap

GROKE: 通过OpenStreetMap上的图推理进行无视觉导航指令评估

Farzad Shami, Subhrasankha Dey, Nico Van de Weghe, Henrikki Tenkanen

机构 * Aalto University(阿alto大学) Ghent University(根特大学)

专题命中 机器人数据与评测 :navigation(title,abstract)

AI总结 GROKE提出一种基于OpenStreetMap的无视觉导航指令评估框架,通过图推理和拓扑导航提升评估精度与可扩展性。

Comments Under Review for ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18411 2026-01-13 cs.RO cs.CV 76%

SeePerSea: Multi-modal Perception Dataset of In-water Objects for Autonomous Surface Vehicles

SeePerSea:用于自主水面车辆的水下物体多模态感知数据集

Mingi Jeong, Arihant Chadda, Ziang Ren, Luyang Zhao, Haowen Liu, Monika Roznere, Aiwei Zhang, Yitao Jiang, Sabriel Achong, Samuel Lensgraf, Alberto Quattrini Li

机构 * Department of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) IQT Labs(IQT实验室) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Department of Computer Science, University of Maryland College Park(马里兰大学计算机科学系) The Institute for Human and Machine Cognition and The University of West Florida(人机认知研究所与西佛罗里达大学) School of Computing, Binghamton University(宾夕法尼亚州立大学计算学院)

专题命中 机器人数据与评测 :robotics(abstract,comments);navigation(abstract);分类 cs.RO、cs.CV

AI总结 SeePerSea数据集为自主水面车辆提供多模态水下物体感知数据,通过训练测试现有深度学习算法,推动海洋自主技术发展。

Comments Topic: Special Issue on ICRA 2024 Workshop on Field Robotics

Journal ref IEEE Transactions on Field Robotics 2 (2025) - 737-752

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06451 2026-01-13 cs.RO cs.CV 73%

CulinaryCut-VLAP: A Vision-Language-Action-Physics Framework for Food Cutting via a Force-Aware Material Point Method

CulinaryCut-VLAP:一种用于通过力感知材料点方法进行食物切割的视觉-语言-动作-物理框架

Hyunseo Koh, Chang-Yong Song, Youngjae Choi, Misa Viveiros, David Hyde, Heewon Kim

机构 * Soongsil University(Soongsil大学) Vanderbilt University(范德比大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 CulinaryCut-VLAP通过力感知材料点方法构建视觉-语言-动作-物理框架,实现对食物切割的物理真实模拟与高效训练。

Comments 16 pages; 15 figures; 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07474 2026-01-13 cs.LG cs.AI cs.CV 67%

Task Prototype-Based Knowledge Retrieval for Multi-Task Learning from Partially Annotated Data

基于任务原型的知识检索多任务学习:从部分标注数据中学习

Youngmin Oh, Hyung-Il Kim, Jung Uk Kim

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出基于原型的知识检索框架,通过任务原型嵌入和知识检索变压器实现稳健的多任务学习,适用于部分标注数据场景。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07333 2026-01-13 cs.CV cs.RO 62%

OSCAR: Open-Set CAD Retrieval from a Language Prompt and a Single Image

OSCAR: 从语言提示和单张图像进行开放集CAD检索

Tessa Pulli, Jean-Baptiste Weibel, Peter Hönig, Matthias Hirschmanner, Markus Vincze, Andreas Holzinger

机构 * BOKU University, Human-Centered AI Lab, FTEC, Department for Ecosystem Management, Climate(博乐大学,以人为中心的人工智能实验室,FTEC,生态系统管理部,气候) Institute for Human Centered Computing, Faculty of Informatics(以人为中心的计算研究所,信息学院) Biomedical Engineering, TU Graz, Graz, Austria(生物医学工程,格拉茨技术大学,格拉茨,奥地利)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 OSCAR通过语言提示和单张图像实现开放集CAD检索,无需训练即可在未标记数据库中检索匹配对象模型,提升6D物体姿态估计的自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02905 2026-01-13 cs.RO cs.AI 62%

LOST-3DSG: Lightweight Open-Vocabulary 3D Scene Graphs with Semantic Tracking in Dynamic Environments

LOST-3DSG: 轻量级开放词汇3D场景图在动态环境中的语义跟踪

Sara Micol Ferraina, Michele Brienza, Francesco Argenziano, Emanuele Musumeci, Vincenzo Suriani, Domenico D. Bloisi, Daniele Nardi

机构 * Sapienza University of Rome(萨皮恩扎罗马大学) International University of Rome UNINT(罗马国际大学UNINT)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 LOST-3DSG通过语义跟踪方法实现轻量级开放词汇3D场景图,在动态环境中高效跟踪物体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07558 2026-01-13 cs.RO 57%

FlyCo: Foundation Model-Empowered Drones for Autonomous 3D Structure Scanning in Open-World Environments

FlyCo:基于基础模型的无人机自主3D结构扫描系统

Chen Feng, Guiyong Zheng, Tengkai Zhuang, Yongqian Wu, Fangzhan He, Haojia Li, Juepeng Zheng, Shaojie Shen, Boyu Zhou

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子与计算机工程系) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) Differential Robotics, Hangzhou, China(杭州差分机器人)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 FlyCo通过整合基础模型实现无人机自主3D扫描,提升开放世界环境下的目标定位与预测效率。

Comments 34 pages, 24 figures, 9 tables. Video: https://www.youtube.com/playlist?list=PLqjZjnqsCyl40rw3y15Yzc7Mdo-z1y2j8

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07186 2026-01-13 cs.RO 57%

PROTEA: Securing Robot Task Planning and Execution

PROTEA:保障机器人任务规划与执行的安全性

Zainab Altaweel, Mohaiminul Al Nahian, Jake Juettner, Adnan Siraj Rakin, Shiqi Zhang

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 PROTEA通过LLM-as-a-Judge机制评估机器人任务计划的安全性,解决维度和历史挑战,提升任务规划系统的鲁棒性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06573 2026-01-13 cs.AI cs.MM 57%

QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models

QMAVIS:利用大多模态模型融合实现长视频音频理解

Zixing Lin, Jiale Wang, Gee Wah Ng, Lee Onn Mak, Chan Zhi Yang Jeriel, Jun Yang Lee, Yaohao Li

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI

AI总结 QMAVIS通过融合大型多模态模型、大型语言模型和语音识别模型,实现了长视频音频理解,展示了在VideoMME数据集上38.75%的性能提升,并在其他数据集上表现出竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01753 2026-01-13 cs.RO eess.SP 57%

AgriLiRa4D: A Multi-Sensor UAV Dataset for Robust SLAM in Challenging Agricultural Fields

AgriLiRa4D:一种多传感器无人机数据集,用于在具有挑战性的农业田间实现鲁棒SLAM

Zhihao Zhan, Yuhang Ming, Shaobin Li, Jie Yuan

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) TopXGun Robotics(TopXGun机器人公司) School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 AgriLiRa4D提供多传感器数据集,用于在农业环境中实现鲁棒SLAM,支持多种SLAM研究和评估

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10766 2026-01-13 cs.CV 57%

Expert Consensus-based Video-Based Assessment Tool for Workflow Analysis in Minimally Invasive Colorectal Surgery: Development and Validation of ColoWorkflow

基于专家共识的视频评估工具用于微创结直肠手术的工作流程分析:ColoWorkflow的开发与验证

Pooja P Jain, Pietro Mascagni, Giuseppe Massimiani, Nabani Banik, Marta Goglia, Lorenzo Arboit, Britty Baby, Andrea Balla, Ludovica Baldari, Gianfranco Silecchia, Claudio Fiorillo, CompSurg Colorectal Experts Group, Sergio Alfieri, Salvador Morales-Conde, Deborah S Keller, Luigi Boni, Nicolas Padoy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France(斯特拉斯堡大学,CNRS,INSERM,ICube,UMR7357,法国斯特拉斯堡) Department of Medical-Surgical Sciences and Translational Medicine, Faculty of Medicine and Psychology, Sapienza University of Rome, Italy(医学与外科科学与转化医学系,医学与心理学学院,罗马萨皮恩扎大学,意大利) University Hospital Virgen Macarena, University of Sevilla, Seville, Spain(圣地亚哥医院,塞维利亚大学,西班牙塞维利亚) Department of General and Minimally Invasive Surgery, Fondazione IRCCS Ca' Granda Ospedale Maggiore Policlinico, Milan, Italy(普通外科与微创外科部门,IRCCS卡格拉奥斯皮奇亚诺医院,米兰,意大利) Arizona State University, Tempe, AZ, USA(亚利桑那州立大学,Tempe,美国亚利桑那)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 ColoWorkflow是一种基于专家共识的视频评估工具,用于微创结直肠手术的工作流程分析,通过标准化培训和提升手术质量。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07484 2026-01-13 cs.GR 50%

R3-RECON: Radiance-Field-Free Active Reconstruction via Renderability

R3-RECON:通过可渲染性进行无辐射场主动重建

Xiaofeng Jin, Matteo Frosi, Yiran Guo, Matteo Matteucci

专题命中 机器人数据与评测 :embodied agent(abstract)

AI总结 R3-RECON通过无辐射场的可渲染性场实现高效主动重建,提升新视角质量和3DGS重建精度。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他机器人 5 篇

2507.05979 2026-01-13 cs.RO 79%

AURA-CVC: Autonomous Ultrasound-guided Robotic Assistance for Central Venous Catheterization

AURA-CVC: 自主超声引导的机器人辅助中心静脉置管

Deepak Raina, Lidia Al-Zogbi, Brian Teixeira, Vivek Singh, Ankur Kapoor, Thorsten Fleiter, Muyinatu A. Lediju Bell, Vinciya Pandian, Axel Krieger

机构 * Johns Hopkins University(约翰霍普金斯大学) Siemens Healthineers(西门子医疗) University of Maryland(马里兰大学) Penn State University(宾夕法尼亚州立大学)

专题命中 其他机器人 :robotic(title,abstract);分类 cs.RO

AI总结 AURA-CVC提出了一种自主超声引导的机器人辅助中心静脉置管系统,实现了从扫描初始化到针头插入的全流程自动化,通过深度学习和运动规划技术在高保真度仿真人体上验证,展示了其在临床应用中的潜力。

Comments Accepted in International Journal of Computer Assisted Radiology and Surgery (IJCARS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06508 2026-01-13 cs.RO cs.CV cs.SY eess.SY 73%

Precision Meets Art: Autonomous Multi-UAV System for Large Scale Mural Drawing

精度与艺术:用于大规模壁画绘制的自主多无人机系统

Andrei A. Korigodskii, Artem E. Vasiunik, Georgii A. Varin, Adilia M. Zukhurova, Matvei V. Urvantsev, Semen A. Osipenkov, Igor S. Efremov, Georgii E. Bondar

专题命中 其他机器人 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种自主多无人机系统,用于户外大规模壁画绘制,通过复杂定位系统和新型飞行控制算法实现了高精度和稳定性。

Comments 6 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05512 2026-01-13 cs.CV cs.RO 62%

Quaternion Approximation Networks for Enhanced Image Classification and Oriented Object Detection

四元数近似网络用于增强的图像分类和定向物体检测

Bryce Grant, Peng Wang

机构 * Department of Electrical, Systems and Computer Engineering(电气系统与计算机工程系;凯斯西储大学) Case Western Reserve University(机械与航空航天工程系;凯斯西储大学) Department of Mechanical and Aerospace Engineering, Case Western Reserve University

专题命中 其他机器人 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 QUAN通过四元数代数提升图像分类和物体检测性能,实现旋转等价性和高效计算,适用于机器人感知等资源受限场景。

Comments Accepted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06243 2026-01-13 eess.IV cs.AI cs.CV 62%

Real-Time Image Processing Algorithms for Embedded Systems

嵌入式系统中的实时图像处理算法

Soundes Oumaima Boufaida, Abdemadjid Benmachiche, Majda Maatallah

专题命中 其他机器人 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本研究提出优化的图像处理算法,用于提高嵌入式系统中实时处理的速度和能效,适用于汽车、监控和机器人领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07445 2026-01-13 physics.bio-ph cond-mat.stat-mech physics.comp-ph 50%

Noise enhances odor source localization

噪声增强气味源定位

Francesco Marcolli, Martin James, Agnese Seminara

专题命中 其他机器人 :robotics(abstract)

AI总结 本研究发现湍流中噪声可提升气味源定位准确性,通过优化噪声利用几何结构信息,改进生物和机器人感知系统。

详情

展开后加载摘要…

URL PDF HTML 收藏