arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-01-28 至 2026-01-28 共收录 52 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 6 篇

2601.19752 2026-01-28 cs.AI 57%

Agentic Design Patterns: A System-Theoretic Framework

代理设计模式:一种系统理论框架

Minh-Dung Dao, Quy Minh Le, Hoang Thanh Lam, Duc-Trong Le, Quoc-Viet Pham, Barry O'Sullivan, Hoang D. Nguyen

机构 * University College Cork Vietnam National University(越南国家大学) IBM Research Ireland(IBM爱尔兰研究) Trinity College Dublin(都柏林三一学院)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出了一种系统理论框架,通过分解代理AI系统为五个核心功能子系统,提出12种代理设计模式,以解决代理设计中的重复问题,提升自主系统的模块化和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11027 2026-01-28 cs.CV 57%

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

Vlaser:具有协同具身推理能力的视觉-语言-动作模型

Ganlin Yang, Tianyi Zhang, Haoran Hao, Weiyun Wang, Yibin Liu, Dehui Wang, Guanzhou Chen, Zijian Cai, Junting Chen, Weijie Su, Wengang Zhou, Yu Qiao, Jifeng Dai, Jiangmiao Pang, Gen Luo, Wenhai Wang, Yao Mu, Zhi Hou

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Fudan University(复旦大学) Tsinghua University(清华大学) NUS(新加坡国立大学) Northeastern University(东北大学) Shenzhen University(深圳大学)

专题命中 具身推理 :embodied agent(abstract);分类 cs.CV

AI总结 Vlaser通过整合高级推理与低级控制,解决了具身推理与VLA策略学习之间的关键差距,在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19819 2026-01-28 gr-qc 50%

Comment on "Multidimensional arrow of time" (arXiv:2601.14134)

对“多维时间之箭”的评论(arXiv:2601.14134)

Andrei Galiautdinov

专题命中 具身推理 :world model(abstract)

AI总结 本文针对Rubin关于时间之箭源于额外维度体积增长的观点,提出"形状动态时间之箭"概念,利用Perelman熵的性质解决体积增长与引力常数观测稳定性之间的矛盾。

Comments Comment on arXiv:2601.14134; 6 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 模仿学习与强化学习 1 篇

2410.11234 2026-01-28 cs.LG cs.AI 62%

Bayes Adaptive Monte Carlo Tree Search for Offline Model-based Reinforcement Learning

贝叶斯自适应蒙特卡洛树搜索用于离线模型驱动强化学习

Jiayu Chen, Le Xu, Wentse Chen, Jeff Schneider

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出贝叶斯自适应蒙特卡洛树搜索算法,用于提升离线模型驱动强化学习的性能,显著优于现有方法。

Comments This paper is accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 人机交互与遥操作 1 篇

2601.19839 2026-01-28 cs.RO cs.AI cs.HC 62%

HARMONI: Multimodal Personalization of Multi-User Human-Robot Interactions with LLMs

HARMONI: 基于大语言模型的多用户人机交互多模态个性化

Jeanne Malécot, Hamed Rahimi, Jeanne Cattoni, Marie Samson, Mouad Abrini, Mahdi Khoramshahi, Maribel Pino, Mohamed Chetouani

机构 * Institut Curie, Université Paris-Saclay(巴黎-萨克勒大学Curie研究所) Institute of Intelligent Systems and Robotics (ISIR), Sorbonne University(索邦大学智能系统与机器人研究所) Assistance Publique – Hôpitaux de Paris (AP-HP), Université Paris Cité(巴黎公共医院(AP-HP)与巴黎城市大学)

专题命中 人机交互与遥操作 :world model(abstract);分类 cs.RO、cs.AI

AI总结 HARMONI通过多模态个性化框架,利用大语言模型提升多用户人机交互的持续个性化和动态适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人数据与评测 12 篇

2601.19406 2026-01-28 cs.RO cs.AI 88%

Sim-and-Human Co-training for Data-Efficient and Generalizable Robotic Manipulation

仿真与人类协同训练用于数据高效且可泛化的机器人操作

Kaipeng Fang, Weiqing Liang, Yuyang Li, Ji Zhang, Pengpeng Zeng, Lianli Gao, Jingkuan Song, Heng Tao Shen

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Southwest Jiaotong University(西南交通大学) Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 SimHum通过结合仿真数据和人类数据,实现了数据高效且可泛化的机器人操作,实验表明其在现实任务中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18923 2026-01-28 cs.RO cs.CV 86%

DeFM: Learning Foundation Representations from Depth for Robotics

DeFM:从深度学习基础表示以供机器人应用

Manthan Patel, Jonas Frey, Mayank Mittal, Fan Yang, Alexander Hansson, Amir Bar, Cesar Cadena, Marco Hutter

机构 * Robotic Systems Lab (RSL), ETH Zurich, Switzerland(苏黎世联邦理工学院机器人系统实验室) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) NVIDIA(NVIDIA公司)

专题命中 机器人数据与评测 :robotics(title);manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 DeFM通过自监督学习从深度图像中学习基础表示,为机器人应用提供强大的泛化能力和仿真到现实的迁移性能。

Comments Under review, 19 pages, 15 Figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19234 2026-01-28 cs.RO 79%

iFAN Ecosystem: A Unified AI, Digital Twin, Cyber-Physical Security, and Robotics Environment for Advanced Nuclear Simulation and Operations

iFAN生态系统:一个统一的AI、数字孪生、网络物理安全和机器人环境,用于高级核模拟和操作

Youndo Do, Chad Meece, Marc Zebrowitz, Spencer Banks, Myeongjun Choi, Xiaoxu Diao, Kai Tan, Michael Doran, Jason Reed, Fan Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人数据与评测 :robotics(title);robotic(abstract);分类 cs.RO

AI总结 iFAN生态系统通过整合AI、数字孪生、网络物理安全和机器人技术,为核模拟和操作提供高保真度的虚拟测试平台,支持自主和网络容错的核操作验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18443 2026-01-28 cs.RO 76%

PneuGelSight: Soft Robotic Vision-Based Proprioception and Tactile Sensing

PneuGelSight:基于视觉的柔性机器人本体感觉与触觉感知

Ruohan Zhang, Uksang Yoo, Yichen Li, Arpit Agarwal, Wenzhen Yuan

机构 * University of Illinois, Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University, USA(卡内基梅隆大学)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO;robotics(comments)

AI总结 PneuGelSight通过内置相机实现高分辨率本体感觉与触觉感知,结合模拟到现实的管道,为柔软机器人提供新颖的传感方法。

Comments 16 pages, 12 figures, International Journal of Robotics Research (accepted), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04056 2026-01-28 cs.RO cs.LG 73%

Problem Space Transformations for Out-of-Distribution Generalisation in Behavioural Cloning

行为克隆中面向分布外泛化的问题空间变换

Kiran Doshi, Marco Bagatella, Stelian Coros

机构 * Department of Computer Science at ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出通过问题空间变换提升行为克隆在分布外泛化中的性能,通过实验验证了姿态等价性和局部性对动作预测的改进作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19484 2026-01-28 cs.CV 70%

Dynamic Worlds, Dynamic Humans: Generating Virtual Human-Scene Interaction Motion in Dynamic Scenes

动态世界,动态人类:生成动态场景中的虚拟人类-场景交互动作

Yin Wang, Zhiying Leng, Haitian Liu, Frederick W. B. Li, Mu Li, Xiaohui Liang

机构 * Beihang University(北航大学) University of Durham(达勒姆大学) State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Zhongguancun Laboratory(中关村实验室)

专题命中 机器人数据与评测 :navigation(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出Dyn-HSI架构,通过动态视觉导航、分层经验记忆和人-场景交互扩散模型,生成高质量的动态场景中人-场景交互动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09110 2026-01-28 cs.CV cs.AI 62%

Synthetic Object Compositions for Scalable and Accurate Learning in Detection, Segmentation, and Grounding

合成对象组合用于检测、分割和接地任务中的可扩展和准确学习

Weikai Huang, Jieyu Zhang, Taoyang Jia, Chenhao Zheng, Ziqi Gao, Jae Sung Park, Winson Han, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 合成对象组合(SOC)通过新的以对象为中心的组合策略,实现了准确且可扩展的数据合成流程,提升了检测、分割和接地任务的性能,尤其在低数据和封闭词汇场景中表现突出。

Comments Project website: https://github.com/weikaih04/Synthetic-Detection-Segmentation-Grounding-Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19514 2026-01-28 cs.RO 61%

PALM: Enhanced Generalizability for Local Visuomotor Policies via Perception Alignment

PALM:通过感知对齐提升局部视觉-运动策略的泛化能力

Ruiyu Wang, Zheyu Zhuang, Danica Kragic, Florian T. Pokorny

机构 * Division of Robotics, Perception and Learning, KTH Royal Institute of Technology(机器人、感知与学习系,皇家理工学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO;robotics(journal_ref)

AI总结 PALM通过感知对齐提升局部视觉-运动策略的泛化能力,有效减少非分布条件下的性能下降。

Journal ref IEEE Robotics and Automation Letters 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19048 2026-01-28 cs.CV 57%

NuiWorld: Exploring a Scalable Framework for End-to-End Controllable World Generation

NuiWorld:探索一个可扩展的端到端可控世界生成框架

Han-Hung Lee, Cheng-Yu Yang, Yu-Lun Liu, Angel X. Chang

机构 * Simon Fraser University(西蒙弗雷泽大学) National Yang Ming Chiao Tung University(国家阳明交通大学) Simon Fraser University, CIFAR AI Chair, Amii(西蒙弗雷泽大学、CIFAR人工智能主席、Amii)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 NuiWorld通过生成性自bootstrap策略和可扩展场景生成技术,解决世界生成中的可控性、可扩展性和效率问题,实现端到端可控世界生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21715 2026-01-28 cs.CV 57%

Impact of Underwater Image Enhancement on Feature Matching

水下图像增强对特征匹配的影响

Jason M. Summers, Mark W. Jones

机构 * Department of Computer Science Swansea University(计算机科学系萨瑟兰大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出了一种评估水下图像增强效果的框架,通过分析增强对特征匹配的影响,验证了其在SLAM算法中的实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11003 2026-01-28 cs.CV 57%

ForensicHub: A Unified Benchmark & Codebase for All-Domain Fake Image Detection and Localization

ForensicHub: 一个统一的基准与代码库用于所有领域伪造图像检测与定位

Bo Du, Xuekang Zhu, Xiaochen Ma, Chenfan Qu, Kaiwen Feng, Zhe Yang, Chi-Man Pun, Jian Liu, Ji-Zhe Zhou

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 ForensicHub 提出一个统一的基准与代码库,用于所有领域伪造图像检测与定位,通过模块化架构和配置驱动设计,实现跨领域灵活组合和深入分析。

Comments NeurIPS 2025 DB Track Paper. Code available at: https://github.com/scu-zjz/ForensicHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19202 2026-01-28 cs.CL 50%

Do Images Speak Louder than Words? Investigating the Effect of Textual Misinformation in VLMs

图像胜过言语吗?探讨文本误导在VLMs中的影响

Chi Zhang, Wenxuan Ding, Jiale Liu, Mingrui Wu, Qingyun Wu, Ray Mooney

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Pennsylvania State University(宾夕法尼亚州立大学) New York University(纽约大学) University of Chinese Academy of Sciences(中国科学院大学) AG2ai, Inc.(AG2ai公司)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 研究探讨了文本误导对视觉-语言模型(VLMs)的影响,发现模型易受误导性文本提示影响,导致性能显著下降。

Comments 24 pages, 10 figures. Accepted at EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他机器人 5 篇

2412.05197 2026-01-28 cs.RO 84%

A Riemannian Take on Distance Fields and Geodesic Flows in Robotics

对机器人中距离场和测地线流的黎曼几何方法

Yiming Li, Jiacheng Qiu, Sylvain Calinon

机构 * Idiap Research Institute(Idiap研究机构) École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)

专题命中 其他机器人 :robotics(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于黎曼几何的神经求解器,用于在机器人任务中计算测地线和最短路径,通过无网格隐式表示解决黎曼恩方程,实现对非欧几里得结构的高效建模。

Comments 27 pages, 20 figures. International Journal of Robotics Research (IJRR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19643 2026-01-28 cs.RO 70%

Enhancing Worker Safety in Harbors Using Quadruped Robots

利用四足机器人增强港口工人安全

Zoe Betta, Davide Corongiu, Carmine Tommaso Recchiuto, Antonio Sgorbissa

机构 * Rice Lab, University of Genova(里奇实验室,热那亚大学) RAISE Ecosystem(RAISE生态系统) Autorità di Sistema Portuale del Mar Ligure Occidentale(利古里亚西海岸港口系统管理局)

专题命中 其他机器人 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出利用四足机器人识别港口关键区域并进行检查,以提升港口工人安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19496 2026-01-28 cs.RO 57%

Self-Reconfiguration Planning for Deformable Quadrilateral Modular Robots

可变形四边形模块化机器人的自重构规划

Jie Gu, Hongrun Gao, Zhihao Xia, Yirun Sun, Chunxu Tian, Dan Zhang

机构 * Institute of AI and Robotics, Academy for Engineering & Technology, Fudan University(人工智能与机器人研究所,工程与技术学院,复旦大学) Department of Mechanical Engineering, The Hong Kong Polytechnic University(机械工程系,香港理工大学)

专题命中 其他机器人 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种针对可变形四边形模块化机器人的自重构规划算法,通过虚拟图和依赖性反树实现稳定连接,验证了其在效率和稳定性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13356 2026-01-28 cs.RO 57%

MODUR: A Modular Dual-reconfigurable Robot

MODUR:一种模块化双级可重构机器人

Jie Gu, Tin Lun Lam, Chunxu Tian, Zhihao Xia, Yongheng Xing, Dan Zhang

机构 * Institute of AI and Robotics, Academy for Engineering & Technology, Fudan University(人工智能与机器人研究院,工程与技术学院,复旦大学) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人社会研究院) Department of Mechanical Engineering, The Hong Kong Polytechnic University(机械工程系,香港理工大学)

专题命中 其他机器人 :robotic(abstract);分类 cs.RO

AI总结 MODUR是一种具备双级重构能力的模块化机器人,通过紧凑连接器和剪式连杆组实现模块自我重构与基本运动执行。

Journal ref Proceedings of the 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), pp. 10212-10219

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19036 2026-01-28 cs.GR 50%

The Last Mile to Production Readiness: Physics-Based Motion Refinement for Video-Based Capture

从视频捕获到生产就绪的最后一公里:基于物理的运动细化

Tianxin Tao, Han Liu, Hung Yu Ling

专题命中 其他机器人 :robotics(abstract)

AI总结 本文提出基于物理的运动细化框架,旨在解决视频捕获中物理真实性和生产准备性不足的问题,通过减少手动清理工作提高视觉质量和真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏