arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-04 至 2025-12-04 共收录 54 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 6 篇

2512.03400 2025-12-04 cs.LG cs.AI 81%

Better World Models Can Lead to Better Post-Training Performance

更好的世界模型可以导致更好的训练后性能

Prakhar Gupta, Henry Conklin, Sarah-Jane Leslie, Andrew Lee

机构 * University of Michigan(密歇根大学) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过比较不同世界建模策略,发现显式建模能提升Transformer的状态表示质量,从而增强强化学习后训练的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04040 2025-12-04 cs.CV 79%

RELIC: Interactive Video World Model with Long-Horizon Memory

RELIC:具有长时间记忆的交互式视频世界模型

Yicong Hong, Yiqun Mei, Chongjian Ge, Yiran Xu, Yang Zhou, Sai Bi, Yannick Hold-Geoffroy, Mike Roberts, Matthew Fisher, Eli Shechtman, Kalyan Sunkavalli, Feng Liu, Zhengqi Li, Hao Tan

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 RELIC通过统一框架实现长时记忆与实时交互,提升视频世界建模的准确性与稳定性。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03418 2025-12-04 cs.CV cs.HC 57%

YOLOA: Real-Time Affordance Detection via LLM Adapter

YOLOA:通过LLM适配器实现实时的可及性检测

Yuqi Ji, Junjie Ke, Lihuo He, Jun Liu, Kaifan Zhang, Yu-Kun Lai, Guiguang Ding, Xinbo Gao

机构 * School of Electronic Engineering, Xidian University(电子工程学院,西安电子科技大学) School of Software, Tsinghua University(软件学院,清华大学) School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学)

专题命中 具身推理 :embodied AI(abstract);分类 cs.CV

AI总结 YOLOA通过LLM适配器实现实时可及性检测,结合对象检测与可及性学习,取得高精度与高效率的平衡。

Comments 13 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03058 2025-12-04 cs.LG 57%

Dynamical Properties of Tokens in Self-Attention and Effects of Positional Encoding

自注意力机制中令牌的动力学特性及位置编码的影响

Duy-Tung Pham, An The Nguyen, Viet-Hoang Tran, Nhan-Phu Chung, Xin T. Tong, Tan M. Nguyen, Thieu N. Vo

机构 * FPT Software AI Center(FPT软件AI中心) National University of Singapore(国立新加坡大学) Ho Chi Minh University of Economics(胡志明经济大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本文研究了Transformer中令牌的动力学特性,揭示了位置编码对模型性能的影响,并提出了改进方法以缓解收敛问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02457 2025-12-04 cs.CV 57%

Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation

听觉有助于视觉吗?研究音频视频联合去噪用于视频生成

Jianzong Wu, Hao Lian, Dachao Hao, Ye Tian, Qingyu Shi, Biaolong Chen, Hao Jiang, Yunhai Tong

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出通过音频视频联合去噪提升视频生成质量,验证了跨模态训练对构建更物理基础的世界模型的潜力。

Comments Project page at https://jianzongwu.github.io/projects/does-hearing-help-seeing/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人基础模型 1 篇

2512.03913 2025-12-04 cs.RO cs.AI 62%

Hierarchical Vision Language Action Model Using Success and Failure Demonstrations

基于成功与失败示范的分层视觉语言行动模型

Jeongeun Park, Jihwan Yoon, Byungwoo Jeon, Juhan Park, Jinwoo Shin, Namhoon Cho, Kyungjae Lee, Sangdoo Yun, Sungjoon Choi

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Kim Jaechul Graduate School of AI, KAIST(金在拙人工智能研究生院,韩国科学技术院) Department of Aerospace Engineering, Seoul National University(首尔国立大学航空航天工程系) Departmnet of Statistics, Korea University(韩国大学统计系) NAVER AI Lab(NAVER人工智能实验室)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 VINE通过分层强化学习框架,利用失败数据提升视觉语言行动模型的鲁棒性和执行能力。

Comments https://vine-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 5 篇

2512.03556 2025-12-04 cs.RO cs.CV 87%

RoboScape-R: Unified Reward-Observation World Models for Generalizable Robotics Training via RL

RoboScape-R: 通用机器人训练的统一奖励-观测世界模型

Yinzhou Tang, Yu Shang, Yinuo Chen, Bingwen Wei, Xin Zhang, Shu'ang Yu, Liangzhi Shi, Chao Yu, Chen Gao, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 模仿学习与强化学习 :world model(title,abstract);robotics(title);分类 cs.RO、cs.CV

AI总结 RoboScape-R通过统一奖励-观测世界模型提升机器人训练的泛化能力,实现37.5%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16411 2025-12-04 cs.RO cs.LG 84%

The Duality of Generative AI and Reinforcement Learning in Robotics: A Review

生成式人工智能与强化学习在机器人中的双重性:综述

Angelo Moroncelli, Vishal Soni, Marco Forgione, Dario Piga, Blerina Spahiu, Loris Roveda

机构 * SUPSI(瑞士苏黎世联邦理工学院)

专题命中 模仿学习与强化学习 :robotics(title,abstract);embodied AI(abstract);分类 cs.RO、cs.LG

AI总结 本文综述了生成式人工智能与强化学习在机器人中的双重性,探讨了两者的整合方法、挑战及未来研究方向。

Comments Submitted for publication to Information Fusion

Journal ref Information Fusion Volume 129, May 2026, 104003

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03166 2025-12-04 cs.RO cs.CV 81%

Multi-Agent Reinforcement Learning and Real-Time Decision-Making in Robotic Soccer for Virtual Environments

多智能体强化学习与虚拟环境中的实时决策在机器人足球中的应用

Aya Taourirte, Md Sohag Mia

机构 * Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种统一的多智能体强化学习框架,通过分层强化学习和均值场理论,提升了机器人足球中的实时决策与协作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03911 2025-12-04 cs.RO cs.AI cs.LG 75%

Autonomous Reinforcement Learning Robot Control with Intel's Loihi 2 Neuromorphic Hardware

自主强化学习机器人控制与英特尔Loihi 2神经形态硬件

Kenneth Stewart, Roxana Leontie, Samantha Chapin, Joe Hays, Sumit Bam Shrestha, Carl Glen Henshaw

机构 * U.S. Naval Research Laboratory Naval(美国海军研究实验室) Intel Labs(英特尔实验室)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出将强化学习策略转换为神经形态硬件的端到端流程,用于实现低功耗的机器人控制。

Comments Submitted for review at NICE 2026 (Neuro-Inspired Computational Elements) conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03707 2025-12-04 cs.RO 57%

ContactRL: Safe Reinforcement Learning based Motion Planning for Contact based Human Robot Collaboration

ContactRL: 基于接触的人机协作中的安全强化学习运动规划

Sundas Rafat Mulkana, Ronyu Yu, Tanaya Guha, Emma Li

机构 * School of Computing Science, University of Glasgow(计算科学学院,格拉斯哥大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 ContactRL通过力反馈强化学习实现安全高效的物理协作,提升人机协作任务的安全性和效率。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 人机交互与遥操作 1 篇

2512.03945 2025-12-04 cs.HC cs.RO 57%

Classification of User Satisfaction in HRI with Social Signals in the Wild

在真实环境中通过社交信号分类用户满意度

Michael Schiffmann, Sabina Jeschke, Anja Richert

机构 * TH Köln - University of Applied Sciences, Cologne Cobots Lab, Betzdorfer Str. 2, 50679, Germany(TH Köln应用科学大学,科隆Cobots实验室) KI Park e.V. & FAU - Friedrich-Alexander University of Erlangen-Nuremberg(KI Park协会与弗赖堡-埃尔兰根-纽伦堡大学)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO

AI总结 本研究通过分析真实环境中的社交信号,自动分类用户满意度,以提升SIAs的交互性能和用户体验。

Comments 15 pages, 3 figures. This paper has been accepted for publication at ICSR+AI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 7 篇

2509.04018 2025-12-04 cs.RO 70%

FPC-VLA: A Vision-Language-Action Framework with a Supervisor for Failure Prediction and Correction

FPC-VLA:一个带有监督器的视觉-语言-动作框架,用于故障预测和纠正

Yifan Yang, Zhixiang Duan, Tianshi Xie, Fuyu Cao, Pinxi Shen, Peili Song, Piaopiao Jin, Guokang Sun, Shaoqing Xu, Yangwei You, Jingtai Liu

机构 * The Institute of Robotics and Automatic Information System(机器人与自动信息系统研究所) Tianjin Key Laboratory of Intelligent Robotics(智能机器人天津重点实验室) TBI Center, Nankai University, Tianjin 300350, China(南开大学天津中心) Faculty of Robot Science and Engineering, Northeastern University, Shenyang 110819, China(机器人科学与工程学院) The State Key Laboratory of Internet of Things for Smart City(智能城市物联网国家重点实验室) Centre for Artificial Intelligence(人工智能中心) Department of Electromechanical Engineering, University of Macau, Macau SAR, China(机电工程系,澳门大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 FPC-VLA 提出了一种双模型框架,结合视觉-语言-动作模块与监督器,用于预测和纠正机器人操作中的故障,提升了自主系统的可靠性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03210 2025-12-04 cs.CV cs.LG cs.RO 67%

Flux4D: Flow-based Unsupervised 4D Reconstruction

Flux4D: 基于流的无监督4D重建

Jingkang Wang, Henry Che, Yun Chen, Ze Yang, Lily Goli, Sivabalan Manivasagam, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学) UIUC(伊利诺伊大学香槟分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 Flux4D通过无监督学习直接从原始数据中重建大规模动态场景,无需预训练模型或先验知识,实现高效且可扩展的4D重建。

Comments NeurIPS 2025. Project page: https://waabi.ai/flux4d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06963 2025-12-04 cs.LG cs.AI stat.ML 62%

Tree Ensembles for Contextual Bandits

基于树集成的上下文老虎机

Hannes Nilsson, Rikard Johansson, Niklas Åkerblom, Morteza Haghir Chehreghani

机构 * Chalmers University of Technology and University of Gothenburg(查尔姆斯理工大学和哥德堡大学) Volvo Car Corporation(沃尔沃汽车公司)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于树集成的上下文老虎机框架,通过改进不确定性估计方法,在减少遗憾和提升计算效率方面优于传统方法。

Comments The first two authors contributed equally to this work

Journal ref Transactions on Machine Learning Research (TMLR), 2024, https://openreview.net/forum?id=59DCkSGw8S, GitHub: https://github.com/HannesNilsson/tree_ensemble_bandits

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14510 2025-12-04 cs.CV cs.GR cs.LG 62%

Deep-BrownConrady: Prediction of Camera Calibration and Distortion Parameters Using Deep Learning and Synthetic Data

Deep-BrownConrady: 使用深度学习和合成数据预测相机校准和畸变参数

Faiz Muhammad Chaudhry, Jarno Ralli, Jerome Leudet, Fahad Sohrab, Farhad Pakdaman, Pierre Corbani, Moncef Gabbouj

机构 * AILiveSim Ltd.(AILiveSim有限公司) Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通讯科学学院,塔尔基耶大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV、cs.LG

AI总结 本文提出使用深度学习和合成数据预测相机校准和畸变参数,基于ResNet架构的模型在合成数据集上训练,以提升真实场景下的校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03558 2025-12-04 cs.CV cs.CL 57%

CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding

CartoMapQA: 一个评估视觉-语言模型在制图地图理解上的基础基准数据集

Huy Quang Ung, Guillaume Habault, Yasutaka Nishimura, Hao Niu, Roberto Legaspi, Tomoki Oya, Ryoichi Kojima, Masato Taya, Chihiro Ono, Atsunori Minamikawa, Yan Liu

机构 * KDDI Research, Inc.(KDDI研究公司) University of Southern California(南加州大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 CartoMapQA通过问答任务评估视觉-语言模型在制图地图理解上的能力,揭示了模型在地图语义和地理推理方面的不足。

Comments Accepted at SIGSPATIAL 2025 (Best paper candidates), 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12603 2025-12-04 eess.SY cs.SY 50%

European Satellite Benchmark for Control Education and Industrial Training

欧洲卫星基准用于控制教育和工业培训

Francesco Sanfedino, Paolo Iannelli, Daniel Alazard, Émilie Pelletier, Samir Bennani, Bénédicte Girouart

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 本文提出欧洲卫星基准,旨在解决GNC设计在研究与工业实践间的创新差距,通过复杂问题训练工程师并展示先进算法的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03181 2025-12-04 math-ph math.MP 50%

Three-dimensional third medium contact model for hyperelastic contact and pneumatically actuated systems

三维第三介质接触模型用于超弹性接触和气动驱动系统

Bing-Bing Xu, Tianju Xue, Peter Wriggers

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 本文提出一种三维第三介质模型,用于处理超弹性接触和自接触问题,适用于软机器人和柔性机制等应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他机器人 5 篇

2512.03687 2025-12-04 cs.CV 57%

Active Visual Perception: Opportunities and Challenges

主动视觉感知:机遇与挑战

Yian Li, Xiaoyu Guo, Hao Zhang, Shuiwang Li, Xiaowei Dai

机构 * College of Computer Science and Engineering, Guilin University of Technology(桂林理工大学计算机科学与工程学院) New Engineering Industry College, Putian University(莆田大学新工程产业学院)

专题命中 其他机器人 :robotics(abstract);分类 cs.CV

AI总结 本文探讨了主动视觉感知在复杂环境中的应用与挑战,分析了其在机器人、自动驾驶等领域的潜力及面临的实时处理与多模态整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03256 2025-12-04 cs.RO 57%

KALIKO: Kalman-Implicit Koopman Operator Learning For Prediction of Nonlinear Dynamical Systems

KALIKO:基于卡尔曼隐式Koopman算子的学习用于非线性动力系统预测

Albert H. Li, Ivan Dario Jimenez Rodriguez, Joel W. Burdick, Yisong Yue, Aaron D. Ames

机构 * Caltech(加州理工学院)

专题命中 其他机器人 :robotics(abstract);分类 cs.RO

AI总结 KALIKO通过卡尔曼滤波隐式学习高维非线性动态系统,实现高精度预测与稳定控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.00727 2025-12-04 cs.RO 57%

Repeated Robot-Assisted Unilateral Stiffness Perturbations Result in Significant Aftereffects Relevant to Post-Stroke Gait Rehabilitation

重复的机器人辅助单侧刚性扰动会产生显著的后效应,与中风后步态康复相关

Vaughn Chambers, Panagiotis Artemiadis

专题命中 其他机器人 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种通过重复单侧刚性扰动的机器人辅助疗法,以改善中风后步态问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08630 2025-12-04 math.DS math.OC 50%

Data-Driven Stabilisation of Unstable Periodic Orbits of the Three-Body Problem

数据驱动的三体问题不稳定周期轨道稳定化

Owen M. Brook, Jason J. Bramburger, Davide Amato, Urban Fasel

专题命中 其他机器人 :robotics(abstract)

AI总结 本文提出了一种数据驱动方法,通过利用混沌敏感性和局部流形结构,高效稳定三体问题中的不稳定周期轨道。

Comments Small addition to page 12 and minor correction on page 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06049 2025-12-04 math.AT 50%

On the topological complexity of directed parametrized motion planning

有向参数化运动规划的拓扑复杂度

Sutirtha Datta, Navnath Daundkar, Abhishek Sarkar

专题命中 其他机器人 :robotics(abstract)

AI总结 本文研究了有向参数化运动规划的拓扑复杂度,引入了相关概念并探讨了其与拓扑机器人学中其他不变量的关系。

Comments 18 pages, We have added some new remarks and computations

详情

展开后加载摘要…

URL PDF HTML 收藏