arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-02 至 2025-12-02 共收录 21 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 21 篇

2512.01446 2025-12-02 cs.RO 83%

$\mathbf{M^3A}$ Policy: Mutable Material Manipulation Augmentation Policy through Photometric Re-rendering

M³A策略:通过光度重渲染的可变材料操控增强策略

Jiayi Li, Yuxuan Hu, Haoran Geng, Xiangyu Chen, Chuhao Zhou, Ziteng Cui, Jianfei Yang

机构 * Tsinghua University(清华大学) MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室) University of California, Berkeley(加州大学伯克利分校) The University of Tokyo(东京大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 M³A策略通过光度重渲染生成多样化演示,提升机器人跨材料操控的泛化能力。

Comments under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01188 2025-12-02 cs.RO cs.AI cs.LG 80%

Real-World Reinforcement Learning of Active Perception Behaviors

现实世界中主动感知行为的强化学习

Edward S. Hu, Jie Wang, Xingfang Yuan, Fiona Luo, Muyao Li, Gaspard Lambrechts, Oleh Rybkin, Dinesh Jayaraman

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Liège(列日大学) UC Berkeley(伯克利大学)

专题命中 机器人数据与评测 :robot learning(abstract);manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出AAWR方法,通过特权传感器训练高效主动感知策略,提升机器人在部分可观测环境下的任务性能。

Comments NeurIPS 2025 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00076 2025-12-02 cs.RO cs.CV 79%

Arcadia: Toward a Full-Lifecycle Framework for Embodied Lifelong Learning

Arcadia:迈向一个完整的生命周期框架用于具身终身学习

Minghe Gao, Juncheng Li, Yuze Lin, Xuqi Liu, Jiaming Ji, Xiaoran Pan, Zihan Xu, Xian Li, Mingjie Li, Wei Ji, Rong Wei, Rui Tang, Qizhou Wang, Kai Shen, Jun Xiao, Qi Wu, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Unitree Tech(单位树科技) Peking University(北京大学) Nanjing University(南京大学) Manycore Tech(Manycore科技) Bytedance Seed(字节跳动种子) University of Adelaide(阿德莱德大学)

专题命中 机器人数据与评测 :embodied agent(abstract);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.CV

AI总结 Arcadia提出了一种闭环框架,通过紧密耦合四个阶段实现具身终身学习,支持持续改进和端到端泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00069 2025-12-02 cs.RO cs.AI 76%

Enhancing Cognitive Robotics with Commonsense through LLM-Generated Preconditions and Subgoals

通过LLM生成的先决条件和子目标增强认知机器人

Ohad Bachner, Bar Gamliel

专题命中 机器人数据与评测 :robotics(title);分类 cs.RO、cs.AI

AI总结 本研究通过结合大型语言模型与符号规划,利用LLM生成的先决条件和子目标提升机器人任务完成的可靠性与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01061 2025-12-02 cs.RO cs.CV 73%

Opening the Sim-to-Real Door for Humanoid Pixel-to-Action Policy Transfer

为人类oid像素到动作策略转移打开仿真到现实的大门

Haoru Xue, Tairan He, Zi Wang, Qingwei Ben, Wenli Xiao, Zhengyi Luo, Xingye Da, Fernando Castañeda, Guanya Shi, Shankar Sastry, Linxi "Jim" Fan, Yuke Zhu

机构 * NVIDIA UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学) CUHK(香港中文大学)

专题命中 机器人数据与评测 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种基于教师-学生-Bootstrap框架的人形机器人仿真到现实策略转移方法,通过分阶段重置探索策略和GRPO微调程序,实现了在多样化可动物体交互任务中的高效零样本性能。

Comments https://doorman-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07556 2025-12-02 cs.RO cs.MS 72%

Optimization-Driven Design of Monolithic Soft-Rigid Grippers

基于优化的单体软-刚性夹持器设计

Pierluigi Mansueto, Mihai Dragusanu, Anjum Saeed, Monica Malvezzi, Matteo Lapucci, Gionata Salvietti

机构 * Department of Information Engineering University of Florence(信息工程系佛罗伦萨大学) Department of Information Engineering and Mathematics, University of Siena(信息工程与数学系锡耶纳大学) Humanoids & Human Centered Mechatronics, Istituto Italiano di Tecnologia(人形与以人为中心的机电一体化,意大利技术研究所)

专题命中 机器人数据与评测 :robotics(abstract,journal_ref);robotic(abstract);分类 cs.RO

AI总结 本研究提出一种结合快速原型和优化策略的方法,以提高软机器人夹持器的制造效率和现实适应性。

Journal ref Soft Robotics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01754 2025-12-02 eess.SY cs.SY 71%

How to Capture Human Preference: Commissioning of a Robotic Use-Case via Preferential Bayesian Optimisation

如何捕捉人类偏好:通过偏好贝叶斯优化委托一个机器人用例

Sander De Witte, Jeroen Taets, Andras Retzler, Guillaume Crevecoeur, Tom Lefebvre

专题命中 机器人数据与评测 :robotic(title)

AI总结 本文提出通过偏好贝叶斯优化解决机器人任务委托问题,展示其在专家偏好反馈下的有效性,并证明辅助成本函数在决策一致性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00565 2025-12-02 cs.CV cs.AI cs.RO 67%

Describe Anything Anywhere At Any Moment

在任何地方、任何时间描述任何事物

Nicolas Gorlo, Lukas Schmid, Luca Carlone

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 DAAAM是一种用于大规模实时4D场景理解的空间时间记忆框架,通过优化前端和分层4D场景图实现高效语义描述与实时性能的平衡。

Comments 14 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00287 2025-12-02 cs.RO cs.AI cs.CV 67%

RealAppliance: Let High-fidelity Appliance Assets Controllable and Workable as Aligned Real Manuals

RealAppliance: 让高保真家电资产可控且可操作,如对齐的现实手册

Yuzheng Gao, Yuxing Long, Lei Kang, Yuchong Guo, Ziyan Yu, Shangqing Mao, Jiyao Zhang, Ruihai Wu, Dongjiang Li, Hui Shen, Hao Dong

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 RealAppliance通过高保真家电资产和对齐手册的基准测试,推动家电操控技术的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01816 2025-12-02 cs.CV cs.AI 62%

Envision: Benchmarking Unified Understanding & Generation for Causal World Process Insights

Envision:基于因果世界过程洞察的统一理解和生成基准测试

Juanxi Tian, Siyuan Li, Conghui He, Lijun Wu, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV

AI总结 Envision通过因果事件进程基准测试,评估统一模型在动态时空一致性上的表现,揭示其在因果叙事一致性上的优势及仍需改进的时空一致性挑战。

Comments 35 pages, 12 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21053 2025-12-02 cs.RO cs.CV 62%

AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios

AerialMind:迈向无人机场景中的指称多目标跟踪

Chenglizhao Chen, Shaofeng Liang, Runwei Guan, Xiaolou Sun, Haocheng Zhao, Haiyun Jiang, Tao Huang, Henghui Ding, Qing-Long Han

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 AerialMind是首个针对无人机场景的RMOT基准,通过COALA框架和HETrack方法提升无人机的自然语言交互能力与多目标跟踪性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01755 2025-12-02 cs.CV cs.RO 62%

3EED: Ground Everything Everywhere in 3D

3EED: 在三维中万物皆 grounded

Rong Li, Yuhao Dong, Tianshuai Hu, Ao Liang, Youquan Liu, Dongyue Lu, Liang Pan, Lingdong Kong, Junwei Liang, Ziwei Liu

机构 * WorldBench Team(WorldBench团队)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 3EED提出一个大规模多平台多模态三维 grounding 基准测试,通过提供丰富的户外场景数据和跨平台学习技术,推动语言驱动的三维具身感知研究。

Comments NeurIPS 2025 DB Track; 38 pages, 17 figures, 10 tables; Project Page at https://project-3eed.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00080 2025-12-02 cs.CV cs.RO 62%

Conceptual Evaluation of Deep Visual Stereo Odometry for the MARWIN Radiation Monitoring Robot in Accelerator Tunnels

深度视觉立体视觉里程计的概念评估:用于加速器隧道中MARWIN辐射监测机器人的评估

André Dehne, Juri Zach, Peer Stelldinger

机构 * Faculty of Computer Science and Digital Society(计算机科学与数字社会学院) HAW Hamburg(汉堡应用技术大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本文评估了深度视觉立体视觉里程计在加速器隧道中为MARWIN机器人提供自主导航的可能性,通过结合3D几何约束,旨在提高在未知环境中的鲁棒性和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00037 2025-12-02 cs.RO cs.CV 62%

ICD-Net: Inertial Covariance Displacement Network for Drone Visual-Inertial SLAM

ICD-Net:用于无人机视觉-惯性SLAM的惯性协方差位移网络

Tali Orlev Shapira, Itzik Klein

机构 * Hatter Department of Marine Technologies, Charney School of Marine Sciences, University of Haifa(哈特尔海洋技术系,查内海洋科学学院,海法大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 ICD-Net通过学习处理原始惯性数据并生成带有不确定性的位移估计,提升无人机视觉-惯性SLAM的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02009 2025-12-02 cs.CV 57%

AirSim360: A Panoramic Simulation Platform within Drone View

AirSim360:无人机视角下的全景模拟平台

Xian Ge, Yuling Pan, Yuhang Zhang, Xiang Li, Weijun Zhang, Dizhe Zhang, Zhaoliang Wan, Xin Lin, Xiangkai Zhang, Juntao Liang, Jason Li, Wenjie Jiang, Bo Du, Ming-Hsuan Yang, Lu Qi

机构 * Insta360 Research(Insta360研究机构) Wuhan University(武汉大学) University of California, San Diego(加州大学圣地亚哥分校) Nanyang Technological University(南洋理工大学) University of California, Merced(加州大学默塞德分校) Shenzhen University(深圳大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 AirSim360 是一个基于无人机视角的全景模拟平台,通过渲染对齐的数据标注、交互式行人建模和自动轨迹生成,实现全方位场景采样和空间智能研究。

Comments Project Website: https://insta360-research-team.github.io/AirSim360-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01897 2025-12-02 cs.RO cs.SY eess.SY 57%

NeuroHJR: Hamilton-Jacobi Reachability-based Obstacle Avoidance in Complex Environments with Physics-Informed Neural Networks

NeuroHJR: 基于Hamilton-Jacobi可达性的复杂环境障碍物避障方法与物理引导神经网络

Granthik Halder, Rudrashis Majumder, Rakshith M R, Rahi Shah, Suresh Sundaram

机构 * Department of Physical Science, Indian Institute of Science Education and Research(物理科学系,印度科学教育与研究学院) Department of Aerospace Engineering, Indian Institute of Science(航空航天工程系,印度科学研究院) Department of Computer Science and Engineering, Shiv Nadar University(计算机科学与工程系,施瓦斯纳大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 NeuroHJR利用物理引导神经网络近似Hamilton-Jacobi可达性方法,实现复杂环境中高效实时障碍物避障。

Comments Author-accepted version. Accepted at IEEE 11th Indian Control Conference (ICC), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01048 2025-12-02 cs.CV 57%

TRoVe: Discovering Error-Inducing Static Feature Biases in Temporal Vision-Language Models

TRoVe: 发现时间视觉-语言模型中的错误引发静态特征偏差

Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz

机构 * Stanford University(斯坦福大学) HOPPR

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 TRoVe通过识别时间视觉-语言模型中的错误引发静态特征偏差,提升模型在下游任务中的表现。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00752 2025-12-02 cs.CV 57%

Charts Are Not Images: On the Challenges of Scientific Chart Editing

图表不是图像:关于科学图表编辑挑战的探讨

Shawn Li, Ryan Rossi, Sungchul Kim, Sunav Choudhary, Franck Dernoncourt, Puneet Mathur, Zhengzhong Tu, Yue Zhao

机构 * University of Southern California(南加州大学) Adobe Research(Adobe研究院) Texas A&M University(德克萨斯A&M大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出FigEdit基准测试,揭示科学图表编辑中结构转换的重要性,并指出传统像素操作方法的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00547 2025-12-02 cs.CV 57%

Asset-Driven Sematic Reconstruction of Dynamic Scene with Multi-Human-Object Interactions

基于资产的动态场景语义重建与多人类-物体交互

Sandika Biswas, Qianyi Wu, Biplab Banerjee, Hamid Rezatofighi

机构 * Monash University(墨尔本大学) Indian Institute of Technology(印度理工学院)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出混合方法,结合3D生成模型、语义感知变形和GS优化,实现动态场景中多人类-物体交互的高保真重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00022 2025-12-02 cs.RO 57%

XFlowMP: Task-Conditioned Motion Fields for Generative Robot Planning with Schrodinger Bridges

XFlowMP:基于施特林桥的任务条件运动场用于生成式机器人规划

Khang Nguyen, Minh Nhat Vu

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德·本·扎耶德人工智能大学) Automation & Control Institute (ACIN), TU Wien(自动化与控制研究所) Austrian Institute of Technology (AIT) GmbH(奥地利技术研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 XFlowMP通过施特林桥建模任务条件下的运动场,实现生成式机器人规划,提升轨迹平滑度、减少能耗并提高规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01438 2025-12-02 math.OC 50%

Competition among seaports through Mean Field Games and real-world data

通过均场博弈和真实世界数据分析港口间的竞争

Charles-Albert Lehalle, Giulia Livieri

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 本文通过均场博弈模型分析港口间竞争,结合真实数据研究海运流量管理,提出中观尺度模型及参数推断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏