arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-11-26 至 2025-11-26 共收录 55 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 12 篇

2511.19451 2025-11-26 eess.SY cs.RO cs.SY 57%

Strong Duality and Dual Ascent Approach to Continuous-Time Chance-Constrained Stochastic Optimal Control

强对偶性与双上升方法在连续时间机会约束随机最优控制中的应用

Apurva Patil, Alfredo Duarte, Fabrizio Bisetti, Takashi Tanaka

机构 * Walker Department of Mechanical Engineering, University of Texas at Austin(德克萨斯大学奥斯汀分校机械工程系)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出了一种基于强对偶性的方法,用于求解连续时间机会约束随机最优控制问题,通过路径积分方法和梯度上升解决对偶问题,并验证了其在移动机器人导航中的有效性。

Comments arXiv admin note: substantial text overlap with arXiv:2504.17154

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19448 2025-11-26 cs.CV 57%

PuzzlePoles: Cylindrical Fiducial Markers Based on the PuzzleBoard Pattern

PuzzlePoles: 基于PuzzleBoard模式的圆柱形标定标记

Juri Zach, Peer Stelldinger

机构 * Faculty of Computer Science and Digital Society(计算机科学与数字社会学院)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 PuzzlePole是一种基于PuzzleBoard模式的圆柱形标定标记,通过独特组合结构实现高精度定位和鲁棒性,适用于机器人导航、SLAM及实体接口等多种自主系统场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16411 2025-11-26 eess.SY cs.SY 50%

A Geometric Perspective on Fusing Gaussian Distributions on Lie Groups

从几何视角融合李群上的高斯分布

Yixiao Ge, Pieter van Goor, Robert Mahony

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出了一种基于几何视角的融合李群上高斯分布的方法,通过指数坐标和平行运输技术实现高效且准确的分布融合。

Comments Preprint for L-CSS

Journal ref IEEE Control Systems Letters, vol. 8, pp. 844-849, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 4 篇

2506.17967 2025-11-26 cs.LG cs.AI cs.CV 85%

Adapting Vision-Language Models for Evaluating World Models

为世界模型评估适应视觉-语言模型

Mariya Hendriksen, Tabish Rashid, David Bignell, Raluca Georgescu, Abdelhak Lemkhenter, Katja Hofmann, Sam Devlin, Sarah Parisot

机构 * University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出UNIVERSE,一种基于视觉-语言模型的视频世界模型评估器,通过适应不同任务格式和数据约束,实现了细粒度、时间敏感的评估,与任务特定检查点性能相当,并在多种环境中验证了其与人类判断的一致性。

Comments NeurIPS LAW 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19654 2025-11-26 cs.CV cs.AI cs.CL cs.RO 82%

From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction

从预测到规划:用于协作状态-动作预测的策略世界模型

Zhida Zhao, Talas Fu, Yifan Wang, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出策略世界模型(PWM),通过整合世界建模与轨迹规划,并利用无动作未来状态预测提升规划性能,实现更可靠的自主驾驶决策。

Comments Accepted by NuerIPS 2025 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20156 2025-11-26 cs.CV cs.RO 81%

Map-World: Masked Action planning and Path-Integral World Model for Autonomous Driving

Map-World: 遮蔽动作规划与路径积分世界模型用于自动驾驶

Bin Hu, Zijian Lu, Haicheng Liao, Chengran Yuan, Bin Rao, Yongkang Li, Guofa Li, Zhiyong Cui, Cheng-zhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) National University of Singapore(新加坡国立大学) Purdue University(普渡大学) Chongqing University(重庆大学) Beihang University(北航大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 MAP-World通过结合遮蔽动作规划和路径加权世界模型,实现了高效的多模式自动驾驶规划,无需强化学习即可达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00188 2025-11-26 cs.AI cs.SY eess.SY q-bio.NC 79%

Influence of the Geometry of the world model on Curiosity Based Exploration

世界模型几何对基于好奇心的探索的影响

Grégoire Sergeant-Perthuis, Nils Ruet, David Rudrauf, Dimitri Ognibene, Yvain Tisserand

机构 * LCQB Sorbonne Université & OURAGAN team, Inria Paris(LCQB 索邦大学及 OURAGAN 团队,巴黎研究所) CIAMS, Université Paris-Saclay, Orsay & Université d’Orléans(CIAMS,巴黎-萨克雷大学,欧塞比及奥尔良大学) Dipartimento di Psicologia, Università Milano-Bicocca(心理学系,米兰-比科卡大学) CISA, University of Geneva(日内瓦大学 CISA)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文研究了世界模型几何结构对智能体好奇心驱动探索行为的影响,通过比较投影群与欧几里得群在知识价值和探索行为中的作用,揭示了几何结构在空间意识中的关键作用。

Journal ref Biol Cybern 119, 4 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 3 篇

2511.18617 2025-11-26 cs.RO cs.CV 62%

AutoFocus-IL: VLM-based Saliency Maps for Data-Efficient Visual Imitation Learning without Extra Human Annotations

AutoFocus-IL:基于视觉语言模型的数据高效视觉模仿学习中的显著性图

Litian Gong, Fatemeh Bahrani, Yutai Zhou, Amin Banayeeanzade, Jiachen Li, Erdem Bıyık

机构 * Department of Electrical and Computer Engineering, University of California, Riverside, USA(电气与计算机工程系,加州大学河滨分校) Thomas Lord Department of Computer Science, University of Southern California, USA(汤姆斯·劳德计算机科学系,南加州大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 AutoFocus-IL通过视觉语言模型自动生成显著性图,提升视觉模仿学习的数据效率和泛化能力,无需额外人类标注。

Comments 8 pages, 6 figures. Code and datasets available at http://autofocus-il.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19528 2025-11-26 cs.RO cs.AI 62%

Discover, Learn, and Reinforce: Scaling Vision-Language-Action Pretraining with Diverse RL-Generated Trajectories

发现、学习与强化:通过多样化强化学习生成轨迹扩展视觉-语言-动作预训练

Rushuai Yang, Zhiyuan Feng, Tianxiang Zhang, Kaixin Wang, Chuheng Zhang, Li Zhao, Xiu Su, Yi Chen, Jiang Bian

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Central South University(中南大学) Microsoft Research(微软研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出DLR框架,通过多样化强化学习生成轨迹,提升VLA预训练的多样性和扩展性,实现更广泛的状态-动作空间覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20018 2025-11-26 cs.NE cs.AI 57%

Energy Costs and Neural Complexity Evolution in Changing Environments

能量成本与神经复杂性在变化环境中的演变

Sian Heesom-Green, Jonathan Shock, Geoff Nitschke

机构 * University of Cape Town(开普敦大学) INRS Montreal(蒙特利尔INRS) NiTheCS

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

AI总结 本研究通过演进人工神经网络探讨环境变化和能量成本如何影响神经复杂性进化,发现高季节性环境限制大脑大小,支持昂贵大脑假说。

Comments Presented at ALIFE 2025, proceedings forthcoming (MIT Press)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 人机交互与遥操作 3 篇

2511.20570 2025-11-26 cs.RO cs.AI cs.HC cs.LG 83%

Gated Uncertainty-Aware Runtime Dual Invariants for Neural Signal-Controlled Robotics

门控不确定性感知的实时双不变量框架用于神经信号控制的机器人

Tasha Kim, Oiwi Parker Jones

机构 * Oxford Robotics Institute (ORI)(牛津机器人研究所) Department of Engineering Science(工程科学系) University of Oxford(牛津大学)

专题命中 人机交互与遥操作 :robotics(title,abstract);分类 cs.RO、cs.AI、cs.LG;robotic(comments)

AI总结 GUARDIAN通过结合校准置信度的脑信号解码与符号目标接地和双层运行时监控,实现神经信号控制机器人系统的高安全性和可靠性。

Comments Embodied and Safe-Assured Robotic Systems workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20299 2025-11-26 cs.RO cs.HC 70%

How Robot Kinematics Influence Human Performance in Virtual Robot-to-Human Handover Tasks

机器人运动学如何影响虚拟机器人到人类交接任务中的人类表现

Róisín Keenan, Joost C. Dessing

专题命中 人机交互与遥操作 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究通过虚拟现实探讨机器人运动学对人类在交接任务中的表现影响,发现机器人提供早期视觉信息和人类样式的轨迹能提升交互准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09621 2025-11-26 cs.RO cs.AI cs.LG 67%

Interpretable Robot Control via Structured Behavior Trees and Large Language Models

通过结构化行为树和大语言模型实现可解释的机器人控制

Ingrid Maéva Chekam, Ines Pastor-Martinez, Ali Tourani, Jose Andres Millan-Romera, Laura Ribeiro, Pedro Miguel Bastos Soares, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group (ARG), Interdisciplinary Centre for Security, Reliability, and Trust (SnT), University of Luxembourg(自动化与机器人研究组(ARG)、安全、可靠性与信任跨学科中心(SnT)、卢森堡大学)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出结合大语言模型与结构化行为树的方法,实现机器人对自然语言指令的可解释执行,提升人机交互的实用性与适应性。

Comments 15 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 10 篇

2509.26536 2025-11-26 cs.CL cs.AI cs.CV cs.LG cs.RO 85%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 机器人数据与评测 :embodied agent(title,abstract);embodied AI(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20226 2025-11-26 cs.RO 79%

Toward generic control for soft robotic systems

面向通用控制的软机器人系统

Yu Sun, Yaosheng Deng, Wenjie Mei, Xiaogang Xiong, Yang Bai, Masaki Ogura, Zeyu Zhou, Mir Feroskhan, Michael Yu Wang, Qiyang Zuo, Yao Li, Yunjiang Lou

机构 * Shenzhen Key Lab of Advanced Motion Control Technology and Modern Automation Equipment(深圳先进运动控制技术及现代自动化装备重点实验室) School of Intelligence Science and Engineering(智能科学与工程学院) College of Artificial Intelligence(人工智能学院) Harbin Institute of Technology(哈尔滨工业大学) School of Mechanical and Aerospace Engineering(机械与航空航天工程学院) Nanyang Technological University(南洋理工大学) School of Robotics and Automation(机器人与自动化学院) Nanjing University(南京大学) School of Advanced Engineering(先进工程学院) Great Bay University(大贝大学) Center for Precision Engineering(精密工程中心) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)

专题命中 机器人数据与评测 :robotic(title);robotics(abstract);分类 cs.RO

AI总结 本文提出了一种基于控制顺应性的通用软机器人控制框架,通过模仿人类运动控制原理,实现了稳定、安全且跨平台可转移的行为,为统一软机器人控制提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19647 2025-11-26 cs.RO cs.AI 62%

Robot-Powered Data Flywheels: Deploying Robots in the Wild for Continual Data Collection and Foundation Model Adaptation

机器人驱动的数据飞轮:在真实世界中部署机器人以实现持续的数据收集和基础模型适应

Jennifer Grannen, Michelle Pan, Kenneth Llontop, Cherie Ho, Mark Zolotas, Jeannette Bohg, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Toyota Research Institute(丰田研究机构)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 机器人驱动的数据飞轮通过部署机器人收集真实世界数据,提升基础模型在复杂环境中的适应能力,减少人工干预并提高多语言OCR性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12937 2025-11-26 cs.AI cs.CV 62%

Yanyun-3: Enabling Cross-Platform Strategy Game Operation with Vision-Language Models

Yanyun-3: 通过视觉-语言模型实现跨平台战略游戏操作

Guoyan Wang, Yanyan Huang, Chunlin Chen, Lifeng Wang, Yuxiang Sun

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 Yanyun-3通过整合视觉-语言模型和结构化多模态数据组织,实现了跨平台战略游戏操作的自动化,提升了任务执行效率和泛化能力。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19836 2025-11-26 cs.CV 57%

4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models

4DWorldBench: 一种用于3D/4D世界生成模型的综合评估框架

Yiting Lu, Wei Luo, Peiyan Tu, Haoran Li, Hanxin Zhu, Zihao Yu, Xingrui Wang, Xinyi Chen, Xinge Peng, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Beijing Zhongguancun Academy(北京中关村学院)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 4DWorldBench提出了一种用于评估3D/4D世界生成模型的综合框架,通过四个维度评估模型的感知质量、条件对齐、物理真实性和一致性,支持多模态输入并整合多种评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10068 2025-11-26 cs.CV 57%

Probabilistic Hyper-Graphs using Multiple Randomly Masked Autoencoders for Semi-supervised Multi-modal Multi-task Learning

基于多随机掩码自编码器的概率超图用于半监督多模态多任务学习

Pîrvu Mihai-Cristian, Marius Leordeanu

机构 * Faculty of Automatic Control and Computer Science, Politehnica University of Bucharest(自动化控制与计算机科学系,布加勒斯特理工大学) Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出PHG-MAE模型,结合神经图和掩码自编码器,通过随机掩码多模态数据提升多任务学习性能,并公开了相关工具和数据集。

Comments Submitted to Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03861 2025-11-26 cs.CV 57%

Refinement of Monocular Depth Maps via Multi-View Differentiable Rendering

通过多视角可微渲染细化单目深度图

Laura Fink, Linus Franke, Bernhard Egger, Joachim Keinert, Marc Stamminger

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) Fraunhofer IIS Erlangen(弗劳恩霍夫研究所埃朗根)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出通过多视角可微渲染优化,提升单目深度图的精度与一致性,实现更高质量的深度估计。

Comments 8 pages main paper + 3 pages of references + 6 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19509 2025-11-26 cs.LG 57%

TouchFormer: A Robust Transformer-based Framework for Multimodal Material Perception

TouchFormer: 一种基于变换器的鲁棒多模态材料感知框架

Kailin Lyu, Long Xiao, Jianing Zeng, Junhao Dong, Xuexin Liu, Zhuojun Zou, Haoyue Yang, Lin Shu, Jie Hao

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.LG

AI总结 TouchFormer通过模态自适应门控和注意力机制提升多模态材料感知的鲁棒性,并在细粒度分类任务中实现性能提升。

Comments 9 pages, 7 figures, Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04323 2025-11-26 cs.LG cs.AI cs.RO stat.ML 56%

GRAM: Generalization in Deep RL with a Robust Adaptation Module

GRAM:深度强化学习中的泛化能力与鲁棒适应模块

James Queeney, Xiaoyi Cai, Alexander Schperberg, Radu Corcodel, Mouhacine Benosman, Jonathan P. How

机构 * Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室(MERL)) Massachusetts Institute of Technology(麻省理工学院) Amazon Robotics(亚马逊机器人)

专题命中 机器人数据与评测 :分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 GRAM通过鲁棒适应模块提升深度强化学习在分布内和分布外场景中的泛化能力,通过仿真和机器人实验验证其有效性。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.12963 2025-11-26 q-bio.NC q-bio.QM 50%

Modeling the subjective perspective of consciousness and its role in the control of behaviours

意识的主观视角建模及其在行为控制中的作用

D. Rudrauf, G. Sergeant-Perthuis, O. Belli, Y. Tisserand, G. Di Marzo Serugendo

专题命中 机器人数据与评测 :robotic(abstract)

AI总结 本文提出基于投影意识模型的主观视角建模,揭示其在行为控制中的作用,通过智能体模拟展示适应与非适应性行为的生成。

Journal ref Journal of Theoretical Biology Volume 534, 7 February 2022, 110957

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他机器人 2 篇

2511.20492 2025-11-26 cs.RO cs.IR 79%

Kleinkram: Open Robotic Data Management

Kleinkram:开放机器人数据管理

Cyrill Püntener, Johann Schwabe, Dominique Garmier, Jonas Frey, Marco Hutter

机构 * Robotic Systems Lab, ETH Zurich(苏黎世联邦理工学院机器人系统实验室)

专题命中 其他机器人 :robotic(title,abstract);分类 cs.RO

AI总结 Kleinkram是一个开源系统,用于管理大规模机器人数据集,提供存储、索引、共享以及数据验证和基准测试的功能。

Comments for associated source code, see https://github.com/leggedrobotics/kleinkram

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10973 2025-11-26 cs.RO cond-mat.mtrl-sci 74%

Developing and Validating a High-Throughput Robotic System for the Accelerated Development of Porous Membranes

开发和验证一种高通量机器人系统用于多孔膜的加速开发

Hongchen Wang, Sima Zeinali Danalou, Jiahao Zhu, Kenneth Sulimro, Chaewon Lim, Smita Basak, Aimee Tai, Usan Siriwardana, Jason Hattrick-Simpers, Jay Werber

机构 * Department of Materials Science and Engineering, University of Toronto(材料科学与工程系,多伦多大学) Department of Chemical Engineering, University of Toronto(化学工程系,多伦多大学) Department of Engineering Science, University of Toronto(工程科学系,多伦多大学) Department of Mechanical Engineering, University of Waterloo(机械工程系,滑铁卢大学)

专题命中 其他机器人 :robotic(title);分类 cs.RO

AI总结 本研究提出了一种自动化平台,通过非溶剂诱导相分离技术实现多孔膜的高通量制备与表征,提升实验效率和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏