arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-15 至 2025-12-15 共收录 40 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 17 篇

2510.08884 2025-12-15 cs.RO 85%

Model-Based Lookahead Reinforcement Learning for in-hand manipulation

基于模型的 lookahead 强化学习用于手部操作

Alexandre Lopes, Catarina Barata, Plinio Moreno

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种混合强化学习框架,用于提高手部操作任务的性能,通过结合模型无关和模型相关的强化学习方法,以提高任务表现,但增加了计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11275 2025-12-15 cs.RO 83%

Towards Logic-Aware Manipulation: A Knowledge Primitive for VLM-Based Assistants in Smart Manufacturing

面向逻辑感知的操控:一种用于智能制造中基于VLM助手的知识原语

Suchang Chen, Daqiang Guo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种面向智能制造的基于VLM助手的知识原语,通过定义对象为中心的操控-逻辑模式,实现了在制造单元中执行复杂操控任务的逻辑感知和高效规划。

Comments 8 pages, 2 figures, submitted to the 2026 IFAC World Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13847 2025-12-15 cs.RO cs.SY eess.SY 83%

Adaptive Compressive Tactile Subsampling: Enabling High Spatiotemporal Resolution in Scalable Robotic Skin

自适应压缩触觉采样:在可扩展机器人皮肤中实现高时空分辨率

Ariel Slepyan, Dian Li, Hongjun Cai, Ryan McGovern, Aidan Aug, Sriramana Sankar, Trac Tran, Nitish Thakor

专题命中 机器人操作 :robotic(title,abstract);robotics(abstract);分类 cs.RO

AI总结 ACTS通过自适应压缩采样技术,实现高密度触觉感知,提升机器人和可穿戴设备的实时交互与运动控制能力。

Comments 51 pages, 11 main figures, 16 supplemental figures, Videos can be accessed at https://tinyurl.com/ACTS-videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.08492 2025-12-15 cs.RO 83%

SENSORIMOTOR GRAPH: Action-Conditioned Graph Neural Network for Learning Robotic Soft Hand Dynamics

传感器运动图:用于学习机器人柔性手动力学的动作条件图神经网络

João Damião Almeida, Paul Schydlo, Atabak Dehban, José Santos-Victor

专题命中 机器人操作 :robotic(title,abstract);robotics(abstract);分类 cs.RO

AI总结 本文提出了一种基于图神经网络的传感器运动图模型,用于学习机器人柔性手的动力学,通过利用系统的组合性和顺序不变性,提升了动力学预测的准确性与鲁棒性。

Comments Accepted at 2021 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2021)

Journal ref IEEE Int. Conference on Intelligent Robots and Systems (IROS) 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00866 2025-12-15 cs.RO cs.AI 81%

3DSGrasp: 3D Shape-Completion for Robotic Grasp

3DSGrasp:用于机器人抓取的3D形状补全

Seyed S. Mohammadi, Nuno F. Duarte, Dimitris Dimou, Yiming Wang, Matteo Taiana, Pietro Morerio, Atabak Dehban, Plinio Moreno, Alexandre Bernardino, Alessio Del Bue, Jose Santos-Victor

机构 * Vislab, Institute for Systems and Robotics—Lisboa, Instituto Superior Técnico, Universidade de Lisboa, Portugal(葡萄牙里斯本系统与机器人研究所Vislab,理工学院里斯本高等技术大学,里斯本大学) Department of Marine, Electrical, Electronic and Telecommunications Engineering, University of Genoa, Italy(意大利热那亚大学海洋、电气、电子与电信工程系) Pattern Analysis & Computer Vision (PAVIS), Istituto Italiano di Tecnologia (IIT), Genoa, Italy(意大利热那亚理工学院模式分析与计算机视觉(PAVIS)) Deep Visual Learning (DVL), Fondazione Bruno Kessler, Trento, Italy(意大利特伦托布鲁诺·凯瑟基金会深度视觉学习(DVL))

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 3DSGrasp通过基于Transformer的编码器-解码器网络实现3D点云补全,提升机器人抓取的准确性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11287 2025-12-15 physics.app-ph 78%

Monolithic Elastic Metasurface Design for Advanced Wave Manipulation via a Direct Wave-Shaping Topology Optimization Approach

单体弹性超材料设计用于高级波操控的直接波形拓扑优化方法

Chun Min Li, Wenjing Ye

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 本文提出直接波形拓扑优化方法,设计高性能单体弹性超材料,实现高效率波转换、大角度波束控制及高数值孔径金属透镜,显著提升波操控性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21773 2025-12-15 cs.RO 70%

Real-Time QP Solvers: A Concise Review and Practical Guide Towards Legged Robots

实时QP求解器:一种简洁回顾与面向腿部机器人的实用指南

Van Nam Dinh

机构 * Institute of Science and Technology(科技研究院) Vinh University(文大学)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文综述了实时QP求解器,分析了其在腿部机器人中的应用,探讨了不同求解器的性能与适用场景,强调了求解器、任务与硬件之间的协同作用。

Comments 12 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11080 2025-12-15 cs.RO 70%

Taxonomy and Modular Tool System for Versatile and Effective Non-Prehensile Manipulations

多功能高效非握力操作的分类与模块化工具系统

Cedric-Pascal Sommer, Robert J. Wood, Justin Werfel

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种模块化工具系统,用于增强机器人在非握力操作中的多功能性和有效性,适用于航空航天和家庭场景。

Comments 34 pages, 10 figures, 2 tables, supplementary videos: https://youtu.be/Hcefy53PY0M, https://youtu.be/nFF9k91hsfU, https://youtu.be/EulPLskNIZQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05029 2025-12-15 cs.CV 70%

Estimating Object Physical Properties from RGB-D Vision and Depth Robot Sensors Using Deep Learning

基于RGB-D视觉和深度机器人传感器利用深度学习估计物体物理特性

Ricardo Cardoso, Plinio Moreno

机构 * Ricardo Pedreiras Cardoso Plinio Moreno

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出结合深度图像和RGB图像的数据,利用深度学习方法估计物体质量,通过合成数据集提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05861 2025-12-15 cs.RO cs.LG 66%

Communication-Efficient Module-Wise Federated Learning for Grasp Pose Detection in Cluttered Environments

面向杂乱环境抓取姿态检测的通信高效模块式联邦学习

Woonsang Kang, Joohyung Lee, Seungjun Kim, Jungchan Cho, Yoonseon Oh

机构 * Department of Electronic Engineering, Hanyang University(电子工程系,翰阳大学) Department of Computing, Gachon University(计算系,加恩大学) Department of Artificial Intelligence, Hanyang University(人工智能系,翰阳大学)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.LG;robotics(comments)

AI总结 本文提出一种模块式联邦学习框架,通过识别抓取姿态检测模型中收敛较慢的模块,优化通信效率,提升在杂乱环境中的抓取性能。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L). 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01004 2025-12-15 cs.CV cs.AI 62%

MoCA-Video: Motion-Aware Concept Alignment for Consistent Video Editing

MoCA-Video:面向一致视频编辑的运动感知概念对齐

Tong Zhang, Juan C Leon Alcazar, Victor Escorcia, Bernard Ghanem

机构 * Department of Computer Science(计算机科学系) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学科学与技术学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 MoCA-Video通过在冻结的视频扩散模型潜在空间中进行语义混合,实现无需训练的高质量视频编辑,通过动量修正和伽马残差模块提升时间稳定性和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11799 2025-12-15 cs.CV 57%

V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties

V-RGBX:具有精确内在属性控制的视频编辑

Ye Fang, Tong Wu, Valentin Deschaintre, Duygu Ceylan, Iliyan Georgiev, Chun-Hao Paul Huang, Yiwei Hu, Xuelin Chen, Tuanfeng Yang Wang

机构 * Fudan University(复旦大学) Adobe Research(Adobe研究院) Stanford University(斯坦福大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 V-RGBX通过端到端框架实现基于内在属性的视频编辑,支持直观且物理合理的视频修改,适用于物体外观和场景重照明等应用。

Comments Project Page: https://aleafy.github.io/vrgbx

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11769 2025-12-15 cs.RO 57%

BLURR: A Boosted Low-Resource Inference for Vision-Language-Action Models

BLURR: 一种提升低资源推理的视觉-语言-动作模型

Xiaoyu Ma, Zhengqing Yuan, Zheyuan Zhang, Kaiwen Shi, Lichao Sun, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Lehigh University(莱斯大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 BLURR通过轻量级推理包装器提升低资源下的视觉-语言-动作模型推理效率,保持任务成功率的同时降低计算开销。

Comments 10 pages, 3 figures. Code and integration scripts will be released at this http URL: https://github.com/JijiKing-Sam/BLURR-A-Boosted-Low-Resource-Inference-for-Vision-Language-Action-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11476 2025-12-15 cs.RO 57%

UMArm: Untethered, Modular, Portable, Soft Pneumatic Arm

UMArm: 无缆、模块化、便携式软气动臂

Runze Zuo, Dong Heon Han, Richard Li, Saima Jamal, Daniel Bruder

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 UMArm是一种无缆、模块化、便携式软气动臂,通过集成高力重比自调节执行器,实现了高精度、高负载能力和无外部调节器的非结构化环境应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11461 2025-12-15 eess.SP 50%

STAR-RIS-Aided Secure Communications:Analytical Insights and Performance Comparison

STAR-RIS辅助安全通信:分析洞察与性能比较

Taissir Y. Elganimi, Mahmoud Aldababsa, Ali A. Nasir, Khaled M. Rabie

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文分析了STAR-RIS辅助通信的性能,比较了其与SISO、传统RISs和DF中继方案的差异,揭示了STAR-RIS在提升通信速率和保密性方面的优势。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18476 2025-12-15 astro-ph.IM astro-ph.SR 50%

SpecpolFlow: a new software package for spectropolarimetry using Python

SpecpolFlow:一种用于光谱偏振测量的新型Python软件包

Colin P. Folsom, Christiana Erba, Veronique Petit, Shaquann Seadrow, Patrick Stanley, Tali Natan, Bonnie Zaire, Mary E. Oksala, Federico Villadiego Forero, Robin Moore, Marisol Catalan Olais

专题命中 机器人操作 :manipulation(abstract)

AI总结 SpecpolFlow 是一种基于 Python 的新型软件包,用于光谱偏振测量,提供数据处理、分析和可视化工具,支持恒星磁场研究。

Comments Submitted to the Journal of Open Source Software

Journal ref Journal of Open Source Software 10 (2025) 7891

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00287 2025-12-15 cond-mat.mtrl-sci 50%

Theory of polarization-switchable electrical conductivity anisotropy in nonpolar semiconductors

非极性半导体中极化可调电导各向异性的理论

Hong Jian Zhao, Yanchao Wang, Laurent Bellaiche, Yanming Ma

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究提出非极性半导体中极化可调电导各向异性的理论,通过极化翻转实现电导切换,为设计各向异性电子器件提供理论基础。

Comments The updated version of the manuscript

Journal ref Phys. Rev. B 112, 035201 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 6 篇

2512.11083 2025-12-15 physics.ao-ph physics.geo-ph 78%

Integrating Regional Ice Charts and Copernicus Sea Ice Products for Navigation Risk in Alaskan Waters

整合区域冰图与哥白尼海冰产品用于阿拉斯加水域航行风险

Grant Peel, Ersegun Deniz Gedikli

专题命中 具身导航 :navigation(title,abstract)

AI总结 本研究通过整合区域冰图与哥白尼海冰数据,评估阿拉斯加水域航行风险,发现两者互补提升导航准确性。

Comments 44 pages, 15 figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07020 2025-12-15 cs.RO cs.AI cs.LG 67%

Driving Through Uncertainty: Risk-Averse Control with LLM Commonsense for Autonomous Driving under Perception Deficits

在不确定性中驾驶:利用大语言模型常识实现风险厌恶控制以应对自动驾驶中的感知缺陷

Yuting Hu, Chenhui Xu, Ruiyang Qin, Dancheng Liu, Amir Nassereldine, Yiyu Shi, Jinjun Xiong

机构 * University at Buffalo(布法罗大学) University of Notre Dame(诺特尔大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出LLM-RCO框架,利用大语言模型整合人类驾驶常识,以提升自动驾驶在感知缺陷下的风险规避与适应性控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14855 2025-12-15 cs.RO cs.AI 66%

Feedback-MPPI: Fast Sampling-Based MPC via Rollout Differentiation -- Adios low-level controllers

反馈-MPPI: 通过轨迹微分实现快速采样-based MPC -- Adios低级控制器

Tommaso Belvedere, Michael Ziegltrum, Giulio Turrisi, Valerio Modugno

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.AI;robotics(journal_ref)

AI总结 Feedback-MPPI通过局部反馈增益提升MPPI性能,实现高频稳定控制,适用于复杂机器人系统。

Journal ref IEEE Robotics and Automation Letters, 2026, 11 (1), pp.1 - 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21451 2025-12-15 cs.CV 57%

MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning

MM-SeR: 多模态自反思用于轻量级图像描述

Junha Song, Yongsik Jo, So Yeon Min, Quanting Xie, Taehwan Kim, Yonatan Bisk, Jaegul Choo

机构 * KAIST(韩国科学技术院) UNIST(全南国立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 MM-SeR通过轻量级多模态自反思框架,在减少计算成本的同时,实现了与大规模模型相当的图像描述性能,并扩展到长距离视频问答任务。

Comments Project page: https://sites.google.com/view/junha/mm-ser

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16643 2025-12-15 cs.RO cs.HC 57%

See What I Mean? Expressiveness and Clarity in Robot Display Design

见我所指?机器人显示设计中的表达性与清晰度

Matthew Ebisu, Hang Yu, Reuben Aronson, Elaine Short

机构 * Tufts University(塔夫茨大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本研究探讨了动画与静态图标在机器人协作任务中的影响,发现动画增强信任,静态图标提升任务完成率。

Journal ref RO-MAN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11086 2025-12-15 eess.IV 50%

An Open Source Realtime GPU Beamformer for Row-Column and Top Orthogonal to Bottom Electrode (TOBE) Arrays

用于行-列阵和顶部正交于底部电极(TOBE)阵列的开源实时GPU波束成像器

Randy Palamar, Darren Dahunsi, Tyler Henry, Mohammad Rahim Sobhani, Roger Zemp

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出了一种开源实时GPU波束成像器,结合新型TOBE阵列,实现高精度实时成像与高效数据处理。

Comments 17 pages, 11 figures. for mentioned datasets, videos, and files see: https://drive.google.com/drive/folders/1ZqfkJjFfx6JA0gwoHjLdohN1dp-p2Yfu?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 3 篇

2410.14040 2025-12-15 cs.LG cs.AI cs.RO 87%

WARPD: World model Assisted Reactive Policy Diffusion

WARPD:世界模型辅助的反应策略扩散

Shashank Hegde, Satyajeet Das, Gautam Salhotra, Gaurav S. Sukhatme

机构 * University of Southern California(南加州大学) Google(谷歌) Intrinsic LLC(Intrinsic 公司)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 WARPD通过直接生成闭环策略,提高了机器人任务中长动作时间跨度和鲁棒性的性能,同时显著降低了推理成本。

Comments Outstanding Paper Award at the Embodied World Models for Decision Making Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11225 2025-12-15 cs.CV cs.AI cs.LG 82%

VFMF: World Modeling by Forecasting Vision Foundation Model Features

VFMF:通过预测视觉基础模型特征进行世界建模

Gabrijel Boduljak, Yushi Lan, Christian Rupprecht, Andrea Vedaldi

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出了一种基于VFM特征的生成预测器,通过自回归流匹配在潜在空间中实现更准确的预测,提升世界建模的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11226 2025-12-15 cs.CV 79%

FutureX: Enhance End-to-End Autonomous Driving via Latent Chain-of-Thought World Model

FutureX: 通过潜在链式思维世界模型增强端到端自动驾驶

Hongbin Lin, Yiming Yang, Yifan Zhang, Chaoda Zheng, Jie Feng, Sheng Wang, Zhennan Wang, Shijia Chen, Boyang Wang, Yu Zhang, Xianming Liu, Shuguang Cui, Zhen Li

机构 * FNii-Shenzhen(FNii深圳分部) SSE, CUHK-Shenzhen(SSE,CUHK深圳分校) Xpeng Motors(小鹏汽车) MiroMind AI(MiroMind人工智能) Xidian University(西安电子科技大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 FutureX通过链式思维世界模型增强端到端自动驾驶,提升复杂场景下的运动规划质量与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 5 篇

2509.19972 2025-12-15 cs.RO cs.AI 73%

An effective control of large systems of active particles: An application to evacuation problem

大规模活性粒子系统的有效控制:应用于疏散问题的应用

Albina Klepach, Egor E. Nuzhin, Alexey A. Tsukanov, Nikolay V. Brilliantov

机构 * AIRI Artificial Intelligence Center, Skolkovo Institute of Science and Technology(人工智能中心,斯克洛夫科技研究所) Department of Mathematics, University of Leicester(数学系,莱斯特大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种结合强化学习与人工力的控制策略,用于机器人救援者高效疏散人群,克服了传统方法的可扩展性和鲁棒性不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13171 2025-12-15 cs.RO cs.AI 73%

Aligning Humans and Robots via Reinforcement Learning from Implicit Human Feedback

通过隐式人类反馈进行人与机器人对齐的强化学习

Suzie Kim, Hye-Bin Shin, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学) Department of Brain and Cognitive Engineering, Korea University(脑科学与认知工程系,韩国大学)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 通过隐式人类反馈的强化学习方法,利用脑电图信号提升机器人与人类的对齐能力。

Comments Accepted to IEEE Int. Conf. Syst., Man, Cybern. (SMC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16396 2025-12-15 cs.LG 70%

GoalLadder: Incremental Goal Discovery with Vision-Language Models

GoalLadder: 基于视觉语言模型的增量目标发现

Alexey Zakharov, Shimon Whiteson

机构 * University of Oxford(牛津大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 GoalLadder利用视觉语言模型在视觉环境中通过增量目标发现提升RL智能体性能,实现高成功率。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00811 2025-12-15 cs.LG 57%

Equilibrium Policy Generalization: A Reinforcement Learning Framework for Cross-Graph Zero-Shot Generalization in Pursuit-Evasion Games

均衡策略泛化:一种用于追捕-躲避游戏跨图零样本泛化的强化学习框架

Runyu Lu, Peng Zhang, Ruochuan Shi, Yuanheng Zhu, Dongbin Zhao, Yang Liu, Dong Wang, Cesare Alippi

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dalian University of Technology(大连理工大学) Università della Svizzera italiana(瑞士意大利大学) Politecnico di Milano(米兰理工学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出EPG框架,通过均衡策略训练实现追捕-躲避游戏中跨图零样本泛化的高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏