arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-22 至 2025-12-22 共收录 41 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2512.17253 2025-12-22 cs.CV 57%

Mitty: Diffusion-based Human-to-Robot Video Generation

Mitty:基于扩散的Human-to-Robot视频生成

Yiren Song, Cheng Liu, Weijia Mao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 机器人学习 :robot learning(abstract);分类 cs.CV

AI总结 Mitty通过基于扩散的变换器实现端到端的人机视频生成,利用预训练模型和双向注意力机制,无需动作标签或中间抽象,生成高质量的机器人执行视频。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 13 篇

2512.17568 2025-12-22 cs.RO 88%

Kinematics-Aware Diffusion Policy with Consistent 3D Observation and Action Space for Whole-Arm Robotic Manipulation

具有一致3D观察和动作空间的运动学感知扩散策略用于全身机械臂操作

Kangchen Lv, Mingrui Yu, Yongyi Jia, Chenyu Zhang, Xiang Li

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 本文提出一种基于一致3D空间的运动学感知扩散策略,用于提高全身机械臂操作的样本效率和空间泛化能力。

Comments The first two authors contributed equally. Project Website: https://kinematics-aware-diffusion-policy.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17907 2025-12-22 cs.CV 85%

Dexterous World Models

灵巧世界模型

Byungjun Kim, Taeksoo Kim, Junyoung Lee, Hanbyul Joo

机构 * Seoul National University(首尔国立大学) RLWRLD

专题命中 机器人操作 :world model(title,abstract);manipulation(abstract);navigation(abstract);分类 cs.CV

AI总结 灵巧世界模型通过场景-动作-条件的视频扩散框架,实现静态3D场景与灵巧人类动作的动态交互模拟,推动交互式数字双胞胎的发展。

Comments Project Page: snuvclab.github.io/dwm

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26362 2025-12-22 cs.RO cs.SY eess.SY 83%

Cooperative Task Spaces for Multi-Arm Manipulation Control based on Similarity Transformations

基于相似变换的多臂操作控制协作任务空间

Tobias Löw, Cem Bilaloglu, Sylvain Calinon

机构 * Idiap Research Institute(Idiap研究 institute) EPFL(瑞士联邦理工学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出基于相似变换的多臂协作操作控制框架,通过几何原语抽象实现复杂系统的简化表示,并结合操作空间控制方法进行实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17062 2025-12-22 cs.RO 83%

Lang2Manip: A Tool for LLM-Based Symbolic-to-Geometric Planning for Manipulation

Lang2Manip: 一种基于LLM的符号到几何规划工具用于操作

Muhayy Ud Din, Jan Rosell, Waseem Akram, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS)(卡利法大学自主机器人系统中心) Khalifa University(卡利法大学) Institute of Industrial and Control Engineering (IOC)(工业与控制工程研究所) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 Lang2Manip通过结合LLM和Kautham框架,实现通用的符号到几何操作规划,适用于多种机器人和任务。

Comments Submitted to ICARA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17661 2025-12-22 cs.RO cs.LG 73%

Vidarc: Embodied Video Diffusion Model for Closed-loop Control

Vidarc:用于闭环控制的具身视频扩散模型

Yao Feng, Chendong Xiang, Xinyi Mao, Hengkai Tan, Zuyue Zhang, Shuhe Huang, Kaiwen Zheng, Haitian Liu, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 Vidarc 提出了一种基于视频扩散的具身模型,通过掩码反向动力学模型实现快速准确的闭环控制,提升了现实部署中的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16625 2025-12-22 cs.CV 57%

DeContext as Defense: Safe Image Editing in Diffusion Transformers

DeContext作为防御:扩散变换器中的安全图像编辑

Linghui Shen, Mingyue Cui, Xingyi Yang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 DeContext通过扰动注意力层来防止图像编辑,有效保护输入图像免受未经授权的修改。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17309 2025-12-22 cs.RO 57%

RecipeMasterLLM: Revisiting RoboEarth in the Era of Large Language Models

RecipeMasterLLM: 重新审视大语言模型时代的RoboEarth

Asil Kaan Bozcuoglu, Ziyuan Liu

机构 * Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))

专题命中 机器人操作 :robotics(abstract);分类 cs.RO

AI总结 RecipeMasterLLM通过微调大语言模型实现自动化知识获取,提升机器人动作描述的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17146 2025-12-22 cs.CR cs.LG q-bio.QM 57%

Biosecurity-Aware AI: Agentic Risk Auditing of Soft Prompt Attacks on ESM-Based Variant Predictors

生物安全意识的AI:基于ESM变体预测器的软提示攻击代理审计

Huixin Zhan

机构 * Department of Computer Science and Engineering(计算机科学与工程系) New Mexico Institute of Mining and Technology(新墨西哥采矿与技术研究院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 本研究提出SAGE框架,通过代理风险审计发现ESM变体预测器对软提示攻击的敏感性,揭示基因组基础模型的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17067 2025-12-22 cs.HC cs.AI cs.SI 57%

Bots Don't Sit Still: A Longitudinal Study of Bot Behaviour Change, Temporal Drift, and Feature-Structure Evolution

机器人不会静止不动:关于机器人行为变化、时间漂移和特征-结构演变的纵向研究

Ohoud Alzahrani, Russell Beale, Bob Hendley

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 该研究通过分析推广型社交机器人在时间上的行为变化和特征演变,揭示了机器人行为的非平稳性及特征依赖性,为机器人检测系统的设计提供了重要参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17839 2025-12-22 math.OC math.AP 50%

Time Optimal Control Problem for the Landau-Lifshitz-Bloch equation

Landau-Lifshitz-Bloch方程的时间最优控制问题

Sidhartha Patnaik, Kumarasamy Sakthivel

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究了Landau-Lifshitz-Bloch方程的时间最优控制问题,通过推导优化条件,为磁态快速操控提供理论基础,并推动高速磁记忆技术发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17669 2025-12-22 quant-ph cond-mat.mtrl-sci 50%

Quantum heat current in Terahertz-driven phonon systems

太赫兹驱动声子系统中的量子热流

Yulong Qiao, Richard. Matthias Geilhufe

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究通过太赫兹脉冲驱动光学声子模式,探讨超快量子热力学,揭示非马尔可夫耗散现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23381 2025-12-22 eess.SP 50%

A Secure Full-Duplex Wireless Circulator enabled by Non-Reciprocal Beyond-Diagonal RIS

非互易超越对角智能反射面实现的 secure 全双工无线 circulator

Ziang Liu, Bruno Clerckx

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出利用非互易超越对角智能反射面实现安全全双工无线circulator,通过单向通信和结构散射增强安全传输性能。

Comments Submitted to IEEE journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17030 2025-12-22 cond-mat.str-el 50%

Exploring the Kondo Effect in Strained Kagome Nanoribbons

探索受应变的 Kagome 纳米带中的 Kondo 效应

Patricia A Almeida, George B Martins, Sergio Ulloa

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究通过应变调控Kagome纳米带中的Kondo效应,揭示了应变对杂质屏蔽和局部态密度的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 7 篇

2511.11011 2025-12-22 cs.RO 88%

Efficient Image-Goal Navigation with Representative Latent World Model

高效图像-目标导航与代表性潜在世界模型

Zhiwei Zhang, Hui Zhang, Kaihong Huang, Chenghao Shi, Huimin Lu

机构 * College of Intelligence Science and Technology, the National Key Laboratory of Equipment State Sensing and Smart Support, National University of Defense Technology(智能科学与技术学院、装备状态感知与智能支持国家重点实验室、国防科技大学)

专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 本文提出ReL-NWM模型,通过在高层次语义潜在空间中进行预测和规划,实现高效图像-目标导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12394 2025-12-22 cs.RO 81%

SIGN: Safety-Aware Image-Goal Navigation for Autonomous Drones via Reinforcement Learning

SIGN:通过强化学习实现安全的图像目标导航用于自主无人机

Zichen Yan, Rui Huang, Lei He, Shao Guo, Lin Zhao

机构 * Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,新加坡国立大学)

专题命中 具身导航 :navigation(title,abstract);robotics(comments,journal_ref);分类 cs.RO

AI总结 本文提出了一种基于强化学习的仿真到现实框架,实现无人机的安全图像目标导航,通过直接速度控制和深度安全模块实现自主探索与避障。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L)

Journal ref IEEE Robotics and Automation Letters, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15258 2025-12-22 cs.RO cs.AI 81%

VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments

VLA-AN:一种用于复杂环境空中导航的高效且机载视觉-语言-动作框架

Yuze Wu, Mo Zhu, Xingxing Li, Yuheng Du, Yuxin Fan, Wenjun Li, Zhichao Han, Xin Zhou, Fei Gao

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 VLA-AN通过高效机载框架提升无人机在复杂环境中的导航能力,实现8.3倍推理吞吐量提升和98.1%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17553 2025-12-22 cs.RO 79%

Deep Learning-based Robust Autonomous Navigation of Aerial Robots in Dense Forests

基于深度学习的密集森林中无人机鲁棒自主导航

Guglielmo Del Col, Väinö Karjalainen, Teemu Hakala, Yibo Zhang, Eija Honkavaara

机构 * Department of Remote Sensing and Photogrammetry, Finnish Geospatial Research Institute FGI, The National Land Survey of Finland(遥感与摄影测量系,芬兰地理空间研究 institute FGI,芬兰国家土地测绘局)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种基于深度学习的无人机导航方法,通过改进的深度编码和神经运动原始评价,提高在密集森林中的自主导航能力,实验证明其在复杂环境中的可靠性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08763 2025-12-22 cs.HC cs.MA stat.AP 50%

Modeling multi-agent motion dynamics in immersive rooms

沉浸式房间中多智能体运动动态建模

Jerry M. Huang, Stefan T. Radev

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出了一种基于智能体的模型,用于模拟沉浸式房间中人类运动动态,通过结合环境影响和智能体内部相互作用,以捕捉行动相关的智能体属性并估计运动模式参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17017 2025-12-22 cs.HC 50%

Explorable Ideas: Externalizing Ideas as Explorable Environments

可探索的想法:将想法外部化为可探索的环境

Euijun Jung, Jingyu Lee, Minji Kim, Youngki Lee

专题命中 具身导航 :navigation(abstract)

AI总结 Explorable Ideas框架通过将抽象概念转化为可探索的环境,提升创意任务中的探索性和沉浸感,验证了其在多领域中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22006 2025-12-22 physics.app-ph physics.optics 50%

All-Optical Photonic Crystal Bolometer with Ultra-Low Heat Capacity for Scalable Thermal Imaging

全光学光子晶体热电计具有超低热容量用于可扩展的热成像

Louis Follet, Jordan Goldstein, Christopher L. Panuski, Ian Christen, Sivan Trajtenberg-Mills, Dirk R. Englund

专题命中 具身导航 :navigation(abstract)

AI总结 本研究提出了一种全光学光子晶体热电计,通过超低热容量实现高速热成像,性能超越现有无冷却技术。

Comments 24 pages, 14 figures (including Supplementary Information)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 3 篇

2512.17152 2025-12-22 cs.CV 79%

PhysFire-WM: A Physics-Informed World Model for Emulating Fire Spread Dynamics

PhysFire-WM: 一种融合物理信息的世界模型用于模拟火灾扩散动力学

Nan Zhou, Huandong Wang, Jiahao Li, Yang Li, Xiao-Ping Zhang, Yong Li, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 PhysFire-WM通过融合物理信息和跨任务协作训练策略,提升火灾扩散预测的物理真实性和几何准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17250 2025-12-22 cs.AI 57%

Accelerating Multi-modal LLM Gaming Performance via Input Prediction and Mishit Correction

通过输入预测和误位修正加速多模态大语言模型游戏性能

Ziyang Lin, Zixuan Sun, Sanhorn Chen, Xiaoyang Chen, Roy Zhao

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 通过输入预测和误位修正方法,显著降低多模态大语言模型游戏性能的推理延迟,提升整体控制效果。

Comments UIUC 25 Fall CS 498

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17582 2025-12-22 quant-ph 50%

Investigating methods to solve large windfarm optimization problems with a minimum number of qubits using circuit-based quantum computers

研究利用电路型量子计算机解决大型风电场优化问题的最小量子比特方法

James Hancock, Matthew Craven, Craig McNeile

专题命中 具身推理 :world model(abstract)

AI总结 本文提出两种编码方法,利用少量量子比特在量子计算机上解决大型风电场布局优化问题,并展示其良好的扩展性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 1 篇

2511.10008 2025-12-22 cs.RO cs.AI 62%

Phantom Menace: Exploring and Enhancing the Robustness of VLA Models Against Physical Sensor Attacks

幻影威胁:探索和增强VLA模型对物理传感器攻击的鲁棒性

Xuancun Lu, Jiaxiang Chen, Shilin Xiao, Zizhi Jin, Zhangrui Chen, Hanwen Yu, Bohan Qian, Ruochen Zhou, Xiaoyu Ji, Wenyuan Xu

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种新型框架,用于研究和增强VLA模型对物理传感器攻击的鲁棒性,并开发了对抗训练方法以提升模型安全性。

Comments Accepted by AAAI 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 模仿学习与强化学习 4 篇

2511.22685 2025-12-22 cs.RO 79%

Deadlock-Free Hybrid RL-MAPF Framework for Zero-Shot Multi-Robot Navigation

无死锁的混合式RL-MAPF框架用于零样本多机器人导航

Haoyi Wang, Licheng Luo, Yiannis Kantaros, Bruno Sinopoli, Mingyu Cai

机构 * Department of Mechanical Engineering University of California Riverside CA USA(加州大学河滨分校机械工程系) Department of Electrical and Systems Engineering Washington University in St. Louis MO USA(华盛顿大学圣路易斯分校电气与系统工程系)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种无死锁的混合RL-MAPF框架,通过整合反应性RL导航与按需MAPF干预,实现零样本多机器人导航的鲁棒性能。

Comments 18 pages (including appendix), 3 figures. Project page (videos, animations, additional resources): https://wanghaoyi518.github.io/rl-mapf-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01956 2025-12-22 cs.RO cs.AI cs.LG 67%

DHP: Discrete Hierarchical Planning for Hierarchical Reinforcement Learning Agents

DHP:用于分层强化学习代理的离散分层规划

Shashank Sharma, Janina Hoffmann, Vinay Namboodiri

机构 * Department of Computer Science University of Bath(计算机科学系巴斯大学) Department of Psychology University of Bath(心理学系巴斯大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 DHP通过离散可达性检查和递归分解任务,提升分层强化学习代理在长距离视觉规划中的效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17846 2025-12-22 cs.RO cs.AI 62%

Planning as Descent: Goal-Conditioned Latent Trajectory Synthesis in Learned Energy Landscapes

规划作为下降:在学习的能量景观中进行目标条件化潜在轨迹合成

Carlos Vélez García, Miguel Cazorla, Jorge Pomares

机构 * University of Alicante(阿利坎特大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 PaD通过学习目标条件化能量函数实现离线无奖励规划,以验证为基础进行轨迹合成,取得95%的成功率并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17841 2025-12-22 cs.CE cs.SY eess.SY 50%

NeuRehab: A Reinforcement Learning and Spiking Neural Network-Based Rehab Automation Framework

NeuRehab:一种基于强化学习和脉冲神经网络的康复自动化框架

Phani Pavan Kambhampati, Chainesh Gautam, Jagan Palaniswamy, Madhav Rao

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 NeuRehab通过结合强化学习和脉冲神经网络,实现康复自动化框架,优化功耗和延迟,提升神经形态部署性能。

Comments 18 pages, 22 figures, 3 tables, for submission to IOP Neuromorphic Computing and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 人机交互与遥操作 3 篇

2512.15411 2025-12-22 cs.RO cs.CV 62%

MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training

MiVLA:迈向具有人机互模仿预训练的通用视觉-语言-动作模型

Zhenhan Yin, Xuanhan Wang, Jiahao Jiang, Kaiyuan Deng, Pengqi Chen, Shuangle Li, Chong Liu, Xing Xu, Jingkuan Song, Lianli Gao, Heng Tao Shen

机构 * Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 MiVLA通过人机互模仿预训练,提升视觉-语言-动作模型在现实与模拟环境中的泛化能力,实验显示其在模拟和现实任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏