arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-11-21 至 2025-11-21 共收录 39 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 10 篇

2511.16661 2025-11-21 cs.RO cs.AI cs.LG 87%

Dexterity from Smart Lenses: Multi-Fingered Robot Manipulation with In-the-Wild Human Demonstrations

智能眼镜中的灵巧性:基于真实世界人类示范的多指机器人操控

Irmak Guzey, Haozhi Qi, Julen Urain, Changhao Wang, Jessica Yin, Krishna Bodduluri, Mike Lambeta, Lerrel Pinto, Akshara Rai, Jitendra Malik, Tingfan Wu, Akash Sharma, Homanga Bharadhwaj

机构 * New York University(纽约大学) Meta

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);robot policy(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出AINA框架,通过智能眼镜采集真实世界人类示范数据,实现多指机器人操控策略的学习,无需依赖传统机器人数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16666 2025-11-21 cs.CV 79%

SceneDesigner: Controllable Multi-Object Image Generation with 9-DoF Pose Manipulation

SceneDesigner: 9自由度姿态操控的可控多物体图像生成

Zhenyuan Qin, Xincheng Shuai, Henghui Ding

机构 * Fudan University(复旦大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV

AI总结 SceneDesigner通过9自由度姿态操控实现多物体图像生成,采用CNOCS图和两阶段训练策略提升可控性与质量。

Comments NeurIPS 2025 (Spotlight), Project Page: https://henghuiding.com/SceneDesigner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03720 2025-11-21 cs.HC 78%

Design of a visual environment for programming by direct data manipulation

为直接数据操作编程设计的视觉环境

Michel Adam, Patrice Frison, Moncef Daoud, Sabine Letellier Zarshenas

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 本文提出了一种通过直接数据操作实现可视化编程的工具,允许用户无需编写代码即可开发任意程序,支持生成Python、C或Java代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15884 2025-11-21 cs.CV cs.AI cs.LG 75%

Box6D : Zero-shot Category-level 6D Pose Estimation of Warehouse Boxes

Box6D : 仓库中零样本类别级6D姿态估计

Yintao Ma, Sajjad Pakdamansavoji, Amir Rasouli, Tongtong Cao

机构 * Huawei Technologies Canada(华为加拿大技术有限公司)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 Box6D通过类别级CAD模板实现仓库存储箱的零样本6D姿态估计,提升精度并减少76%的推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15995 2025-11-21 cs.RO 72%

PushingBots: Collaborative Pushing via Neural Accelerated Combinatorial Hybrid Optimization

PushingBots: 通过神经加速的组合混合优化实现协作推搡

Zili Tang, Ying Zhang, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(先进制造与机器人学院,北京大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 PushingBots通过神经加速的组合混合优化实现机器人协作推搡,解决复杂环境中多物体精准推运问题。

Comments 20 pages, 24 figures. Accepted to IEEE Transactions on Robotics (T-RO), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04695 2025-11-21 cs.AI cs.CE cs.ET cs.LG 62%

Bridging the Gap in XAI-Why Reliable Metrics Matter for Explainability and Compliance

弥合XAI差距:可靠度量在可解释性与合规性中的重要性

Pratinav Seth, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出以度量治理的范式,通过标准化指标提升AI系统的可解释性和合规性,防止对齐造假,构建持续的AI保证流程。

Comments Accepted at first EurIPS Workshop on Private AI Governance

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06941 2025-11-21 cs.AI cs.CL cs.LG 62%

The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity

思维的幻觉:通过问题复杂性的视角理解推理模型的优势与局限

Parshin Shojaee, Iman Mirzadeh, Keivan Alizadeh, Maxwell Horton, Samy Bengio, Mehrdad Farajtabar

机构 * Apple(苹果公司)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 通过问题复杂性分析,研究揭示大规模推理模型在不同复杂度任务中的表现差异及局限性。

Comments NeurIPS 2025. camera-ready version + additional discussion in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16399 2025-11-21 eess.SY cs.SY 50%

A Comprehensive Study on Cyber Attack Vectors in EV Traction Power Electronics

对电动汽车牵引电力电子中网络攻击途径的全面研究

Siddhesh Pimpale

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究了电动汽车牵引电力电子中的网络攻击途径,利用STRIDE框架分析了潜在漏洞,并通过实验验证了固件安全设计的重要性。

Comments 15 pages, 3 Figures

Journal ref Journal of Information Systems Engineering and Management, 2023, 8(2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04556 2025-11-21 cond-mat.supr-con cond-mat.quant-gas cond-mat.stat-mech hep-th quant-ph 50%

Inverse Superconductor-Insulator Transition in Weakly Monitored Josephson Junction Arrays

弱监测约瑟夫森结阵列中的反向超导-绝缘体相变

Purnendu Das, Sumilan Banerjee

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究通过弱监测和反馈在约瑟夫森结阵列中实现反向超导-绝缘体相变,揭示了量子反馈对非平衡稳态温度控制的作用。

Comments 7+13 pages, 2+1 figures

Journal ref Phys. Rev. B 112, L180503 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06567 2025-11-21 quant-ph 50%

Generation of multi-photon Fock states at telecommunication wavelength using picosecond pulsed light

在电信波长下利用皮秒脉冲光生成多光子Fock态

Tatsuki Sonoyama, Kazuma Takahashi, Tomoki Sano, Takumi Suzuki, Takefumi Nomura, Masahiro Yabuno, Shigehito Miki, Hirotaka Terai, Kan Takase, Warit Asavanant, Mamoru Endo, Akira Furusawa

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文首次在电信波长C波段利用皮秒脉冲光生成多光子Fock态,并通过相干解调成像技术验证其Wigner负性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 5 篇

2511.16406 2025-11-21 cs.RO nlin.AO 83%

Homogeneous Proportional-Integral-Derivative Controller in Mobile Robotic Manipulators

同构比例-积分-微分控制器在移动机器人机械臂中的应用

Luis Luna, Isaac Chairez, Andrey Polyakov

机构 * Tecnologico de Monterrey, Institute of Advanced Materials for Sustinable Manufacturing(墨西哥蒙特雷理工大学可持续制造先进材料研究所)

专题命中 具身导航 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出了一种针对移动机器人机械臂的同构PID控制器,通过同构控制理论提升系统稳定性与收敛性,实现在动态不确定性和外部干扰下的高精度轨迹跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16048 2025-11-21 cs.RO cs.AI cs.HC 79%

Semantic Glitch: Agency and Artistry in an Autonomous Pixel Cloud

语义裂隙:自主像素云中的代理与艺术性

Qing Zhang, Jing Huang, Mingyang Xu, Jun Rekimoto

机构 * The University of Tokyo(东京大学) Tokyo University of the Arts(东京艺术大学) Keio University(庆应大学) SONY CSL Kyoto(索尼 CSL 京都)

专题命中 具身导航 :robotics(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出语义裂隙,通过多模态大语言模型实现自主导航,展示低 fidelity方法在创造不完美但富有艺术性的机器人同伴中的应用。

Comments NeurIPS 2025 Creative AI Track, The Thirty-Ninth Annual Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16140 2025-11-21 cs.CV 70%

Real-Time 3D Object Detection with Inference-Aligned Learning

基于推理对齐学习的实时3D物体检测

Chenyu Zhao, Xianwei Zheng, Zimin Xia, Linwei Yue, Nan Xue

专题命中 具身导航 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 SR3D通过空间优先级最优传输分配和排名意识自适应自蒸馏方案,提升实时3D物体检测的准确性和效率

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08057 2025-11-21 cs.NE cs.AI cs.LG cs.RO 67%

Vector Quantized-Elites: Unsupervised and Problem-Agnostic Quality-Diversity Optimization

向量量化-精英:无监督和问题无关的质量-多样性优化

Constantinos Tsakonas, Konstantinos Chatzilygeroudis

机构 * Computational Intelligence Laboratory (CILab), Department of Mathematics, University of Patras(数学系计算智能实验室(CILab),帕特拉大学) Laboratory of Automation and Robotics (LAR) in the Department of Electrical & Computer Engineering, University of Patras(电气与计算机工程系自动化与机器人实验室(LAR),帕特拉大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 VQ-Elites通过无监督学习构建结构化行为空间,实现灵活且任务无关的质量-多样性优化。

Comments 15 pages (+4 supplementary), 14 (+1) figures, 1 algorithm, 1 (+8) table(s), accepted at IEEE Transactions on Evolutionary Computation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16005 2025-11-21 cs.SE cs.AI 57%

InfCode-C++: Intent-Guided Semantic Retrieval and AST-Structured Search for C++ Issue Resolution

InfCode-C++: 基于意图的语义检索与AST结构化搜索用于C++问题解决

Qingao Dong, Mengfei Wang, Hengzhi Zhang, Zhichao Li, Yuan Yuan, Mu Li, Xiang Gao, Hailong Sun, Chunming Hu, Weifeng Lv

机构 * Beihang University(北航) Beijing Tokfinity Technology Co., Ltd.(北京 Tokfinity 技术有限公司)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 INFCODE-C++ 是首个针对 C++ 的自主系统,通过结合语义代码意图检索和 AST 结构查询,实现端到端的问题解决,其性能显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 6 篇

2511.16333 2025-11-21 cs.LG 83%

Beyond Generative AI: World Models for Clinical Prediction, Counterfactuals, and Planning

超越生成式AI:用于临床预测、反事实和规划的世界模型

Mohammad Areeb Qazi, Maryam Nadeem, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫莫德·本·扎伊德人工智能大学)

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.LG

AI总结 本文探讨了世界模型在医疗领域中的应用,旨在通过预测动态、反事实评估和规划提升临床决策的可靠性。

Comments 2 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10819 2025-11-21 cs.AI cs.LG 81%

PoE-World: Compositional World Modeling with Products of Programmatic Experts

PoE-World: 通过程序专家的乘积进行组合世界建模

Wasu Top Piriyakulkij, Yichao Liang, Hao Tang, Adrian Weller, Marta Kryven, Kevin Ellis

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) The Alan Turing Institute(艾伦·图灵研究所) Dalhousie University(达尔豪斯大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 PoE-World通过程序专家的乘积有效建模复杂非网格世界领域,利用LLMs学习世界模型并实现高效泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16049 2025-11-21 cs.CV 79%

LiSTAR: Ray-Centric World Models for 4D LiDAR Sequences in Autonomous Driving

LiSTAR: 基于4D激光雷达序列的射线中心世界模型用于自动驾驶

Pei Liu, Songtao Wang, Lang Zhang, Xingyue Peng, Yuandong Lyu, Jiaxin Deng, Songxin Lu, Weiliang Ma, Xueyang Zhang, Yifei Zhan, XianPeng Lang, Jun Ma

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 LiSTAR通过射线中心变换器和混合柱形球形表示,实现高保真4D激光雷达数据生成,提升自动驾驶模拟的可控性和真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16484 2025-11-21 cs.CV 70%

Flow and Depth Assisted Video Prediction with Latent Transformer

基于流和深度的视频预测与潜在变换器

Eliyas Suleyman, Paul Henderson, Eksan Firkat, Nicolas Pugeault

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出基于流和深度的视频预测方法,通过整合点流和深度信息提升遮挡场景下的预测性能和背景运动准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16655 2025-11-21 cs.CV cs.LG 62%

Solving Spatial Supersensing Without Spatial Supersensing

无需空间超感知的解决方法

Vishaal Udandarao, Shyamgopal Karthik, Surabhi S. Nath, Andreas Hochlehnert, Matthias Bethge, Ameya Prabhu

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) Max Planck Institute for Biological Cybernetics(马克斯·普朗克生物 cybernetics 研究所)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 Cambrian-S通过定制推理策略在无需空间超感知的情况下解决视频世界模型基准。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16432 2025-11-21 cs.AI q-bio.NC 57%

From generative AI to the brain: five takeaways

从生成式AI到大脑:五点启示

Claudius Gros

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文探讨生成式AI与大脑之间的潜在联系,通过五个例子展示神经科学可能从机器学习研究中获得的启示。

Comments Frontiers in Computational Neuroscience, in press

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 4 篇

2502.02054 2025-11-21 cs.RO cs.AI cs.CV cs.LG 84%

RAPID: Robust and Agile Planner Using Inverse Reinforcement Learning for Vision-Based Drone Navigation

RAPID: 基于逆强化学习的鲁棒且敏捷规划器用于基于视觉的无人机导航

Minwoo Kim, Geunsik Bae, Jinwoo Lee, Woojae Shin, Changseung Kim, Myong-Yol Choi, Heejung Shin, Hyondong Oh

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV;robotics(journal_ref)

AI总结 本文提出基于逆强化学习的无人机高速视觉导航规划器,通过减少环境交互和提升鲁棒性,实现复杂环境中的敏捷飞行。

Comments 18 pages, 11 figures, 58 references, and appendix is included

Journal ref Proceedings of Robotics: Science and Systems (RSS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16593 2025-11-21 cs.SE cs.AI cs.CV cs.RO 67%

Green Resilience of Cyber-Physical Systems: Doctoral Dissertation

物理信息系统的绿色韧性:博士论文

Diaeddin Rimawi

专题命中 模仿学习与强化学习 :robot learning(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本研究提出GResilience框架,通过多目标优化、博弈论和强化学习优化OL-CAIS的绿色恢复,减少能源影响并维持性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16602 2025-11-21 cs.AI 57%

Bridging VLMs and Embodied Intelligence with Deliberate Practice Policy Optimization

通过刻意练习策略优化弥合视觉语言模型与具身智能之间的鸿沟

Yi Zhang, Che Liu, Xiancong Ren, Hanchu Ni, Yingji Zhang, Shuai Zhang, Zeyuan Ding, Jiayu Hu, Haozhe Shan, Junbo Qi, Yan Bai, Dengjie Li, Jiachen Luo, Yidong Wang, Yong Dai, Zenglin Xu, Bin Shen, Qifan Wang, Jian Tang, Xiaozhu Ju

机构 * X-Humanoid Imperial College London(帝国理工学院) Peking University(北京大学) University of Manchester(曼彻斯特大学) Westlake University(西湖大学) Fudan University(复旦大学) Waseda University(早稻田大学) Nvidia Queen Mary University of London(伦敦大学玛丽女王学院) Celonis AI Meta AI

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 本文提出DPPO框架,通过监督微调与强化学习交替训练,提升具身智能系统在稀疏数据下的学习效率,并在性能和参数规模上取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16108 2025-11-21 cs.AI 57%

SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent

SkyRL-Agent: 多轮长周期LLM代理高效强化学习训练

Shiyi Cao, Dacheng Li, Fangzhou Zhao, Shuo Yuan, Sumanth R. Hegde, Connor Chen, Charlie Ruan, Tyler Griggs, Shu Liu, Eric Tang, Richard Liaw, Philipp Moritz, Matei Zaharia, Joseph E. Gonzalez, Ion Stoica

机构 * NovaSky AI UC Berkeley(加州大学伯克利分校) Anyscale

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 SkyRL-Agent通过高效异步调度和工具增强训练配方,实现多轮长周期LLM代理的高效强化学习训练,使SA-SWE-32B在SWE-Bench上达到39.4% Pass@1,成本降低超2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 12 篇

2511.16158 2025-11-21 cs.RO cs.LG 84%

MagBotSim: Physics-Based Simulation and Reinforcement Learning Environments for Magnetic Robotics

MagBotSim: 基于物理的磁力机器人仿真与强化学习环境

Lara Bergmann, Cedric Grothues, Klaus Neumann

机构 * Bielefeld University(比勒菲尔德大学) Fraunhofer IOSB-INA(弗劳恩霍夫研究所)

专题命中 机器人数据与评测 :robotics(title,abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 MagBotSim通过将运输与操作结合为磁力机器人群,为磁悬浮系统提供基于物理的仿真环境,以提升制造系统的效率和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16347 2025-11-21 cs.CR cs.CY cs.RO 83%

The Shawshank Redemption of Embodied AI: Understanding and Benchmarking Indirect Environmental Jailbreaks

具身AI的肖申克救赎:理解与评估间接环境劫持

Chunyang Li, Zifeng Kang, Junwei Zhang, Zhuo Ma, Anda Cheng, Xinghua Li, Jianfeng Ma

机构 * Xidian University(西安电子科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Ant Group(蚂蚁集团)

专题命中 机器人数据与评测 :embodied AI(title,abstract);embodied agent(abstract);分类 cs.RO

AI总结 本文提出了一种新型的间接环境劫持攻击,通过环境注入的恶意提示劫持具身AI,并设计了自动攻击生成和基准评估框架,评估结果显示其在多个任务场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16651 2025-11-21 cs.RO 77%

InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policy

InternData-A1:开创高保真合成数据用于预训练通用策略

Yang Tian, Yuyin Yang, Yiman Xie, Zetao Cai, Xu Shi, Ning Gao, Hangxu Liu, Xuekun Jiang, Zherui Qiu, Feng Yuan, Yaping Li, Ping Wang, Junhao Cai, Jia Zeng, Hao Dong, Jiangmiao Pang

机构 * Shanghai AI Laboratory Peking University(北京大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 机器人数据与评测 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 InternData-A1通过高保真合成数据实现与最强$π$-数据集相当的VLA模型预训练性能,展示了大规模模拟在机器人任务中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16166 2025-11-21 cs.CV 70%

EvoVLA: Self-Evolving Vision-Language-Action Model

EvoVLA:自进化视觉-语言-动作模型

Zeting Liu, Zida Yang, Zeyu Zhang, Hao Tang

机构 * Peking University(北京大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 EvoVLA通过自监督框架解决VLA模型的阶段幻觉问题,提升任务成功率和样本效率,实现有效的仿真到现实转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15874 2025-11-21 cs.CV cs.AI cs.LG 67%

WALDO: Where Unseen Model-based 6D Pose Estimation Meets Occlusion

WALDO: 未见模型驱动的6D姿态估计与遮挡的交汇

Sajjad Pakdamansavoji, Yintao Ma, Amir Rasouli, Tongtong Cao

机构 * Huawei Technologies Canada(华为技术加拿大)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 WALDO提出四种改进方法,提升模型驱动6D姿态估计在遮挡情况下的鲁棒性和精度,实验显示在ICBIN和BOP数据集上精度提升超过5%。

详情

展开后加载摘要…

URL PDF HTML 收藏