arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-17 至 2025-12-17 共收录 31 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 6 篇

2511.05129 2025-12-17 cs.RO 79%

Decomposed Object Manipulation via Dual-Actor Policy

通过双演员策略分解物体操控

Bin Fan, Jian-Jian Jiang, Zhuohao Li, Xiao-Ming Wu, Yi-Xiang He, YiHan Yang, Shengbang Liu, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(华南理工大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本文提出双演员策略DAP,通过分解物体操控任务为接近和操控阶段,利用异质视觉先验提升性能,实验表明在多个数据集上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14320 2025-12-17 cs.CV cs.AI cs.CY cs.LG 67%

Semantic Mismatch and Perceptual Degradation: A New Perspective on Image Editing Immunity

语义不匹配与感知退化:图像编辑免疫的新视角

Shuai Dong, Jie Zhang, Guoying Zhao, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of China Academy of Sciences(中国科学院大学) Center for Machine Vision and Signal Analysis, University of Oulu(信号分析中心,奥卢大学) School of Computer Science, China University of Geosciences(计算机科学学院,中国地质大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出SIFM方法和ISR度量标准,通过语义不匹配和感知退化来评估图像编辑免疫效果,提升对抗恶意扩散式操纵的能力。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14206 2025-12-17 cs.RO cs.SY eess.SY 57%

Trajectory Tracking for Multi-Manipulator Systems in Constrained Environments

在受限环境中多机械臂系统的轨迹跟踪

Mayank Sewlia, Christos K. Verginis, Dimos V. Dimarogonas

机构 * Division of Decision and Control, Department of Electrical Engineering, KTH Royal Institute of Technology(决策与控制系,电气工程系,皇家理工学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出了一种多速率规划与控制框架,用于在受限环境中实现多机械臂系统的协同轨迹跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14611 2025-12-17 physics.atom-ph cond-mat.quant-gas 50%

Engineering Zeeman-manifold quintets using state-dependent light shifts in neutral atoms

通过状态依赖的光移在中性原子中工程化Zeeman- manifold五重态

Benedikt Heizenreder, Bas Gerritsen, Katya Fouka, Robert J. C. Spreeuw, Florian Schreck, Arghavan Safavi Naini, Alexander Urech

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过状态依赖的光移在中性锶原子中工程化Zeeman- manifold五重态,实现高保真度的qudit操控。

Comments 18 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14528 2025-12-17 quant-ph 50%

Continuous Accumulation of Cold Atoms in an Optical Cavity

光学腔内冷原子的连续积累

Edward Gheorghita, Sebastian Wald, Andrea Pupić, Onur Hosten

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究通过光移位操控实现光学腔内冷原子的持续积累,为持续运行的量子传感器和处理器提供新途径。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14402 2025-12-17 physics.optics 50%

From Atomic Defects to Integrated Photonics: A Perspective on Solid-State Quantum Light Sources

从原子缺陷到集成光子学:关于固态量子光源的视角

Anuj Kumar Singh, Parul Sharma, Kishor Kumar Mandal, Lekshmi Eswaramoorthy, Anshuman Kumar

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文探讨了固态量子光源在量子技术中的应用,包括材料景观、集成路径及与量子传感、通信和计算的接口。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 8 篇

2512.13293 2025-12-17 cs.RO cs.AI 81%

Intrinsic-Motivation Multi-Robot Social Formation Navigation with Coordinated Exploration

内在动机多机器人社会编队导航与协调探索

Hao Fu, Wei Liu, Shuai Zhou

机构 * School of Computer Science and Technology(计算机科学与技术学院) Wuhan University of Science and Technology(武汉科技大学) Hubei Province Key Laboratory of Intelligent Information Processing(湖北省智能信息处理重点实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于内在动机的多机器人协调探索RL算法,通过双采样模式和双时间尺度更新规则提升导航策略与奖励表示,实现更高效的社交编队导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11472 2025-12-17 cs.HC cs.RO 79%

Mirror Skin: In Situ Visualization of Robot Touch Intent on Robotic Skin

镜肤:机器人触觉意图的现场可视化

David Wagmann, Matti Krüger, Chao Wang, Jürgen Steimle

机构 * Saarland University, Saarland Informatics Campus(萨尔兰大学,萨尔兰信息技术校区) Honda Research Institute Europe(本田欧洲研究院)

专题命中 具身导航 :robotic(title,abstract);分类 cs.RO

AI总结 镜肤通过高分辨率视觉反馈提升机器人触觉意图的传达,提高交互准确性并减少响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14046 2025-12-17 cs.RO 79%

E-Navi: Environmental Adaptive Navigation for UAVs on Resource Constrained Platforms

E-Navi:面向资源受限平台的环境自适应导航

Boyang Li, Zhongpeng Jin, Shuai Zhao, Jiahui Liao, Tian Liu, Han Liu, Yuanhai Zhang, Kai Huang

机构 * Sun Yat-sen University(中山大学) Key Laboratory of Machine Intelligence and Advanced Computing(智能与先进计算关键实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 E-Navi通过动态调整任务执行优化无人机在资源受限平台上的环境自适应导航性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13974 2025-12-17 cs.RO 70%

Autonomous Construction-Site Safety Inspection Using Mobile Robots: A Multilayer VLM-LLM Pipeline

基于移动机器人的自主施工工地安全检查:一种多层VLM-LLM流水线

Hossein Naderi, Alireza Shojaei, Philip Agee, Kereshmeh Afsari, Abiola Akanmu

专题命中 具身导航 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 本文提出一种多层VLM-LLM流水线,通过机器人自主导航与人工智能结合,实现施工工地安全检查的自动化报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16349 2025-12-17 cs.CV cs.GR 70%

CRISTAL: Real-time Camera Registration in Static LiDAR Scans using Neural Rendering

CRISTAL:利用神经渲染进行静态LiDAR扫描中的实时相机定位

Joni Vanherck, Steven Moonen, Brent Zoomers, Kobe Werner, Jeroen Put, Lode Jorissen, Nick Michiels

机构 * Hasselt University - Digital Future Lab - Flanders(哈塞尔特大学-数字未来实验室-弗拉芒)

专题命中 具身导航 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 CRISTAL通过神经渲染技术实现静态LiDAR扫描中的实时相机定位,提供无漂移且具有正确度量尺度的跟踪,优于现有SLAM流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14411 2025-12-17 cs.RO 57%

Synthetic Data Pipelines for Adaptive, Mission-Ready Militarized Humanoids

面向适应性、任务导向的军事化人形机器人的合成数据管道

Mohammed Ayman Habib, Aldo Petruzzelli

机构 * Omnia

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 Omnia提出了一种合成数据管道,用于加速军事化人形机器人的训练、验证和部署准备,通过生成高保真度模拟场景提升感知、导航和决策能力。

Comments 6 pages; xTech Humanoid white paper submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17116 2025-12-17 cs.AI 57%

MCTS-EP: Empowering Embodied Planning with Online Preference Optimization

MCTS-EP:通过在线偏好优化增强具身规划

Hang Xu, Zang Yu, Yehui Tang, Pengbo Hu, Yuhao Tang, Hao Dong

机构 * School of Management, Fudan University, Shanghai, China(复旦大学管理学院) Independent Researcher(独立研究者) CFCS, School of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学) PKU-AgiBot Lab, Peking University, Beijing, China(北京大学)

专题命中 具身导航 :embodied agent(abstract);分类 cs.AI

AI总结 MCTS-EP通过结合大语言模型与蒙特卡洛树搜索,实现具身智能体的在线偏好优化,提升多模态任务的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14377 2025-12-17 quant-ph 50%

Steering Alternative Realities through Local Quantum Memory Operations

通过局部量子记忆操作引导替代现实

Xiongfeng Ma

专题命中 具身导航 :navigation(abstract)

AI总结 通过局部量子记忆操作实现现实引导,允许观察者以概率访问不同现实,但受限于相干参与和无法验证的转换。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 5 篇

2512.14014 2025-12-17 cs.AI 83%

MobileWorldBench: Towards Semantic World Modeling For Mobile Agents

MobileWorldBench: 向移动智能体的语义世界建模迈进

Shufan Li, Konstantinos Kallidromitis, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Salesforce AI Research(Salesforce人工智能研究)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.AI

AI总结 MobileWorldBench通过语义世界模型提升移动智能体任务成功率

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14442 2025-12-17 cs.CV cs.RO 62%

A4-Agent: An Agentic Framework for Zero-Shot Affordance Reasoning

A4-Agent: 一种用于零样本 affordance 推理的代理框架

Zixin Zhang, Kanghao Chen, Hanqing Wang, Hongfei Zhang, Harold Haodong Chen, Chenfei Liao, Litao Guo, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) Knowin

专题命中 具身推理 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 A4-Agent 提出一种无需训练的代理框架,通过三个阶段的流水线实现零样本 affordance 推理,优于现有监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14020 2025-12-17 cs.CV 57%

Deep Learning Perspective of Scene Understanding in Autonomous Robots

自主机器人场景理解的深度学习视角

Afia Maham, Dur E Nayab Tashfa

专题命中 具身推理 :navigation(abstract);分类 cs.CV

AI总结 本文从深度学习角度综述了自主机器人场景理解中的关键技术,包括目标检测、语义分割、深度估计等,探讨了其在动态环境中的应用与挑战。

Comments 11 pages. Review Paper on Deep Learning Perspective of Scene Understanding in Autonomous Robots

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13707 2025-12-17 physics.bio-ph cs.LG cs.NE stat.ML 57%

Modular connectivity in neural networks emerges from Poisson noise-motivated regularisation, and promotes robustness and compositional generalisation

神经网络中的模块化连接源于受泊松噪声启发的正则化,并促进鲁棒性和组合泛化

Daoyuan Qian, Qiyao Liang, Ila Fiete

机构 * McGovern Institute for Brain Research, Massachusetts Institute of Technology, MA 02139, U.S.A.(麦戈文脑科学研究所,麻省理工学院) K. Lisa Yang Integrative Computational Neuroscience Center in the Yang-Tan Collective(李嘉诚整合计算神经科学中心) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology, MA 02139, U.S.A.(脑科学与认知科学系,麻省理工学院) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology, MA 02139, U.S.A.(电气工程与计算机科学系,麻省理工学院)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本研究通过受泊松噪声启发的正则化方法,揭示了神经网络中模块化连接的形成机制,并展示了其在提升鲁棒性和泛化能力方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10400 2025-12-17 cs.MA cs.AI cs.CL 57%

Rethinking the Reliability of Multi-agent System: A Perspective from Byzantine Fault Tolerance

重新思考多智能体系统可靠性:从拜占庭容错的角度出发

Lifan Zheng, Jiawei Chen, Qinghong Yin, Jingyuan Zhang, Xinyi Zeng, Yu Tian

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文从拜占庭容错角度研究基于大语言模型的智能体可靠性,提出CP-WBFT机制提升多智能体系统稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 1 篇

2512.14666 2025-12-17 cs.RO cs.CV 73%

EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models

EVOLVE-VLA: 通过环境反馈进行测试时训练以实现视觉-语言-动作模型

Zechen Bai, Chen Gao, Mike Zheng Shou

机构 * Show Lab National University of Singapore(新加坡国立大学Show实验室)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 EVOLVE-VLA通过环境反馈实现测试时训练,使视觉-语言-动作模型能持续适应,提升任务性能并实现跨任务泛化。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 1 篇

2512.07342 2025-12-17 cs.CR cs.LG 57%

PrivORL: Differentially Private Synthetic Dataset for Offline Reinforcement Learning

PrivORL: 用于离线强化学习的差分隐私合成数据集

Chen Gong, Zheng Liu, Kecen Li, Tianhao Wang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 PrivORL通过差分隐私技术合成离线强化学习数据集,利用扩散模型和好奇心驱动预训练提升合成数据的多样性和保真度。

Comments Accepted at NDSS 2026; code available at https://github.com/2019ChenGong/PrivORL

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 人机交互与遥操作 1 篇

2512.13981 2025-12-17 cs.RO 57%

Impact of Robot Facial-Audio Expressions on Human Robot Trust Dynamics and Trust Repair

机器人面部-语音表达对人类机器人信任动态及信任修复的影响

Hossein Naderi, Alireza Shojaei, Philip Agee, Kereshmeh Afsari, Abiola Akanmu

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO

AI总结 本研究探讨了机器人面部-语音表达对人类信任动态及修复的影响,发现成功提升信任,失败导致信任下降,道歉表达部分恢复信任,且年龄和先前态度影响信任变化的持续时间。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 机器人数据与评测 6 篇

2512.14217 2025-12-17 cs.CV cs.RO 86%

DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos

DRAW2ACT:将深度编码轨迹转化为机器人演示视频

Yang Bai, Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Ziyuan Liu, Gitta Kutyniok

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Freiburg(弗赖堡大学) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))

专题命中 机器人数据与评测 :robotic(title,abstract);embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 DRAW2ACT通过深度感知的轨迹条件视频生成框架,生成可控且一致的机器人演示视频,提升机器人操作的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01705 2025-12-17 cs.RO 74%

Efficient Collision Detection for Long and Slender Robotic Links in Euclidean Distance Fields: Application to a Forestry Crane

在欧几里得距离场中高效检测长而细的机械臂碰撞:应用于林业起重机

Marc-Philip Ecker, Bernhard Bischof, Minh Nhat Vu, Christoph Fröhlich, Tobias Glück, Wolfgang Kemmetmüller

机构 * Automation & Control Institute (ACIN), TU Wien(自动化与控制研究所(ACIN),维也纳技术大学) Center for Vision, Automation & Control, AIT Austrian Institute of Technology GmbH(视觉、自动化与控制中心,奥地利技术研究所)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO

AI总结 本文提出了一种针对长细机械臂的高效碰撞检测算法,通过利用其细长结构提升运动规划效率,适用于林业起重机等大尺寸机械臂的应用。

Comments Accepted at IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14601 2025-12-17 cs.CV cs.AI 62%

FakeRadar: Probing Forgery Outliers to Detect Unknown Deepfake Videos

FakeRadar: 探测伪造异常以检测未知深度伪造视频

Zhaolun Li, Jichang Li, Yinqi Cai, Junye Chen, Xiaonan Luo, Guanbin Li, Rushi Lan

机构 * Guilin University of Electronic Technology(桂林电子科技大学) Pengcheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学) Guangxi Key Laboratory of Image and Graphic Intelligent Processing(广西图像与图形智能处理重点实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 FakeRadar通过动态子聚类建模和异常引导训练,有效检测未知深度伪造视频,提升跨域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14434 2025-12-17 cs.RO 57%

Geometric Parameter Optimization of a Novel 3-(PP(2-(UPS))) Redundant Parallel Mechanism based on Workspace Determination

一种基于工作空间确定的新型3-(PP(2-(UPS)))冗余并联机构几何参数优化

Quan Yuan, Daqian Cao, Weibang Bai

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种新型冗余并联机构,通过分析关键几何参数对工作空间的影响,优化其几何参数以提升工作空间性能。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14331 2025-12-17 cs.RO 57%

ARCADE: Adaptive Robot Control with Online Changepoint-Aware Bayesian Dynamics Learning

ARCADE: 基于在线变化点感知的自适应机器人控制

Rishabh Dev Yadav, Avirup Das, Hongyu Song, Samuel Kaski, Wei Pan

机构 * Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Department of Computer Science, Aalto University(阿alto大学计算机科学系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 ARCADE通过在线变化点感知机制实现机器人动态的自适应控制,提升预测精度和恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.01519 2025-12-17 cs.AI 57%

A Generalised Approach for Encoding and Reasoning with Qualitative Theories in Answer Set Programming

一种用于答案集编程中定性理论编码与推理的通用方法

George Baryannis, Ilias Tachmazidis, Sotiris Batsakis, Grigoris Antoniou, Mario Alviano, Emmanuel Papadakis

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出了一种基于答案集编程的通用方法,用于处理需要结合定性与非定性推理的问题,并通过实验验证了其有效性。

Comments Paper presented at the 36th International Conference on Logic Programming (ICLP 2020), University Of Calabria, Rende (CS), Italy, September 2020, 18 pages, 3 figures

Journal ref Theory and Practice of Logic Programming 20 (2020) 687-702

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他机器人 3 篇

2411.12977 2025-12-17 cs.AI cs.CL 79%

MindForge: Empowering Embodied Agents with Theory of Mind for Lifelong Cultural Learning

MindForge: 通过显式视角转换赋能具身智能体的终身文化学习

Mircea Lică, Ojas Shirekar, Baptiste Colle, Chirag Raman

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 其他机器人 :embodied agent(title,abstract);分类 cs.AI

AI总结 MindForge通过显式视角转换和多组件记忆系统,使智能体在Minecraft中实现文化终身学习,显著提升基础任务表现并适应新任务。

Comments Accepted to NeurIPS 2025 main track as poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14112 2025-12-17 cs.AI 57%

Optimizing Multi-Tier Supply Chain Ordering with a Hybrid Liquid Neural Network and Extreme Gradient Boosting Model

优化多级供应链订货的混合液态神经网络与极梯度提升模型

Chunan Tong

机构 * University of Maryland, College Park(马里兰大学学院 park)

专题命中 其他机器人 :robotics(abstract);分类 cs.AI

AI总结 本研究提出混合液态神经网络与极梯度提升模型,用于优化多级供应链订货,以提高效率和盈利能力。

详情

展开后加载摘要…

URL PDF HTML 收藏