arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-18 至 2025-12-18 共收录 38 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 2 篇

2512.15379 2025-12-18 cs.RO cs.CR cs.LG cs.SY eess.SY 84%

Remotely Detectable Robot Policy Watermarking

远程可检测的机器人策略水印

Michael Amir, Manon Flageat, Amanda Prorok

机构 * University of Cambridge(剑桥大学)

专题命中 机器人学习 :robot policy(title);robotics(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出Colored Noise Coherency(CoNoCo)水印策略,通过嵌入频谱信号实现机器人策略的远程检测,确保非侵入式验证策略来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15715 2025-12-18 cs.CV 57%

In Pursuit of Pixel Supervision for Visual Pre-training

追寻像素监督用于视觉预训练

Lihe Yang, Shang-Wen Li, Yang Li, Xinjie Lei, Dong Wang, Abdelrahman Mohamed, Hengshuang Zhao, Hu Xu

机构 * FAIR, Meta(Meta研究院)

专题命中 机器人学习 :robot learning(abstract);分类 cs.CV

AI总结 Pixio通过增强的掩码自编码器实现像素监督的视觉预训练,表现优异于DINOv3,适用于多种下游任务。

Comments Project page: https://github.com/facebookresearch/pixio

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 14 篇

2504.03515 2025-12-18 cs.RO cs.LG 86%

Dexterous Manipulation through Imitation Learning: A Survey

通过模仿学习实现灵巧操作:综述

Shan An, Ziyu Meng, Chao Tang, Yuning Zhou, Tengyu Liu, Fangqiang Ding, Shufang Zhang, Yao Mu, Ran Song, Wei Zhang, Zeng-Guang Hou, Hong Zhang

机构 * Tianjin Key Laboratory of Intelligent Unmanned Swarm Technology and System(天津智能集群技术与系统重点实验室) School of Electrical and Information Engineering(电气与信息工程学院) Shandong University(山东大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Division of Robotics, Perception and Learning(机器人、感知与学习 division) School of Control Science and Engineering(控制科学与工程学院) Massachusetts Institute of Technology(麻省理工学院) School of Computer Science(计算机科学学院) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence(人工智能学院)

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文综述了基于模仿学习的灵巧操作方法,探讨了最新进展和关键挑战,并提出增强IL驱动灵巧操作的潜在研究方向。

Comments 32pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15597 2025-12-18 cs.RO 85%

An Open Toolkit for Underwater Field Robotics

用于水下现场机器人的开源工具包

Giacomo Picardi, Saverio Iacoponi, Matias Carandell, Jorge Aguirregomezcorta, Mrudul Chellapurath, Joaquin del Rio, Marcello Calisti, Iacopo Aguzzi

机构 * ICM-CSIC(西班牙加泰罗尼亚海洋科学研究所) Khalifa University(哈利法大学) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学) KTH Royal Institute of Technology(皇家理工学院) Scuola Superiore Sant’Anna(圣安娜高等学院)

专题命中 机器人操作 :robotics(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一个开源工具包,提供低成本、可重复的水下机器人硬件和软件,用于提升水下操作研究的可行性和创新性。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15512 2025-12-18 cs.CV cs.MM 79%

VAAS: Vision-Attention Anomaly Scoring for Image Manipulation Detection in Digital Forensics

VAAS:面向数字取证中图像篡改检测的视觉-注意力异常评分

Opeyemi Bamigbade, Mark Scanlon, John Sheppard

机构 * Forensics and Security Research Group, South East Technological University(法医与安全研究组,南东技术大学) Security Research Group, School of Computer Science, University College Dublin(安全研究组,计算机科学学院,都柏林大学学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV

AI总结 VAAS通过整合视觉注意力和片段一致性评分,提出一种双模块框架用于图像篡改检测,提升检测精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15493 2025-12-18 cs.LG cs.AI stat.ML 62%

Soft Geometric Inductive Bias for Object Centric Dynamics

基于几何的诱导偏置用于物体中心动力学

Hampus Linander, Conor Heins, Alexander Tschantz, Marco Perin, Christopher Buckley

机构 * VERSES AI University of Sussex(苏塞克斯大学) University of Sussex, Department of Informatics(苏塞克斯大学信息学院)

专题命中 机器人操作 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于几何代数神经网络的物体中心世界模型,通过柔软几何诱导偏置提升物理动力学模拟的保真度和泛化能力。

Comments 8 pages, 11 figures; 6 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14709 2025-12-18 cs.AI cs.LG 62%

Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning

注意力作为绑定:一种向量符号视角下的Transformer推理

Sahil Rajesh Dhayalkar

机构 * Sahil Rajesh Dhayalkar(独立研究者)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将Transformer的注意力机制视为软向量符号计算,通过向量符号架构视角解释其推理行为,并提出改进架构和训练目标以提升逻辑可靠性和可解释性。

Comments 12 pages with references. Submitted to 'Logical and Symbolic Reasoning in Language Models @ AAAI 2026' conference and is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10402 2025-12-18 cs.LG cs.AI 62%

The Eminence in Shadow: Exploiting Feature Boundary Ambiguity for Robust Backdoor Attacks

阴影中的卓越:利用特征边界模糊性实现稳健的后门攻击

Zhou Feng, Jiahao Chen, Chunyi Zhou, Yuwen Pu, Tianyu Du, Jinbao Li, Jianhai Chen, Shouling Ji

机构 * Zhejiang University(浙江大学) Chongqing University(重庆大学) Qilu University of Technology (Shandong Academy of Science)(青岛科技大学(山东科学院))

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 Eminence通过利用特征边界模糊性,实现稳健且隐蔽的后门攻击,以极低的毒化率有效提升攻击效果。

Comments Accepted by KDD2026 Cycle 1 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15708 2025-12-18 cs.CV 57%

Multi-View Foundation Models

多视图基础模型

Leo Segre, Or Hirschorn, Shai Avidan

机构 * Tel Aviv University(特拉维夫大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出一种将基础模型转换为多视图基础模型的方法,通过引入3D感知注意力层提升多视角特征一致性,应用于表面法线估计和多视角分割任务,实验表明其在特征匹配上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15180 2025-12-18 cs.SD cs.LG 57%

BEAT2AASIST model with layer fusion for ESDD 2026 Challenge

BEAT2AASIST模型结合层融合用于ESDD 2026挑战

Sanghyeok Chung, Eujin Kim, Donggun Kim, Gaeun Heo, Jeongbin You, Nahyun Lee, Sunmook Choi, Soyul Han, Seungsang Oh, Il-Youp Kwak

机构 * Department of Mathematics, Korea University(韩国大学数学系) Department of Statistics and Data Science, Chung-Ang University(Chung-Ang 大学统计与数据科学系) Department of Smart Cities, Chung-Ang University(Chung-Ang 大学智慧城市系) Center for Applied Mathematics, Cornell University(康奈尔大学应用数学中心) Department of Big Data Application, Hannam University(汉南大学大数据应用系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 BEAT2AASIST模型通过层融合和双AASIST分支提升环境声音深度伪造检测性能。

Comments 3 pages, 1 figure, challenge paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15703 2025-12-18 math.NA cs.NA 50%

Time integration of quantized tensor trains using the interpolative dynamical low-rank approximation

基于量化张量列车的时间积分方法

Erika Ye, Chao Yang

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出了一种基于插值的动态低秩近似方法,用于在量化张量列车框架下高效处理非线性系统的时间积分问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15400 2025-12-18 cond-mat.mtrl-sci 50%

Ultrafast Strongly Anisotropic Valleytronics in SnSe

SnSe中超快强各向异性谷电子学

Yiming Pan, Sotirios Fragkos, Dominique Descamps, Stéphane Petit, Fabio Caruso, Samuel Beaulieu

专题命中 机器人操作 :manipulation(abstract)

AI总结 SnSe中通过极化控制光激发实现了超快强各向异性谷极化动力学,揭示了与常见二维谷电子材料不同的非平衡谷物理特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14104 2025-12-18 cs.GT cs.AR cs.CY 50%

The Impact Market to Save Conference Peer Review: Decoupling Dissemination and Credentialing

市场影响:拯救会议同行评审:解耦传播与认证

Karthikeyan Sankaralingam

专题命中 机器人操作 :manipulation(abstract)

AI总结 影响市场通过解耦传播与认证,解决同行评审中的等价类问题,通过投资机制提升高影响力论文的检索率。

Comments 41 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14035 2025-12-18 physics.optics 50%

Confinement-Induced Nonlocality and Optical Nonlinearity of Transdimensional Titanium Nitride in the Epsilon-Near-Zero Region

受限诱导的非局域性和光非线性性:跨维钛氮在介电近零区域的特性

Fan-Ting Tseng, I-Hung Ho, Ting-Jui Kuo, Shangjr Gwo, Igor V. Bondarev, Hyeyoung Ahn

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究发现跨维钛氮在介电近零区域表现出显著增强的非线性吸收,揭示其作为高效非线性光学平台的潜力。

Comments Main text and supplementary information; total of 38 pages and 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27200 2025-12-18 physics.optics quant-ph 50%

Optical Vortices: Revolutionizing the field of linear and nonlinear optics

光涡:革新线性和非线性光学领域

Bikash K. Das, Camilo Granados, Marcelo F. Ciappina

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文探讨了光学涡流在线性和非线性光学中的应用,包括其生成、检测及在各种光学现象中的作用。

Comments Invited Review (Adv. Phys.: X); 104 pages; 38 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11071 2025-12-18 quant-ph cond-mat.other cond-mat.quant-gas 50%

Walsh-Floquet Theory of Periodic Kick Drives

Walsh-Floquet理论中的周期性冲击驱动

James Walkling, Marin Bukov

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究提出Walsh-Floquet理论,利用Walsh基描述周期性冲击驱动,提升单体和多体系统Floquet动力学的准确性,适用于数字量子设备的Floquet态操控。

Comments 14 pages, 12 figures

Journal ref Phys. Rev. Research 7, L042063 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 5 篇

2512.14757 2025-12-18 cs.CV cs.RO 84%

SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning

SocialNav-MoE: 一种用于社交合规导航的混合专家视觉语言模型,结合强化微调

Tomohito Kawabata, Xinyu Zhang, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 SocialNav-MoE通过混合专家模型和强化微调提升机器人社交合规导航的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15047 2025-12-18 cs.RO cs.AI cs.CL cs.CV 82%

HERO: Hierarchical Traversable 3D Scene Graphs for Embodied Navigation Among Movable Obstacles

HERO:用于在可移动障碍物间进行具身导航的分层可通行3D场景图

Yunheng Wang, Yixiao Feng, Yuetong Fang, Shuning Zhang, Tan Jing, Jian Li, Xiangrui Jiang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 HERO通过构建分层可通行3D场景图,重新定义可通行性以提升在复杂环境中的导航效率和可达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14222 2025-12-18 cs.CV cs.RO 81%

History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation

基于历史增强的双阶段变压器用于空域视觉与语言导航

Xichen Ding, Jianzhe Gao, Cong Pan, Wenguan Wang, Jie Qin

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出HETT框架,通过粗到细的导航流程整合全局环境推理与局部场景理解,提升无人机在大规模城市环境中基于语言指令的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15327 2025-12-18 cs.CV cs.AI 62%

Vision-based module for accurately reading linear scales in a laboratory

基于视觉的模块,用于实验室中准确读取线性标尺

Parvesh Saini, Soumyadipta Maiti, Beena Rai

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出了一种基于视觉的模块,用于实验室中准确读取线性标尺的测量值,通过纠正注射器方向并提取关键特征来实现高精度读数。

Comments 10 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15533 2025-12-18 eess.SY cs.SY 50%

Ising Machines for Model Predictive Path Integral-Based Optimal Control

Ising机器用于基于路径积分的最优控制的模型预测

Lorin Werthen-Brabants, Pieter Simoens

专题命中 具身导航 :robotics(abstract)

AI总结 本文提出将模型预测路径积分作为Ising机器实现的MPC方法,通过QUBO问题映射实现高效最优控制轨迹探索,并展示了其在实时控制中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 1 篇

2512.15621 2025-12-18 cs.CV 57%

OccSTeP: Benchmarking 4D Occupancy Spatio-Temporal Persistence

OccSTeP:4D占用率时空持续性基准测试

Yu Zheng, Jie Hu, Kailun Yang, Jiaming Zhang

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 OccSTeP提出了一种4D占用率时空持续性基准,通过OccSTeP-WM模型实现对自动驾驶中未来行为的反应和前瞻性预测,实验结果显示其在语义和占用率指标上均有显著提升。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 2 篇

2512.14057 2025-12-18 cs.RO 70%

Context Representation via Action-Free Transformer encoder-decoder for Meta Reinforcement Learning

通过无动作变换器编码器-解码器进行上下文表示以实现元强化学习

Amir M. Soufi Enayati, Homayoun Honari, Homayoun Najjaran

机构 * Department of Mechanical Engineering University of Victoria(机械工程系维多利亚大学) Mila-Quebec AI Institute(魁北克AI研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出CRAFT模型,通过无动作变换器编码器-解码器实现上下文表示,提升元强化学习在机器人控制中的泛化能力和适应速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15120 2025-12-18 cs.LG cs.AI 62%

Automatic Reward Shaping from Multi-Objective Human Heuristics

多目标人类启发式自动奖励塑造

Yuqing Xie, Jiayu Chen, Wenhao Tang, Ya Zhang, Chao Yu, Yu Wang

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 MORSE通过双层优化框架自动整合多目标人类启发式奖励,提升机器人任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 人机交互与遥操作 3 篇

2512.15282 2025-12-18 cs.RO cs.HC 70%

A Network-Based Framework for Modeling and Analyzing Human-Robot Coordination Strategies

基于网络的用于建模和分析人机协作策略的框架

Martijn IJtsma, Salvatore Hargis

机构 * Department of Integrated Systems Engineering, The Ohio State University(整合系统工程系,俄亥俄州立大学)

专题命中 人机交互与遥操作 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于网络的框架,用于分析人机协作策略,通过整合功能性建模与图论方法,支持在早期设计阶段对协作需求的显式推理。

Comments Under review at IEEE Transactions on Human-Machine Systems. 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14952 2025-12-18 cs.RO cs.HC 57%

Breathe with Me: Synchronizing Biosignals for User Embodiment in Robots

与我一同呼吸:用于机器人中用户具身的生物信号同步

Iddo Yehoshua Wald, Amber Maimon, Shiyao Zhang, Dennis Küster, Robert Porzel, Tanja Schultz, Rainer Malaka

机构 * University of Bremen(不莱梅大学) University of Haifa(海法大学) Cognitive Systems Lab(认知系统实验室) The Digital Media Lab(数字媒体实验室)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO

AI总结 通过实时呼吸信号同步提升机器人中用户具身体验,探索生理信号作为新型内脏通路在人机交互中的应用。

Comments Accepted to appear in the ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), Edinburgh, United Kingdom. Iddo Yehoshua Wald and Amber Maimon contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14270 2025-12-18 cs.RO 57%

CaFe-TeleVision: A Coarse-to-Fine Teleoperation System with Immersive Situated Visualization for Enhanced Ergonomics

CaFe-TeleVision:一种用于增强人体工学的粗细层次远程操控系统

Zixin Tang, Yiming Chen, Quentin Rouxel, Dianxi Li, Shuang Wu, Fei Chen

机构 * Department of Mechanical and Automation Engineering, T-Stone Robotics Institute, The Chinese University of Hong Kong, Hong Kong SAR(机械与自动化工程系、T-Stone机器人研究所、香港中文大学(深圳))

专题命中 人机交互与遥操作 :manipulation(abstract);分类 cs.RO

AI总结 CaFe-TeleVision通过粗细层次控制机制和沉浸式可视化技术,提升远程操控的人体工学效率和用户接受度。

Comments Project webpage: https://clover-cuhk.github.io/cafe_television/ Code: https://github.com/Zixin-Tang/CaFe-TeleVision

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 机器人数据与评测 8 篇

2512.15448 2025-12-18 cs.RO 80%

Load-Based Variable Transmission Mechanism for Robotic Applications

基于负载的可变传动机制用于机器人应用

Sinan Emre, Victor Barasuol, Matteo Villa, Claudio Semini

机构 * Dynamic Legged Systems (DLS) lab, Istituto Italiano di Tecnologia (IIT)(动态腿部系统(DLS)实验室,意大利技术研究所) Dipartimento di Informatica, Bioingegneria, Robotica e Ingegneria dei Sistemi (DIBRIS)(信息学、生物工程、机器人学和系统工程系)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出了一种基于负载的可变传动机制,通过预张紧弹簧和四杆机构实现传动比的被动调节,提升机器人关节驱动效率和动态扭矩适应能力。

Comments 22nd International Conference on Advanced Robotics (ICAR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14691 2025-12-18 cs.CL cs.CV 70%

MMGR: Multi-Modal Generative Reasoning

MMGR:多模态生成推理

Zefan Cai, Haoyi Qiu, Tianyi Ma, Haozhe Zhao, Gengze Zhou, Kung-Hsiang Huang, Parisa Kordjamshidi, Minjia Zhang, Wen Xiao, Jiuxiang Gu, Nanyun Peng, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) Michigan State University(密歇根州立大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Adelaide(阿德莱德大学) Salesforce AI Research(Salesforce人工智能研究) Microsoft(微软) Adobe Research(Adobe研究)

专题命中 机器人数据与评测 :navigation(abstract);world model(abstract);分类 cs.CV

AI总结 MMGR提出一个多模态生成推理评估框架,通过物理、逻辑、空间和时间五个能力评估视频和图像生成模型,揭示其在抽象推理和具身导航中的性能不足。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18929 2025-12-18 cs.CV 70%

Human-Centric Open-Future Task Discovery: Formulation, Benchmark, and Scalable Tree-Based Search

以人为中心的开放未来任务发现: formulation、基准和可扩展的树基搜索

Zijian Song, Xiaoxin Lin, Tao Pu, Zhenlong Yuan, Guangrun Wang, Liang Lin

机构 * Zijian Song 1(Song 研究所) Xiaoxin Lin 1(Lin 研究所) Tao Pu 1(Pu 研究所) Zhenlong Yuan 4(Yuan 研究所) Guangrun Wang 1,2,3(Wang 研究所) Liang Lin 1,2,3(Lin 研究所)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 本研究提出HOTD问题,通过CMAST框架在开放未来任务发现中实现最佳性能,显著超越现有LMMs。

Comments accepted to AAAI 2026, 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏