arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8673 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8673 篇

2602.02318 2026-02-03 cs.CV 57%

Enhancing Indoor Occupancy Prediction via Sparse Query-Based Multi-Level Consistent Knowledge Distillation

通过稀疏查询多级一致知识蒸馏增强室内占用预测

Xiang Li, Yupeng Zheng, Pengfei Li, Yilun Chen, Ya-Qin Zhang, Wenchao Ding

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) AIR, Tsinghua University(清华大学人工智能研究院) TARS College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 DiScene通过多级一致知识蒸馏和教师引导初始化,实现高效鲁棒的室内占用预测,优于现有方法并取得SOTA性能。

Comments Accepted by RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01535 2026-02-03 cs.RO 57%

Co-Design of Rover Wheels and Control using Bayesian Optimization and Rover-Terrain Simulations

利用贝叶斯优化和越野地形模拟进行轮式机器人轮子与控制的协同设计

Huzaifa Mustafa Unjhawala, Khizar Shaikh, Luning Bakke, Radu Serban, Dan Negrut

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出利用贝叶斯优化和高保真模拟,实现越野车辆轮子设计与控制的协同优化,提升全车辆在可变形地形中的性能。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20377 2026-02-03 cs.RO eess.SP 57%

RF-MatID: Dataset and Benchmark for Radio Frequency Material Identification

RF-MatID: 用于射频材料识别的数据集和基准

Xinyan Chen, Qinchun Li, Ruiqin Ma, Jiaqi Bai, Li Yi, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室) Ibaraki University(岩手大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO

AI总结 RF-MatID是一个大规模射频数据集,用于细粒度材料识别,包含16个细粒度类别和5个超类,覆盖4至43.5 GHz的频率范围,通过多设置多协议基准推动算法发展和实际应用。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01226 2026-02-03 cs.RO cs.HC 57%

SkySim: A ROS2-based Simulation Environment for Natural Language Control of Drone Swarms using Large Language Models

SkySim: 一种基于ROS2的无人机群自然语言控制仿真环境

Aditya Shibu, Marah Saleh, Mohamed Al-Musleh, Nidhal Abdulaziz

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 SkySim通过基于ROS2的仿真框架,利用大型语言模型实现无人机群的自然语言控制,结合人工势场算法确保安全执行,验证了空间推理精度和实时碰撞避免能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00839 2026-02-03 cs.CV 57%

TransNormal: Dense Visual Semantics for Diffusion-based Transparent Object Normal Estimation

TransNormal: 用于扩散基透明物体法线估计的密集视觉语义

Mingwei Li, Hehe Fan, Yi Yang

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 TransNormal通过整合密集视觉语义和多任务学习,提升透明物体法线估计的精度与鲁棒性。

Comments Project Page: https://longxiang-ai.github.io/TransNormal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00500 2026-02-03 cs.RO 57%

Inject Once Survive Later: Backdooring Vision-Language-Action Models to Persist Through Downstream Fine-tuning

一次注入,后期存活:向视觉-语言-动作模型注入后门以在下游微调中持续存在

Jianyi Zhou, Yujie Wei, Ruichen Zhen, Bo Zhao, Xiaobo Xia, Rui Shao, Xiu Su, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院) Shanghai Jiaotong University(上海交通大学) National University of Singapore(新加坡国立大学) Central South University(中南大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO

AI总结 本文提出INFUSE框架,首次实现对VLA模型的后门攻击,使其在用户微调后仍能保持有效性,显著提升攻击成功率并保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21915 2026-02-03 cs.CV 57%

VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models

VideoAesBench: 大规模多模态模型视频审美感知能力评估基准

Yunhao Li, Sijing Wu, Zhilin Gao, Zicheng Zhang, Qi Jia, Huiyu Duan, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 VideoAesBench通过多样化视频内容和多类型问题评估大规模多模态模型的视频审美感知能力,揭示当前模型在该领域的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22878 2026-02-02 eess.IV cs.CV 57%

Development of Domain-Invariant Visual Enhancement and Restoration (DIVER) Approach for Underwater Images

水下图像领域不变视觉增强与恢复(DIVER)方法的开发

Rajini Makam, Sharanya Patil, Dhatri Shankari T M, Suresh Sundaram, Narasimhan Sundararajan

机构 * Department of Aerospace Engineering, Indian Institute of Science(航空航天工程系,印度科学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 DIVER通过整合经验校正与物理引导建模,实现水下图像的领域不变增强与恢复,显著提升视觉质量和机器人感知性能。

Comments Submitted to IEEE Journal of Oceanic Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13218 2026-02-02 cs.CV 57%

ObjectVisA-120: Object-based Visual Attention Prediction in Interactive Street-crossing Environments

ObjectVisA-120: 交互式过街环境中的基于物体的视觉注意力预测

Igor Vozniak, Philipp Mueller, Nils Lipp, Janis Sprenger, Konstantin Poddubnyy, Davit Hovhannisyan, Christian Mueller, Andreas Bulling, Philipp Slusallek

机构 * German Research Center for Artificial Intelligence (DFKI) GmbH(德国人工智能研究中心(DFKI)) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Institute for Visualization and Interactive Systems (VIS) at Stuttgart University(斯图加特大学可视化与交互系统研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 ObjectVisA-120提出了一种新的虚拟现实数据集和基于物体的相似性指标,用于改进视觉注意力预测模型。

Comments Accepted for publication at the IEEE Intelligent Vehicles Symposium (IV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22529 2026-02-02 cs.CV 57%

SHED Light on Segmentation for Dense Prediction

SHED:用于密集预测的分割光照

Seung Hyun Lee, Sangwoo Mo, Stella X. Yu

机构 * University of Michigan(密歇根大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 SHED通过整合分割到密集预测中,提出了一种新的编码器-解码器架构,以提升深度边界锐度、分割连贯性和3D重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22322 2026-02-02 cs.LG eess.SP 57%

Spatially-Adaptive Conformal Graph Transformer for Indoor Localization in Wi-Fi Driven Networks

空间自适应符合图变换器用于Wi-Fi驱动网络中的室内定位

Ayesh Abu Lehyeh, Anastassia Gharib, Safwan Wshah

机构 * Department of Computer Science, The University of Vermont(佛罗里达大学计算机科学系) Department of Computer Science & Engineering, American University of Sharjah(阿曼大学计算机科学与工程系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 本文提出SAC-GT框架,通过空间自适应符合预测方法提升Wi-Fi驱动网络中室内定位的精度与可靠性。

Comments Accepted to IEEE ICC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08198 2026-02-02 cs.GR cs.RO 57%

Emergent morphogenesis via planar fabrication enabled by a reduced model of composites

通过平面制造实现的新兴形态生成:由复合材料简化模型驱动

Yupeng Zhang, Adam Alon, M. Khalid Jawed

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出了一种简化模型,通过平面制造实现可编程的三维形态生成,利用双层系统中的应变不匹配产生多种三维结构。

Comments GitHub repository: https://github.com/StructuresComp/discrete-shells-shrinky-dink/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22027 2026-01-30 cs.AI 57%

CAR-bench: Evaluating the Consistency and Limit-Awareness of LLM Agents under Real-World Uncertainty

CAR-bench: 评估在现实世界不确定性下LLM代理的一致性和限意识

Johannes Kirmayr, Lukas Stappen, Elisabeth André

机构 * BMW Group Research and Technology(宝马集团研究与技术) Augsburg University(艾希施泰特大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 CAR-bench旨在评估LLM代理在现实世界不确定性下的一致性、不确定性处理和能力意识,通过多轮对话和工具使用测试其可靠性和自我意识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25731 2026-01-30 cs.CV 57%

LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing

LaTo:基于地标token化的扩散变换器用于精细的人脸编辑

Zhenghao Zhang, Ziying Zhang, Junchao Liao, Xiangyu Meng, Qiang Hu, Siyu Zhu, Xiaoyun Zhang, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里云计算) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 LaTo通过地标token化扩散变换器实现精细的人脸编辑,提升身份保持与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02250 2026-01-30 cs.HC cs.RO 57%

Designing Effective Human-Swarm Interaction Interfaces: Insights from a User Study on Task Performance

设计高效的人-群体交互界面:基于任务表现的用户研究洞察

Wasura D. Wattearachchi, Erandi Lakshika, Kathryn Kasmarik, Michael Barlow

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种系统方法设计人-群体交互界面,通过用户研究验证了其在目标搜索任务中对机器人群的引导效果,尤其在移动危险情况下表现优异。

Comments 8 pages, 4 figures, 5 tables

Journal ref 2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Vienna, Austria, 2025, pp. 3386-3393

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20130 2026-01-29 cs.RO 57%

Real-Time Robot Execution with Masked Action Chunking

实时机器人执行与遮蔽动作分块

Haoxuan Wang, Gengyu Zhang, Yan Yan, Yuzhang Shang, Ramana Rao Kompella, Gaowen Liu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Central Florida(中央佛罗里达大学) Cisco Research(思科研究)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 REMAC通过遮蔽动作分块学习修正调整,提升机器人在异步推理中的执行可靠性与鲁棒性。

Comments ICLR 2026. Project page at https://remac-async.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11987 2026-01-29 cs.AI 57%

SimBench: A Framework for Evaluating and Diagnosing LLM-Based Digital-Twin Generation for Multi-Physics Simulation

SimBench:用于多物理仿真中基于LLM的数字孪生生成评估与诊断的框架

Jingquan Wang, Andrew Negrut, Hongyu Wang, Harry Zhang, Dan Negrut

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI

AI总结 SimBench是一个用于评估和诊断基于LLM的数字孪生生成能力的框架,适用于多物理仿真场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19048 2026-01-28 cs.CV 57%

NuiWorld: Exploring a Scalable Framework for End-to-End Controllable World Generation

NuiWorld:探索一个可扩展的端到端可控世界生成框架

Han-Hung Lee, Cheng-Yu Yang, Yu-Lun Liu, Angel X. Chang

机构 * Simon Fraser University(西蒙弗雷泽大学) National Yang Ming Chiao Tung University(国家阳明交通大学) Simon Fraser University, CIFAR AI Chair, Amii(西蒙弗雷泽大学、CIFAR人工智能主席、Amii)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 NuiWorld通过生成性自bootstrap策略和可扩展场景生成技术,解决世界生成中的可控性、可扩展性和效率问题,实现端到端可控世界生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21715 2026-01-28 cs.CV 57%

Impact of Underwater Image Enhancement on Feature Matching

水下图像增强对特征匹配的影响

Jason M. Summers, Mark W. Jones

机构 * Department of Computer Science Swansea University(计算机科学系萨瑟兰大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出了一种评估水下图像增强效果的框架,通过分析增强对特征匹配的影响,验证了其在SLAM算法中的实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11003 2026-01-28 cs.CV 57%

ForensicHub: A Unified Benchmark & Codebase for All-Domain Fake Image Detection and Localization

ForensicHub: 一个统一的基准与代码库用于所有领域伪造图像检测与定位

Bo Du, Xuekang Zhu, Xiaochen Ma, Chenfan Qu, Kaiwen Feng, Zhe Yang, Chi-Man Pun, Jian Liu, Ji-Zhe Zhou

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 ForensicHub 提出一个统一的基准与代码库,用于所有领域伪造图像检测与定位,通过模块化架构和配置驱动设计,实现跨领域灵活组合和深入分析。

Comments NeurIPS 2025 DB Track Paper. Code available at: https://github.com/scu-zjz/ForensicHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18754 2026-01-27 cs.CR cs.AI 57%

$α^3$-SecBench: A Large-Scale Evaluation Suite of Security, Resilience, and Trust for LLM-based UAV Agents over 6G Networks

$α^3$-SecBench:一个大规模评估套件,用于评估基于LLM的无人机代理在6G网络中的安全、韧性与信任

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿拉伯联合酋长国大学) Khalifa University of Science and Technology(科学与技术喀拉奇大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 $α^3$-SecBench通过大规模评估基于LLM的无人机代理在6G网络中的安全、韧性和信任,揭示了现有模型在对抗环境下的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08684 2026-01-27 cs.RO 57%

A Computationally Efficient Maximum A Posteriori Sequence Estimation via Stein Variational Inference

通过Stein变分推断实现计算高效的最大后验序列估计

Min-Won Seo, Solmaz S. Kia

机构 * Department of Mechanical and Aerospace Engineering, University of California, Irvine(加州大学尔湾分校机械与航空航天工程系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出Stein-MAP-Seq方法,通过整合Stein变分梯度下降与动态规划算法,实现高效多模态状态估计。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05153 2026-01-27 stat.ML cs.LG 57%

Uncertainty Quantification and Propagation in Surrogate-based Bayesian Inference

代理模型中不确定性量化与传播的 Bayesian 推断

Philipp Reiser, Javier Enrique Aguilar, Anneli Guthke, Paul-Christian Bürkner

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 本文提出了一种可扩展的贝叶斯框架,用于代理建模中的不确定性量化与传播,通过三种方法提升对现实世界建模任务中参数估计的可靠性。

Journal ref Statistics and Computing 35(3):66 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09213 2026-01-27 cs.RO 57%

iFANnpp: Nuclear Power Plant Digital Twin for Robots and Autonomous Intelligence

iFANnpp:用于机器人和自主智能的核电厂数字孪生

Youndo Do, Marc Zebrowitz, Jackson Stahl, Fan Zhang

机构 * George W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology(佐治亚理工学院乔治·W·伍德鲁夫机械工程学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 iFANnpp提出一种全面的核电厂数字孪生,通过Unreal Engine 5和通用加压水堆模拟器实现实时监控与预测性维护,提升机器人自主智能研究。

Journal ref Annals of Nuclear Energy, 210, 111993 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16079 2026-01-26 cs.CV 57%

Masked Modeling for Human Motion Recovery Under Occlusions

遮蔽建模用于遮挡下的人体运动恢复

Zhiyin Qian, Siwei Zhang, Bharat Lal Bhatnagar, Federica Bogo, Siyu Tang

机构 * ETH Zürich(苏黎世联邦理工学院) Meta Reality Labs(Meta现实实验室)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 MoRo通过遮蔽建模方法,在遮挡条件下实现高效且鲁棒的人体运动恢复,结合多模态先验提升推理性能。

Comments Project page: https://mikeqzy.github.io/MoRo

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25237 2026-01-26 cs.CV 57%

DeepShield: Fortifying Deepfake Video Detection with Local and Global Forgery Analysis

DeepShield: 通过局部和全局伪造分析强化深度伪造视频检测

Yinqi Cai, Jichang Li, Zhaolun Li, Weikai Chen, Rushi Lan, Xi Xie, Xiaonan Luo, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Pengcheng Laboratory(鹏城实验室) Guilin University of Electronic Technology(桂林电子科技大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 DeepShield通过局部和全局伪造分析提升深度伪造检测的鲁棒性,有效应对未知伪造攻击。

Comments ICCV 2025. Code is available at https://github.com/lijichang/DeepShield

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00243 2026-01-26 cs.CV 57%

VOCAL: Visual Odometry via ContrAstive Learning

基于对比学习的视觉里程计:VOCAL

Chi-Yao Huang, Zeel Bhatt, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 VOCAL通过对比学习将视觉里程计重新定义为标签排序问题,提升可解释性和灵活性,推动更通用的空间智能发展。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09693 2026-01-23 cs.CV 57%

CropCraft: Complete Structural Characterization of Crop Plants From Images

CropCraft: 作物植物的完整结构表征从图像

Albert J. Zhai, Xinlei Wang, Kaiyuan Li, Zhao Jiang, Junxiong Zhou, Sheng Wang, Zhenong Jin, Kaiyu Guan, Shenlong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 CropCraft通过逆向程序建模优化植物形态参数,实现从图像中完整重建作物3D结构,用于农业监测与模拟应用。

Comments 3DV 2026 (Oral). Project page: https://ajzhai.github.io/CropCraft

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14691 2026-01-23 cs.AI cs.CL 57%

Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation

操纵法官:不忠的推理链可能损害智能体评估

Muhammad Khalifa, Lajanugen Logeswaran, Jaekyeom Kim, Sungryull Sohn, Yunxiang Zhang, Moontae Lee, Hao Peng, Lu Wang, Honglak Lee

机构 * University of Michigan(密歇根大学) LG AI Research(LG人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文揭示了LLM法官对智能体推理轨迹操纵的脆弱性,表明基于内容的操纵能显著提高假阳性率,凸显了需验证推理与证据的评估机制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11932 2026-01-22 cs.CV 57%

Hyperphantasia: A Benchmark for Evaluating the Mental Visualization Capabilities of Multimodal LLMs

Hyperphantasia: 一个多模态大语言模型心理可视化能力评估基准

Mohammad Shahab Sepehri, Berk Tinaz, Zalan Fabian, Mahdi Soltanolkotabi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 Hyperphantasia是一个评估多模态大语言模型心理可视化能力的合成基准,通过四个精心设计的谜题揭示了人类与当前模型之间的性能差距,并探索了强化学习在提升视觉模拟能力上的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏