arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-02-11 至 2026-02-11 共收录 15 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 15 篇

2602.10093 2026-02-11 cs.RO 83%

UniVTAC: A Unified Simulation Platform for Visuo-Tactile Manipulation Data Generation, Learning, and Benchmarking

UniVTAC:一种用于视觉-触觉操作数据生成、学习和评估的统一仿真平台

Baijun Chen, Weijie Wan, Tianxing Chen, Xianda Guo, Congsheng Xu, Yuanyang Qi, Haojie Zhang, Longyan Wu, Tianling Xu, Zixuan Li, Yizhe Wu, Rui Li, Xiaokang Yang, Ping Luo, Wei Sui, Yao Mu

机构 * ScaleLab, Shanghai Jiao Tong University(上海交通大学ScaleLab) D-Robotics ViTai Robotics The University of Hong Kong(香港大学) Nanjing University(南京大学) Shenzhen University(深圳大学) Wuhan University(武汉大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 UniVTAC提出了一种统一的视觉-触觉数据生成平台,通过训练触觉中心的编码器和基准任务提升机器人操作的成功率。

Comments Website: https://univtac.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09367 2026-02-11 cs.RO 83%

CAPER: Constrained and Procedural Reasoning for Robotic Scientific Experiments

CAPER:用于机器人科学实验的约束和程序性推理

Jinghan Yang, Jingyi Hou, Xinbo Yu, Wei He, Yifan Wu

机构 * University of Science and Technology Beijing(北京科技大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 CAPER通过约束和程序性推理框架提升机器人在科学实验中的可控性、鲁棒性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21797 2026-02-11 cs.CV 77%

MoWM: Mixture-of-World-Models for Embodied Planning via Latent-to-Pixel Feature Modulation

MoWM: 通过潜在到像素特征调制的混合世界模型实现具身规划

Yangcheng Yu, Xin Jin, Yu Shang, Xin Zhang, Haisheng Su, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);world model(abstract);分类 cs.CV

AI总结 MoWM通过融合潜在世界模型与像素特征,提升具身规划中动作解码的精度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09772 2026-02-11 cs.RO 74%

Design and Evaluation of an Assisted Programming Interface for Behavior Trees in Robotics

行为树在机器人中的辅助编程接口设计与评估

Jonathan Styrud, Matteo Iovino, Rebecca Stower, Mart Kartašev, Mikael Norrlöf, Mårten Björkman, Christian Smith

专题命中 机器人数据与评测 :robotics(title);分类 cs.RO

AI总结 本文提出BETR-GUI,结合AI助手与拖放编辑器,通过整合多种技术提升机器人行为树编程效率,实验证明人类用户优于纯AI助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18083 2026-02-11 cs.LG cs.RO 73%

What Do You Need for Compositional Generalization in Diffusion Planning?

在扩散规划中你需要什么才能实现组合泛化?

Quentin Clark, Florian Shkurti

机构 * Department of Computer Science, University of Toronto(计算机科学系,多伦多大学)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出Eq-Net架构,通过位移等变性、局部感受野和推断选择实现扩散规划的组合泛化,展示其在导航和操作任务中的有效性。

Comments 8 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10102 2026-02-11 cs.CV 70%

VideoWorld 2: Learning Transferable Knowledge from Real-world Videos

VideoWorld 2: 从真实世界视频中学习可迁移的知识

Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, Xiaojie Jin

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.CV

AI总结 VideoWorld 2通过动态增强的潜在动态模型从真实世界视频中学习可迁移知识,显著提升了任务成功率和长周期推理能力。

Comments Code and models are released at: https://maverickren.github.io/VideoWorld2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09893 2026-02-11 cs.RO cs.AI 62%

TaCo: A Benchmark for Lossless and Lossy Codecs of Heterogeneous Tactile Data

TaCo: 一种用于异构触觉数据无损和有损编解码器的基准测试

Zhengxue Cheng, Yan Zhao, Keyu Wang, Hengdi Zhang, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Paxini Tech.(帕辛尼科技)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 TaCo提出了一种用于评估触觉数据编解码器性能的基准测试,通过评估30种压缩方法,包括神经编解码器,验证了无损和有损压缩方案在多个任务中的优越性能。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19713 2026-02-11 cs.CV cs.RO 62%

VIMD: Monocular Visual-Inertial Motion and Depth Estimation

VIMD:单目视觉-惯性运动和深度估计

Saimouli Katragadda, Guoquan Huang

机构 * University of Delaware (UD) College of Engineering(德克萨斯大学达勒姆分校工程学院) University of Delaware(德克萨斯大学达勒姆分校) Robot Perception and Navigation Group (RPNG)(机器人感知与导航小组)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 VIMD通过多视图信息迭代优化像素尺度,实现高效且鲁棒的单目视觉-惯性深度估计,适用于资源受限的3D视觉感知场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22516 2026-02-11 cs.LG cs.CV 62%

Ice-FMBench: A Foundation Model Benchmark for Sea Ice Type Segmentation

Ice-FMBench: 一个用于海冰类型分割的基础模型基准

Samira Alkaee Taleghan, Morteza Karimzadeh, Andrew P. Barrett, Walter N. Meier, Farnoush Banaei-Kashani

机构 * University of Colorado Denver(科罗拉多大学丹佛分校) University of Colorado Boulder(科罗拉多大学波德分校) National Snow and Ice Data Center (NSIDC), CIRES, University of Colorado Boulder(国家冰雪数据研究中心(NSIDC)、CIRES、科罗拉多大学波德分校)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV、cs.LG

AI总结 Ice-FMBench为海冰类型分割任务提供了一个基准框架,评估基础模型的性能,并通过多教师知识蒸馏方法提升模型的时空可转移性。

Journal ref ACM ACM SIGSPATIAL PoIDS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21872 2026-02-11 eess.IV cs.LG 57%

Targeted Unlearning Using Perturbed Sign Gradient Methods With Applications On Medical Images

利用扰动符号梯度方法的目标遗忘与医疗图像应用

George R. Nahass, Zhu Wang, Homa Rashidisabet, Won Hwa Kim, Sasha Hubschman, Jeffrey C. Peterson, Chad A. Purnell, Pete Setabutr, Ann Q. Tran, Darvin Yi, Sathya N. Ravi

机构 * Department of Biomedical Engineering(生物医学工程系) Department of Ophthalmology(眼科学系) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Department of Computer Science(计算机科学系) Computer Science and Engineering(计算机科学与工程) Pohang University of Science and Technology, South Korea(韩国釜山科学技术大学) Department of Plastic and Reconstructive Surgery(整形外科与重建外科系)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 本文提出了一种基于扰动符号梯度的方法,用于医疗图像中的目标遗忘,通过可调损失设计和模型组合策略,在遗忘与保留之间取得平衡,优于现有基线方法。

Comments 39 pages, 12 figures, 11 tables, 3 algorithms

Journal ref Transactions on Machine Learning Research 2025, https://openreview.net/forum?id=XE0bJg6sQN

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09765 2026-02-11 cs.RO 57%

NavDreamer: Video Models as Zero-Shot 3D Navigators

NavDreamer: 视频模型作为零样本三维导航器

Xijie Huang, Weiqi Gai, Tianyue Wu, Congyu Wang, Zhiyang Liu, Xin Zhou, Yuze Wu, Fei Gao

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 NavDreamer利用视频模型实现零样本三维导航,通过生成视频模型作为语言指令与导航轨迹的接口,结合时空信息和物理动态,实现强大泛化能力。

Comments Work in the progress. 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06747 2026-02-11 cs.CV 57%

Wandering around: A bioinspired approach to visual attention through object motion sensitivity

游走探索:一种受生物启发的通过物体运动敏感性实现视觉注意的方法

Giulia D'Angelo, Victoria Clerico, Chiara Bartolozzi, Matej Hoffmann, P. Michael Furlong, Alexander Hadjiivanov

机构 * Department of Cybernetics, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克技术大学普拉茨分校电子工程系) IBM Research Europe, Zurich, Switzerland(IBM欧洲研究院,瑞士苏黎世) Italian Institute of Technology, Genoa, Italy(意大利理工学院,热那亚) National Research Council of Canada & Systems Design Engineering, University of Waterloo, Canada(加拿大国家研究理事会与系统设计工程,滑铁卢大学) European Space Agency, Noordwijk, The Netherlands(欧洲航天局,荷兰诺德维克) Adapsent, Leiden, The Netherlands(Adapsent,荷兰莱顿)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出了一种受生物启发的视觉注意系统,通过物体运动敏感性实现选择性注意,利用动态视觉传感器和神经形态算法,实现高效低延迟的实时目标检测与分割。

Journal ref Neuromorphic Computing and Engineering 5.2 (2025): 024019

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07801 2026-02-11 cs.CV 57%

Deep Learning-Based Object Pose Estimation: A Comprehensive Survey

基于深度学习的对象位姿估计:全面综述

Jian Liu, Wei Sun, Hui Yang, Zhiwen Zeng, Chongpei Liu, Jin Zheng, Xingyu Liu, Hossein Rahmani, Nicu Sebe, Ajmal Mian

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文综述了基于深度学习的对象位姿估计的最新进展,涵盖实例级、类别级和未见过对象的位姿估计,分析了当前方法的挑战与未来方向。

Comments Accepted by IJCV 2026, 45 pages, 13 figures

Journal ref International Journal of Computer Vision, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09310 2026-02-11 cs.HC 50%

A11y-CUA Dataset: Characterizing the Accessibility Gap in Computer Use Agents

A11y-CUA数据集:表征计算机使用代理中的可访问性差距

Ananya Gubbi Mohanbabu, Rosiana Natalie, Brandon Kim, Anhong Guo, Amy Pavel

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 A11y-CUA数据集通过分析BLVUs与SUs的交互差异,揭示CUAs在辅助技术条件下的性能下降,旨在推动更包容的CUA发展。

Comments 25 pages, 10 figures. Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15518 2026-02-11 physics.ao-ph physics.geo-ph 50%

Developing Global Aerosol Models based on the Analysis of 30-Year Ground Measurements by AERONET (AEROEX models) and Implication on Satellite based Aerosol Retrievals

基于AERONET 30年地面观测分析开发全球气溶胶模型(AEROEX模型)及其对卫星气溶胶反演的启示

Manoj K Mishra, Shameela S F, Pradyuman Singh Rathore

专题命中 机器人数据与评测 :robotic(abstract)

AI总结 本研究基于AERONET30年数据开发AEROEX模型,通过聚类分析改进全球气溶胶模型并提升卫星反演精度。

Journal ref Science of The Total Environment 2025

详情

展开后加载摘要…

URL PDF HTML 收藏