arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8699 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8699 篇

2503.03947 2026-01-27 cs.CV cs.AI cs.RO 67%

COARSE: Collaborative Pseudo-Labeling with Coarse Real Labels for Off-Road Semantic Segmentation

COARSE:协作伪标签与粗略真实标签用于越野语义分割

Aurelio Noca, Xianmei Lei, Jonathan Becktor, Jeffrey Edlund, Anna Sabel, Patrick Spieler, Curtis Padgett, Alexandre Alahi, Deegan Atha

机构 * Jet Propulsion Laboratory, California Institute of Technology(喷气推进实验室,加州理工学院) EPFL, Ecole Polytechnique Federale de Lausanne(苏黎世联邦理工学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 COARSE通过协作伪标签与粗略真实标签提升越野语义分割的域适应能力,实验证明在多生物环境下的有效性。

Comments preprint, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14438 2026-01-22 cs.CV cs.AI cs.CL cs.LG 67%

Vision-Based Natural Language Scene Understanding for Autonomous Driving: An Extended Dataset and a New Model for Traffic Scene Description Generation

基于视觉的自然语言场景理解用于自动驾驶:一个扩展数据集和一个用于交通场景描述生成的新模型

Danial Sadrian Zadeh, Otman A. Basir, Behzad Moshiri

机构 * Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系) School of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰大学电气与计算机工程学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出了一种基于视觉的自然语言场景理解模型,通过扩展数据集和混合注意力机制,提升自动驾驶中交通场景描述生成的准确性和丰富性。

Comments Under review at Computer Vision and Image Understanding (submitted July 25, 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16281 2026-01-15 cs.RO cs.AI cs.LG 67%

Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification

按言行事:通过运行时推理-动作对齐验证引导视觉-语言-动作模型

Yilin Wu, Anqi Li, Tucker Hermans, Fabio Ramos, Andrea Bajcsy, Claudia Pérez-D'Arpino

机构 * NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) University of Utah(犹他大学) University of Sydney(悉尼大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 通过运行时推理-动作对齐验证方法提升视觉-语言-动作模型的鲁棒性和行为组合能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07474 2026-01-13 cs.LG cs.AI cs.CV 67%

Task Prototype-Based Knowledge Retrieval for Multi-Task Learning from Partially Annotated Data

基于任务原型的知识检索多任务学习:从部分标注数据中学习

Youngmin Oh, Hyung-Il Kim, Jung Uk Kim

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出基于原型的知识检索框架,通过任务原型嵌入和知识检索变压器实现稳健的多任务学习,适用于部分标注数据场景。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02994 2026-01-07 cs.RO cs.AI cs.LG 67%

Learning to Act Robustly with View-Invariant Latent Actions

通过视图不变的潜在动作学习鲁棒性

Youngjoon Jeong, Junha Chun, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 VILA通过建模基于物理动态的视图不变潜在动作,提升机器人策略在不同视角下的鲁棒性和泛化能力。

Comments Website: https://joon-stack.github.io/VILA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02427 2026-01-07 cs.CV cs.AI cs.LG 67%

NitroGen: An Open Foundation Model for Generalist Gaming Agents

NitroGen:一种通用游戏代理的开源基础模型

Loïc Magne, Anas Awadalla, Guanzhi Wang, Yinzhen Xu, Joshua Belofsky, Fengyuan Hu, Joohwan Kim, Ludwig Schmidt, Georgia Gkioxari, Jan Kautz, Yisong Yue, Yejin Choi, Yuke Zhu, Linxi "Jim" Fan

机构 * NVIDIA Stanford(斯坦福大学) Caltech(加州理工学院) UChicago(芝加哥大学) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 NitroGen通过大规模行为克隆训练,实现跨游戏泛化能力,提升任务成功率达52%

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22263 2025-12-30 cs.CV cs.LG cs.RO 67%

Evaluating an Adaptive Multispectral Turret System for Autonomous Tracking Across Variable Illumination Conditions

评估一种自适应多光谱 turret 系统用于自主跟踪在变化的照明条件下

Aahan Sachdeva, Dhanvinkumar Ganeshkumar, James E. Gallagher, Tyler Treat, Edward J. Oughton

机构 * Department of Geography & Geoinformation Science, George Mason University(地理与地理信息科学系,乔治·马歇尔大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出了一种自适应多光谱turret系统,通过融合RGB和LWIR视频流提升自主机器人在不同光照条件下的跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21723 2025-12-29 cs.RO cs.AI cs.LG 67%

HELP: Hierarchical Embodied Language Planner for Household Tasks

家庭任务的分层具身语言规划器HELP

Alexandr V. Korchemnyi, Anatoly O. Onishchenko, Eva A. Bakaeva, Alexey K. Kovalev, Aleksandr I. Panov

机构 * MIRAI Cognitive AI Systems Lab(认知人工智能系统实验室)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 HELP通过分层结构的LLM智能体解决家庭任务中的复杂规划问题,结合自然语言处理与具身智能,实现高效任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21673 2025-12-29 cs.CV cs.AI cs.LG 67%

Comparative Analysis of Deep Learning Models for Perception in Autonomous Vehicles

自动驾驶车辆感知中深度学习模型的比较分析

Jalal Khan

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文比较了YOLO-NAS和YOLOv8在自动驾驶车辆感知任务中的性能,发现YOLOv8在训练时间和检测精度上均优于YOLO-NAS。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03210 2025-12-04 cs.CV cs.LG cs.RO 67%

Flux4D: Flow-based Unsupervised 4D Reconstruction

Flux4D: 基于流的无监督4D重建

Jingkang Wang, Henry Che, Yun Chen, Ze Yang, Lily Goli, Sivabalan Manivasagam, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学) UIUC(伊利诺伊大学香槟分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 Flux4D通过无监督学习直接从原始数据中重建大规模动态场景,无需预训练模型或先验知识,实现高效且可扩展的4D重建。

Comments NeurIPS 2025. Project page: https://waabi.ai/flux4d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02810 2025-12-03 cs.RO cs.AI cs.LG 67%

Phase-Adaptive LLM Framework with Multi-Stage Validation for Construction Robot Task Allocation: A Systematic Benchmark Against Traditional Optimization Algorithms

具有多阶段验证的相适应LLM框架用于施工机器人任务分配:与传统优化算法的系统基准测试

Shyam prasad reddy Kaitha, Hongrui Yu

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出LTAA框架,结合LLM推理与结构化验证,实现施工机器人任务分配的高效协调,展示LLM在任务分配中的优越性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00565 2025-12-02 cs.CV cs.AI cs.RO 67%

Describe Anything Anywhere At Any Moment

在任何地方、任何时间描述任何事物

Nicolas Gorlo, Lukas Schmid, Luca Carlone

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 DAAAM是一种用于大规模实时4D场景理解的空间时间记忆框架,通过优化前端和分层4D场景图实现高效语义描述与实时性能的平衡。

Comments 14 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00287 2025-12-02 cs.RO cs.AI cs.CV 67%

RealAppliance: Let High-fidelity Appliance Assets Controllable and Workable as Aligned Real Manuals

RealAppliance: 让高保真家电资产可控且可操作,如对齐的现实手册

Yuzheng Gao, Yuxing Long, Lei Kang, Yuchong Guo, Ziyan Yu, Shangqing Mao, Jiyao Zhang, Ruihai Wu, Dongjiang Li, Hui Shen, Hao Dong

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 RealAppliance通过高保真家电资产和对齐手册的基准测试,推动家电操控技术的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15874 2025-11-21 cs.CV cs.AI cs.LG 67%

WALDO: Where Unseen Model-based 6D Pose Estimation Meets Occlusion

WALDO: 未见模型驱动的6D姿态估计与遮挡的交汇

Sajjad Pakdamansavoji, Yintao Ma, Amir Rasouli, Tongtong Cao

机构 * Huawei Technologies Canada(华为技术加拿大)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 WALDO提出四种改进方法,提升模型驱动6D姿态估计在遮挡情况下的鲁棒性和精度,实验显示在ICBIN和BOP数据集上精度提升超过5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14160 2025-11-19 cs.CV cs.AI cs.RO 67%

RynnEC: Bringing MLLMs into Embodied World

Ronghao Dang, Yuqian Yuan, Yunxuan Mao, Kehan Li, Jiangpin Liu, Zhikai Wang, Xin Li, Fan Wang, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(虎盘实验室) Zhejiang University(浙江大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

Comments The technical report of RynnEC, an embodied cognition MLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09724 2025-11-14 cs.CV cs.AI cs.RO 67%

PALMS+: Modular Image-Based Floor Plan Localization Leveraging Depth Foundation Model

Yunqian Cheng, Benjamin Princen, Roberto Manduchi

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.CV

Comments Accepted to IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026, Application Track. Main paper: 8 pages, 5 figures. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07096 2025-11-11 cs.RO cs.AI cs.LG 67%

X-Sim: Cross-Embodiment Learning via Real-to-Sim-to-Real

Prithwish Dan, Kushal Kedia, Angela Chao, Edward Weiyi Duan, Maximus Adrian Pace, Wei-Chiu Ma, Sanjiban Choudhury

机构 * Cornell University(康奈尔大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00801 2025-11-11 cs.CV cs.AI cs.RO 67%

Environment-Driven Online LiDAR-Camera Extrinsic Calibration

Zhiwei Huang, Jiaqi Li, Hongbo Zhao, Xiao Ma, Ping Zhong, Xiaohu Zhou, Wei Ye, Rui Fan

机构 * Department of Control Science & Engineering, the College of Electronic & Information Engineering, Tongji University(控制科学与工程系,电子与信息工程学院,同济大学) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) Beijing Institute of Aerospace Control Devices(北京航天控制器件研究所) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.11911 2025-11-03 cs.CV cs.LG cs.RO 67%

Domain Adaptation Through Task Distillation

Brady Zhou, Nimit Kalra, Philipp Krähenbühl

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV、cs.LG

Comments Published in European Conference on Computer Vision (ECCV 2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24317 2025-10-29 cs.CR 67%

Cybersecurity AI Benchmark (CAIBench): A Meta-Benchmark for Evaluating Cybersecurity AI Agents

María Sanz-Gómez, Víctor Mayoral-Vilches, Francesco Balassone, Luis Javier Navarrete-Lozano, Cristóbal R. J. Veas Chavez, Maite del Mundo de Torres

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23576 2025-10-28 cs.RO cs.AI cs.CV 67%

UrbanVLA: A Vision-Language-Action Model for Urban Micromobility

Anqi Li, Zhiyong Wang, Jiazhao Zhang, Minghan Li, Yunpeng Qi, Zhibo Chen, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot USTC(中国科学技术大学) BAAI(阿里巴巴人工智能研究院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20414 2025-10-28 cs.GR cs.CV cs.LG cs.RO 67%

SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent

Yandan Yang, Baoxiong Jia, Shujie Zhang, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(1 通用人工智能国家重点实验室、BIGAI) Tsinghua University(2 清华大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV、cs.LG

Comments Accepted by NeurIPS 2025, 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13457 2025-10-28 cs.RO cs.AI cs.LG cs.SY eess.SY 67%

Zero-Shot Trajectory Planning for Signal Temporal Logic Tasks

Ruijia Liu, Ancheng Hou, Xiao Yu, Xiang Yin

机构 * Department of Automation(自动化系) Shanghai Jiao Tong University(上海交通大学) Institute of Artificial Intelligence(人工智能研究院) Xiamen University(厦门大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14980 2025-10-21 cs.AI cs.CL cs.CV cs.GR cs.LG 67%

Agentic Design of Compositional Machines

Wenqian Zhang, Weiyang Liu, Zhen Liu

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

Comments 75 pages, 31 figures, Project Page: https://besiegefield.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12634 2025-10-20 cs.CV cs.AI cs.CL cs.RO 67%

MotionScript: Natural Language Descriptions for Expressive 3D Human Motions

Payam Jome Yazdian, Rachel Lagasse, Hamid Mohammadi, Eric Liu, Li Cheng, Angelica Lim

机构 * School of Computing Science, Simon Fraser University(西蒙弗雷泽大学计算机科学系) Dept. of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

Comments Project webpage: https://pjyazdian.github.io/MotionScript

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11031 2025-10-09 cs.RO cs.AI cs.LG 67%

NAR-*ICP: Neural Execution of Classical ICP-based Pointcloud Registration Algorithms

Efimia Panagiotaki, Daniele De Martini, Lars Kunze, Paul Newman, Petar Veličković

机构 * Oxford Robotics Institute (ORI), University of Oxford, UK(牛津大学机器人研究所(ORI)) Bristol Robotics Laboratory (BRL), University of the West of England, UK(布里斯托尔机器人实验室(BRL)) Google DeepMind and the University of Cambridge, UK(谷歌DeepMind和剑桥大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

Comments 19 pages, 16 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05976 2025-10-08 cs.CV cs.AI cs.LG 67%

Diffusion Models for Low-Light Image Enhancement: A Multi-Perspective Taxonomy and Performance Analysis

Eashan Adhikarla, Yixin Liu, Brian D. Davison

机构 * Lehigh University(莱维大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26457 2025-10-01 cs.CV cs.AI cs.LG 67%

Attention over Scene Graphs: Indoor Scene Representations Toward CSAI Classification

Artur Barros, Carlos Caetano, João Macedo, Jefersson A. dos Santos, Sandra Avila

机构 * Instituto de Computação (IC) Universidade Estadual de Campinas (UNICAMP)(计算机学院(IC)Campinas大学(UNICAMP)) Departamento de Ciência da Computação (DCC) Universidade Federal de Minas Gerais (UFMG)(计算机科学系(DCC)巴西矿务联邦大学(UFMG)) School of Computer Science University of Sheffield(计算机科学学院谢菲尔德大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

Comments British Machine Vision Conference (BMVC 2025), in the From Scene Understanding to Human Modeling Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24093 2025-09-30 cs.LG cs.CV cs.RO 67%

Clebsch-Gordan Transformer: Fast and Global Equivariant Attention

Owen Lewis Howell, Linfeng Zhao, Xupeng Zhu, Yaoyao Qian, Haojie Huang, Lingfeng Sun, Wil Thomason, Robert Platt, Robin Walters

机构 * Northeastern University(东北大学) The Boston Dynamics AI Institute(波士顿动力AI研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21733 2025-09-29 cs.CV cs.AI cs.CL cs.HC cs.LG 67%

UISim: An Interactive Image-Based UI Simulator for Dynamic Mobile Environments

Jiannan Xiang, Yun Zhu, Lei Shu, Maria Wang, Lijun Yu, Gabriel Barcik, James Lyon, Srinivas Sunkara, Jindong Chen

机构 * University of California, San Diego (UCSD)(加州大学圣地亚哥分校) Google DeepMind(谷歌DeepMind)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏