arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-02-12 至 2026-02-12 共收录 54 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 5 篇

2602.08025 2026-02-12 cs.CV cs.AI 81%

MIND: Benchmarking Memory Consistency and Action Control in World Models

MIND:世界模型中内存一致性与动作控制的基准测试

Yixuan Ye, Xuanyu Lu, Yuxin Jiang, Yuchao Gu, Rui Zhao, Qiwei Liang, Jiachun Pan, Fengda Zhang, Weijia Wu, Alex Jinpeng Wang

机构 * CSU-JPG, Central South University(中南大学) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 MIND提出首个开放域闭环基准,评估世界模型的内存一致性和动作控制能力,揭示当前模型在长期记忆保持和动作空间泛化上的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10884 2026-02-12 cs.CV 79%

ResWorld: Temporal Residual World Model for End-to-End Autonomous Driving

ResWorld: 用于端到端自动驾驶的时序残差世界模型

Jinqing Zhang, Zehua Fu, Zelin Xu, Wenying Dai, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,北京航空航天大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) Beijing Jingwei Hirain Technologies Co., Inc.(北京京wei Hirain科技有限公司) Hangzhou Innovation Institute, Beihang University, Hangzhou, China(杭州创新研究院,北京航空航天大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 ResWorld通过时序残差世界模型和未来引导轨迹细化模块,提升端到端自动驾驶的规划性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22130 2026-02-12 cs.AI cs.SE 79%

World of Workflows: A Benchmark for Bringing World Models to Enterprise Systems

世界工作流:一个将世界模型引入企业系统的基准

Lakshya Gupta, Litao Li, Yizhe Liu, Sriram Ganapathi Subramanian, Kaheer Suleman, Zichen Zhang, Haoye Lu, Sumit Pasupalak

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 World of Workflows提出一个基于ServiceNow的企业系统基准,揭示前沿LLMs在动态建模中的盲区,并强调基于现实世界建模的可靠性需求。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 模仿学习与强化学习 4 篇

2602.11142 2026-02-12 cs.RO cs.AI cs.LG 69%

Data-Efficient Hierarchical Goal-Conditioned Reinforcement Learning via Normalizing Flows

通过归一化流实现数据高效的分层目标条件强化学习

Shaswat Garg, Matin Moezzi, Brandon Da Silva

机构 * ArenaX Labs(ArenaX实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 本文提出基于归一化流的分层隐式Q学习框架,通过提升策略表达能力与数据效率,实现更稳健的长周期任务学习。

Comments 9 pages, 3 figures, IEEE International Conference on Robotics and Automation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09893 2026-02-12 cs.RO cs.AI 66%

Self-Augmented Robot Trajectory: Efficient Imitation Learning via Safe Self-augmentation with Demonstrator-annotated Precision

自增强机器人轨迹:通过安全自增强实现高效的模仿学习

Hanbit Oh, Masaki Murooka, Tomohiro Motoda, Ryoichi Nakajo, Yukiyasu Domae

机构 * AIST(日本产业技术综合研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI;robotics(comments)

AI总结 SART通过安全自增强技术,从单次人类演示中高效学习机器人轨迹,提升数据收集效率并减少碰撞风险。

Comments 21 pages, 10 figures, Advanced Robotics accepted 2026.02.03

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10547 2026-02-12 cs.RO 57%

ReSPEC: A Framework for Online Multispectral Sensor Reconfiguration in Dynamic Environments

ReSPEC:动态环境中在线多光谱传感器重新配置框架

Yanchen Liu, Yuang Fan, Minghui Zhao, Xiaofan Jiang

机构 * Department of Electrical Engineering, Columbia University(电气工程系,哥伦比亚大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 ReSPEC框架通过强化学习实现动态多光谱传感器重新配置,提升机器人在复杂环境下的感知效率与资源利用率。

Comments 8 pages, 4 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04538 2026-02-12 cs.LG 57%

HypeRL: Hypernetwork-Based Reinforcement Learning for Control of Parametrized Dynamical Systems

HypeRL: 基于超网络的强化学习用于参数化动力系统控制

Nicolò Botteghi, Stefania Fresca, Mengwu Guo, Andrea Manzoni

机构 * MOX - Department of Mathematics Politecnico di Milano(米兰理工数学系MOX部门) Department of Mechanical Engineering University of Washington(华盛顿大学机械工程系) Centre for Mathematical Sciences Lund University(卢德大学数学科学中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 HypeRL通过超网络强化学习方法,解决参数化动力系统控制问题,实现高效泛化和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 人机交互与遥操作 1 篇

2602.10771 2026-02-12 cs.CV cs.RO 62%

From Steering to Pedalling: Do Autonomous Driving VLMs Generalize to Cyclist-Assistive Spatial Perception and Planning?

从转向到踩踏:自动驾驶VLMs是否能泛化到骑行辅助的空间感知与规划?

Krishna Kanth Nakka, Vedasri Nakka

专题命中 人机交互与遥操作 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出CyclingVQA基准,评估自动驾驶VLMs在骑行辅助场景中的感知与推理能力,发现现有模型在骑行特定交通提示理解上存在不足,需进一步改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人数据与评测 13 篇

2602.08971 2026-02-12 cs.CV cs.RO 84%

WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models

WorldArena: 一个用于评估具身世界模型感知与功能效用的统一基准

Yu Shang, Zhuohang Li, Yiding Ma, Weikang Su, Xin Jin, Ziyou Wang, Lei Jin, Xin Zhang, Yinzhou Tang, Haisheng Su, Chen Gao, Wei Wu, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Yong Li

机构 * Tsinghua University, Beijing, China(清华大学) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) The University of Hong Kong, Hong Kong SAR, China(香港大学) Princeton University, Princeton, NJ, USA(普林斯顿大学) Chinese Academy of Sciences, Beijing, China(中国科学院) University of Science(科学技术大学) Peking University, Beijing, China(北京大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :world model(title,abstract);embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 WorldArena是一个统一的基准,用于评估具身世界模型的感知和功能效用,揭示高视觉质量与强具身任务能力之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10775 2026-02-12 cs.CV cs.AI eess.IV 73%

A New Dataset and Performance Benchmark for Real-time Spacecraft Segmentation in Onboard Computers

一种新的数据集和性能基准用于机载计算机上的实时航天器分割

Jeffrey Joan Sam, Janhavi Sathe, Nikhil Chigali, Naman Gupta, Radhey Ruparel, Yicheng Jiang, Janmajay Singh, James W. Berck, Arko Barman

机构 * Department of Computer Science, Rice University(计算机科学系,里士大学) Johnson Space Center, NASA(约翰逊航天中心,美国国家航空航天局) Data to Knowledge Lab, Rice University(数据到知识实验室,里士大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出了一种新的航天器分割数据集和性能基准,通过真实航天器模型和混合背景生成,结合噪声和失真模拟,用于实时机载应用的图像分割挑战测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10015 2026-02-12 cs.RO cs.AI 73%

RoboSubtaskNet: Temporal Sub-task Segmentation for Human-to-Robot Skill Transfer in Real-World Environments

RoboSubtaskNet: 人类-机器人技能转移中的时间子任务分割用于现实环境

Dharmendra Sharma, Archit Sharma, John Rebeiro, Vaibhav Kesharwani, Peeyush Thakur, Narendra Kumar Dhar, Laxmidhar Behera

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 RoboSubtaskNet通过结合增强注意力的I3D特征和改进的MS-TCN,实现了人类-机器人技能转移中的时间子任务分割,提升了现实环境中的机器人操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04215 2026-02-12 cs.RO cs.AI cs.LG 67%

OAT: Ordered Action Tokenization

OAT:有序动作标记化

Chaoqi Liu, Xiaoshen Han, Jiawei Gao, Yue Zhao, Haonan Chen, Yilun Du

专题命中 机器人数据与评测 :robot learning(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 OAT通过有序动作标记化方法,实现高压缩性和因果有序的标记空间,提升机器人动作生成的灵活性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10702 2026-02-12 cs.RO cs.LG cs.SE 62%

A Unified Experimental Architecture for Informative Path Planning: from Simulation to Deployment with GuadalPlanner

信息路径规划的统一实验架构:从仿真到部署的GuadalPlanner

Alejandro Mendoza Barrionuevo, Dame Seck Diop, Alejandro Casado Pérez, Daniel Gutiérrez Reina, Sergio L. Toral Marín, Samuel Yanes Luis

机构 * Department of Electronic Engineering, University of Sevilla(电子工程系,塞维利亚大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出GuadalPlanner,通过统一架构实现信息路径规划算法在仿真与现实部署间的无缝衔接,支持多种环境和策略,提升算法评估的一致性与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10492 2026-02-12 cs.CV cs.RO 62%

End-to-End LiDAR optimization for 3D point cloud registration

端到端激光雷达优化用于3D点云配准

Siddhant Katyan, Marc-André Gardner, Jean-François Lalonde

机构 * Université Laval(拉瓦尔大学) Bentley Systems(贝恩特系统)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出端到端自适应激光雷达框架,通过动态调整参数优化点云配准,提升精度与效率,并在CARLA模拟中验证其优于固定参数方法的性能。

Comments 36th British Machine Vision Conference 2025, {BMVC} 2025, Sheffield, UK, November 24-27, 2025. Project page: https://lvsn.github.io/e2e-lidar-registration/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04345 2026-02-12 cs.SD cs.AI cs.LG 62%

AUDETER: A Large-scale Dataset for Deepfake Audio Detection in Open Worlds

AUDETER:一种大规模深度伪造音频检测数据集用于开放世界

Qizhou Wang, Hanxun Huang, Guansong Pang, Sarah Erfani, Christopher Leckie

机构 * The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理学院)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.LG

AI总结 AUDETER是一种大规模深度伪造音频检测数据集,通过课程学习方法提升开放世界检测性能,实现1.87%的EER在野外测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11049 2026-02-12 cs.RO 57%

SQ-CBF: Signed Distance Functions for Numerically Stable Superquadric-Based Safety Filtering

SQ-CBF:基于超二次曲面的安全过滤中的符号距离函数

Haocheng Zhao, Lukas Brunke, Oliver Lagerquist, Siqi Zhou, Angela P. Schoellig

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 SQ-CBF通过符号距离函数改进安全过滤,解决隐式函数梯度病态问题,提升机器人在复杂环境中的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11005 2026-02-12 cs.CV 57%

Interpretable Vision Transformers in Monocular Depth Estimation via SVDA

通过SVDA实现单目深度估计中的可解释性视觉变换器

Vasileios Arampatzakis, George Pavlidis, Nikolaos Mitianoudis, Nikos Papamarkos

机构 * Dept. Electrical and Computer Engineering(电子与计算机工程系) Democritus University of Thrace(德米特里乌斯大学) Athena Research Center(雅典研究中心) University Campus at Kimmeria(基米里亚大学校园)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 SVDA通过引入谱结构化的注意力机制,提升了单目深度估计的可解释性,同时保持了预测精度并降低了计算开销。

Comments 8 pages, 2 figures, submitted to CVPR Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10980 2026-02-12 cs.RO 57%

RADAR: Benchmarking Vision-Language-Action Generalization via Real-World Dynamics, Spatial-Physical Intelligence, and Autonomous Evaluation

RADAR:通过现实动态、空间-物理智能和自主评估进行视觉-语言-动作泛化基准测试

Yuhao Chen, Zhihao Zhan, Xiaoxin Lin, Zijian Song, Hao Liu, Qinhan Lyu, Yubo Zu, Xiao Chen, Zhiyuan Liu, Tao Pu, Tianshui Chen, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 RADAR通过现实动态、空间-物理智能和自主评估,系统评估VLA模型在现实环境中的泛化能力,揭示其在物理动态和空间推理上的脆弱性。

Comments 12 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10814 2026-02-12 cs.AI 57%

See, Plan, Snap: Evaluating Multimodal GUI Agents in Scratch

见、计划、快照:评估Scratch中的多模态GUI代理

Xingyi Zhang, Yulei Ye, Kaifeng Huang, Wenhao Li, Xiangfeng Wang

机构 * Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出ScratchWorld基准,用于评估多模态GUI代理在Scratch中的程序构建能力,揭示了推理与执行之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10559 2026-02-12 cs.RO 57%

Towards Safe Path Tracking Using the Simplex Architecture

基于简单形架构的安全路径跟踪

Georg Jäger, Nils-Jonathan Friedrich, Hauke Petersen, Benjamin Noack

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出基于简单形架构的路径跟踪控制器,结合强化学习和高保证控制器,以实现安全性和高性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07593 2026-02-12 stat.ML cs.LG stat.ME 57%

Diffusion posterior sampling for simulation-based inference in tall data settings

扩散后验采样用于高数据设置下的基于模拟的推断

Julia Linhart, Gabriel Victorino Cardoso, Alexandre Gramfort, Sylvain Le Corff, Pedro L. C. Rodrigues

机构 * Université Paris-Saclay(巴黎-萨克雷大学) Inria(法国国家信息与自动化技术研究院) CEA(法国原子能委员会) CMAP, École Polytechnique(高等理工学院CMAP部门) Institut Polytechnique de Paris(巴黎理工 institute) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔INP) LJK(格勒诺布尔联合实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 本文提出了一种无需兰格-动态步骤的扩散后验采样方法,提高了高数据设置下基于模拟的推断效率和稳定性。

Comments 49 pages, 24 figures, 3 tables, 2 algorithms, 12 appendices, TMLR acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他机器人 3 篇

2207.04196 2026-02-12 cs.RO 81%

Robotic Depowdering for Additive Manufacturing Via Pose Tracking

通过姿态跟踪的机器人去粉用于增材制造

Zhenwei Liu, Junyi Geng, Xikai Dai, Tomasz Swierzewski, Kenji Shimada

机构 * Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学) Robotics Institute, Carnegie Mellon University(机器人研究所,卡内基梅隆大学)

专题命中 其他机器人 :robotic(title,abstract);分类 cs.RO;robotics(journal_ref)

AI总结 本文提出了一种基于视觉的机器人去粉系统,通过姿态跟踪实时去除3D打印部件表面的未熔合粉末,无需预处理即可适应不同形状的部件。

Comments Github link: https://github.com/zhenweil/Robotic-Depowdering-for-Additive-Manufacturing-Via-Pose-Tracking Video link: https://www.youtube.com/watch?v=AUIkyULAhqM

Journal ref 2022 IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06454 2026-02-12 cs.RO cs.MA 79%

Simplification of Robotic System Model Analysis by Petri Net Meta-Model Property Transfer

通过Petri网元模型属性转移简化机器人系统模型分析

Maksym Figat, Cezary Zieliński

专题命中 其他机器人 :robotic(title,abstract);分类 cs.RO

AI总结 通过将RSHPN元模型属性转移到设计系统模型,简化机器人系统分析,减少状态空间爆炸并提升设计效率。

Comments 16 pages

Journal ref IEEE Access, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10946 2026-02-12 cs.RO 57%

Developing Neural Network-Based Gaze Control Systems for Social Robots

基于神经网络的社交机器人眼动控制系统的开发

Ramtin Tabatabaei, Alireza Taheri

专题命中 其他机器人 :robotics(abstract);分类 cs.RO

AI总结 本研究利用深度神经网络开发社交机器人眼动控制系统,通过分析不同社交场景下的目光行为,提升机器人在互动中的注意力引导能力。

详情

展开后加载摘要…

URL PDF HTML 收藏