arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-02-25 至 2026-02-25 共收录 19 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 19 篇

2602.21161 2026-02-25 cs.RO 86%

ActionReasoning: Robot Action Reasoning in 3D Space with LLM for Robotic Brick Stacking

动作推理:利用LLM进行三维空间中的机器人动作推理以实现积木堆叠

Guangming Wang, Qizhen Ying, Yixiong Jing, Olaf Wysocki, Brian Sheil

机构 * CV4DT, CSIC, Department of Engineering, University of Cambridge(CV4DT、CSIC、工程系、剑桥大学)

专题命中 机器人数据与评测 :robotic(title,abstract);embodied AI(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出ActionReasoning框架,利用LLM进行三维空间中的动作推理,实现稳定积木堆叠,提升机器人操作的泛化能力。

Comments 8 pages, 5 figures, accepted by the 2026 IEEE International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21203 2026-02-25 cs.RO cs.CV cs.LG 85%

Squint: Fast Visual Reinforcement Learning for Sim-to-Real Robotics

Squint:用于机器人仿真到现实的高效视觉强化学习

Abdulaziz Almuzairee, Henrik I. Christensen

专题命中 机器人数据与评测 :robotics(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 Squint通过并行仿真、分布性批评者等方法,实现了在实际时间中比现有视觉强化学习方法更快的训练速度,成功实现了从仿真到现实的机器人任务迁移。

Comments For website and code, see https://aalmuzairee.github.io/squint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02602 2026-02-25 cs.CV cs.AI 81%

Addressing Camera Sensors Faults in Vision-Based Navigation: Simulation and Dataset Development

解决基于视觉的导航中摄像头传感器故障:仿真与数据集开发

Riccardo Gallon, Fabian Schiemenz, Alessandra Menicucci, Eberhard Gill

机构 * Department of Space Systems Engineering, Faculty of Aerospace Engineering(航天系统工程系,航空航天工程学院) Airbus Defence and Space GmbH(空客防御与空间公司)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 本文通过仿真与数据集开发,解决基于视觉导航中摄像头传感器故障的检测问题,提供故障图像数据集用于训练AI故障检测算法。

Comments Submitted to Acta Astronautica

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20687 2026-02-25 cs.AI 79%

How Foundational Skills Influence VLM-based Embodied Agents:A Native Perspective

基础技能如何影响基于VLM的具身体验代理:一种原生视角

Bo Peng, Pi Bu, Keyu Pan, Xinrun Xu, Yinxiu Zhao, Miao Chen, Yang Du, Lin Li, Jun Song, Tong Xu

机构 * Alibaba-inc(阿里巴巴集团)

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.AI

AI总结 本文提出NativeEmbodied基准测试,通过统一的原生低级动作空间评估VLM驱动具身体验代理的综合性能,并揭示基础技能缺陷对高级任务性能的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20566 2026-02-25 cs.RO cs.CV 73%

BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model

BFA++: 多视角视觉语言动作模型的分层最佳特征感知令牌剪枝

Haosheng Li, Weixin Mao, Zihan Lan, Hongwei Xiong, Hongan Wang, Chenyang Si, Ziwei Liu, Xiaoming Deng, Hua Chen

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) LimX Dynamic(LimX动态) Nanjing University(南京大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 BFA++通过分层最佳特征感知令牌剪枝提升多视角视觉语言动作模型的效率和成功率

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21015 2026-02-25 cs.CV 70%

From Perception to Action: An Interactive Benchmark for Vision Reasoning

从感知到行动:一个交互式基准测试用于视觉推理

Yuhao Wu, Maojia Song, Yihuai Lan, Lei Wang, Zhiqiang Hu, Yao Xiao, Heng Zhou, Weihua Zheng, Dylan Raharja, Soujanya Poria, Roy Ka-Wei Lee

机构 * Singapore University of Technology(新加坡科技设计大学) Singapore Management University (SMU), Singapore(新加坡管理学院) Nanyang Technological University (NTU), Singapore(南洋理工大学) University of Science(科学大学)

专题命中 机器人数据与评测 :embodied agent(abstract);manipulation(abstract);分类 cs.CV

AI总结 CHAIN基准测试通过交互式3D物理驱动环境,评估模型在动态环境中理解、规划和执行基于物理约束的结构化动作序列的能力。

Comments Work in processing. Website: https://social-ai-studio.github.io/CHAIN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13394 2026-02-25 cs.CV 70%

Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models

空间-DisE:评估视觉语言模型空间推理能力的统一基准

Xinmiao Huang, Qisong He, Zhenglin Huang, Boxuan Wang, Zhuoyun Li, Guangliang Cheng, Yi Dong, Xiaowei Huang

机构 * School of Computer Science & informatics, University of Liverpool(计算机科学与信息学系,利物浦大学)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 本文提出Spatial-DISE基准,用于评估视觉语言模型的空间推理能力,通过四个象限分类和大规模数据集,揭示当前模型在多步骤多视角推理上的不足。

Comments ICLR 2026 Accepted Project Page: https://shinmohuang.github.io/spatialdise_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04867 2026-02-25 cs.AI cs.HC cs.LG cs.RO 69%

Sensory-Motor Control with Large Language Models via Iterative Policy Refinement

通过迭代策略优化实现大语言模型的感官-运动控制

Jônata Tyska Carvalho, Stefano Nolfi

机构 * Federal University of Santa Catarina (UFSC)(圣卡塔琳娜联邦大学) Institute of Cognitive Sciences and Technologies (ISTC-CNR)(认知科学与技术研究所)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 本文提出通过迭代策略优化,利用大语言模型控制具身代理,结合符号知识与子符号感官运动数据实现高效控制。

Comments Final version of the article accepted for publication on Scientific Reports. 29 pages (13 pages are from appendix), 8 figures, 2 tables, code for experiments replication and supplementary material provided at https://github.com/jtyska/llm-robotics-article/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21119 2026-02-25 cs.RO cs.AI 66%

Cooperative-Competitive Team Play of Real-World Craft Robots

现实世界工艺机器人的协作-竞争团队合作

Rui Zhao, Xihui Li, Yizheng Zhang, Yuzhen Liu, Zhong Zhang, Yufeng Zhang, Cheng Zhou, Zhengyou Zhang, Lei Han

机构 * Tencent Robotics X Laboratory(腾讯机器人实验室) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI;robotics(comments)

AI总结 本文提出了一种针对现实世界工艺机器人协作与竞争任务的强化学习方法,通过引入OODSI技术提升仿真到现实的迁移性能。

Comments Accepted by 2026 IEEE International Conference on Robotics and Automation (ICRA 2026), Vienna, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20709 2026-02-25 cs.CV cs.AI 62%

Onboard-Targeted Segmentation of Straylight in Space Camera Sensors

空间相机传感器中 straylight 的 onboard 目标分割

Riccardo Gallon, Fabian Schiemenz, Alessandra Menicucci, Eberhard Gill

机构 * Department of Space Systems Engineering, Faculty of Aerospace Engineering(航天系统工程系,航空航天工程学院) Airbus Defence and Space GmbH(Airbus防务与空间有限公司)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本研究提出了一种基于 AI 的方法,用于在航天器资源受限硬件上实现空间相机中 straylight 的语义分割,并通过自定义指标评估其系统性能。

Comments Submitted to Aerospace Science and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20636 2026-02-25 cs.CV cs.AI 62%

SurgAtt-Tracker: Online Surgical Attention Tracking via Temporal Proposal Reranking and Motion-Aware Refinement

SurgAtt-Tracker: 通过时间提案重排和运动感知细化实现在线手术注意力跟踪

Rulin Zhou, Guankun Wang, An Wang, Yujie Ma, Lixin Ouyang, Bolin Cui, Junyan Li, Chaowei Zhu, Mingyang Li, Ming Chen, Xiaopin Zhong, Peng Lu, Jiankun Wang, Xianming Liu, Hongliang Ren

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学电子工程系) Division of Gastrointestinal Surgery, Shenzhen People's Hospital, China(深圳人民医院胃肠外科) College of Mechatronics and Control Engineering, Shenzhen University, China(深圳大学机电与控制工程学院) Department of Mechanical Engineering, The University of Hong Kong, Hong Kong SAR, China(香港大学机械工程系) Department of Electronic and Electrical Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 SurgAtt-Tracker通过时间提案重排和运动感知细化实现手术注意力跟踪,提供帧级视野指导以支持机器人规划和自动摄像头控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20867 2026-02-25 cs.CR cs.AI cs.CE cs.ET 57%

SoK: Agentic Skills -- Beyond Tool Use in LLM Agents

SoK: 代理技能——超越LLM代理中的工具使用

Yanna Jiang, Delong Li, Haiyu Deng, Baihe Ma, Xu Wang, Qin Wang, Guangsheng Yu

机构 * University of Technology Sydney(悉尼科技大学) CSIRO Data61(CSIRO数据61)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 本文探讨了代理技能在LLM代理中的应用,分析了技能的生命周期管理、分类方法及其安全影响,并提出了未来研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20813 2026-02-25 cs.AI 57%

Pressure Reveals Character: Behavioural Alignment Evaluation at Depth

压力揭示特性:深度下的行为对齐评估

Nora Petrova, John Burden

机构 * Prolific

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出一个深度行为对齐评估基准,通过多轮场景揭示模型行为倾向,发现多数模型在多个类别存在弱点,且对齐行为呈现统一构念特性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20773 2026-02-25 cs.CV 57%

Federated Learning for Cross-Modality Medical Image Segmentation via Augmentation-Driven Generalization

通过增强驱动泛化实现跨模态医学图像分割的联邦学习

Sachin Dudda Nagaraju, Ashkan Moradi, Bendik Skarre Abrahamsen, Mattijs Elschot

机构 * Department of Circulation and Medical Imaging, Norwegian University of Science and Technology(循环医学成像系,挪威科学与技术大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出一种联邦学习方法,通过增强驱动泛化实现跨模态医学图像分割,提升模型泛化能力的同时保护数据隐私。

Comments Submitted to IEEE JBHI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20639 2026-02-25 cs.AI 57%

Grounding LLMs in Scientific Discovery via Embodied Actions

通过具身动作 grounding LLMs 在科学发现中

Bo Zhang, Jinfeng Zhou, Yuxuan Chen, Jianing Yin, Minlie Huang, Hongning Wang

机构 * Tsinghua University, Beijing, China(清华大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI

AI总结 通过具身动作框架,LLMs在科学发现中实现更稳定的物理模拟和更高的建模准确性。

Comments 24 pages, 7 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20354 2026-02-25 cs.CV 57%

3DSPA: A 3D Semantic Point Autoencoder for Evaluating Video Realism

3DSPA:一种用于评估视频真实性的3D语义点自编码器

Bhavik Chandna, Kelsey R. Allen

机构 * University of California, San Diego, CA, USA(加州大学圣迭戈分校) University of British Columbia, Vancouver, BC, Canada(不列颠哥伦比亚大学) Vector Institute, Toronto, ON, Canada(向量研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 3DSPA通过整合3D语义与时空点轨迹,实现无需参考视频的视频真实性自动评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20304 2026-02-25 cs.RO 57%

Smoothly Differentiable and Efficiently Vectorizable Contact Manifold Generation

光滑可微且高效可向量化的接触流形生成

Onur Beker, Andreas René Geist, Anselm Paulus, Nico Gürtler, Ji Shi, Sylvain Calinon, Georg Martius

机构 * University of Tübingen(图宾根大学) Idiap Research Institute(Idiap研究机构) EPFL(瑞士联邦理工学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出了一种高效且可微的接触流形生成框架,通过平衡凸原形方法与障碍方法,实现高效且光滑的接触模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14719 2026-02-25 cs.RO 57%

DiSPo: Diffusion-SSM based Policy Learning for Coarse-to-Fine Action Discretization

DiSPo:基于扩散-状态空间模型的策略学习用于粗到细动作离散化

Nayoung Oh, Jaehyeong Jang, Moonkyeong Jung, Daehyung Park

机构 * Korea Advanced Institute of Science and Technology(韩国高级科学研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 DiSPo通过结合扩散-状态空间模型和步骤缩放方法,实现了高效且灵活的粗到细动作离散化学习,显著提升了成功率和推理效率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18448 2026-02-25 cs.CL 50%

INSURE-Dial: A Phase-Aware Conversational Dataset & Benchmark for Compliance Verification and Phase Detection

INSURE-Dial: 一个面向合规验证和阶段检测的相位感知对话数据集与基准

Shubham Kulkarni, Alexander Lyzhov, Preetam Joshi, Shiva Chaitanya

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 INSURE-Dial是一个面向合规验证和阶段检测的相位感知对话数据集与基准,通过相位结构化标注和两个新评估任务提升语音代理的合规性评估能力。

Comments Accepted to the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏