arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-26 至 2026-08-26 共收录 20 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 20 篇

2608.23839 2026-08-26 cs.RO cs.AI 新提交 84%

Resilience Matters for Embodied Agents System: New Metrics, Systematic Evaluation, and Optimization

弹性对具身智能体系统的重要性:新指标、系统评估与优化

Yapeng Liu, Yuanzhao Zhai, Xudong Gong, Dawei Feng, Bo Ding, Lin Wang, Huaimin Wang

机构 * National University of Defense Technology(国防科技大学) Nanyang Technological University(南洋理工大学)

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究针对具身智能体系统忽略弹性属性的问题,提出弹性评估框架与指标集,经400项家庭任务实验验证其诊断优化效果,揭示弹性特征间的权衡关系。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24199 2026-08-26 cs.RO 新提交 83%

NVIDIA Cosmos-H-Dreams: Real-Time Generative Physics Simulation for Surgical Robotics

NVIDIA Cosmos-H-Dreams:面向外科机器人的实时生成式物理仿真

Javier Gamazo Tejero, Lukas Zbinden, Keyur Sheth, Raghavendra K M, Nadim Daher, Diego Granero Maraña, Filip Binkiewicz, Patrick Thornycroft, Mahdi Azizian, Sean D. Huver

专题命中 机器人数据与评测 :robotics(title,abstract);world model(abstract);分类 cs.RO

AI总结 该研究提出Cosmos-H-Dreams系统,结合生成模型与蒸馏技术实现实时外科机器人仿真,支持多控制器驱动,为外科教育等提供开放基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12144 2026-08-26 cs.CV cs.RO eess.IV 版本更新 81%

O3N: Omnidirectional Open-Vocabulary Occupancy Prediction for Embodied Intelligent Robotics

O3N: 全向开放词汇占用预测

Mengfei Duan, Hao Shi, Fei Teng, Guoqiang Zhao, Yuheng Zhang, Zhiyong Li, Kailun Yang

机构 * Hunan University(湖南大学) Zhejiang University(浙江大学)

专题命中 机器人数据与评测 :robotics(title,abstract);分类 cs.RO、cs.CV

AI总结 O3N通过全向感知和开放词汇方法,实现三维空间的连续表示和长距离上下文建模,提升具身智能在开放世界中的感知与建模能力。

Comments The source code will be made publicly available at this https URL (https://github.com/MengfeiD/O3N)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09892 2026-08-26 cs.RO 版本更新 79%

XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment

XPolicyLab:用于机器人策略评估与部署的统一标准及开放生态系统

XPolicyLab Community, Tianxing Chen, Yue Chen, Tian Nian, Zijian Cai, Guangyu Chen, Wenwei Lin, Qiwei Liang, Zanxin Chen, Peicheng Xiang, Kailun Su, Zixuan Li, Junyuan Tang, Yan Qin, Qiangyu Chen, Shaolong Zhu, Tengyue Jiang, Yiqing Wang, Xiang Li, Jiahao Zhang, Weijie Wan, Baijun Chen, Honghao Su, Kehe Ye, Shujia Liu, Kaixuan Wang, Haotian Liang, Yunze Liu, Mingleyang Li, Yuran Wang, Boyu Chen, Hongzhe Bi, Shuhe Huang, Hengkai Tan, Jisong Cai, Yao Mu, Jun Guo, Xiaofeng Wang, Zheng Zhu, Weijie Ke, Hengtao Li, Yuhang Tang, Xiaofan Li, Ganlin Yang, Zhangzheng Tu, Shuai Yang, Wenxuan Song, Pengxiang Ding, Kaidong Zhang, Yu Sun, Junliang Guo, Tong Zhang, Yixing Chen, Rongxu Cui, Zongzheng Zhang, Haoxiang Ma, Junhao Cai, Haoyu Zhang, Senqiao Yang, Jinhui Ye, Pengguang Chen, Shu Liu, Xiu Su, Wenhan Fang, Wenhao Li, Yichao Cao, Chengyao Wang, Qiang Chen, Ping Luo, Wenbo Ding

机构 * THU(清华大学)

专题命中 机器人数据与评测 :robot policy(title,abstract);分类 cs.RO

AI总结 XPolicyLab是统一机器人策略评估与部署的开放生态系统,通过标准化接口降低集成成本,集成42个策略,可适配仿真与真实机器人,减少了策略与环境的适配工作量。

Comments Website: this http URL (http://xpolicylab.github.io), Code: this https URL (https://github.com/XPolicyLab/XPolicyLab)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03086 2026-08-26 cs.RO 版本更新 79%

Design and Evaluation of a Compliant Quasi Direct Drive End-effector for Safe Robotic Ultrasound Imaging

用于安全机器人超声成像的柔顺准直接驱动末端执行器的设计与评估

Danyi Chen, Ravi Prakash, Vincent Y. Wang, Zacharias Chen, Sarah Dias, Daniel M. Buckland, Leila J. Bridgeman, Siobhan R. Oca, Brian P. Mann

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 本文设计了一种采用准直接驱动执行器的新型柔顺末端执行器,经离体实验验证,其力跟踪误差及多项图像质量指标均优于传统方案,可提升机器人超声成像的安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24603 2026-08-26 cs.RO 新提交 70%

Gripper-aware Vision Language Action Models

感知夹具的视觉语言动作模型

Hanyi Zhang, Zihong Luo, Tianyu Li, Khang Nguyen, Basu Hela, Shreyas Kumar, Ngoc Duy Tran, Feng Dai, Charith Munasinghe, Jorge Peña Queralta, Giovanni Toffetti, Khoa Vo, Ngan Le, Ravi Prakash, Quan Vuong, Tung D. Ta, Long Hu, Anh Nguyen, Baoru Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Indian Institute of Science(印度科学学院) The University of Tokyo(东京大学) Zürcher Hochschule für Angewandte Wissenschaften(苏黎世应用科技大学) University of Arkansas(阿肯色大学) Physical Intelligence(物理智能公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对现有视觉语言动作模型(VLA)忽略夹具差异的问题,提出多夹具感知数据集MiGA与结合多夹具分词器及适配器策略路由的GVLA,实验显示其性能优于基线且泛化与适应能力更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24212 2026-08-26 cs.CV 新提交 70%

NeoWorld-Pro: Programming Interactive Scenes from Monocular Images for Embodied Simulation

NeoWorld-Pro:从单目图像编程交互式场景以实现具身仿真

Yumeng He, Yichen Song, Xiaotian Yang, Weijia Zhang, Zanwei Zhou, Junru Gong, Xiaokang Yang, Yunbo Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 机器人数据与评测 :embodied AI(abstract);manipulation(abstract);分类 cs.CV

AI总结 针对具身AI中图像转仿真场景的物理与交互性不足问题,提出NeoWorld-Pro框架,通过MLLMs将单目图像转为可执行程序,结合物理在环机制优化,性能优于现有方法并支持复杂下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24101 2026-08-26 cs.RO 新提交 70%

TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks

TrAct:通过视觉轨迹连接机器人控制与视觉预测

Zhi Cao, Howard Ji, Kevin Zhang, Kuangzhi Ge, Li Fei-Fei, Jiajun Wu, Huang Huang

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :manipulation(abstract);world model(abstract);分类 cs.RO

AI总结 TrAct是基于世界模型的机器人决策框架,以视觉轨迹为控制与预测的中间接口,在LIBERO-INTEGRAL基准和Franka任务上,相较基线π₀.5显著提升了操作成功率与视频预测质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23636 2026-08-26 cs.CV 新提交 70%

Cross-Generation Optimization of YOLOv26, YOLOv11, and YOLOv8 for Fine-Grained Small-Object Detection and Instance Segmentation in Complex Orchards

面向复杂果园中细粒度小目标检测与实例分割的YOLOv26、YOLOv11和YOLOv8跨代优化

Ranjan Sapkota, Manoj Karkee

机构 * Cornell University(康奈尔大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.CV

AI总结 该研究针对复杂果园中小目标检测与实例分割难题,对YOLOv8、YOLOv11、YOLOv26开展跨代基准测试,发现YOLOv11s-960精度最优、YOLOv26s-960效率与精度均衡,为农业机器人感知提供实用基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13394 2026-08-26 cs.CV 版本更新 70%

Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models

空间-DisE:评估视觉语言模型空间推理能力的统一基准

Xinmiao Huang, Qisong He, Zhenglin Huang, Boxuan Wang, Zhuoyun Li, Guangliang Cheng, Yi Dong, Xiaowei Huang

机构 * School of Computer Science & informatics, University of Liverpool(计算机科学与信息学系,利物浦大学)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 本文提出Spatial-DISE基准,用于评估视觉语言模型的空间推理能力,通过四个象限分类和大规模数据集,揭示当前模型在多步骤多视角推理上的不足。

Comments ICLR 2026 Accepted Project Page: this https URL (https://shinmohuang.github.io/spatialdise_page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24042 2026-08-26 cs.RO cs.AI cs.LG 新提交 67%

Hierarchical Skill Retrieval for Data-Efficient Adaptation of Vision-Language-Action Models

用于视觉-语言-动作模型数据高效适配的分层技能检索

Haoran Hao, Shahram Najam Syed, Jeff Schneider, Jeffrey Ichnowski

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对视觉-语言-动作模型在有限演示下适配性能下降的问题,提出分层技能检索框架,结合子任务语言检索与行为特征重排序,在LIBERO基准及真实机器人任务上提升平均成功率10.3%和21.3%。

Comments Project Page: this https URL (https://hoar012.github.io/HSR-Project)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11048 2026-08-26 cs.RO cs.AI 版本更新 62%

ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching

ForceFlow: 通过接触驱动的流匹配学习感知与行动

Shuoheng Zhang, Yifu Yuan, Hongyao Tang, Yan Zheng, Qiaojun Yu, Pengyi Li, Guowei Huang, Helong Huang, Xingyue Quan, Jianye Hao

机构 * Tianjin University(天津大学) Huawei Noah's Ark Lab(华为诺亚实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出ForceFlow框架,通过融合力信号与多模态信息,提升机器人在复杂接触任务中的鲁棒性和泛化能力,实验显示其在六个真实任务中成功率提升37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24882 2026-08-26 cs.RO 新提交 57%

Latent Action as Intention Enables Efficient Future Imagination for World Action Models

作为意图的隐式动作:为世界动作模型实现高效的未来想象

Xiang Li, Yupeng Zheng, Songen Gu, Huailiang Ma, Feng Yu, Xian Nie, Shanshuai Yuan, Yujie Zang, Weize Li, Shuai Tian, Moyang Liu, Ya-Qin Zhang, Wenchao Ding

机构 * CollegeAI, THU(清华大学CollegeAI) AIR, THU(清华大学AIR) CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人公司) FDU(复旦大学) Southeast University(东南大学) SJTU(上海交通大学) NUS(新加坡国立大学) BUAA(北京航空航天大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本文提出名为 LAWA 的 WAM 架构,以紧凑隐式动作作为未来意图实现高效未来想象,在 RoboCasa 等数据集上优于 Fast-WAM,延迟更低且性能更优,兼顾性能、泛化性与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24585 2026-08-26 cs.AI 新提交 57%

Pivot-and-Station Multi-Agent Path Finding: Solvability, Complexity, and Algorithms

枢轴与站点多智能体路径寻径:可解性、复杂性与算法

Andrea Di Nezza, Mihir Patel, Fabio Fagnani, Sara Bernardini

机构 * Politecnico di Torino(都灵理工大学) University of Oxford(牛津大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI

AI总结 针对需访问枢轴后停放的多智能体路径寻径问题,研究人员证明其可解性条件、最小化相关时间指标的NP难性,并提出PPP算法,大幅提升基准实例求解效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24361 2026-08-26 cs.AI 新提交 57%

Adaptive Influence Graphs for Failure Attribution in Multi-Agent Systems

用于多智能体系统故障归因的自适应影响图

Yarden Bakish, Amir Dudai, Roy Ganz, Oren Nuriel, Elad Ben Avraham, Mor Shpigel Nacson, Ron Litman

机构 * Tel Aviv University(特拉维夫大学) AWS Agentic AI

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 该研究针对多智能体LLM系统故障归因难题,提出自适应影响图(AIGs)框架,在标准基准Who&When上取得最优性能,证实轨迹表示与探索对故障归因的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23869 2026-08-26 cs.CV 新提交 57%

Gen2Physics: Grounding Generated 3D Meshes in Physics via Multi-View Material Decomposition

Gen2Physics:通过多视图材料分解将生成的三维网格与物理特性关联

Mauro Comi, Jordi Serrano Berbel, Kevis-Kokitsi Maninis, Philipp Henzler, Manuel Sanchez

机构 * University of Bristol(布里斯托大学) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 Gen2Physics是一个将生成的三维网格与物理特性关联的自动化框架,通过多视图材料分解实现,其材料分割精度较现有方法提升超一倍,还能输出水密性各材料子网格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23035 2026-08-26 cs.AI 版本更新 57%

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准测试

Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi

机构 * Alibaba(阿里巴巴)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 该研究提出 MobilePA-Bench 基准,针对现有移动智能体评估基准的盲区,从多维度测试移动规划智能体,发现前沿 LLM 在移动场景中存在可靠性问题,该基准可用于诊断与加速可靠移动智能体开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01113 2026-08-26 cs.RO 版本更新 57%

From Dialogue to Execution: Mixture-of-Agents Assisted Interactive Planning for Behavior Tree-Based Long-Horizon Robot Execution

从对话到执行:基于混合代理的交互式规划用于基于行为树的长时域机器人执行

Kanata Suzuki, Kazuki Hori, Haruka Miyoshi, Shuhei Kurita, Tetsuya Ogata

机构 * Waseda University(早稻田大学) National Institute of Informatics(国家信息研究所) NII Research and Development Center for Large Language Models(国家信息研究所大型语言模型研究开发中心) The Graduate University for Advanced Studies (SOKENDAI)(高级研究大学研究生院(SOKENDAI))

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出基于混合代理的交互式规划框架,通过生成行为树实现长时域机器人任务的高效执行,减少人类干预并提升执行质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00260 2026-08-26 cs.CV 版本更新 57%

C3VDReg: A Benchmark for Local-to-Local Colonoscopic Registration toward Anatomical Localization

C3VDReg:面向解剖定位的局部-局部结肠镜配准基准

Linzhe Jiang, Jiayuan Huang, Sophia Bano, Matthew J. Clarkson, Zhehua Mao, Mobarak I. Hoque

机构 * UCL Hawkes Institute(UCL哈维斯研究所) University College London, University of London(伦敦大学学院, 伦敦大学) Division of Informatics, Imaging and Data Sciences(信息学、成像与数据科学部门) University of Manchester(曼彻斯特大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出面向局部-局部结肠镜配准的基准C3VDReg,通过构建点云对评估基线模型,发现高几何重叠不足以保证配准精度,重复管状解剖的平移歧义是主要瓶颈,凸显需更强解剖与上下文约束。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24639 2026-08-26 eess.AS eess.SP 新提交 50%

Investigating voiced and unvoiced regions of speech for audio deepfake detection

探究语音的浊音与清音区域用于音频深度伪造检测

Ganesh Sivaraman, Hemlata Tak, Elie Khoury

专题命中 机器人数据与评测 :robotic(abstract)

AI总结 本研究探究语音浊音与清音区域在音频深度伪造检测中的作用,基于图注意力的AASIST系统分别训练后发现,清音区域检测效果更优,融合浊音区域后性能进一步提升,在MLAAD数据集上取得5.82%的等错误率。

Comments Accepted in IEEE ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏