arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8666 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8666 篇

2602.10155 2026-08-17 eess.IV cs.CV 版本更新 57%

Data-driven registration and modeling of brain deformation for image-guided neurosurgery

数据驱动的图像配准与变形建模在图像引导神经外科中的应用:系统综述

Tiago Assis, Colin P. Galvin, Joshua P. Castillo, Nazim Haouchine, Marta Kersten-Oertel, Zeyu Gao, Mireia Crispin-Ortuzar, Stephen J. Price, Thomas Santarius, Yangming Ou, Sarah Frisken, Nuno C. Garcia, Alexandra J. Golby, Reuben Dorent, Ines P. Machado

机构 * LASIGE, Faculty of Sciences, University of Lisbon(里斯本大学科学学院LASIGE) Department of Neurosurgery and Department of Radiology, Brigham and Women's Hospital, Harvard Medical School(哈佛医学院布里洛妇女医院神经外科与放射科) Gina Cody School of Engineering and Computer Science, Concordia University(康科迪亚大学工程与计算机科学学院) Cancer Research UK Cambridge Centre, University of Cambridge(剑桥大学癌症研究英国中心) Department of Oncology, University of Cambridge(剑桥大学肿瘤科) Department of Clinical Neurosciences, University of Cambridge(剑桥大学临床神经科学系) Computational Health Informatics Program (CHIP) and Department of Radiology, Boston Children's Hospital, Harvard Medical School(哈佛医学院波士顿儿童医院计算健康信息学计划与放射科) Sorbonne Université, Institut du Cerveau - Paris Brain Institute - ICM(索邦大学巴黎脑研究所-ICM)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 系统综述2020-2025年间基于学习的脑变形补偿方法,包括深度学习配准、变形场回归、多模态对齐、切除感知架构及混合模型,指出当前方法在鲁棒性、标准化基准、可解释性和临床部署方面的局限,并展望未来研究方向。

Comments 41 pages, 7 figures, 9 tables. Final postprint version available in Medical Image Analysis at https://doi.org/10.1016/j.media.2026.104217

Journal ref Assis, T., et al. (2026). Data-driven registration and modeling of brain deformation for image-guided neurosurgery. Medical Image Analysis, 114, 104217

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04491 2026-08-17 cs.RO 版本更新 57%

Estimating Dynamic Soft Continuum Robot States From Boundaries

从边界估计动态软体连续体机器人的状态

Tongjia Zheng, Jessica Burgner-Kahrs

机构 * The Continuum Robotics Laboratory(连续机器人实验室) the Robotics Institute at the University of Toronto(多伦多大学机器人研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本研究提出一种基于基座力/力矩测量的对偶边界观测器,实现动态无穷维软体连续体机器人状态估计,兼具传感需求低、增益调参高效等优势,经仿真与实验验证了其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13420 2026-08-14 cs.AI 新提交 57%

Enhancing Virtual Agents through SLMs and Edge-Computing: An Exploratory Evaluation of Think and Memory Processes

通过小型语言模型(SLMs)与边缘计算增强虚拟智能体:对思考与记忆过程的探索性评估

Aimilios Hadjiliasi, Louis Nisiotis

机构 * University of Central Lancashire(中央兰开夏大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI

AI总结 本文探索利用SLMs与边缘计算支持CEAA的“思考”“记忆”组件,在NVIDIA Jetson Orin NX上用Qwen2.5模型开发边缘虚拟智能体网关,经模拟实验验证其可高效运行部分CEAA过程,助力沉浸式虚拟世界具身智能体开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12476 2026-08-14 cs.AI 新提交 57%

Governed Persistent Memory: Source-Bound State Semantics and Fail-Closed Release for Long-Horizon Agents

受控持久内存:长程智能体的源绑定状态语义与故障关闭式释放

Guodong Xu

机构 * Qingdao Guodongxiansheng Network Technology Co., Ltd.(青岛果动先生网络科技有限公司)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 本文针对长程智能体内存的矛盾记录问题,提出受控持久内存(GPM)模型,经多组基准测试与服务评估,其在GPM-ReleaseBench、中英文指令分支等场景均实现零不匹配,修复大量基线故障且无退化。

Comments 23 pages, 2 figures, 11 tables. Includes a sealed end-to-end governed-memory service evaluation with an ungoverned local Qwen2.5-7B comparison

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09045 2026-08-14 cs.CV 57%

Scene-Agnostic Object-Centric Representation Learning for 3D Gaussian Splatting

面向3D高斯散射的场景无关物体感知表示学习

Tsuheng Hsu, Guiyu Liu, Juho Kannala, Janne Heikkilä

机构 * Aalto University(阿尔托大学) University of Oulu(奥卢大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出一种场景无关的物体感知监督方案,通过预训练的slot attention基Global Object Centric Learning模块,学习一致的物体代码本,提升3DGS的表示结构和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11790 2026-08-13 cs.LG 新提交 57%

High-Order Liquid Evidence Encoding for Gradual GNSS Spoofing Detection in Autonomous Driving

面向自动驾驶中渐进式GNSS欺骗检测的高阶液体证据编码

Muhammad Ayub Sabir, Junbiao Pang, Fatima Ashraf

机构 * Faculty of Information Technology, Beijing University of Technology(北京工业大学信息学部)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 针对自动驾驶中渐进式GNSS欺骗难检测问题,提出因果高阶液体证据框架,在AV-GPS数据集子集上获最高F1分数,可快速检测正常到攻击的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11692 2026-08-13 cs.AI 新提交 57%

HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting

HUGIN:增强自主物流分拣的视觉-语言规划能力

Xikai Sun, Cangtian Zhou, Kebin Liu, Ke Ma, Xu Wang, Zaishu Chen, Haotian Wang, Li Liu, Yunhao Liu

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI

AI总结 针对自主物流分拣的联合多场景理解挑战,提出HUGIN训练框架,构建SortingBench基准,在多VLMs上性能提升,验证了方法有效性与实际可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11286 2026-08-13 cs.CR cs.LG cs.SY eess.SY 新提交 57%

Benchmarking Cyberattack Detection in Electric Vehicle Charging Infrastructure with Benign User Updates

基于良性用户更新的电动汽车充电基础设施网络攻击检测基准测试

Hannan Chen, Roshni Anna Jacob, Jie Zhang

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文构建了保留真实ACN会话的泄漏控制会话级基准,提出双分支Masked-AE转换增强模型,在多类模型对比中实现最强鲁棒验证性能,可检测电动汽车充电基础设施的恶意请求操纵且不拒绝合法用户选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14615 2026-08-13 cs.CV 版本更新 57%

CalibAnyView: Beyond Single-View Camera Calibration in the Wild

CalibAnyView:超越单视角相机校准的野外应用

Boying Li, Cheng Zhang, Weirong Chen, Guyuan Chen, Daniel Cremers, Jianfei Cai, Ian Reid, Hamid Rezatofighi

机构 * Monash University(蒙纳士大学) Technical University of Munich(慕尼黑技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 CalibAnyView通过多视角几何一致性建模,提升野外多视角相机校准的鲁棒性和精度,适用于复杂场景下的3D重建和机器人感知。

Comments 27 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10623 2026-08-12 cs.RO 新提交 57%

When Your State Estimator Has Lost The Plot: Detecting Estimator Failures Via Spectral Analysis

当你的状态估计器“迷失方向”时:通过频谱分析检测估计器故障

Christian Lanegger, Helen Oleynikova, Roland Siegwart, Michael Pantic

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本研究提出一种与传感器无关的频域分析方法,用于检测状态估计器故障,在三类里程计框架中可检测51%-58%的故障,精度达60%-84%,可作为轻量级自省工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10145 2026-08-12 cs.LG 新提交 57%

The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom

评估协议决定结果:在TwoRoom上独立复现LeWorldModel

Joyjeet Singh

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 本研究独立复现LeWorldModel在TwoRoom上的结果,发现评估协议(如目标偏移量)会显著影响性能,还揭示单步预测准确率无法预测长程规划成功、批量归一化层会夸大验证损失等关键结论。

Comments Independent reproduction of arXiv:2603.19312 - https://github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10309 2026-08-12 cs.AI 版本更新 57%

Measure the Sim-to-Real Gap: Designing an Affordable Real-World Benchmark Platform for Reinforcement Learning in AIoT Systems

测量模拟到现实的差距:为物联网系统中的强化学习设计一个经济实惠的真实世界基准平台

Rongping Zhou, Omid Tavallaie, Shuaijun Chen, Albert Y. Zomaya

机构 * The University of Sydney(悉尼大学) University of Oxford(牛津大学) The University of Western Australia(西澳大利亚大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 针对AIoT系统中强化学习模拟到现实的差距问题,开发了成本低于400美元的真实世界平台,通过硬件模拟键盘让边缘设备智能体玩游戏训练,实验显示模拟训练智能体部署后性能大幅下降,直接现实训练有可行性,为强化学习评估提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24112 2026-08-12 cs.AI 版本更新 57%

ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection

ReMMD: 面向多模态虚假信息检测的现实多语言多图像智能体验证

Chenhao Dang, Dantong Zhu, Jun Yang, Conghui He, Weijia Li

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Central South University(中南大学) China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 提出ReMMD框架,包含多语言多图像基准ReMMDBench和持久记忆验证器ReMMD-Agent,通过原子点分解和可重用证据集实现高效准确的多模态虚假信息检测。

Comments The project is available at https://dang-ai.github.io/ReMMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09898 2026-08-11 cs.CL cs.LG 新提交 57%

Consilience for Verifier-Free Test-Time Scaling

无验证器的测试时扩展的一致性方法

Lecheng Kong, Like Hui, Haitao Mao, Jun Huan

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 本文针对现有基于置信度的无验证器测试时扩展(VF-TTS)方法在复杂任务上失效的问题,提出一致性(consilience)框架,通过评估置信度时间不对称性提升LLM推理性能,在数学和代码生成任务上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09593 2026-08-11 cs.SD cs.AI 新提交 57%

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

MADBench:面向模态感知音频深度伪造检测的基准

Yanqiu Li, Yang Xiao, Jisheng Bai, Bin Chen, Hong Jia, Ting Dang

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 MADBench是首个区分语音与环境音频的音频深度伪造检测基准,测试发现环境音频操纵更易检测,现有预训练检测器在两类声学成分上均失效,为相关研究提供严谨基础。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09556 2026-08-11 cs.RO cs.SY eess.SY 新提交 57%

TDMA Based Communications Control Co-Design for Cooperative Carrying: Delay Calibration and Sampling-Rate Optimization

基于TDMA的协同搬运通信控制协同设计:时延校准与采样率优化

Zahra Seifaei, Maximilian Luebke, Torsten Reissland, Danial Dehghani, Norman Franchi

机构 * Institute for Smart Electronics and Systems, Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔朗根-纽伦堡大学智能电子与系统研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文针对多机器人协同搬运的通信挑战,在MuJoCo仿真中评估三种控制方法,发现动态采样降开销、轮换领导提公平性且不影响搬运能力,为通信受限场景部署协同机器人提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09388 2026-08-11 cs.CV 新提交 57%

Efficient Human-Contact Representation for Human-Scene Interaction

面向人-场景交互的高效人体接触表示

Nghia Vu, Tuong Do, Binh X. Nguyen, Erman Tjiputra, Anh Nguyen

机构 * AIOZ University of Liverpool(利物浦大学) NTHU(国立清华大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 针对人-场景交互中接触表示效率不足的问题,提出稀疏接触掩码与稀疏算子,在三个基准数据集的接触预测和场景合成任务上,实现至少12倍提速且精度优于现有最优模型。

Comments Accepted in ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08884 2026-08-11 cs.RO cs.HC 新提交 57%

SHRIMP: Iterative Refinement of Robot Task Plans

SHRIMP:机器人任务计划的迭代优化

Mya Schroder, Yuna Hwang, Callie Y. Kim, Leqian Cheng, Jeffrey Li-cheng Liu, Chenchen Zheng, Xinning He, Bilge Mutlu

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对协作机器人任务计划的语义歧义与透明度不足问题,提出SHRIMP系统,可通过自然语言生成分层机器人原语计划并迭代修正,经35人用户研究验证其能提升用户感知控制与机器人透明度。

Comments 11 pages, 8 figures, The 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08558 2026-08-11 cs.RO 新提交 57%

Vid2WAM: Distilling Video Diffusion Priors into World Action Models

Vid2WAM:将视频扩散先验蒸馏为世界动作模型

Chenhao Qiu, Ruixiang Wang, Runyi Zhao, Sixu Lin, Songen Gu, Shufeng Nan, Guiliang Liu, Kui Jia, Yanwei Fu, Simo Wu

专题命中 机器人数据与评测 :robot policy(abstract);分类 cs.RO

AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。

Comments Project website: https://qch-fa.github.io/vid2wam-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08070 2026-08-11 cs.RO 新提交 57%

SurgWMBench: A Vision-Based Benchmark for World-Modeling Surgical Instrument Motion Planning

SurgWMBench:面向世界建模的手术器械运动规划视觉基准

Huanrong Liu, Weiliang Huang, Bob Zhang, Weichao Cai, Chunlin Tian, Qingbiao Li

机构 * University of Macau(澳门大学) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO

AI总结 本文提出SurgWMBench,一种面向短程手术运动规划的视觉基准,可评估手术世界模型的器械运动预测与连续回推稳定性,解决现有指标与器械规划需求不匹配的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07873 2026-08-11 cs.AI 新提交 57%

Back to the Future: A workbook time machine for spread sheet creation benchmarks

回到未来:用于电子表格创建基准测试的工作簿时光机

Mansi Uniyal, Agamdeep Singh, Ananya Singha, Priyanshu Gupta, Mukul Singh, Gust Verbruggen, Vu Le, Sumit Gulwani

机构 * Microsoft(微软公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本研究提出workbook time machine流水线,构建了含150个任务的电子表格创建评估基准wtmbench,揭示了查询特异性等因素对大语言模型Excel任务性能的关键影响。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19341 2026-08-11 cs.CV 版本更新 57%

ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis

ExpertVerse:知识密集型视觉合成中专家级推理的通用基准

Yuan Wang, Yongchao Du, Mengting Chen, Jinsong Lan, Jiaxuan Luo, Xuetao Feng, Xiaoyong Zhu

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 研究针对多模态生成模型在知识密集型生成的不足,开发ExpertVerse基准,涵盖多种认知能力和专家学科,生成相关数据集,训练KnowThinker并提出BPPO优化方法,揭示模型推理缺陷,强调知识密集型基准对下一代视觉生成的重要性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26519 2026-08-11 cs.CV 版本更新 57%

GIFGuard: Proactive Forensics against Deepfakes in Facial GIFs via Spatiotemporal Watermarking

GIFGuard:通过时空水印实现面向面部GIF的主动取证对抗深度伪造

Shupeng Che, Zhiqing Guo, Changtao Miao, Dan Ma, Gaobo Yang

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出GIFGuard,首个针对GIF中深度伪造的时空水印框架,通过STARE和DIRD实现高鲁棒性取证,构建GIFfaces基准数据集以促进研究。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24084 2026-08-11 cs.AI 版本更新 57%

Bridging the Evaluation Gap: Standardized Benchmarks for Multi-Objective Search

弥合评估差距:多目标搜索的标准化基准

Hadar Peer, Carlos Hernandez, Sven Koenig, Ariel Felner, Oren Salzman

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI

AI总结 本文提出首个标准化多目标搜索基准,涵盖四个结构各异的领域,通过固定实例和标准查询确保评估的鲁棒性和全面性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17504 2026-08-11 cs.CV q-bio.QM 版本更新 57%

BMDS-Net:Deployment-aware multi-modal brain tumor segmentation with adaptive fusion,decoder regularization,and Bayesian calibration

BMDS-Net:一种用于鲁棒脑肿瘤分割的贝叶斯多模态深度监督网络

Yan Zhou, Suncheng Xiang, Zhen Huang, Yue Ouyang, Yingqiu Li, Zehua Wang

机构 * School of Mathematics and Statistics, Changsha University of Science and Technology(数学与统计学学院,长沙理工大学) School of Biomedical Engineering, Shanghai Jiao Tong University(生物医学工程学院,上海交通大学) Shanghai Chest Hospital, Shanghai Jiao Tong University School of Medicine(上海胸科医院,上海交通大学医学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 BMDS-Net通过贝叶斯方法提升多模态脑肿瘤分割的鲁棒性和可信度,实现更稳定的临床应用。

Comments 21 pages, 6 figures. Manuscript prepared for submission to ACM HEALTH

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07004 2026-08-10 cs.RO cs.SY eess.SY 新提交 57%

Benchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical Systems

面向复杂动态系统反馈控制器设计的大语言模型基准测试与推理蒸馏

Zhongchao Zhou, Yixuan Xie, Wenwei Yu, Yuxi Lu, Yaonan Zhu, Qian Niu, Yutaka Matsuo, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Chiba University(千叶大学) Tongji University(同济大学) Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 该研究构建了CoDyControlBench基准,评估了6种LLMs的控制器设计性能,开发的15亿参数推理蒸馏模型可实现边缘部署,在机械臂试验中成功完成目标跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06756 2026-08-10 cs.AI 新提交 57%

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence

Capek 0.5:面向具身智能的以执行为中心的视觉语言模型

Ying Chen, Weizhen Li, Zhe Hu, Zhenjiang Li, Rui Jiang, Zhifeng Gu, Lihuang Fang, Jiangping Liu, Lei Yi, Jie Chen

机构 * Xiaopeng(小鹏汽车)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI

AI总结 提出以执行为中心的具身视觉语言模型Capek 0.5,通过分类法整合四类具身能力,在多维度评估中表现优于初始化模型,可迁移至闭环具身任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06477 2026-08-10 cs.CR cs.AI cs.CL 新提交 57%

StepJack: Benchmarking Computer-Use Agent Safety Against Multi-Step Indirect Prompt Injection

StepJack:针对多步骤间接提示注入的计算机使用智能体安全基准测试

Zhuoxin Zhan, Akbar Rafiey, Avery Ma, Leila Pishdad, Layla El Asri

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文提出多步骤间接提示注入新型攻击,构建含480个测试样例的StepJack基准,评估六款先进CUAs,发现多步骤攻击可提升部分CUAs的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05747 2026-08-07 cs.CV 新提交 57%

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

GST-Bench:视觉语言模型能否从视频中发展出全局空间感知能力?

Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie Zhu, Yonghang Chen, Zhiyu Zhang, Wei Li

机构 * ByteDance Seed(字节跳动 Seed) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 该研究提出GST-Bench基准评估VLMs的视频全局空间感知,发现其与人类存在显著差距,构建GST-Bench-Local探究原因,还提供GST-Train数据集助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24445 2026-08-07 cs.RO 版本更新 57%

Legible and Intuitive Multi-modal Robot State and Intent Communication Validated in Online and Real-world Studies

可读且直观的多模态机器人状态与意图通信:在线和真实世界研究验证

Tim Schreiter, Jens V. Rüppel, Andrey Rudenko, Martin Magnusson, Achim J. Lilienthal

机构 * Chair of Perception for Intelligent Systems, Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所智能系统感知教席) Centre for Applied Autonomous Sensor Systems (AASS), Örebro University(厄勒布鲁大学应用自主传感器系统中心) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对移动非人形机器人,通过在线和真实世界实验,系统比较了低表达单模态LED与高表达多模态(凝视、手势、语音)通信策略,发现多模态更可读直观,且真实环境中可读性和信心下降。

Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏