arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8666 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8666 篇

2604.22331 2026-04-27 cs.CV 57%

Depth-Aware Rover: A Study of Edge AI and Monocular Vision for Real-World Implementation

具备深度感知的越野车:边缘AI与单目视觉在现实世界中的应用研究

Lomash Relia, Jai G Singla, Amitabh, Nitant Dube

机构 * Space Applications Centre(空间应用中心) Institute of Advanced Indian Space Research(印度高级空间研究机构) Indian Space Research Organization(印度空间研究组织) Technology and Research(技术与研究)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文研究了基于边缘AI和单目视觉的越野车导航,通过模拟和现实测试,发现单目深度估计在实际部署中更稳健且成本更低。

Comments Accepted by IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22296 2026-04-27 cs.CV 57%

Evaluation of image simulation open source solutions for simulation of synthetic images in lunar environment

月球环境下的图像模拟开源解决方案评估

Jai G Singla, Hinal B Patel, Nitant Dube

机构 * Space Applications centre(空间应用中心) Indian Space Research Organization(印度空间研究组织)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文评估了用于生成月球环境合成图像的开源解决方案,重点分析不同相机模型和光照条件对图像质量的影响,以提高自主导航和决策系统在月球探索中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21478 2026-04-24 cs.CV 57%

Rethinking Cross-Domain Evaluation for Face Forgery Detection with Semantic Fine-grained Alignment and Mixture-of-Experts

重新思考面向面部伪造检测的跨领域评估:基于语义细粒度对齐和专家混合

Yuhan Luo, Tao Chen, Decheng Liu

机构 * School of Cyber Engineering, Xidian University(西安电子科技大学信息工程学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出Cross-AUC评估指标和SFAM框架,通过语义细粒度对齐和专家混合提升面部伪造检测的跨领域鲁棒性,实验证明方法在多个数据集上优于现有技术。

Comments The source code is available at https://github.com/Yuhan-Luo/Semantic-Fine-grained-Alignment-and-Mixture-of-Experts

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21453 2026-04-24 cs.CV 57%

Instance-level Visual Active Tracking with Occlusion-Aware Planning

实例级视觉主动跟踪与遮挡感知规划

Haowei Sun, Kai Zhou, Hao Gao, Shiteng Zhang, Jinwu Hu, Xutao Wen, Qixiang Ye, Mingkui Tan

机构 * South China University of Technology(南方科技大学) Pazhou Laboratory(Pazhou实验室) Key Laboratory of Big Data and Intelligent Robot, Ministry of Education(教育部大数据与智能机器人重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出OA-VAT方法,通过实例感知原型初始化、在线原型增强跟踪和遮挡感知轨迹规划模块,解决遮挡和相似干扰问题,实现高精度实时跟踪。

Comments CVPR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19787 2026-04-23 cs.CL cs.AI cs.CY 57%

LLM Agents Predict Social Media Reactions but Do Not Outperform Text Classifiers: Benchmarking Simulation Accuracy Using 120K+ Personas of 1511 Humans

LLM代理预测社交媒体反应但不优于文本分类器:使用120,000多个1511人的人设进行基准测试

Ljubisa Bojic, Alexander Felfernig, Bojana Dinic, Velibor Ilic, Achim Rettinger, Vera Mevorah, Damian Trilling

机构 * Institute for Artificial Intelligence Research and Development of Serbia(塞尔维亚人工智能研究与开发研究所) University of Belgrade, Institute for Philosophy and Social Theory, Digital Society Lab(贝尔格莱德大学,哲学与社会理论研究所,数字社会实验室) Complexity Science Hub, Vienna, Austria(维也纳复杂科学中心) Graz University of Technology, Graz, Austria(技术大学格拉茨,格拉茨,奥地利) University of Novi Sad, Faculty of Philosophy, Novi Sad, Serbia(诺维萨德大学,哲学学院,诺维萨德,塞尔维亚) University of Trier, Trier, Germany(特里尔大学,特里尔,德国) Vrije University Amsterdam, Amsterdam, Netherlands(阿姆斯特丹自由大学,阿姆斯特丹,荷兰)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文研究LLM代理预测人类社交媒体反应的准确性,发现其表现不如传统文本分类器,揭示了零样本代理在模拟极化动态中的潜力及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14311 2026-04-23 eess.SY cs.RO cs.SY 57%

Multi-Timescale Model Predictive Control for Slow-Fast Systems

多时间尺度模型预测控制用于慢-快系统

Lukas Schroth, Daniel Morton, Amon Lahr, Daniele Gammelli, Andrea Carron, Marco Pavone

机构 * Institute for Dynamic Systems and Control(动态系统与控制研究所) Department of Aeronautics and Astronautics(航空与航天系) Department of Mechanical Engineering(机械工程系) NVIDIA Research(NVIDIA研究)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出多时间尺度MPC方法,通过切换简化模型和增加积分步长来提升计算效率,应用于机器人控制问题,实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18823 2026-04-23 cs.CV 57%

MSLAU-Net: A Hybrid CNN-Transformer Network for Medical Image Segmentation

MSLAU-Net:一种用于医学图像分割的混合CNN-Transformer网络

Libin Lan, Yanxin Li, Xiaojuan Liu, Juan Zhou, Jianxun Zhang, Nannan Huang, Yudong Zhang

机构 * College of Computer Science and Engineering(计算机科学与工程学院) College of Artificial Intelligence(人工智能学院) Department of Pharmacy(药学部) Department of Prosthodontics(修复学部) Chongqing Key Laboratory of Oral Diseases(重庆口腔疾病重点实验室) Chongqing Municipal Key Laboratory of Oral Biomedical Engineering of Higher Education(重庆市口腔生物医学工程高等教育重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Southeast University(东南大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出MSLAU-Net,结合CNN和Transformer的优势,通过多尺度线性注意力和自上而下特征聚合机制,提升医学图像分割的精度与效率。

Comments 15 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20795 2026-04-23 cs.AI 57%

Automatic Ontology Construction Using LLMs as an External Layer of Memory, Verification, and Planning for Hybrid Intelligent Systems

利用LLMs构建自动本体:作为混合智能系统记忆、验证和规划的外部层

Pavel Salovskii, Iuliia Gorshkova

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 本文提出了一种混合架构,通过扩展LLMs的外部本体记忆层,实现结构化知识图谱的构建与维护,提升多步推理性能并支持生成-验证-修正流程。

Comments Artificial Intelligence; Knowledge Representation and Reasoning; Information Retrieval; Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20760 2026-04-23 cs.CV 57%

Exploring High-Order Self-Similarity for Video Understanding

探索高阶自相似性用于视频理解

Manjin Kim, Heeseung Kwon, Karteek Alahari, Minsu Cho

机构 * POSTECH RLWRLD Inc.(RLWRLD公司) INRIA Grenoble Rhône-Alpes(INRIA格勒诺布尔罗纳-阿尔卑斯研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出多阶自相似模块MOSS,通过学习和整合多阶时空自相似特征,提升视频任务中的运动建模能力,实验表明在动作识别、视频VQA和机器人任务中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19567 2026-04-22 cs.AI 57%

Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic

基于LLM的多模态推理用于视觉语义算术

Chuou Xu, Liya Ji, Qifeng Chen

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 本文提出两种新型任务和IRPD数据集,通过SAri-RFT方法提升大视觉语言模型的跨模态关系推理能力,实现视觉语义算术的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16662 2026-04-22 cs.RO eess.SP 57%

Joint Magnetometer-IMU Calibration via Maximum A Posteriori Estimation

通过最大后验估计联合磁力计-IMU校准

Chuan Huang, Gustaf Hendeby, Isaac Skog

机构 * Dept. of Electrical Engineering and Computer Science, KTH Royal Institute of Technology(电子工程与计算机科学系,皇家理工学院) Dept. of Electrical Engineering, Linköping University(电子工程系,利尔贝里大学) Dept. of Electrical Engineering and Computer Science, KTH Royal Institute of Technology, and the Div. of Underwater Technology, Swedish Defence Research Agency (FOI)(电子工程与计算机科学系,皇家理工学院,以及瑞典国防研究机构(FOI)的水下技术系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出一种联合校准磁力计和惯性测量单元的方法,通过最大后验估计框架优化校准参数,提升精度与效率,实验证明其校准精度提高20-30%,且计算效率高。

Comments Accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18790 2026-04-22 cs.CV 57%

EfficientPENet: Real-Time Depth Completion from Sparse LiDAR via Lightweight Multi-Modal Fusion

EfficientPENet:通过轻量多模态融合实现稀疏LiDAR的实时深度补全

Johny J. Lopez, Md Meftahul Ferdaus, Mahdi Abdelguerfi, Anton Netchaev, Steven Sloan, Ken Pathak, Kendall N. Niles

机构 * Canizaro Livingston Gulf States Center for Environmental Informatics, the University of New Orleans, New Orleans, USA(Canizaro Livingston Gulf States环境信息中心,新奥尔良大学,美国新奥尔良) US Army Corps of Engineers, Engineer Research and Development Center, Vicksburg, Mississippi, USA(美国陆军工程兵团,工程师研究与发展中心,密西西比州维克斯堡,美国)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出EfficientPENet,通过轻量级多模态融合网络,在稀疏LiDAR和RGB图像上实现实时深度补全,具有更少的参数和更高的速度,同时保持竞争力的精度。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17065 2026-04-21 cs.CV 57%

BasketHAR: A Multimodal Dataset for Human Activity Recognition and Sport Analysis in Basketball Training Scenarios

BasketHAR:一种用于篮球训练场景中的人体活动识别和运动分析的多模态数据集

Xian Gao, Haoyue Zhang, Zongyun Zhang, Jiacheng Ruan, Ting Liu, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出BasketHAR数据集,用于解决现有HAR数据集在体育分析应用中的不足,通过多模态数据包括运动传感器和视频记录,提供先进的HAR任务研究资源。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15857 2026-04-20 cs.CV 57%

AHS: Adaptive Head Synthesis via Synthetic Data Augmentations

AHS: 通过合成数据增强实现自适应头部合成

Taewoong Kang, Hyojin Jang, Sohyun Jeong, Seunggi Moon, Gihwi Kim, Hoon Jin Jung, Jaegul choo

机构 * KAIST(韩国国立科学技术院) Korea University(韩国大学) FLIPTION

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出AHS方法,通过合成数据增强解决头部合成中视角和表情多样性的限制,提升真实场景下的泛化能力。

Comments CVPR 2026, Project Page : https://keh0t0.github.io/AHS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15823 2026-04-20 cs.CV 57%

Watching Movies Like a Human: Egocentric Emotion Understanding for Embodied Companions

像人类一样看电影:面向具身陪伴的视角中心情绪理解

Ze Dong, Hao Shi, Zejia Gao, Zhonghua Yi, Kaiwei Wang, Lin Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学, 新加坡) Zhejiang University, China(浙江大学, 中国) Ant Group, China(蚂蚁集团, 中国) MirrorMe, China(MirrorMe, 中国)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出EgoScreen-Emotion基准数据集,用于视角中心电影情绪理解,通过多标签标注和长上下文模型提升跨域泛化能力,实验显示基于传统电影数据的模型在真实视角观看场景中性能显著下降。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15052 2026-04-17 cs.RO 57%

CAVERS: Multimodal SLAM Data from a Natural Karstic Cave with Ground Truth Motion Capture

CAVERS:从自然喀斯特洞穴获取多模态SLAM数据并采用地面真实运动捕捉

Giacomo Franchini, David Rodríguez-Martínez, Alfonso Martínez-Petersen, C. J. Pérez-del-Pulgar, Marcello Chiaberge

机构 * Polytechnic of Turin Interdepartmental Centre for Service Robotics (PIC4SeR)(都灵理工大学服务机器人跨部门研究中心(PIC4SeR)) Systems Engineering and Automation Department, Universidad de Málaga(马德里大学系统工程与自动化系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出CAVERS数据集,通过地面真实运动捕捉系统提供高精度姿态和速度数据,验证了多模态传感器在复杂洞穴环境中的SLAM算法性能。

Comments 8 pages, 5 figures, preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10069 2026-04-17 cs.RO 57%

Humanoid Factors: Design Principles for AI Humanoids in Human Worlds

人形因素:人工智能人形在人类世界中的设计原则

Xinyuan Liu, Eren Sadikoglu, Ransalu Senanayake, Lixiao Huang

机构 * School of Computing and Augmented Intelligence, Arizona State University, AZ, USA(计算与增强智能学院,亚利桑那州立大学,亚利桑那州,美国) School of Manufacturing Systems and Networks, Arizona State University, AZ, USA(制造系统与网络学院,亚利桑那州立大学,亚利桑那州,美国) Human Systems Engineering, Arizona State University, AZ, USA(人机系统工程,亚利桑那州立大学,亚利桑那州,美国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出人形因素框架,旨在指导人工智能人形与人类共存与协作的设计,强调物理、认知、社会和伦理四个支柱,以解决人形与人类交互中的新挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21025 2026-04-17 cs.CV 57%

CaptionQA: Is Your Caption as Useful as the Image Itself?

CaptionQA: 你的描述是否和它所代表的图像一样有用?

Shijia Yang, Yunong Liu, Bohan Zhai, Ximeng Sun, Zicheng Liu, Emad Barsoum, Manling Li, Chenfeng Xu

机构 * Advanced Micro Devices, Inc.(先进微器件公司) Stanford University(斯坦福大学) Independent Researcher(独立研究者) Northwestern University(西北大学) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 CaptionQA通过评估生成描述在下游任务中的实用性,揭示了图像与描述之间的效用差距,涵盖四个领域,包含25个顶级和69个子类别,提供33,027个密集标注的多选问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13959 2026-04-16 cs.AI 57%

[Emerging Ideas] Artificial Tripartite Intelligence: A Bio-Inspired, Sensor-First Architecture for Physical AI

新兴理念:人工三元智能:一种生物启发、以传感器优先的物理AI架构

You Rim Choi, Subeom Park, Hyung-Sin Kim

机构 * Seoul National University(首尔国立大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI

AI总结 本文提出人工三元智能(ATI),一种生物启发的物理AI架构,通过模块化设计实现传感器控制与推理的协同进化,提升动态环境下的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05991 2026-04-16 cs.AI 57%

3D Instruction Ambiguity Detection

三维指令歧义检测

Jiayu Ding, Haoran Tang, Hongbo Jin, Wei Gao, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI

AI总结 本文提出三维指令歧义检测任务,构建了大规模基准Ambi3D,发现现有3D大语言模型难以判断指令歧义,提出AmbiVer框架解决该问题,提升具身AI的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13121 2026-04-16 cs.RO 57%

Olfactory pursuit: catching a moving odor source in complex flows

嗅觉追逐:在复杂的流体中捕捉移动的气味源

Maurizio Carbone, Lorenzo Piro, Robin A. Heinonen, Luca Biferale, Massimo Cencini, Antonio Celani

机构 * Istituto dei Sistemi Complessi, CNR(复杂系统研究所,国家研究 council) Department of Physics & INFN, Tor Vergata University of Rome(罗马 Tor Vergata 大学物理系及 INFN)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 研究提出了一种基于部分可观测马尔可夫决策过程的嗅觉追逐方法,结合信息获取与贪心策略,有效应对目标持续运动的挑战,提升在信息贫乏环境中的搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13046 2026-04-16 cs.DB cs.CL cs.IR cs.LG cs.PL 57%

A Domain-Specific Language for LLM-Driven Trigger Generation in Multimodal Data Collection

面向LLM驱动触发生成的领域特定语言

Philipp Reis, Philipp Rigoll, Martin Zehetner, Jacqueline Henle, Stefan Otten, Eric Sax

机构 * FZI Research Center for Information Technology(FZI信息与技术研究中心)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.LG

AI总结 本文提出一种基于领域特定语言的意图驱动数据收集框架,通过自然语言交互与形式化规范相结合,实现多模态传感器数据的选择性采集,提升生成一致性与执行效率。

Comments Version submitted to the IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02738 2026-04-16 cs.RO cs.SY eess.SY 57%

Optimizing Control-Friendly Trajectories with Self-Supervised Residual Learning

利用自监督残差学习优化可控路径

Kexin Guo, Zihan Yang, Yuhang Liu, Jindou Jia, Xiang Yu

机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院) Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院) School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出自监督残差学习与轨迹优化框架,通过学习闭环模型中的未知动态效应,生成对后续控制器友好的最优轨迹,验证了混合动力学在四旋翼敏捷飞行中的有效性。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12852 2026-04-15 cs.RO 57%

PAINT: Partner-Agnostic Intent-Aware Cooperative Transport with Legged Robots

PAINT:伙伴无关意图感知的协作运输

Zhihao Cao, Tianxu An, Chenhao Li, Stelian Coros, Marco Hutter

机构 * Robotic Systems Lab, ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院机器人系统实验室) Computational Robotics Lab, ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院计算机器人学实验室) ETH AI Center, ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院ETH人工智能中心)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 PAINT通过 proprioceptive 反馈直接推断伙伴意图,实现轻量级、高效的协作运输,适用于复杂地形和多种伙伴。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10929 2026-04-15 cs.RO 57%

Ro-SLM: Onboard Small Language Models for Robot Task Planning and Operation Code Generation

Ro-SLM:机器人任务规划与操作代码生成的 onboard 小语言模型

Wenhao Wang, Yanyan Li, Long Jiao, Jiawei Yuan

机构 * Department of Computer & Information Science, University of Massachusetts Dartmouth(达特茅斯大学计算机与信息科学系) Department of Computer Science & Engineering, California State University San Marcos(加州州立大学桑马克斯分校计算机科学与工程系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出Ro-SLM框架,通过蒸馏大语言模型知识提升机器人任务规划与代码生成能力,实验证明其性能接近大语言模型。

Comments 25 pages, 2 figures, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14634 2026-04-15 cs.RO 57%

Physically Accurate Rigid-Body Dynamics in Particle-Based Simulation

基于物理的刚体动力学在粒子模拟中的实现

Ava Abderezaei, Nataliya Nechyporenko, Joseph Miceli, Gilberto Briscoe-Martinez, Alessandro Roncone

机构 * Department of Computer Science, University of Colorado Boulder(科罗拉多大学博尔德分校计算机科学系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出PBD-R方法,通过新的动量守恒约束和修改的速度假设,提升粒子模拟在机器人中的物理准确性,并引入无solver基准测试评估性能。

Comments Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10073 2026-04-15 cs.CR cs.CV 57%

SecureWebArena: A Holistic Security Evaluation Benchmark for LVLM-based Web Agents

SecureWebArena: 一个针对基于大视觉-语言模型的Web代理的综合安全评估基准

Zonghao Ying, Yangguang Shao, Jianle Gan, Gan Xu, Wenxin Zhang, Quanchen Zou, Junzheng Shi, Zhenfei Yin, Mingchuan Zhang, Aishan Liu, Xianglong Liu

机构 * SKLCCSE, Beihang University(北京航空航天大学安全实验室) Institute of Information Engineering, CAS(中国科学院信息工程研究所) China University of Petroleum (East China)(中国石油大学(华东)) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Science(中国科学院大学) AI Security Lab(360人工智能安全实验室) The University of Sydney(悉尼大学) Henan University of Science and Technology(河南理工大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出SecureWebArena,首个针对基于大视觉-语言模型的Web代理安全性的综合评估基准,通过六个真实模拟的Web环境和2970条高质量轨迹,分析代理在内部推理、行为轨迹和任务结果三个维度上的安全风险。

Comments ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11038 2026-04-14 cs.CV 57%

EgoFun3D: Modeling Interactive Objects from Egocentric Videos using Function Templates

EgoFun3D:基于第一人称视频建模交互三维物体的协调任务

Weikun Peng, Denys Iliash, Manolis Savva

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出EgoFun3D,通过函数模板建模交互三维物体,解决真实世界视频中交互物体建模难题,提出四阶段流程并展示其挑战性。

Comments Project website: https://3dlg-hcvc.github.io/EgoFun3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10780 2026-04-14 cs.CV 57%

LIDARLearn: A Unified Deep Learning Library for 3D Point Cloud Classification, Segmentation, and Self-Supervised Representation Learning

LIDARLearn: 一个用于3D点云分类、分割和自监督表示学习的统一深度学习库

Said Ohamouddou, Hanaa El Afia, Abdellatif El Afia, Raddouane Chiheb

机构 * ENSIAS, Mohammed V University, Rabat, Morocco(穆罕默德五世大学ENSIAS学院,拉巴特,摩洛哥)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出LIDARLearn,一个整合多种3D点云处理方法的统一深度学习库,支持分类、语义分割、部分分割和少样本学习,并提供标准化训练流程和严格多模型比较工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05510 2026-04-14 cs.CV 57%

Benchmarking Vision-Language Models under Contradictory Virtual Content Attacks in Augmented Reality

在增强现实中评估视觉-语言模型在矛盾虚拟内容攻击下的基准测试

Yanming Xiu, Zhengyuan Jiang, Neil Zhenqiang Gong, Maria Gorlatova

机构 * Duke University(杜克大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出ContrAR基准,评估视觉-语言模型在增强现实中的鲁棒性,通过312个真实AR视频验证,测试11种VLMs,发现现有模型在检测对抗性内容操纵方面仍有改进空间。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏