arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8673 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8673 篇

2410.13322 2025-12-01 cs.RO 57%

Arc-Length-Based Warping for Robot Skill Synthesis from Multiple Demonstrations

基于弧长的变形用于多示教机器人技能合成

Giovanni Braglia, Davide Tebaldi, André Eugenio Lazzaretti, Luigi Biagiotti

机构 * Faculty of Electrical Engineering, Mathematics and Computer Science, University of Twente(代尔夫特理工大学电子工程、数学和计算机科学学院) Department of Electrical Engineering, Wright State University(威斯汀豪斯大学电气工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出基于弧长的变形方法,用于提升多示教机器人技能合成的轨迹同步和技能提取质量。

Comments 8 pages, 7 figures

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21887 2025-12-01 cs.CV 57%

UniArt: Unified 3D Representation for Generating 3D Articulated Objects with Open-Set Articulation

UniArt: 一种统一的3D表示方法,用于从单张图像生成具有开集关节的3D可动物体

Bu Jin, Weize Li, Songen Gu, Yupeng Zheng, Yuhang Zheng, Zhengyi Zhou, Yao Yao

机构 * Hong Kong University of Science and Technology(香港理工大学) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 UniArt通过统一的潜在表示和开集关节预测方法,实现了从单张图像生成高质量可动3D物体的端到端合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21784 2025-12-01 cs.LG 57%

Physics-Informed Spiking Neural Networks via Conservative Flux Quantization

基于保守通量量子化的物理指导脉冲神经网络

Chi Zhang, Lin Wang

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.LG

AI总结 本文提出了一种基于保守通量量子化的物理指导脉冲神经网络框架,通过设计保守泄漏积分-放电神经元和保守通量量子化策略,实现了严格的物理守恒和稳健的时间泛化,解决了传统PINNs在物理守恒和长期泛化上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21757 2025-12-01 cs.CY cs.AI cs.CL cs.CR 57%

Medical Malice: A Dataset for Context-Aware Safety in Healthcare LLMs

医疗恶意:用于医疗LLM中情境感知安全的数据库

Andrew Maranhão Ventura D'addario

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 Medical Malice提出一个情境感知安全的医疗数据库,通过对抗性提示和伦理推理提升医疗LLM的安全性,以应对医疗领域复杂且系统性的威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18773 2025-12-01 cs.CV 57%

Spacewalk-18: A Benchmark for Multimodal and Long-form Procedural Video Understanding in Novel Domains

Spacewalk-18:多模态和长形式程序视频理解的基准测试,用于新领域

Zitian Tang, Rohan Myer Krishnan, Zhiqiu Yu, Chen Sun

机构 * Brown University(布朗大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 Spacewalk-18是一个用于多模态和长形式程序视频理解的新领域基准测试,通过步骤识别和视频问答任务评估模型在新领域和长时序上下文中的泛化能力。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17379 2025-12-01 cs.RO cs.HC 57%

What Could a Social Mediator Robot Do? Lessons from Real-World Mediation Scenarios

社交调解机器人能做什么?来自真实世界调解场景的启示

Thomas H. Weisswange, Hifza Javed, Manuel Dietrich, Tuan Vu Pham, Maria Teresa Parreira, Michael Sack, Nawid Jamali

机构 * Honda Research Institute Europe GmbH(本田欧洲研究院) Honda Research Institute USA, Inc.(本田美国研究院) University of Siegen(锡根大学) Cornell University(康奈尔大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文探讨了社交调解机器人在真实场景中的六种潜在角色,并提出评估其调解效果的方法,旨在推动机器人辅助社会调解的研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21312 2025-11-27 cs.RO 57%

Neural NMPC through Signed Distance Field Encoding for Collision Avoidance

通过符号距离场编码的神经NMPC用于避障

Martin Jacquet, Marvin Harms, Kostas Alexis

机构 * Autonomous Robots Lab, Norwegian University of Science and Technology (NTNU)(自主机器人实验室,挪威科学技术大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出一种基于符号距离场编码的神经NMPC框架,用于飞行器在未知环境中的无地图避障导航,通过深度学习编码环境信息并实现安全避障。

Comments accepted for publication in IJRR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20784 2025-11-27 cs.CV 57%

One Patch is All You Need: Joint Surface Material Reconstruction and Classification from Minimal Visual Cues

一个补丁就够了:从最小的视觉线索联合表面材料重建与分类

Sindhuja Penchala, Gavin Money, Gabriel Marques, Samuel Wood, Jessica Kirschman, Travis Atkison, Shahram Rahimi, Noorbakhsh Amiri Golilarz

机构 * Department of Computer Science, The University of Alabama(计算机科学系,阿拉巴马大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 SMARC通过单个补丁实现表面材料重建与分类,以应对稀疏视觉输入下的挑战,取得最佳性能。

Comments 9 pages,3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17358 2025-11-27 cs.CV 57%

Image as an IMU: Estimating Camera Motion from a Single Motion-Blurred Image

图像作为IMU:从单张运动模糊图像估计相机运动

Jerred Chen, Ronald Clark

机构 * University of Oxford(牛津大学) Department of Computer Science(计算机科学系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出了一种利用运动模糊估计相机运动的方法,通过预测运动流场和深度图,结合线性最小二乘问题恢复相机速度,实现高精度姿态估计。

Comments Project page: https://jerredchen.github.io/image-as-imu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00525 2025-11-27 cs.CV 57%

Systematic Evaluation and Guidelines for Segment Anything Model in Surgical Video Analysis

手术视频分析中Segment Anything模型的系统评估与指南

Cheng Yuan, Jian Jiang, Kunyi Yang, Lv Wu, Rui Wang, Zi Meng, Haonan Ping, Ziyu Xu, Yifan Zhou, Wanli Song, Hesheng Wang, Yueming Jin, Qi Dou, Yutong Ban

机构 * Global College(全球学院) Shanghai Jiao Tong University(上海交通大学) Department of Automation(自动化系) National University of Singapore(新加坡国立大学) Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文评估了SAM2模型在手术视频分割中的零样本能力,揭示其在结构化场景中的表现与动态手术条件下的局限性,为手术数据科学提供未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19836 2025-11-26 cs.CV 57%

4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models

4DWorldBench: 一种用于3D/4D世界生成模型的综合评估框架

Yiting Lu, Wei Luo, Peiyan Tu, Haoran Li, Hanxin Zhu, Zihao Yu, Xingrui Wang, Xinyi Chen, Xinge Peng, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Beijing Zhongguancun Academy(北京中关村学院)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 4DWorldBench提出了一种用于评估3D/4D世界生成模型的综合框架,通过四个维度评估模型的感知质量、条件对齐、物理真实性和一致性,支持多模态输入并整合多种评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10068 2025-11-26 cs.CV 57%

Probabilistic Hyper-Graphs using Multiple Randomly Masked Autoencoders for Semi-supervised Multi-modal Multi-task Learning

基于多随机掩码自编码器的概率超图用于半监督多模态多任务学习

Pîrvu Mihai-Cristian, Marius Leordeanu

机构 * Faculty of Automatic Control and Computer Science, Politehnica University of Bucharest(自动化控制与计算机科学系,布加勒斯特理工大学) Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出PHG-MAE模型,结合神经图和掩码自编码器,通过随机掩码多模态数据提升多任务学习性能,并公开了相关工具和数据集。

Comments Submitted to Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03861 2025-11-26 cs.CV 57%

Refinement of Monocular Depth Maps via Multi-View Differentiable Rendering

通过多视角可微渲染细化单目深度图

Laura Fink, Linus Franke, Bernhard Egger, Joachim Keinert, Marc Stamminger

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) Fraunhofer IIS Erlangen(弗劳恩霍夫研究所埃朗根)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出通过多视角可微渲染优化,提升单目深度图的精度与一致性,实现更高质量的深度估计。

Comments 8 pages main paper + 3 pages of references + 6 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19509 2025-11-26 cs.LG 57%

TouchFormer: A Robust Transformer-based Framework for Multimodal Material Perception

TouchFormer: 一种基于变换器的鲁棒多模态材料感知框架

Kailin Lyu, Long Xiao, Jianing Zeng, Junhao Dong, Xuexin Liu, Zhuojun Zou, Haoyue Yang, Lin Shu, Jie Hao

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.LG

AI总结 TouchFormer通过模态自适应门控和注意力机制提升多模态材料感知的鲁棒性,并在细粒度分类任务中实现性能提升。

Comments 9 pages, 7 figures, Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18983 2025-11-25 cs.CV 57%

UMCL: Unimodal-generated Multimodal Contrastive Learning for Cross-compression-rate Deepfake Detection

UMCL: 单模生成多模对比学习用于跨压缩率深度伪造检测

Ching-Yi Lai, Chih-Yu Jian, Pei-Cheng Chuang, Chia-Ming Lee, Chih-Chung Hsu, Chiou-Ting Hsu, Chia-Wen Lin

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 UMCL通过单模生成多模对比学习,提升跨压缩率深度伪造检测的鲁棒性和准确性。

Comments 24-page manuscript accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02595 2025-11-25 cs.RO 57%

Extremum Seeking Controlled Wiggling for Tactile Insertion

极值寻求控制的触觉插入振动

Levi Burner, Pavan Mantripragada, Gabriele M. Caddeo, Lorenzo Natale, Cornelia Fermüller, Yiannis Aloimonos

机构 * Department of Electrical and Computer Engineering, University of Maryland, College Park(电气与计算机工程系,马里兰大学学院公园分校) Department of Computer Science, University of Maryland, College Park(计算机科学系,马里兰大学学院公园分校) Istituto Italiano di Tecnologia, Via San Quirico, 19 D, Genova, Italy(意大利理工学院,圣奎里科路19D号,热那亚,意大利) University of Maryland Institute for Advanced Computer Studies, University of Maryland, College Park(马里兰大学高级计算机研究 institute)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于触觉反馈的极值寻求控制方法,用于提高机器人插入任务的鲁棒性和成功率。

Comments 8 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18173 2025-11-25 cs.CV 57%

EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses

EgoControl: 通过3D全身姿态实现可控的目视视频生成

Enrico Pallotta, Sina Mokhtarzadeh Azar, Lars Doorenbos, Serdar Ozsoy, Umar Iqbal, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔人工智能与机器学习研究所) NVIDIA(NVIDIA公司)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 EgoControl通过3D全身姿态控制生成高质量的目视视频,实现对动作的精细控制,推动具身AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18088 2025-11-25 cs.RO 57%

A Unified Multi-Dynamics Framework for Perception-Oriented Modeling in Tendon-Driven Continuum Robots

为腱驱动连续机器人感知导向建模设计的统一多动态框架

Ibrahim Alsarraj, Yuhao Wang, Abdalla Swikir, Cesare Stefanini, Dezhen Song, Zhanchi Wang, Ke Wu

机构 * Robotics Department, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed大学人工智能研究院机器人部门) Hefei National Research Center for Physical Sciences at the Microscale, University of Science and Technology of China (USTC)(中国科学技术大学微尺度物理科学国家级研究中心)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种统一的多动态框架,用于腱驱动连续机器人中基于内在动态的感知建模与交互解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13404 2025-11-25 cs.LG 57%

SWIR-LightFusion: Multi-spectral Semantic Fusion of Synthetic SWIR with Thermal IR (LWIR/MWIR) and RGB

SWIR-LightFusion: 多光谱合成SWIR与热红外(LWIR/MWIR)及RGB的语义融合

Muhammad Ishfaq Hussain, Ma Van Linh, Zubia Naz, Unse Fatima, Yeongmin Ko, Moongu Jeon

机构 * GIST(韩国全南大学) Kyungpook National University(庆尚国立大学) KISTI(韩国科学技术院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 本文提出SWIR-LightFusion框架,通过合成SWIR图像融合LWIR、RGB多模态数据,提升恶劣环境下的场景理解能力。

Journal ref Cluster Computing (Springer) as Volume 29, Issue 1, Article 48, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02387 2025-11-25 cs.RO cs.SY eess.SY 57%

RGBSQGrasp: Inferring Local Superquadric Primitives from Single RGB Image for Graspability-Aware Bin Picking

RGBSQGrasp: 从单张RGB图像推断局部超二次曲面原语以实现抓取感知的托盘拾取

Yifeng Xu, Fan Zhu, Ye Li, Sebastian Ren, Xiaonan Huang, Yuhao Chen

机构 * University of Michigan(密歇根大学) University of Waterloo(滑铁卢大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University College London(伦敦大学学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 RGBSQGrasp通过单目RGB图像推断抓取姿态,利用超二次曲面原语提升托盘拾取任务的抓取稳定性和适应性。

Comments 8 pages, 6 figures, IROS2025 RGMCW Best Workshop Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18904 2025-11-21 cs.CV 57%

TC-Light: Temporally Coherent Generative Rendering for Realistic World Transfer

TC-Light: 用于现实世界迁移的时序一致生成渲染

Yang Liu, Chuanchen Luo, Zimo Tang, Yingyan Li, Yuran Yang, Yuanyong Ning, Lue Fan, Junran Peng, Zhaoxiang Zhang

机构 * NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Shandong University(山东大学) University of Science and Technology Beijing(北京科技大学) Tencent(腾讯) Huazhong University of Science and Technology(华中科技大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 TC-Light通过优化外观嵌入和唯一视频张量,实现高质量且高效的世界迁移渲染。

Comments Project Page: https://dekuliutesla.github.io/tclight/ Code: https://github.com/Linketic/TC-Light

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15759 2025-11-21 cs.CR cs.AI 57%

Securing AI Agents Against Prompt Injection Attacks

保护AI代理免受提示注入攻击

Badrinath Ramakrishnan, Akshaya Balaji

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出了一种多层防御框架,通过评估RAG系统中的提示注入风险,将攻击成功率降低至8.7%,同时保持高任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15550 2025-11-21 cs.RO 57%

UltraDP: Generalizable Carotid Ultrasound Scanning with Force-Aware Diffusion Policy

UltraDP: 通用的颈动脉超声扫描与力感知扩散策略

Ruoqu Chen, Xiangjie Yan, Kangchen Lv, Gao Huang, Zheng Li, Xiang Li

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Department of Surgery, Chow Yuk Ho Technology Centre for Innovative Medicine, Li Ka Shing Institute of Health Science and Multi-scale Medical Robotics Center, The Chinese University of Hong Kong, Hong Kong(外科系,创新医学技术中心,利文斯科健康科学研究所及多尺度医学机器人中心,香港中文大学,香港)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 UltraDP通过力感知扩散策略实现通用颈动脉超声扫描,利用多感官输入和混合控制器提高扫描成功率至95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17425 2025-11-21 cs.AI 57%

Evaluating Multimodal Large Language Models with Daily Composite Tasks in Home Environments

在家庭环境中评估多模态大语言模型的日常复合任务

Zhenliang Zhang, Yuxi Wang, Hongzhao Xie, Shiyun Zhao, Mingyuan Liu, Yujie Lu, Xinyi He, Zhenku Cheng, Yujia Peng

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence(通用人工智能国家重点实验室、北京通用人工智能研究院) School of Psychological and Cognitive Sciences and Beijing Key Laboratory of Behavior and Mental Health, Key Laboratory of Machine Perception (Ministry of Education), Peking University(心理与认知科学学院及北京行为与心理健康重点实验室、机器感知重点实验室(教育部)) School of Intelligence Science and Technology, Peking University(智能科学与技术学院)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI

AI总结 本研究在家庭环境中评估了多模态大语言模型在日常复合任务中的表现,发现其在物体理解、空间智能和社会活动领域存在显著差距,为具身MLLMs的发展提供了初步评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08546 2025-11-21 cs.RO 57%

Grounding LLMs For Robot Task Planning Using Closed-loop State Feedback

通过闭环状态反馈接地LLMs用于机器人任务规划

Vineet Bhat, Ali Umut Kaypak, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出BrainBody-LLM方法,通过闭环反馈机制提升LLMs在机器人任务规划中的鲁棒性,实现在复杂任务中的显著性能提升。

Comments Preprint version. Accepted full paper available here: https://advanced.onlinelibrary.wiley.com/doi/10.1002/adrr.202500072

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15567 2025-11-20 cs.CV cs.CL cs.HC 57%

Computer-Use Agents as Judges for Generative User Interface

计算机使用代理作为生成用户界面的法官

Kevin Qinghong Lin, Siyuan Hu, Linjie Li, Zhengyuan Yang, Lijuan Wang, Philip Torr, Mike Zheng Shou

机构 * University of Oxford(牛津大学) Show Lab, National University of Singapore(新加坡国立大学Show实验室) Microsoft(微软公司)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本研究提出Coder-CUA协作框架,通过代理作为法官与编码模型协作,提升自动GUI设计的效率和可靠性。

Comments Project: https://showlab.github.io/AUI Github: https://github.com/showlab/AUI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15532 2025-11-20 cs.RO cs.SY eess.SY 57%

NMPC-based Motion Planning with Adaptive Weighting for Dynamic Object Interception

基于自适应加权的非线性模型预测控制运动规划用于动态物体拦截

Chen Cai, Saksham Kohli, Steven Liu

机构 * Department of Electrical and Computer Engineering, University of Kaiserslautern-Landau(电气与计算机工程系,凯撒斯劳滕-兰道大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于自适应终端MPC的运动规划方法,用于提高动态物体拦截任务的运动质量和鲁棒性,同时减少计算开销。

Comments This work has been submitted to the IFAC World Congress for possible publication. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15429 2025-11-20 cs.CV 57%

WarNav: An Autonomous Driving Benchmark for Segmentation of Navigable Zones in War Scenes

WarNav: 一种用于战场场景中可导航区域分割的自动驾驶基准测试集

Marc-Emmanuel Coupvent des Graviers, Hejer Ammar, Christophe Guettier, Yann Dumortier, Romaric Audigier

机构 * Safran Electronics and Defense(萨弗兰电子与防御公司) Université Paris-Saclay(巴黎-萨克雷大学) CEA(法国原子能委员会) List

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 WarNav是一个专为战场场景中自主车辆导航设计的语义分割基准测试集,旨在填补传统城市驾驶资源与战区独特操作场景之间的空白。

Comments Accepted at CAID (Conference on Artificial Intelligence for Defence)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15379 2025-11-20 cs.CV 57%

Zero-Shot Open-Vocabulary Human Motion Grounding with Test-Time Training

零样本开放词汇人体运动接地与测试时训练

Yunjiao Zhou, Xinyan Chen, Junlang Qian, Lihua Xie, Jianfei Yang

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出ZOMG框架,通过语言语义分区和软掩码优化,在无需标注或微调的情况下实现零样本开放词汇的人体运动接地,提升了运动理解的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15153 2025-11-20 cs.CV 57%

SceneEdited: A City-Scale Benchmark for 3D HD Map Updating via Image-Guided Change Detection

Chun-Jung Lin, Tat-Jun Chin, Sourav Garg, Feras Dayoub

机构 * Australian Institute for Machine Learning (AIML), University of Adelaide, Australia(澳大利亚机器学习研究所(AIML)、阿德莱德大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

Comments accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏