arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2604.15312 2026-04-17 cs.CV

Bidirectional Cross-Modal Prompting for Event-Frame Asymmetric Stereo

双向跨模态提示用于事件-帧不对称立体

Ninghui Xu, Fabio Tosi, Lihui Wang, Jiawei Han, Luca Bartolomei, Zhiting Yao, Matteo Poggi, Stefano Mattoccia

机构 * School of Instrument Science and Engineering, Southeast University, State Key Lab of Comprehensive PNT Network and Equipment Technology, Key Lab of Micro-Inertial Instrument and Advanced Navigation Technology, MOE(仪器科学与工程学院,东南大学,综合PNT网络与设备技术国家重点实验室,微惯性仪器与先进导航技术重点实验室,教育部) Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学) College of Computer Science and Software Engineering, Hohai University(计算机科学与软件工程学院,河海大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出Bi-CMPStereo框架,通过双向跨模态提示利用语义和结构特征实现稳健匹配,提升高速运动和复杂光照下的3D感知性能。

Comments CVPR 2026. Code URL: https://github.com/xnh97/Bi-CMPStereo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15311 2026-04-17 cs.CV

LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories

LeapAlign: 通过构建两步轨迹实现任意生成步骤的训练后流匹配模型对齐

Zhanhao Liang, Tao Yang, Jie Wu, Chengjian Feng, Liang Zheng

机构 * The Australian National University(澳大利亚国立大学)

AI总结 本文提出LeapAlign方法,通过缩短生成轨迹为两步,减少计算成本并实现早期生成步骤的梯度传播,提升模型更新效率与稳定性,优于现有方法。

Comments Accepted by CVPR 2026. Project page: https://rockeycoss.github.io/leapalign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15027 2026-04-17 cs.CV

Quality-Aware Calibration for AI-Generated Image Detection in the Wild

面向AI生成图像检测的高质量意识校准

Fabrizio Guillaro, Vincenzo De Rosa, Davide Cozzolino, Luisa Verdoliva

机构 * University Federico II of Naples(那不勒斯费德里科二世大学)

AI总结 本文提出QuAD框架,通过整合图像的近似副本并考虑其质量,提升AI生成图像检测的可靠性,实验表明其在平衡准确率上平均提升约8%。

Comments Accepted at the APAI Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14973 2026-04-17 cs.CR cs.CV

Robustness of Vision Foundation Models to Common Perturbations

视觉基础模型对常见扰动的鲁棒性

Hongbin Liu, Zhengyuan Jiang, Cheng Hong, Neil Zhenqiang Gong

机构 * Duke University(杜克大学) Ant Group(蚂蚁集团)

AI总结 研究探讨了视觉基础模型对常见扰动的鲁棒性,提出三种鲁棒性指标和五种数学性质,评估了六个行业级模型,发现其普遍不鲁棒,并提出改进方法。

Comments Accepted by CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20645 2026-04-17 cs.CV

PixelDiT: Pixel Diffusion Transformers for Image Generation

PixelDiT:用于图像生成的像素扩散变换器

Yongsheng Yu, Wei Xiong, Weili Nie, Yichen Sheng, Shiqiu Liu, Jiebo Luo

机构 * NVIDIA University of Rochester(罗切斯特大学)

AI总结 PixelDiT提出了一种单阶段端到端模型,直接在像素空间学习扩散过程,提升了图像生成质量与效率,其在ImageNet和文本到图像生成任务中均取得优异成绩。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14762 2026-04-17 cs.CV

OmniGCD: Abstracting Generalized Category Discovery for Modality Agnosticism

OmniGCD:面向模态无关性的泛化类别发现

Jordan Shipard, Arnold Wiliem, Kien Nguyen Thanh, Wei Xiang, Clinton Fookes

机构 * SAIVT, QUT, Australia(萨伊特大学(SAIVT)、昆士兰理工大学(QUT)、澳大利亚) Shield AI, Australia(Shield AI公司、澳大利亚) La Trobe University, Australia(拉特罗布大学、澳大利亚)

AI总结 本文提出OmniGCD,一种模态无关的泛化类别发现方法,通过多模态编码器构建GCD潜在空间,并在零样本设置下提升分类精度。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14710 2026-04-17 cs.CV

G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrieval

G-MIXER:基于测地混合的隐式语义扩展和显式语义重新排序用于零样本复合图像检索

Jiyoung Lim, Heejae Yang, Jee-Hyong Lee

机构 * Sungkyunkwan University(顺天大学)

AI总结 G-MIXER通过测地混合生成隐式语义特征并重新排序显式语义,提升零样本复合图像检索的多样性和准确性,实现跨多个基准的最优性能。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14706 2026-04-17 cs.CV

NG-GS: NeRF-Guided 3D Gaussian Splatting Segmentation

NG-GS: 基于NeRF引导的3D高斯点云分割

Yi He, Tao Wang, Yi Jin, Congyan Lang, Yidong Li, Haibin Ling

机构 * Key Laboratory of Big Data and Artificial Intelligence in Transportation, Ministry of Education(交通大数据与人工智能联合实验室,教育部) School of Computer and Information Technology, Beijing Jiaotong University(北京交通大学计算机与信息学院) Department of Artificial Intelligence, Westlake University(西湖大学人工智能学院)

AI总结 本文提出NG-GS框架,通过掩码方差分析识别边界模糊的高斯点,利用RBF插值和多分辨率哈希编码构建连续特征场,结合NeRF模块实现高质量3D高斯点云分割。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14648 2026-04-17 cs.CV cs.AI cs.LG

Seen-to-Scene: Keep the Seen, Generate the Unseen for Video Outpainting

视见过境:保留已见,生成未见以实现视频外推画布

Inseok Jeon, Minhyeok Lee, Seunghoon Lee, Minseok Kang, Suhwan Cho, Sangyoun Lee

机构 * Yonsei University(延世大学) GenGenAI

AI总结 本文提出Seen-to-Scene框架,结合传播和生成方法提升视频外推画布的时空一致性与视觉真实性,通过流传播和参考引导的潜在传播提高效率和可靠性。

Comments 8 pages, 8 figures (main paper); 9 pages, 10 figures (supplementary). Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14629 2026-04-17 cs.CV

Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models

Switch-KD:视觉切换知识蒸馏用于视觉-语言模型

Haoyi Sun, Xiaoxiao Wang, Ning Mao, Qian Wang, Lifu Mu, Wen Zheng, Tao Wei, Wei Chen

机构 * Li Auto Inc(利-auto公司)

AI总结 Switch-KD通过统一视觉-语言知识转移,解决多模态对齐问题,使小模型高效蒸馏大模型的多模态知识。

Comments 11 pages, 3 figures

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14591 2026-04-17 cs.CV

Prompt-Guided Image Editing with Masked Logit Nudging in Visual Autoregressive Models

基于视觉自回归模型的掩码logit调整的提示引导图像编辑

Amir El-Ghoussani, Marc Hölle, Gustavo Carneiro, Vasileios Belagiannis

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) University of Surrey(萨里大学)

AI总结 本文提出掩码logit调整方法,通过调整模型预测logits实现提示引导的图像编辑,保留无关区域,提升编辑质量和重建效果,优于现有方法。

Comments Accepted at the 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Findings (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14563 2026-04-17 cs.CV

Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors

重新审视令牌压缩以加速基于ViT的稀疏多视角3D目标检测器

Mingqian Ji, Shanshan Zhang, Jian Yang

机构 * PCA Lab, School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学PCA实验室) PCA Lab, School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学PCA实验室)

AI总结 本文提出SEPatch3D框架,通过动态调整拼接块大小和改进特征增强方法,提升基于ViT的稀疏多视角3D目标检测器的推理速度和效率,实验显示其比基线模型快57%且比当前最优方法更高效。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14449 2026-04-17 cs.CV cs.AI

Crowdsourcing of Real-world Image Annotation via Visual Properties

通过视觉属性进行现实世界图像标注的众包

Xiaolei Diao, Fausto Giunchiglia

机构 * University College London(伦敦大学学院) University of Trento(特伦托大学)

AI总结 本文提出结合知识表示、自然语言处理和计算机视觉技术的图像标注方法,通过视觉属性约束减少标注偏差,采用交互式众包框架动态提问以优化标注过程。

Journal ref AI4RWC@CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14433 2026-04-17 cs.CV cs.LG

Zero-Ablation Overstates Register Content Dependence in DINO Vision Transformers

零消融高估了DINO视觉变换器中注册内容的依赖性

Felipe Parodi, Jordan Matelsky, Melanie Segado

机构 * University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins Applied Physics Laboratory(约翰霍普金斯应用物理实验室)

AI总结 研究通过零消融实验发现,DINOv2+和DINOv3的注册内容对分类和分割任务至关重要,但其他替换控制方法如均值替换、噪声替换和跨图像注册洗牌能保持性能,表明注册内容并非绝对必要。

Comments 12 pages, 10 figures, to be published in CVPR 2026 HOW Vision Interpretability Workshop Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14259 2026-04-17 q-bio.TO cs.LG eess.IV

Continual Learning for fMRI-Based Brain Disorder Diagnosis via Functional Connectivity Matrices Generative Replay

基于功能性连接矩阵生成性重放的fMRI脑部疾病诊断持续学习

Qianyu Chen, Shujian Yu

机构 * Nanyang Technological University(南洋理工大学) VU Amsterdam(阿姆斯特丹大学) UiT The Arctic University of Norway(北欧大学)

AI总结 本文提出首个针对异构临床站点的fMRI诊断持续学习框架,通过生成对抗网络生成真实功能性连接矩阵,并结合多级知识蒸馏策略和分层上下文老虎机方案,有效缓解灾难性遗忘问题。

Comments manuscript accepted by CVPR 2026, code is available from \url{https://github.com/4me808/FORGE}

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12580 2026-04-17 cs.CV

PDF-GS: Progressive Distractor Filtering for Robust 3D Gaussian Splatting

PDF-GS:渐进式干扰过滤用于鲁棒的3D高斯点划法

Kangmin Seo, MinKyu Lee, Tae-Young Kim, ByeongCheol Lee, JoonSeoung An, Jae-Pil Heo

机构 * Sungkyunkwan University(成均馆大学)

AI总结 PDF-GS通过渐进多阶段优化增强3D高斯点划法的自过滤能力,有效去除干扰,实现高质量重建,优于现有方法。

Comments Accepted to CVPR Findings 2026. Project Page: https://kangrnin.github.io/PDF-GS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05541 2026-04-17 cs.CV

EchoAgent: Towards Reliable Echocardiography Interpretation with "Eyes","Hands" and "Minds"

EchoAgent:迈向可靠超声心动图解读的“眼、手、脑”系统

Qin Wang, Zhiqing He, Yu Liu, Bowen Guo, Zeju Li, Miao Zhao, Wenhao Ju, Zhiling Luo, Xianhong Shu, Yi Guo, Yuanyuan Wang

机构 * Fudan University(复旦大学) Fudan Zhongshan Hospital(复旦中山医院) Fuwai Yunnan Hospital(阜外云南医院) Fuwai Beijing Hospital(阜外北京医院)

AI总结 本文提出EchoAgent,通过整合视觉、手动操作与专家知识,实现端到端的超声心动图解读,提升临床可靠性与实用性。

Comments Accepted by CVPR 2026 CV4Clinical, 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20328 2026-04-17 cs.CV eess.IV math.OC

GSNR: Graph Smooth Null-Space Representation for Inverse Problems

GSNR:图平滑空域表示用于逆问题

Romario Gualdrón-Hurtado, Roman Jacome, Rafael S. Suarez, Henry Arguello

机构 * Universidad Industrial de Santander(圣安德烈大学)

AI总结 本文提出GSNR方法,通过在不可见成分中施加结构,解决逆问题中空域信息约束不足的问题,提升重建精度。

Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026)

Journal ref Proceedings of the Computer Vision and Pattern Recognition Conference (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17417 2026-04-17 cs.LG cs.AI

Generative Modeling of Class Probability for Multi-Modal Representation Learning

多模态表示学习中的类别概率生成建模

Jungkyoo Shin, Bumsoo Kim, Eunwoo Kim

机构 * Department of AI(人工智能系) School of CSE(计算机科学与工程学院) Chung-Ang University(Chung-Ang 大学)

AI总结 本文提出了一种基于类别概率分布的多模态表示学习方法CALM,通过生成和对齐类别概率分布提升多模态对齐效果,并引入跨模态概率变分自编码器以增强模态间关系的建模能力。

Comments To appear in CVPR 2025 (Highlight)

Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR), 2025, pp. 20737-20746

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14147 2026-04-16 cs.CV

ROSE: Retrieval-Oriented Segmentation Enhancement

ROSE:基于检索的分割增强

Song Tang, Guangquan Jie, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

AI总结 本文提出ROSE框架,通过引入网络检索模块和提示增强模块,提升多模态大语言模型在新兴实体和新实体分割任务中的性能,实验表明其在NEST基准上表现优异。

Comments CVPR 2026 Findings, Project Page: https://henghuiding.com/ROSE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13906 2026-04-16 cs.CV

Blind Bitstream-corrupted Video Recovery via Metadata-guided Diffusion Model

基于元数据引导扩散模型的盲视流损坏视频恢复

Shuyun Wang, Hu Zhang, Xin Shen, Dadong Wang, Xin Yu

机构 * The University of Queensland(昆士兰大学) Data61, CSIRO, Australia(澳大利亚CSIRO数据61实验室)

AI总结 本文提出元数据引导扩散模型,用于在无预定义损坏区域掩码的情况下恢复损坏视频,通过双流元数据编码器提取运动向量和帧类型,结合交叉注意力机制与后处理模块提升恢复效果。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13789 2026-04-16 cs.CV

Temporally Consistent Long-Term Memory for 3D Single Object Tracking

用于3D单目标跟踪的时序一致长期记忆

Jaejoon Yoo, SuBeen Lee, Yerim Jeon, Miso Lee, Jae-Pil Heo

机构 * Sungkyunkwan University(成均馆大学)

AI总结 本文提出ChronoTrack框架,通过长期记忆和双重损失函数提升3D单目标跟踪的时序一致性与效率,实现新的SOTA性能。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20913 2026-04-16 cs.CV

LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding

LongVideo-R1: 低成本长视频理解的智能导航

Jihao Qiu, Lingxi Xie, Xinyue Huo, Qi Tian, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Huawei Consumer Business Group(华为消费者业务集团)

AI总结 本文提出LongVideo-R1,一种基于多模态大语言模型的智能导航系统,通过高效视频上下文导航减少冗余搜索,提升长视频理解的效率与准确性。

Comments 17 pages, 9 figures, 8 tables, accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02697 2026-04-16 cs.CV

GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization

GeoBridge:一种语义锚定的多视图基础模型,用于图像与文本之间的地理定位

Zixuan Song, Jing Zhang, Di Wang, Zidie Zhou, Wenbin Liu, Haonan Guo, En Wang, Bo Du

机构 * School of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

AI总结 GeoBridge通过语义锚定机制实现多视图特征桥接,提升地理定位的鲁棒性和灵活性。该模型构建了首个大规模跨模态多视图对齐数据集GeoLoc,验证了预训练对地理定位精度和跨领域泛化能力的提升。

Comments The paper is accepted by CVPR 2026! Code, dataset, and pretrained models will be released at https://github.com/MiliLab/GeoBridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01773 2026-04-16 cs.RO

IGen: Scalable Data Generation for Robot Learning from Open-World Images

IGen: 为机器人学习从开放世界图像中实现可扩展的数据生成

Chenghao Gu, Haolan Kang, Junchao Lin, Jinghe Wang, Duo Wu, Shuzhao Xie, Fanding Huang, Junchen Ge, Ziyang Gong, Letian Li, Hongying Zheng, Changwei Lv, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) Beijing University of Chemical Technology(北京化工大学) Shanghai Jiao Tong University(上海交通大学) Shenzhen University of Infomation Technology(深圳信息大学)

AI总结 本文提出IGen框架,通过开放世界图像生成高质量的视觉-运动数据,验证了其在机器人学习中的有效性。

Comments 8 pages, 8 figures; Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13761 2026-04-16 cs.CV cs.LG

Design and Behavior of Sparse Mixture-of-Experts Layers in CNN-based Semantic Segmentation

基于CNN语义分割的稀疏混合专家层的设计与行为

Svetlana Pavlitska, Haixi Fan, Konstantin Ditschuneit, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

AI总结 本文研究了在CNN中集成稀疏混合专家层的粗粒度分块方法,通过实验验证了架构选择对路由动态和专家专业化的影响,实现了性能提升。

Comments Accepted for publication at the SAIAD workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13746 2026-04-16 cs.CV

ClipGStream: Clip-Stream Gaussian Splatting for Any Length and Any Motion Multi-View Dynamic Scene Reconstruction

ClipGStream: 用于任意长度和任意运动多视角动态场景重建的Clip-Stream高斯点云法

Jie Liang, Jiahao Wu, Chao Wang, Jiayu Yang, Xiaoyun Zheng, Kaiqiang Xiong, Zhanke Wang, Jinbo Yan, Feng Gao, Ronggang Wang

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东超高清沉浸式媒体技术省重点实验室) Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Pengcheng Laboratory(鹏城实验室) Peking University(北京大学) MIGU Video Co., Ltd.(MIGU视频有限公司)

AI总结 本文提出ClipGStream框架,通过clip级流优化实现长动态视频的高斯点云重建,兼顾可扩展性和时间一致性。

Comments CVPR 2026, Project pages: https://liangjie1999.github.io/ClipGStreamWeb/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13730 2026-04-16 cs.CV

ReConText3D: Replay-based Continual Text-to-3D Generation

ReConText3D: 基于重放的持续文本到3D生成

Muhammad Ahmed Ullah Khan, Muhammad Haris Bin Amir, Didier Stricker, Muhammad Zeshan Afzal

机构 * DFKI(德累斯顿自由大学) RPTU Kaiserslautern-Landau(科布伦茨-劳恩堡大学)

AI总结 本文提出ReConText3D框架,解决文本到3D生成中的持续学习问题,通过文本嵌入k-Center选择构建紧凑多样回放记忆,实现增量学习新3D类别并保持旧类生成能力。

Comments Accepted at CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13456 2026-04-16 cs.LG cs.CV

MyoVision: A Mobile Research Tool and NEATBoost-Attention Ensemble Framework for Real Time Chicken Breast Myopathy Detection

MyoVision:一种移动研究工具和NEATBoost-Attention集成框架用于实时鸡胸肌病检测

Chaitanya Pallerla, Siavash Mahmoudi, Dongyi Wang

机构 * Department of Biological and Agricultural Engineering, University of Arkansas(亚拉巴马大学生物与农业工程系) Department of Food Science, University of Arkansas(亚拉巴马大学食品科学系)

AI总结 本文提出MyoVision移动透光成像框架,结合NEATBoost-Attention模型实现低成本多类肌病检测,测试准确率达82.4%,优于传统方法并匹配高成本高光谱成像系统性能。

Comments Accepted at CVPR 2026 MetaFoods Workshop. 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13448 2026-04-16 cs.CV cs.AI

A Study of Failure Modes in Two-Stage Human-Object Interaction Detection

两阶段人-物交互检测中故障模式的研究

Lemeng Wang, Qinqian Lei, Vidhi Bakshi, Daniel Yi, Yifan Liu, Jiacheng Hou, Asher Seng Hao, Zheda Mai, Wei-Lun Chao, Robby T. Tan, Bo Wang

机构 * The Ohio State University(俄亥俄州立大学) National University of Singapore(新加坡国立大学) Boston University(波士顿大学) Independent Researcher(独立研究者) University of Mississippi(密西西比大学)

AI总结 本文研究两阶段人-物交互检测模型的故障模式,通过分解检测任务为多个可解释视角,分析模型行为以识别不同失败模式,揭示高基准性能不等于 robust 视觉推理的结论。

Comments Accepted to SAUAFG Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏