arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-25 至 2026-03-25 共收录 44
2603.23495 2026-03-25 cs.CV cs.AI cs.LG

VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions

VISion On Request: 基于稀疏、动态选择的视觉-语言交互提升大模型效率

Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas, Yassine Ouali, Georgios Tzimiropoulos

机构 * Samsung AI Cambridge(三星AI剑桥实验室) Technical University of Iasi(伊阿斯技术大学) Queen Mary University of London(伦敦女王玛丽大学)

AI总结 VISOR通过稀疏化视觉-语言交互提升大模型效率,无需丢弃视觉信息,动态分配计算资源,实验表明在多样基准和挑战任务中性能优异。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23463 2026-03-25 cs.CV cs.AI

InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpainting

InverFill:一种用于增强少步扩散修复的一步倒置方法

Duc Vu, Kien Nguyen, Trong-Tung Nguyen, Ngan Nguyen, Phong Nguyen, Khoi Nguyen, Cuong Pham, Anh Tran

机构 * Qualcomm AI Research(.qualcomm 高级研究院) Posts & Telecommunications Inst. of Tech., Vietnam(越南邮电技术研究所)

AI总结 本文提出InverFill,通过注入输入遮挡图像的语义信息到初始噪声中,实现高质量少步修复。该方法无需训练修复模型,利用文本到图像模型进行混合采样,提升图像质量和文本一致性。

Comments Accepted to CVPR'26 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23439 2026-03-25 cs.CV

SIGMA: A Physics-Based Benchmark for Gas Chimney Understanding in Seismic Images

SIGMA:一种基于物理的气体烟囱理解在地震图像中的基准数据集

Bao Truong, Quang Nguyen, Baoru Huang, Jinpei Han, Van Nguyen, Ngan Le, Minh-Tan Pham, Doan Huy Hien, Anh Nguyen

机构 * FPT Software AI Center(FPT软件AI中心) Imperial College London(伦敦帝国理工学院) University of Arkansas(阿肯色大学) University of South Brittany(南布列塔尼大学) University of Liverpool(利物浦大学)

AI总结 本文提出SIGMA数据集,用于地震图像中气体烟囱的理解,通过像素级掩膜和退化与真实图像配对,提升检测与增强能力,验证了其在气体烟囱解释中的挑战性。

Comments Accepted at The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23381 2026-03-25 cs.CV

FG-Portrait: 3D Flow Guided Editable Portrait Animation

FG-Portrait: 基于3D流的可编辑肖像动画

Yating Xu, Yunqi Miao, Evangelos Ververas, Jiankang Deng, Jifei Song

机构 * National University of Singapore(新加坡国立大学) University of Warwick(沃里克大学) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

AI总结 本文提出FG-Portrait,通过3D流引导的方法实现高质量的肖像动画生成,结合3D几何信息和扩散模型,提升驱动运动与源肖像的对应精度,并支持用户对表情和头部姿态的编辑。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04348 2026-03-25 cs.CV cs.AI

RANGER: Sparsely-Gated Mixture-of-Experts with Adaptive Retrieval Re-ranking for Pathology Report Generation

RANGER: 用于病理报告生成的稀疏门控专家混合模型与自适应检索重排序

Yixin Chen, Ziyu Su, Hikmat Khan, Muhammad Khalid Khan Niazi

机构 * Department of Biomedical Engineering, The Ohio State University(生物医学工程系,俄亥俄州立大学) Department of Pathology, The Ohio State University(病理学系,俄亥俄州立大学)

AI总结 RANGER通过稀疏门控专家混合模型和自适应检索重排序,提升病理报告生成的生成特化与语义对齐,实验表明在PathText-BRCA数据集上性能优于现有方法。

Journal ref Proceedings of the IEEE/CVF CVPR 2026 Workshops (CV4Clinical)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16740 2026-03-25 cs.CV

Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation

面向任务的数据合成与控制-校正采样用于遥感语义分割

Yunkai Yang, Yudong Zhang, Kunquan Zhang, Jinxiao Zhang, Xinying Chen, Haohuan Fu, Runmin Dong

机构 * Sun Yat-Sen University(中山大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出TODSynth框架,结合多模态扩散变换器和任务反馈驱动的采样策略,提升遥感语义分割数据合成效果,尤其在少样本和复杂场景中表现优异。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23276 2026-03-25 cs.CV

CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection

CCF:互补协作融合用于领域泛化的多模态3D目标检测

Yuchen Wu, Kun Wang, Yining Pan, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 本文提出CCF方法,通过查询解耦损失、LiDAR引导深度先验和互补跨模态掩码,提升多模态3D目标检测在跨领域场景下的鲁棒性,实验表明优于现有方法且保持源域性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23272 2026-03-25 cs.CV cs.MM

Multi-Modal Image Fusion via Intervention-Stable Feature Learning

多模态图像融合 via 干预稳定的特征学习

Xue Wang, Zheng Guan, Wenhua Qian, Chengchao Wang, Runzhuo Ma

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) School of Artificial Intelligence, Nanyang Normal University(南阳师范学院人工智能学院) Department of Electrical and Electronic Engineering, Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

AI总结 本文提出基于因果原则的干预框架,通过三种干预策略探索模态关系,设计因果特征整合器捕捉稳健的模态依赖而非虚假关联。

Comments Accpted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23227 2026-03-25 cs.RO

Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation

基于球面谐波的高效混合SE(3)-等变视觉运动流策略用于机器人操作

Qinglun Zhang, Shen Cheng, Tian Dan, Haoqiang Fan, Guanghui Liu, Shuaicheng Liu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Dexmal

AI总结 本文提出E3Flow框架,通过球面谐波表示实现高效且稳定的多模态等变学习,提升机器人操作的性能、效率和数据效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23126 2026-03-25 cs.CV

3rd Place of MeViS-Audio Track of the 5th PVUW: VIRST-Audio

第5届PVUW比赛MeViS-Audio赛道的第三名:VIRST-Audio

Jihwan Hong, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室)

AI总结 本文提出VIRST-Audio框架,通过将音频转换为文本并基于文本进行分割,实现音频驱动的视频对象分割,实验表明其在MeViS-Audio赛道上取得第三名,展示了良好的泛化能力和稳定性。

Comments 4 pages, 2 figures. Technical report for the CVPR 2026 PVUW Workshop (MeViS-Audio Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23104 2026-03-25 cs.CV

NeuroSeg Meets DINOv3: Transferring 2D Self-Supervised Visual Priors to 3D Neuron Segmentation via DINOv3 Initialization

NeuroSeg Meets DINOv3:通过DINOv3初始化将2D自监督视觉先验转移到3D神经元分割

Yik San Cheng, Runkai Zhao, Weidong Cai

机构 * The University of Sydney(悉尼大学)

AI总结 本文提出利用DINOv3学习的2D视觉表示适应3D生物分割模型,通过膨胀策略和拓扑感知骨架损失提升神经元重建精度,实验显示在四个神经影像数据集上均优于现有方法。

Comments 17 pages, 12 figures, and 11 tables. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23030 2026-03-25 cs.CV cs.AI

Looking Beyond the Window: Global-Local Aligned CLIP for Training-free Open-Vocabulary Semantic Segmentation

超越窗口:用于无训练开放词汇语义分割的全局-局部对齐CLIP

ByeongCheol Lee, Hyun Seok Seong, Sangeek Hyun, Gilhan Park, WonJun Moon, Jae-Pil Heo

机构 * Sungkyunkwan University(全北大学)

AI总结 本文提出GLA-CLIP框架,通过增强窗口间信息交换解决传统滑动窗口方法的语义不一致问题,引入代理锚点和动态归一化方案提升小目标检测性能。

Comments 18 pages, 13 figures, 12 tables, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22953 2026-03-25 cs.CV

Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining

基于簇的时空掩码用于高效的视频-语言预训练

Weijun Zhuang, Yuqing Huang, Weikang Meng, Xin Li, Ming Liu, Xiaopeng Hong, Yaowei Wang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

AI总结 本文提出ClusterSTM策略,通过簇内掩码保留关键时空信息,提升视频-语言预训练效率,并在多任务上取得新状态。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22870 2026-03-25 cs.CV

Designing to Forget: Deep Semi-parametric Models for Unlearning

设计以遗忘:用于去学习的深度半参数模型

Amber Yijia Zheng, Yu-Shan Tai, Raymond A. Yeh

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系)

AI总结 本文提出深度半参数模型,通过融合模块实现测试时删除训练样本,无需改变模型参数,在图像分类和生成任务中表现优异,且去学习效率显著提升。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22821 2026-03-25 cs.CV

Cross-Slice Knowledge Transfer via Masked Multi-Modal Heterogeneous Graph Contrastive Learning for Spatial Gene Expression Inference

跨切片知识迁移 via 遮蔽多模态异质图对比学习用于空间基因表达推断

Zhiceng Shi, Changmiao Wang, Jun Wan, Wenwen Min

机构 * Yunnan University(云南大学) Shenzhen Research Institute of Big Data(深圳大数据研究院) Zhongnan University of Economics and Law(中南财经政法大学)

AI总结 本文提出SpaHGC模型,通过多模态异质图对比学习,结合局部空间上下文和跨切片相似性,提升空间基因表达预测精度,优于现有九种方法。

Comments Accepted by CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22819 2026-03-25 cs.CV cs.AI

TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment

TDATR:通过表格细节感知学习和单元级视觉对齐改进端到端表格识别

Chunxia Qin, Chenyu Liu, Pengcheng Xia, Jun Du, Baocai Yin, Bing Yin, Cong Liu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

AI总结 TDATR通过表格细节感知学习和单元级视觉对齐改进端到端表格识别,采用感知-融合策略,提升模型鲁棒性和识别精度,无需数据集特定微调即可在七个基准上取得领先性能。

Comments Acceptd by CVPR 2026. Project Page: https://github.com/Chunchunwumu/TDATR.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22815 2026-03-25 cs.CV cs.AI

Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understanding

聚焦,而非裁剪:识别与指令相关的区域以实现信息丰富的图像理解

Mincheol Kwon, Minseung Lee, Seonga Choi, Miso Choi, Kyeong-Jin Oh, Hyunyoung Lee, Cheonyoung Park, Yongho Song, Seunghyun Park, Jinkyu Kim

机构 * Korea University(韩国大学) KT Corporation(KT公司) Soongsil University(松山大学) Kakao Mobility(Kakao移动)

AI总结 本文提出PinPoint框架,通过识别与指令相关的图像区域并提取细粒度视觉特征,提升多模态任务的推理效率与准确性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22794 2026-03-25 cs.CV

It Takes Two: A Duet of Periodicity and Directionality for Burst Flicker Removal

需要两人:周期性和方向性双人舞 for 灭火器移除

Lishen Qu, Shihao Zhou, Jie Liang, Hui Zeng, Lei Zhang, Jufeng Yang

机构 * Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田)) Peng Cheng Laboratory(鹏城实验室) College of Computer Science, Nankai University(南开大学计算机科学学院) The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

AI总结 本文提出Flickerformer,通过周期性和方向性特性有效去除闪烁噪声,避免鬼影伪影,提升图像质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22763 2026-03-25 cs.CV

ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding

ENC-Bench:用于评估多模态大语言模型在电子航海图理解中的基准

Ao Cheng, Xingming Li, Xuanyu Ji, Xixiang He, Qiyao Sun, Chunping Qiu, Runke Huang, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) Intelligent Game and Decision Lab(智能游戏与决策实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 ENC-Bench是首个专注于专业电子航海图理解的基准,包含20490个经过专家验证的样本,评估了10种先进多模态大语言模型在符号识别、空间推理和航海决策中的表现,揭示了模型在符号 grounding、空间计算和多约束推理方面的系统性挑战。

Comments Accepted to CVPR 2026, Project page: https://qingyonghu.github.io/ENC-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22758 2026-03-25 cs.CV cs.LG

Reconstruction-Guided Slot Curriculum: Addressing Object Over-Fragmentation in Video Object-Centric Learning

基于重建的槽课程:解决视频对象中心学习中的对象过碎片化问题

WonJun Moon, Hyun Seok Seong, Jae-Pil Heo

机构 * Sungkyunkwan University(顺天妇女大学)

AI总结 本文提出SlotCurri方法,通过逐步扩展槽位并结合结构感知损失和循环推理,解决视频对象中心学习中的对象过碎片化问题,实验显示在YouTube-VIS和MOVi-C上取得显著提升。

Comments CVPR 2026 paper. Our code is available at github.com/wjun0830/SlotCurri

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22732 2026-03-25 cs.CV

SOUPLE: Enhancing Audio-Visual Localization and Segmentation with Learnable Prompt Contexts

SOUPLE: 通过可学习的提示上下文增强音频-视觉定位与分割

Khanh Binh Nguyen, Chae Jung Park

机构 * Deakin University(德克萨斯大学) National Cancer Center(国立癌症中心)

AI总结 SOUPLE通过可学习的上下文标记提升音频-视觉定位与分割性能,利用视觉特征生成条件上下文以连接音频与视觉输入。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22689 2026-03-25 cs.CV

Think 360°: Evaluating the Width-centric Reasoning Capability of MLLMs Beyond Depth

Think 360°: 评估MLLMs的宽度中心推理能力超越深度

Mingrui Chen, Hexiong Yang, Haogeng Liu, Huaibo Huang, Ran He

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) NLPR&MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所NLPR&MAIS) School of Advanced Interdisciplinary Science, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院) Zhongguancun Academy(中关村学院)

AI总结 本文提出一个全面的多模态基准,评估MLLMs的推理能力,特别关注推理宽度,作为深度的补充维度。通过1200+高质量多模态案例,提出细粒度树状思维评估协议,评估12种模型家族的推理宽度和深度,揭示当前模型在结合深度推理与广泛探索搜索方面的能力不足。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22624 2026-03-25 cs.CV cs.AI

Toward Faithful Segmentation Attribution via Benchmarking and Dual-Evidence Fusion

通过基准测试和双证据融合实现忠实的分割属性

Abu Noman Md Sakib, OFM Riaz Rahman Aranya, Kevin Desai, Zijie Zhang

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

AI总结 本文提出双证据属性方法,通过融合梯度证据与区域干预信号提升分割模型的可解释性,验证了属性评估的稳定性与忠实性平衡。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22529 2026-03-25 cs.CV cs.AI cs.CL

Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos

Ego2Web:一种基于第一人称视频的网络代理基准测试

Shoubin Yu, Lei Shu, Antoine Yang, Yao Fu, Srinivas Sunkara, Maria Wang, Jindong Chen, Mohit Bansal, Boqing Gong

机构 * Google DeepMind(谷歌DeepMind) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 Ego2Web通过结合真实世界第一人称视频与网络任务,解决网络代理在现实物理环境中的感知问题,提出LLM-as-a-Judge评估方法,揭示当前代理在视觉理解和任务规划上的不足。

Comments CVPR 2026. Project page: https://ego2web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22466 2026-03-25 cs.CV cs.AI cs.HC cs.MM

Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing

颜色何时重要:灰度引导的在线触发用于始终开启的流视频感知

Weitong Cai, Hang Zhang, Yukai Huang, Shitong Sun, Jiankang Deng, Songcen Xu, Jifei Song, Zhensong Zhang

机构 * Queen Mary University of London(伦敦皇后玛丽大学) Independent Researcher(独立研究者) Durham University(杜伦大学) Imperial College London(伦敦帝国学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本文提出灰度引导的在线触发方法,通过减少颜色捕获频率,在资源受限设备上实现高效流视频感知,实验显示其在保持性能的同时显著降低能耗。

Comments Accepted at CVPR 2026 (Main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19609 2026-03-25 cs.CV cs.AI cs.RO

LoD-Loc v3: Generalized Aerial Localization in Dense Cities using Instance Silhouette Alignment

LoD-Loc v3:基于实例轮廓对齐的密集城市中通用航空视觉定位

Shuaibang Peng, Juelin Zhu, Xia Li, Kun Yang, Maojun Zhang, Yu Liu, Shen Yan

机构 * National University of Defense Technology(国防科技大学) Northwestern Polytechnical University(西北工业大学)

AI总结 LoD-Loc v3通过实例轮廓对齐和合成数据生成提升密集城市中的航空视觉定位性能,克服了现有方法在跨场景和密集建筑场景中的局限。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09798 2026-03-25 cs.CV

Test-time Ego-Exo-centric Adaptation for Action Anticipation via Multi-Label Prototype Growing and Dual-Clue Consistency

测试时自体-外体适应用于动作预见的多标签原型生长与双线索一致性

Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Qingbo Wu, Fanman Meng, Lili Pan, Hongliang Li

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

AI总结 本文提出TE²A任务,通过多标签原型生长模块和双线索一致性模块实现测试时自体-外体适应,提升动作预见性能,实验表明优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08809 2026-03-25 cs.CV

Where, What, Why: Toward Explainable 3D-GS Watermarking

何处、何物、为何:迈向可解释的3D-GS水印

Mingshu Cai, Jiajun Li, Osamu Yoshie, Yuya Ieiri, Yixuan Li

机构 * Waseda University(早稻田大学) Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出一种原生表示框架,通过三专家模块和安全预算感知门实现水印载体选择和质量保护,结合通道组掩码提升水印鲁棒性和可解释性,相比现有方法在PSNR和比特精度上均有提升。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07057 2026-03-25 cs.CV

SODA: Sensitivity-Oriented Dynamic Acceleration for Diffusion Transformer

SODA:面向敏感性的动态加速方法用于扩散变换器

Tong Shao, Yusen Fu, Guoying Sun, Jingde Kong, Zhuotao Tian, Jingyong Su

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 SODA通过细粒度敏感性分析动态调整缓存与剪枝策略,提升扩散变换器在可控加速比下的生成质量,实验表明其生成保真度达到最优。

Comments 23 pages, CVPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02098 2026-03-25 cs.IR cs.CL cs.CV

Efficient and High-Fidelity Omni Modality Retrieval

高效且高保真的多模态检索

Chuong Huynh, Manh Luong, Abhinav Shrivastava

机构 * University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) Monash University(墨尔本大学)

AI总结 本文提出OmniRet模型,解决多模态检索中的计算效率与表示保真度问题,通过注意力机制和改进的池化方法提升三模态(文本、视觉、音频)检索性能,并引入新的音频中心多模态基准测试。

Comments CVPR 2026. Project page: https://hmchuong.github.io/omniret

详情

展开后加载摘要…

URL PDF HTML 收藏