arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2602.22212 2026-03-26 cs.CV

Neu-PiG: Neural Preconditioned Grids for Fast Dynamic Surface Reconstruction on Long Sequences

Neu-PiG:神经预条件网格用于长序列快速动态表面重建

Julian Kaltheuner, Hannah Dröge, Markus Plack, Patrick Stotko, Reinhard Klein

机构 * University of Bonn(波恩大学)

AI总结 本文提出Neu-PiG,通过预条件潜在网格编码实现快速动态表面重建,解决了长序列中点云数据的一致性问题,提升精度和效率。

Comments CVPR 2026, Code: https://github.com/vc-bonn/neu-pig

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19900 2026-03-26 cs.CV cs.GR

ExpPortrait: Expressive Portrait Generation via Personalized Representation

ExpPortrait:通过个性化表示生成表现力强的肖像

Junyi Wang, Yudong Guo, Boyang Guo, Shengming Yang, Juyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出一种高保真个性化头部表示,用于生成具有高表现力的肖像视频,通过引入表达转移模块实现不同身份间的头部姿态和表情细节转移,实验表明在身份保持、表情准确性和时间稳定性方面优于现有方法。

Comments CVPR 2026, Project Page: https://ustc3dv.github.io/ExpPortrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18996 2026-03-26 cs.CV

Learning Cross-View Object Correspondence via Cycle-Consistent Mask Prediction

通过循环一致性掩码预测学习跨视角物体对应关系

Shannan Yan, Leqi Zheng, Keyu Lv, Jingchen Ni, Hongyang Wei, Jiajun Zhang, Guangting Wang, Jing Lyu, Chun Yuan, Fengyun Rao

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室) USTC(中国科学技术大学)

AI总结 本文提出基于条件二值分割的框架,通过循环一致性训练目标视角预测掩码并重建源视角掩码,实现无标注的自监督学习,提升跨视角物体对应性能。

Comments The paper has been accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04000 2026-03-26 cs.CV cs.AI cs.LG

Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding

分割后再地面:为长视频理解适应帧选择以查询类型

Jialuo Li, Bin Li, Jiahao Li, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出DIG框架,根据查询类型调整帧选择策略,通过高效均匀采样处理全局查询,利用专用流程提取相关帧处理局部查询,提升长视频理解性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18370 2026-03-26 cs.CV cs.GR

MimiCAT: Mimic with Correspondence-Aware Cascade-Transformer for Category-Free 3D Pose Transfer

MimiCAT:基于对应感知级联变换器的无类别3D姿态迁移

Zenghao Chai, Chen Tang, Yongkang Wong, Xulei Yang, Mohan Kankanhalli

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Institute for Infocomm Research, A ∗ STAR(资讯通信研究院(A*STAR))

AI总结 本文提出MimiCAT模型,通过语义关键点标签学习软对应关系,实现无类别3D姿态迁移,提升跨形态姿态转换的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026. Project page: https://mimicat3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15087 2026-03-26 cs.CV cs.CL cs.LG

Phrase-Instance Alignment for Generalized Referring Segmentation

短语-实例对齐用于通用指称分割

E-Ro Nguyen, Hieu Le, Dimitris Samaras, Michael S. Ryoo

机构 * Stony Brook University(石溪大学) UNC Charlotte(北卡罗来纳州立大学 Charlotte 分校)

AI总结 本文提出通过短语-实例对齐解决通用指称分割问题,通过实例级推理和POA损失实现精确对应,提升分割性能。

Comments Accepted to PVUW - CVPR 2026 Workshop. Webpage: https://eronguyen.github.io/InstAlign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23495 2026-03-25 cs.CV cs.AI cs.LG

VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions

VISion On Request: 基于稀疏、动态选择的视觉-语言交互提升大模型效率

Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas, Yassine Ouali, Georgios Tzimiropoulos

机构 * Samsung AI Cambridge(三星AI剑桥实验室) Technical University of Iasi(伊阿斯技术大学) Queen Mary University of London(伦敦女王玛丽大学)

AI总结 VISOR通过稀疏化视觉-语言交互提升大模型效率,无需丢弃视觉信息,动态分配计算资源,实验表明在多样基准和挑战任务中性能优异。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23463 2026-03-25 cs.CV cs.AI

InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpainting

InverFill:一种用于增强少步扩散修复的一步倒置方法

Duc Vu, Kien Nguyen, Trong-Tung Nguyen, Ngan Nguyen, Phong Nguyen, Khoi Nguyen, Cuong Pham, Anh Tran

机构 * Qualcomm AI Research(.qualcomm 高级研究院) Posts & Telecommunications Inst. of Tech., Vietnam(越南邮电技术研究所)

AI总结 本文提出InverFill,通过注入输入遮挡图像的语义信息到初始噪声中,实现高质量少步修复。该方法无需训练修复模型,利用文本到图像模型进行混合采样,提升图像质量和文本一致性。

Comments Accepted to CVPR'26 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23439 2026-03-25 cs.CV

SIGMA: A Physics-Based Benchmark for Gas Chimney Understanding in Seismic Images

SIGMA:一种基于物理的气体烟囱理解在地震图像中的基准数据集

Bao Truong, Quang Nguyen, Baoru Huang, Jinpei Han, Van Nguyen, Ngan Le, Minh-Tan Pham, Doan Huy Hien, Anh Nguyen

机构 * FPT Software AI Center(FPT软件AI中心) Imperial College London(伦敦帝国理工学院) University of Arkansas(阿肯色大学) University of South Brittany(南布列塔尼大学) University of Liverpool(利物浦大学)

AI总结 本文提出SIGMA数据集,用于地震图像中气体烟囱的理解,通过像素级掩膜和退化与真实图像配对,提升检测与增强能力,验证了其在气体烟囱解释中的挑战性。

Comments Accepted at The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23381 2026-03-25 cs.CV

FG-Portrait: 3D Flow Guided Editable Portrait Animation

FG-Portrait: 基于3D流的可编辑肖像动画

Yating Xu, Yunqi Miao, Evangelos Ververas, Jiankang Deng, Jifei Song

机构 * National University of Singapore(新加坡国立大学) University of Warwick(沃里克大学) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

AI总结 本文提出FG-Portrait,通过3D流引导的方法实现高质量的肖像动画生成,结合3D几何信息和扩散模型,提升驱动运动与源肖像的对应精度,并支持用户对表情和头部姿态的编辑。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04348 2026-03-25 cs.CV cs.AI

RANGER: Sparsely-Gated Mixture-of-Experts with Adaptive Retrieval Re-ranking for Pathology Report Generation

RANGER: 用于病理报告生成的稀疏门控专家混合模型与自适应检索重排序

Yixin Chen, Ziyu Su, Hikmat Khan, Muhammad Khalid Khan Niazi

机构 * Department of Biomedical Engineering, The Ohio State University(生物医学工程系,俄亥俄州立大学) Department of Pathology, The Ohio State University(病理学系,俄亥俄州立大学)

AI总结 RANGER通过稀疏门控专家混合模型和自适应检索重排序,提升病理报告生成的生成特化与语义对齐,实验表明在PathText-BRCA数据集上性能优于现有方法。

Journal ref Proceedings of the IEEE/CVF CVPR 2026 Workshops (CV4Clinical)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16740 2026-03-25 cs.CV

Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation

面向任务的数据合成与控制-校正采样用于遥感语义分割

Yunkai Yang, Yudong Zhang, Kunquan Zhang, Jinxiao Zhang, Xinying Chen, Haohuan Fu, Runmin Dong

机构 * Sun Yat-Sen University(中山大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出TODSynth框架,结合多模态扩散变换器和任务反馈驱动的采样策略,提升遥感语义分割数据合成效果,尤其在少样本和复杂场景中表现优异。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23276 2026-03-25 cs.CV

CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection

CCF:互补协作融合用于领域泛化的多模态3D目标检测

Yuchen Wu, Kun Wang, Yining Pan, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 本文提出CCF方法,通过查询解耦损失、LiDAR引导深度先验和互补跨模态掩码,提升多模态3D目标检测在跨领域场景下的鲁棒性,实验表明优于现有方法且保持源域性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23272 2026-03-25 cs.CV cs.MM

Multi-Modal Image Fusion via Intervention-Stable Feature Learning

多模态图像融合 via 干预稳定的特征学习

Xue Wang, Zheng Guan, Wenhua Qian, Chengchao Wang, Runzhuo Ma

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) School of Artificial Intelligence, Nanyang Normal University(南阳师范学院人工智能学院) Department of Electrical and Electronic Engineering, Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

AI总结 本文提出基于因果原则的干预框架,通过三种干预策略探索模态关系,设计因果特征整合器捕捉稳健的模态依赖而非虚假关联。

Comments Accpted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23227 2026-03-25 cs.RO

Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation

基于球面谐波的高效混合SE(3)-等变视觉运动流策略用于机器人操作

Qinglun Zhang, Shen Cheng, Tian Dan, Haoqiang Fan, Guanghui Liu, Shuaicheng Liu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Dexmal

AI总结 本文提出E3Flow框架,通过球面谐波表示实现高效且稳定的多模态等变学习,提升机器人操作的性能、效率和数据效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23126 2026-03-25 cs.CV

3rd Place of MeViS-Audio Track of the 5th PVUW: VIRST-Audio

第5届PVUW比赛MeViS-Audio赛道的第三名:VIRST-Audio

Jihwan Hong, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室)

AI总结 本文提出VIRST-Audio框架,通过将音频转换为文本并基于文本进行分割,实现音频驱动的视频对象分割,实验表明其在MeViS-Audio赛道上取得第三名,展示了良好的泛化能力和稳定性。

Comments 4 pages, 2 figures. Technical report for the CVPR 2026 PVUW Workshop (MeViS-Audio Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23104 2026-03-25 cs.CV

NeuroSeg Meets DINOv3: Transferring 2D Self-Supervised Visual Priors to 3D Neuron Segmentation via DINOv3 Initialization

NeuroSeg Meets DINOv3:通过DINOv3初始化将2D自监督视觉先验转移到3D神经元分割

Yik San Cheng, Runkai Zhao, Weidong Cai

机构 * The University of Sydney(悉尼大学)

AI总结 本文提出利用DINOv3学习的2D视觉表示适应3D生物分割模型,通过膨胀策略和拓扑感知骨架损失提升神经元重建精度,实验显示在四个神经影像数据集上均优于现有方法。

Comments 17 pages, 12 figures, and 11 tables. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23030 2026-03-25 cs.CV cs.AI

Looking Beyond the Window: Global-Local Aligned CLIP for Training-free Open-Vocabulary Semantic Segmentation

超越窗口:用于无训练开放词汇语义分割的全局-局部对齐CLIP

ByeongCheol Lee, Hyun Seok Seong, Sangeek Hyun, Gilhan Park, WonJun Moon, Jae-Pil Heo

机构 * Sungkyunkwan University(全北大学)

AI总结 本文提出GLA-CLIP框架,通过增强窗口间信息交换解决传统滑动窗口方法的语义不一致问题,引入代理锚点和动态归一化方案提升小目标检测性能。

Comments 18 pages, 13 figures, 12 tables, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22953 2026-03-25 cs.CV

Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining

基于簇的时空掩码用于高效的视频-语言预训练

Weijun Zhuang, Yuqing Huang, Weikang Meng, Xin Li, Ming Liu, Xiaopeng Hong, Yaowei Wang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

AI总结 本文提出ClusterSTM策略,通过簇内掩码保留关键时空信息,提升视频-语言预训练效率,并在多任务上取得新状态。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22870 2026-03-25 cs.CV

Designing to Forget: Deep Semi-parametric Models for Unlearning

设计以遗忘:用于去学习的深度半参数模型

Amber Yijia Zheng, Yu-Shan Tai, Raymond A. Yeh

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系)

AI总结 本文提出深度半参数模型,通过融合模块实现测试时删除训练样本,无需改变模型参数,在图像分类和生成任务中表现优异,且去学习效率显著提升。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22821 2026-03-25 cs.CV

Cross-Slice Knowledge Transfer via Masked Multi-Modal Heterogeneous Graph Contrastive Learning for Spatial Gene Expression Inference

跨切片知识迁移 via 遮蔽多模态异质图对比学习用于空间基因表达推断

Zhiceng Shi, Changmiao Wang, Jun Wan, Wenwen Min

机构 * Yunnan University(云南大学) Shenzhen Research Institute of Big Data(深圳大数据研究院) Zhongnan University of Economics and Law(中南财经政法大学)

AI总结 本文提出SpaHGC模型,通过多模态异质图对比学习,结合局部空间上下文和跨切片相似性,提升空间基因表达预测精度,优于现有九种方法。

Comments Accepted by CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22819 2026-03-25 cs.CV cs.AI

TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment

TDATR:通过表格细节感知学习和单元级视觉对齐改进端到端表格识别

Chunxia Qin, Chenyu Liu, Pengcheng Xia, Jun Du, Baocai Yin, Bing Yin, Cong Liu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

AI总结 TDATR通过表格细节感知学习和单元级视觉对齐改进端到端表格识别,采用感知-融合策略,提升模型鲁棒性和识别精度,无需数据集特定微调即可在七个基准上取得领先性能。

Comments Acceptd by CVPR 2026. Project Page: https://github.com/Chunchunwumu/TDATR.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22815 2026-03-25 cs.CV cs.AI

Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understanding

聚焦,而非裁剪:识别与指令相关的区域以实现信息丰富的图像理解

Mincheol Kwon, Minseung Lee, Seonga Choi, Miso Choi, Kyeong-Jin Oh, Hyunyoung Lee, Cheonyoung Park, Yongho Song, Seunghyun Park, Jinkyu Kim

机构 * Korea University(韩国大学) KT Corporation(KT公司) Soongsil University(松山大学) Kakao Mobility(Kakao移动)

AI总结 本文提出PinPoint框架,通过识别与指令相关的图像区域并提取细粒度视觉特征,提升多模态任务的推理效率与准确性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22794 2026-03-25 cs.CV

It Takes Two: A Duet of Periodicity and Directionality for Burst Flicker Removal

需要两人:周期性和方向性双人舞 for 灭火器移除

Lishen Qu, Shihao Zhou, Jie Liang, Hui Zeng, Lei Zhang, Jufeng Yang

机构 * Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田)) Peng Cheng Laboratory(鹏城实验室) College of Computer Science, Nankai University(南开大学计算机科学学院) The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

AI总结 本文提出Flickerformer,通过周期性和方向性特性有效去除闪烁噪声,避免鬼影伪影,提升图像质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22763 2026-03-25 cs.CV

ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding

ENC-Bench:用于评估多模态大语言模型在电子航海图理解中的基准

Ao Cheng, Xingming Li, Xuanyu Ji, Xixiang He, Qiyao Sun, Chunping Qiu, Runke Huang, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) Intelligent Game and Decision Lab(智能游戏与决策实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 ENC-Bench是首个专注于专业电子航海图理解的基准,包含20490个经过专家验证的样本,评估了10种先进多模态大语言模型在符号识别、空间推理和航海决策中的表现,揭示了模型在符号 grounding、空间计算和多约束推理方面的系统性挑战。

Comments Accepted to CVPR 2026, Project page: https://qingyonghu.github.io/ENC-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22758 2026-03-25 cs.CV cs.LG

Reconstruction-Guided Slot Curriculum: Addressing Object Over-Fragmentation in Video Object-Centric Learning

基于重建的槽课程:解决视频对象中心学习中的对象过碎片化问题

WonJun Moon, Hyun Seok Seong, Jae-Pil Heo

机构 * Sungkyunkwan University(顺天妇女大学)

AI总结 本文提出SlotCurri方法,通过逐步扩展槽位并结合结构感知损失和循环推理,解决视频对象中心学习中的对象过碎片化问题,实验显示在YouTube-VIS和MOVi-C上取得显著提升。

Comments CVPR 2026 paper. Our code is available at github.com/wjun0830/SlotCurri

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22732 2026-03-25 cs.CV

SOUPLE: Enhancing Audio-Visual Localization and Segmentation with Learnable Prompt Contexts

SOUPLE: 通过可学习的提示上下文增强音频-视觉定位与分割

Khanh Binh Nguyen, Chae Jung Park

机构 * Deakin University(德克萨斯大学) National Cancer Center(国立癌症中心)

AI总结 SOUPLE通过可学习的上下文标记提升音频-视觉定位与分割性能,利用视觉特征生成条件上下文以连接音频与视觉输入。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22689 2026-03-25 cs.CV

Think 360°: Evaluating the Width-centric Reasoning Capability of MLLMs Beyond Depth

Think 360°: 评估MLLMs的宽度中心推理能力超越深度

Mingrui Chen, Hexiong Yang, Haogeng Liu, Huaibo Huang, Ran He

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) NLPR&MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所NLPR&MAIS) School of Advanced Interdisciplinary Science, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院) Zhongguancun Academy(中关村学院)

AI总结 本文提出一个全面的多模态基准,评估MLLMs的推理能力,特别关注推理宽度,作为深度的补充维度。通过1200+高质量多模态案例,提出细粒度树状思维评估协议,评估12种模型家族的推理宽度和深度,揭示当前模型在结合深度推理与广泛探索搜索方面的能力不足。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22624 2026-03-25 cs.CV cs.AI

Toward Faithful Segmentation Attribution via Benchmarking and Dual-Evidence Fusion

通过基准测试和双证据融合实现忠实的分割属性

Abu Noman Md Sakib, OFM Riaz Rahman Aranya, Kevin Desai, Zijie Zhang

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

AI总结 本文提出双证据属性方法,通过融合梯度证据与区域干预信号提升分割模型的可解释性,验证了属性评估的稳定性与忠实性平衡。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22529 2026-03-25 cs.CV cs.AI cs.CL

Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos

Ego2Web:一种基于第一人称视频的网络代理基准测试

Shoubin Yu, Lei Shu, Antoine Yang, Yao Fu, Srinivas Sunkara, Maria Wang, Jindong Chen, Mohit Bansal, Boqing Gong

机构 * Google DeepMind(谷歌DeepMind) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 Ego2Web通过结合真实世界第一人称视频与网络任务,解决网络代理在现实物理环境中的感知问题,提出LLM-as-a-Judge评估方法,揭示当前代理在视觉理解和任务规划上的不足。

Comments CVPR 2026. Project page: https://ego2web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏