arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-02-24 至 2026-02-24 共收录 35
2602.20157 2026-02-24 cs.CV

Flow3r: Factored Flow Prediction for Scalable Visual Geometry Learning

Flow3r: 用于可扩展视觉几何学习的因式分解流预测

Zhongxiao Cong, Qitao Zhao, Minsik Jeon, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 Flow3r通过因式分解流预测提升视觉几何学习,利用未标记视频实现动态场景的高精度重建。

Comments CVPR 2026. Project website: https://flow3r-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20068 2026-02-24 cs.CV cs.LG

The Invisible Gorilla Effect in Out-of-distribution Detection

分布外检测中的隐形大猩猩效应

Harry Anthony, Ziyun Liang, Hermione Warr, Konstantinos Kamnitsas

机构 * Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

AI总结 本文发现分布外检测中存在隐形大猩猩效应,即当异常检测对象与模型感兴趣区域在视觉上相似时,检测性能会提高,揭示了OOD检测中的潜在失败模式。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20053 2026-02-24 cs.CV

Decoupling Defense Strategies for Robust Image Watermarking

解耦防御策略用于鲁棒图像水印

Jiahui Chen, Zehang Deng, Zeyu Zhang, Chaoyang Li, Lianchen Jia, Lifeng Sun

机构 * Tsinghua University(清华大学) Swinburne University of Technology(斯威本理工大学) The Australian National University(澳大利亚国立大学) Key Laboratory of Pervasive Computing, Ministry of Education(教育部感知计算重点实验室)

AI总结 AdvMark通过解耦防御策略,提升图像水印在对抗和再生攻击下的鲁棒性,实验显示其在多种攻击下均取得显著性能提升。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07853 2026-02-24 cs.CV cs.LG

Hier-COS: Making Deep Features Hierarchy-aware via Composition of Orthogonal Subspaces

Hier-COS: 通过正交子空间的组合使深度特征层次感知

Depanshu Sani, Saket Anand

机构 * Indraprastha Institute of Information Technology(印度理工学院信息科技研究所)

AI总结 Hier-COS通过正交子空间组合提升深度特征层次感知,实现统一的细粒度与层次多级分类,克服现有评估指标缺陷,达到SOTA性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19944 2026-02-24 cs.CV

Discover, Segment, and Select: A Progressive Mechanism for Zero-shot Camouflaged Object Segmentation

发现、分割与选择:一种用于零样本伪装物体分割的渐进机制

Yilong Yang, Jianxin Tian, Shengchuan Zhang, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,教育部,厦门大学)

AI总结 本文提出DSS机制,通过特征一致的对象发现、分割细化和语义驱动的掩码选择,提升零样本伪装物体分割的性能。

Comments Accepted by CVPR 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19753 2026-02-24 cs.CV cs.GR

RAP: Fast Feedforward Rendering-Free Attribute-Guided Primitive Importance Score Prediction for Efficient 3D Gaussian Splatting Processing

RAP: 快速前馈渲染-free 属性引导的原始形体重要性分数预测用于高效3D高斯点绘处理

Kaifa Yang, Qi Yang, Yiling Xu, Zhu Li

机构 * Shanghai Jiao Tong University(上海交通大学) University of Missouri–Kansas City(密苏里大学-堪萨斯城分校)

AI总结 RAP通过属性引导和高效算法,实现3DGS中原始形体重要性分数的快速预测,提升重建、压缩和传输效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19715 2026-02-24 cs.CV

Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision

像素不会说谎(但你的检测器可能会):通过生成器-评估器过程构建MLLM作为判断者以实现可信的深度伪造检测和推理监督

Kartik Kuckreja, Parul Gupta, Muhammad Haris Khan, Abhinav Dhall

机构 * MBZUAI Monash University(墨尔本大学)

AI总结 本文提出DeepfakeJudge框架,通过生成器-评估器过程提升深度伪造检测的推理忠实性,实现高准确率和高一致性的推理监督。

Comments CVPR-2026, Code is available here: https://github.com/KjAeRsTuIsK/DeepfakeJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19679 2026-02-24 cs.CV cs.AI

TeHOR: Text-Guided 3D Human and Object Reconstruction with Textures

TeHOR:基于文本的3D人体和物体重建与纹理

Hyeongjin Nam, Daniel Sungho Jung, Kyoung Mu Lee

机构 * Dept. of ECE&ASRI(电子工程与先进科学研究院) IPAI(人工智能研究所)

AI总结 TeHOR通过结合文本描述和外观信息,实现更准确的3D人体和物体重建,提升非接触互动的重建能力。

Comments Published at CVPR 2026, 20 pages including the supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19615 2026-02-24 cs.CV

Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness

清晰可见,自信推理:用于视觉语言模型盲点的即插即用修复方法

Xin Hu, Haomiao Ni, Yunbei Zhang, Jihun Hamm, Zechen Li, Zhengming Ding

机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) Department of Computer Science, University of Memphis(密苏里大学计算机科学系)

AI总结 本文提出一种无需微调的即插即用模块,通过细化视觉标记和丰富文本提示,提升VLM对罕见物体的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19611 2026-02-24 cs.CV

RAID: Retrieval-Augmented Anomaly Detection

RAID: 基于检索的异常检测

Mingxiu Cai, Zhe Zhang, Gaochang Wu, Tianyou Chai, Xiatian Zhu

机构 * State Key Laboratory of Synthetical Automation for Process Industries, Northeastern University(过程工业综合自动化 state key laboratory,东北大学)

AI总结 RAID提出了一种基于检索的无监督异常检测框架,通过利用检索到的正常样本指导噪声抑制,实现鲁棒的异常检测和定位。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19605 2026-02-24 cs.CV cs.AI cs.MM

CLCR: Cross-Level Semantic Collaborative Representation for Multimodal Learning

CLCR:多模态学习中的跨层语义协作表示

Chunlei Meng, Guanhong Huang, Rong Fu, Runmin Jian, Zhongxue Gan, Chun Ouyang

机构 * Fudan University(复旦大学) Shantou University(汕头大学) University of Macau(澳门大学) Guangzhou Huashang College(广州华商学院)

AI总结 CLCR通过跨层语义协同表示方法,有效解决多模态数据中的语义错位问题,提升多模态学习的表示质量与任务泛化能力。

Comments This study has been Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19596 2026-02-24 cs.CV

Learning Mutual View Information Graph for Adaptive Adversarial Collaborative Perception

学习适应性对抗协作感知的互视信息图

Yihang Tao, Senkang Hu, Haonan An, Zhengru Fang, Hangcheng Cao, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City(香港JC STEM实验室) City University of Hong Kong(香港城市大学)

AI总结 本文提出MVIG攻击,通过学习不同防御系统的漏洞知识,实现自适应对抗协作感知的攻击方法,有效降低防御成功率并暴露系统安全漏洞。

Comments Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19585 2026-02-24 cs.MM cs.AI

Tri-Subspaces Disentanglement for Multimodal Sentiment Analysis

三子空间解耦用于多模态情感分析

Chunlei Meng, Jiabin Luo, Zhenglin Yan, Zhenyu Yu, Rong Fu, Zhongxue Gan, Chun Ouyang

机构 * Fudan University(复旦大学) Peking University(北京大学) University of Macau(澳门大学)

AI总结 本文提出三子空间解耦框架,通过分解多模态特征为公共、子模态共享和私人子空间,提升多模态情感分析的性能和鲁棒性。

Comments This study has been Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19542 2026-02-24 cs.CV

Vinedresser3D: Agentic Text-guided 3D Editing

Vinedresser3D: 基于代理的文本引导3D编辑

Yankuan Chi, Xiang Li, Zixuan Huang, James M. Rehg

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 Vinedresser3D通过多模态大语言模型和潜在空间编辑技术实现高质量文本引导的3D编辑,提升编辑精度与一致性。

Comments CVPR 2026, Project website:https://vinedresser3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19285 2026-02-24 cs.CV

MRI Contrast Enhancement Kinetics World Model

MRI对比增强动力学世界模型

Jindi Kong, Yuting He, Cong Xia, Rongjun Ge, Shuo Li

机构 * Case Western Reserve University(凯斯西储大学) Jiangsu Cancer Hospital(江苏癌症医院) Southeast University(东南大学)

AI总结 本文提出MRI CEKWorld模型,通过时空一致性学习解决MRI对比增强动力学建模中的时间连续性和内容一致性问题。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19180 2026-02-24 cs.CV

VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

基于扩散模型的人体网格恢复中的群体偏好对齐

Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) HKUST(GZ)(香港科技大学(广州)) SenseTime Research(商汤科技研究院) A*STAR(新加坡科技研究局)

AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19170 2026-02-24 cs.CV

BriMA: Bridged Modality Adaptation for Multi-Modal Continual Action Quality Assessment

BriMA:基于多模态适应的持续动作质量评估

Kanglei Zhou, Chang Li, Qingyi Pan, Liyuan Wang

机构 * Department of Psychological and Cognitive Sciences, 2 Department of Statistics and Data Science, Tsinghua University(1 心理学与认知科学系,2 统计学与数据科学系,清华大学)

AI总结 BriMA通过桥接模态适应方法,在模态缺失条件下提升多模态持续动作质量评估的性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19140 2026-02-24 cs.CV cs.LG

CaReFlow: Cyclic Adaptive Rectified Flow for Multimodal Fusion

CaReFlow:循环适应修正流用于多模态融合

Sijie Mai, Shiqin Han

机构 * South China Normal University(华南师范大学)

AI总结 CaReFlow通过循环适应修正流实现多模态融合,解决模态间隙问题,提升分布对齐和特征转换的鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19089 2026-02-24 cs.CV cs.GR cs.LG

Ani3DHuman: Photorealistic 3D Human Animation with Self-guided Stochastic Sampling

Ani3DHuman:基于自引导随机采样的逼真3D人体动画

Qi Sun, Can Wang, Jiaxiang Shang, Yingchun Liu, Jing Liao

机构 * City University of Hong Kong(香港城市大学)

AI总结 Ani3DHuman通过结合运动学动画与视频扩散先验,利用自引导随机采样实现逼真3D人体动画生成。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19064 2026-02-24 cs.CV

L3DR: 3D-aware LiDAR Diffusion and Rectification

L3DR:基于3D感知的LiDAR扩散与校正

Quan Liu, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 L3DR通过3D-aware的LiDAR扩散和校正框架,在3D空间中消除RV伪影并恢复局部几何结构,实现更真实的3D几何生成。

Comments In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19063 2026-02-24 cs.CV

Direction-aware 3D Large Multimodal Models

具有方向感知的3D大多模态模型

Quan Liu, Weihao Xuan, Junjue Wang, Naoto Yokoya, Ling Shao, Shijian Lu

AI总结 本文提出方向感知的3D大多模态模型,通过补充自身姿态并改进点云数据对齐,提升3D多模态模型的性能和通用性。

Comments In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06391 2026-02-24 cs.CV

Object-WIPER : Training-Free Object and Associated Effect Removal in Videos

Object-WIPER : 无需训练的对象及关联效果视频去除

Saksham Singh Kushwaha, Sayan Nag, Yapeng Tian, Kuldeep Kulkarni

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Adobe Research(Adobe研究院)

AI总结 Object-WIPER通过预训练的文本到视频扩散模型实现无需训练的对象及关联效果视频去除,通过创新的去噪方法和新指标在DAVIS和WIPER-Bench上取得优越性能。

Comments Accepted to CVPR 2026. Project Page: https://sakshamsingh1.github.io/object_wiper_webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17514 2026-02-24 cs.CV

Foundation Model Priors Enhance Object Focus in Feature Space for Source-Free Object Detection

基础模型先验增强特征空间中的目标聚焦以实现无源目标检测

Sairam VCR, Rishabh Lalla, Aveen Dayal, Tejal Kulkarni, Anuj Lalla, Vineeth N Balasubramanian, Muhammad Haris Khan

机构 * IIT Hyderabad(印度海得拉尔理工学院) MBZUAI, Abu Dhabi(阿布扎赫尔MBZUAI) UC San Diego(圣地亚哥大学) IIT Jodhpur(乔普尔理工学院) Microsoft Research India(微软印度研究院)

AI总结 FALCON-SFOD通过增强特征空间中的目标聚焦,利用基础模型先验和噪声鲁棒伪标签方法,提升无源目标检测在领域偏移下的性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15690 2026-02-24 cs.CV cs.CL

MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping

通过动态专家跳过加速混合专家多模态大语言模型

Yushi Huang, Zining Wang, Zhihang Yuan, Yifu Ding, Ruihao Gong, Jinyang Guo, Xianglong Liu, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Peking University(北京大学)

AI总结 MoDES通过动态专家跳过机制提升多模态大语言模型的推理效率和准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08318 2026-02-24 cs.CV

LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation

LinVideo: 一种面向高效视频生成的O(n)注意力后训练框架

Yushi Huang, Xingtong Ge, Ruihao Gong, Chengtao Lv, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Sensetime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

AI总结 LinVideo提出一种高效的无数据后训练框架,通过选择性迁移将部分自注意力模块替换为线性注意力,从而在保持性能的同时显著提升视频生成效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10065 2026-02-24 cs.CV

MoVieS: Motion-Aware 4D Dynamic View Synthesis in One Second

MoVieS: 一秒钟内基于运动感知的4D动态视角合成

Chenguo Lin, Yuchen Lin, Panwang Pan, Yifan Yu, Tao Hu, Honglei Yan, Katerina Fragkiadaki, Yadong Mu

机构 * Peking University(北京大学) ByteDance(字节跳动) Carnegie Mellon University(卡内基梅隆大学)

AI总结 MoVieS通过一秒钟内从单目视频重建4D动态场景,实现外观、几何和运动的统一建模,并支持多种零样本应用。

Comments Project page: https://chenguolin.github.io/projects/MoVieS; Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03584 2026-02-24 cs.CV cs.AI

RDFC-GAN: RGB-Depth Fusion CycleGAN for Indoor Depth Completion

RDFC-GAN:基于RGB-深度融合的循环GAN用于室内深度补全

Haowen Wang, Zhengping Che, Yufan Yang, Mingyuan Wang, Zhiyuan Xu, Xiuquan Qiao, Mengshi Qi, Feifei Feng, Jian Tang

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, China(网络与交换技术国家重点实验室,北京邮电大学,中国) Midea Group, China(美的集团,中国) School of Computer Science, Beijing University of Posts and Telecommunications, China(计算机科学学院,北京邮电大学,中国)

AI总结 RDFC-GAN通过融合RGB和深度图像,利用循环GAN和自适应融合模块提升室内深度补全效果。

Comments Haowen Wang and Zhengping Che are with equal contributions. Paper accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). An earlier version has been accepted by CVPR 2022 (arXiv:2203.10856). arXiv admin note: text overlap with arXiv:2203.10856

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (Volume: 46, Issue: 11, November 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19024 2026-02-24 cs.CV

Towards Calibrating Prompt Tuning of Vision-Language Models

面向视觉-语言模型提示微调的校准

Ashshak Sharifdeen, Fahad Shamshad, Muhammad Akhtar Munir, Abhishek Basu, Mohamed Insaf Ismithdeen, Jeyapriyan Jeyamohan, Chathurika Sewwandi Silva, Karthik Nandakumar, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) University of Colombo(科伦坡大学) Michigan State University(密歇根州立大学)

AI总结 本文提出一种校准框架,通过引入均值-方差边际惩罚和文本矩匹配损失,提升视觉-语言模型提示微调的预测可靠性与置信度校准。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18977 2026-02-24 cs.CV

Frame2Freq: Spectral Adapters for Fine-Grained Video Understanding

Frame2Freq: 用于细粒度视频理解的频谱适配器

Thinesh Thiyakesan Ponbagavathi, Constantin Seibold, Alina Roitberg

机构 * Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) University Hospital Heidelberg, Diagnostic and Interventional Radiology(海德堡大学医院放射诊断与介入科) Intelligent Assistive Systems Lab, University of Hildesheim(希尔德斯海姆大学智能辅助系统实验室)

AI总结 Frame2Freq通过频谱编码提升细粒度视频理解,利用FFT和频率带嵌入改进动作识别性能。

Comments Accepted to CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18863 2026-02-24 eess.IV cs.CV cs.LG cs.MM

TIACam: Text-Anchored Invariant Feature Learning with Auto-Augmentation for Camera-Robust Zero-Watermarking

TIACam: 基于自增强的文本锚定不变特征学习用于抗相机零水印

Abdullah All Tanvir, Agnibh Dasgupta, Xin Zhong

机构 * Department of Computer Science University of Nebraska Omaha(计算机科学系 内布拉斯加大学奥马哈分校)

AI总结 TIACam通过文本锚定不变特征学习和自增强技术,实现抗相机重拍的零水印系统,提升特征稳定性和水印提取准确性。

Comments This paper is accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏