arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2511.22344 2026-03-27 cs.LG

Cleaning the Pool: Progressive Filtering of Unlabeled Pools in Deep Active Learning

清池:深度主动学习中未标记池的渐进过滤

Denis Huseljic, Marek Herde, Lukas Rauch, Paul Hahn, Bernhard Sick

机构 * University of Kassel(卡塞尔大学)

AI总结 本文提出REFINE方法,通过结合多种主动学习策略,提升模型在不同数据集和任务中的性能,实验表明其优于单一策略和现有集成方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20721 2026-03-27 cs.CV cs.AI cs.LG cs.NE

Foundry: Distilling 3D Foundation Models for the Edge

Foundry:为边缘设备蒸馏3D基础模型

Guillaume Letellier, Siddharth Srivastava, Frédéric Jurie, Gaurav Sharma

机构 * GREYC, Normandy University, Unicaen, ENSICAEN, UMR CNRS 6072(GREYC,诺曼底大学,卡昂大学,ENSICAEN,CNRS UMR 6072) IIT Delhi(印度理工学院德里分校) IIT Kanpur(印度理工学院坎普尔分校)

AI总结 本文提出Foundry,一种蒸馏3D点云的大规模自监督学习模型的方法,通过压缩模型保留通用表示能力,使模型更适用于资源受限的边缘设备。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18822 2026-03-27 cs.CV

DiP: Taming Diffusion Models in Pixel Space

DiP:在像素空间中驯服扩散模型

Zhennan Chen, Junwei Zhu, Xu Chen, Jiangning Zhang, Xiaobin Hu, Hanzhen Zhao, Chengjie Wang, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯优图实验室) National University of Singapore(新加坡国立大学)

AI总结 DiP提出一种高效的像素空间扩散框架,通过解耦生成过程为全局和局部阶段,结合Diffusion Transformer和轻量级Patch Detailer Head,在不依赖VAE的情况下实现高效生成,推理速度提升10倍,FID分数达1.79。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15186 2026-03-27 cs.CV

Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Dataset

基于指令的胸部X光片病变分割方法及大规模数据集构建

Geon Choi, Hangyul Yoon, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Eunho Yang, Edward Choi

机构 * KAIST(韩国科学技术院) Samsung Medical Center(三星医学中心) AITRICS

AI总结 本文提出基于指令的病变分割方法,构建首个大规模指令-回答数据集,通过自动化流程生成标注,提升胸部X光片病变分割的实用性与准确性。

Comments Camera-ready version for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10800 2026-03-27 cs.CV

ThinkingViT: Matryoshka Thinking Vision Transformer for Elastic Inference

ThinkingViT: 用于弹性推断的Matryoshka思考视觉Transformer

Ali Hojjat, Janek Haberer, Soren Pirk, Olaf Landsiedel

机构 * Kiel University(基尔大学) Hamburg University of Technology (TUHH)(汉堡工业大学) UNU-INWEH(联合国大学水、环境与健康研究所)

AI总结 ThinkingViT通过动态调整计算资源提升视觉Transformer的效率,采用分层推理阶段和token重用机制,在保持吞吐量的同时提升精度,并适用于多种下游任务。

Comments Accepted at CVPR'26, please cite the conference version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24840 2026-03-27 cs.CV cs.AI cs.CL cs.LG

The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition

大语言模型的瓶颈:为何开源视觉大语言模型在层级视觉识别上遇到困难

Yuwen Tan, Yuan Qing, Boqing Gong

机构 * Boston University(波士顿大学)

AI总结 本文指出开源大语言模型缺乏对视觉世界的层级知识,导致视觉大语言模型在识别如水母鱼但无法识别脊椎动物时存在瓶颈,通过构建六种分类学和四个图像数据集的百万级多项选择视觉问答任务验证了这一问题。

Comments Accepted to CVPR 2026. Project page and code: https://yuanqing-ai.github.io/llm-hierarchy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25058 2026-03-27 cs.CV

Learning Explicit Continuous Motion Representation for Dynamic Gaussian Splatting from Monocular Videos

从单目视频学习显式连续运动表示以实现动态高斯点扩散

Xuankai Zhang, Junjin Xiao, Shangwei Huang, Wei-shi Zheng, Qing Zhang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(教育部机器智能与先进计算重点实验室)

AI总结 本文提出了一种从单目视频生成高质量动态高斯点扩散的方法,通过SE(3) B样条运动基函数显式建模动态高斯的连续位置和姿态变形,并采用自适应控制机制提升计算效率和复杂运动建模能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24965 2026-03-27 cs.CV cs.AI

Self-Corrected Image Generation with Explainable Latent Rewards

可解释性潜在奖励的自校正图像生成

Yinyi Luo, Hrishikesh Gokhale, Marios Savvides, Jindong Wang, Shengfeng He

机构 * Carnegie Mellon University(卡内基梅隆大学) Singapore Management University(新加坡管理大学) William & Mary(威廉与玛丽学院)

AI总结 本文提出xLARD框架,利用多模态大语言模型通过可解释性潜在奖励指导生成,改进语义对齐和视觉保真度,同时保持生成先验。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24953 2026-03-27 cs.CV

Select, Hypothesize and Verify: Towards Verified Neuron Concept Interpretation

选择、假设与验证:迈向验证的神经元概念解释

ZeBin Ji, Yang Hu, Xiuli Bi, Bo Liu, Bin Xiao

机构 * Chongqing Key Laboratory of Image Cognition, Chongqing University of Posts and Telecommunications(重庆邮电大学图像认知重庆市重点实验室) Jinan Inspur Data Technology Co., Ltd.(济南浪潮数据技术有限公司)

AI总结 本文提出Select-Hypothesize-Verify框架,通过激活分布分析选择神经元样本,形成概念假设并验证其准确性,提升神经元功能解释的准确性。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24934 2026-03-27 cs.LG cs.AI cs.CV

CVA: Context-aware Video-text Alignment for Video Temporal Grounding

CVA: 基于上下文的视频-文本对齐用于视频时间定位

Sungho Moon, Seunghun Lee, Jiwan Seo, Sunghoon Im

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST), Republic of Korea(韩国大邱庆北科学技术院(DGIST))

AI总结 本文提出CVA框架,通过查询感知上下文多样化、上下文不变边界判别损失和上下文增强Transformer编码器,提升视频时间定位的鲁棒性和准确性,显著提高Recall@1分数。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24912 2026-03-27 cs.CV

ICTPolarReal: A Polarized Reflection and Material Dataset of Real World Objects

ICTPolarReal:真实世界物体的偏振反射与材质数据集

Jing Yang, Krithika Dharanikota, Emily Jia, Haiwei Chen, Yajie Zhao

机构 * Institute for Creative Technologies, University of Southern California(南加州大学创意技术研究所)

AI总结 本文提出一个大规模真实世界物体偏振反射与材质数据集,用于改进逆渲染和正渲染模型的材料分离与光照真实性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24821 2026-03-27 cs.CV cs.AI

Generative Adversarial Perturbations with Cross-paradigm Transferability on Localized Crowd Counting

生成对抗扰动在局部人群计数中的跨范式可转移性

Alabi Mehzabin Anisha, Guangjing Wang, Sriram Chellappan

机构 * University of South Florida(南佛罗里达大学)

AI总结 本文提出一种新型对抗框架,通过多任务损失优化平衡密度图与点回归范式,实现对人群计数模型的有效攻击,提升攻击效果与不可察觉性。

Comments Accepted at CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24801 2026-03-27 cs.CV cs.AI cs.LG

Dissecting Model Failures in Abdominal Aortic Aneurysm Segmentation through Explainability-Driven Analysis

通过可解释性驱动分析解剖腹主动脉瘤分割中的模型故障

Abu Noman Md Sakib, Merjulah Roby, Zijie Zhang, Satish Muluk, Mark K. Eskandari, Ender A. Finol

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Drexel University(德雷塞尔大学) Northwestern University(西北大学)

AI总结 本文通过可解释性驱动分析,提出一种基于XAI的编码器塑造框架,优化编码器焦点以提升复杂场景下的分割性能。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24721 2026-03-27 cs.CV cs.AI cs.LG cs.MM

Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models

可扩展的对象关系编码以提升大语言模型中的3D空间推理

Shengli Zhou, Minghang Zheng, Feng Zheng, Yang Liu

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

AI总结 本文提出QuatRoPE,通过线性增长的对象数量输入长度和注意力层中的点积计算配对空间关系,提升大语言模型在3D空间推理中的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24653 2026-03-27 cs.CV

From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition

从权重到概念:通过奇异向量分解实现CLIP的数据无关可解释性

Francesco Gentile, Nicola Dall'Asen, Francesco Tonini, Massimiliano Mancini, Lorenzo Vaquero, Elisa Ricci

机构 * University of Trento(特伦托大学) University of Pisa(比萨大学) Fondazione Bruno Kessler(布鲁诺·凯撒基金会)

AI总结 本文提出SITH框架,通过奇异向量分解分析CLIP视觉Transformer的权重空间,利用COMP算法实现细粒度概念解释,提升模型可解释性和下游性能。

Comments Accepted @ CVPR 2026. Project page: https://frangente.github.io/SITH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24278 2026-03-27 cs.CV

TopoMesh: High-Fidelity Mesh Autoencoding via Topological Unification

TopoMesh: 通过拓扑统一实现高保真的网格自编码

Guan Luo, Xiu Li, Rui Chen, Xuanyu Yi, Jing Lin, Chia-Hao Chen, Jiahang Liu, Song-Hai Zhang, Jianfeng Zhang

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子) HKUST(香港科技大学)

AI总结 TopoMesh通过拓扑统一框架解决网格生成中的拓扑不匹配问题,利用稀疏体素VAE实现高保真重建,提升几何细节和锐利特征的保留能力。

Comments Accepted to CVPR 2026. Project page: https://logan0601.github.io/projects/topomesh/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23906 2026-03-27 cs.CV

GenMask: Adapting DiT for Segmentation via Direct Mask Generation

GenMask:通过直接掩码生成适应DiT进行分割

Yuhuan Yang, Xianwei Zhuang, Yuxuan Cai, Chaofan Ma, Shuai Bai, Jiangchao Yao, Ya Zhang, Junyang Lin, Yanfeng Wang

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学协作中位网创新中心) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Artificial Intelligence for Medicine, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院人工智能医学研究院) Alibaba Group(阿里巴巴集团)

AI总结 本文提出GenMask,通过直接生成二进制掩码实现分割任务,避免传统间接特征提取流程,提升分割性能。

Comments Accepted by cvpr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21208 2026-03-27 cs.CV cs.LG

JANUS: A Lightweight Framework for Jailbreaking Text-to-Image Models via Distribution Optimization

JANUS:通过分布优化轻量级框架实现文本到图像模型的 jailbreak 攻击

Haolun Zheng, Yu He, Tailun Chen, Shuo Shao, Zhixuan Chu, Hongbin Zhou, Lan Tao, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Alibaba Group(阿里巴巴集团) Hangzhou HighTech Zone (Binjiang) Blockchain and Data Security Research Institute(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 JANUS 通过分布优化实现文本到图像模型的 jailbreak 攻击,提升 ASR-8 评分并保持语义,适用于开源和商业模型。

Comments This paper is accepted by the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18596 2026-03-27 cs.LG cs.AI cs.CV

Elastic Weight Consolidation Done Right for Continual Learning

在持续学习中正确实现弹性权重整合

Xuan Liu, Xiaobin Chang

机构 * School of Artificial Intelligence, Sun Yat-sen University, China(中山大学人工智能学院,中国) Key Laboratory of Intelligent Assessment Technology for Sustainable Tourism, Ministry of Culture and Tourism, Sun Yat-sen University(文化旅游可持续发展智能评估技术重点实验室,文化部,中山大学) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(机器智能与高级计算重点实验室,教育部,中国)

AI总结 本文分析了EWC中权重重要性估计的问题,提出Logits Reversal操作改进EWC,通过防止梯度消失和冗余保护提升持续学习性能。

Comments Accepted to CVPR 2026

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04733 2026-03-27 cs.CV

FOZO: Forward-Only Zeroth-Order Prompt Optimization for Test-Time Adaptation

FOZO:面向测试时间适应的前向零阶提示优化

Xingyu Wang, Tao Wang

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

AI总结 本文提出FOZO,一种无需反向传播的测试时间适应方法,通过优化中间特征统计和预测熵,实现高效稳定适应,实验显示其在ImageNet-C上达到59.52%的Top-1准确率,优于主流方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23022 2026-03-27 cs.CV

DMAligner: Enhancing Image Alignment via Diffusion Model Based View Synthesis

DMAligner:通过扩散模型基于视角合成增强图像对齐

Xinglong Luo, Ao Luo, Zhengning Wang, Yueqi Yang, Chaoyu Feng, Lei Lei, Bing Zeng, Shuaicheng Liu

机构 * University of Electronic Science and Technology of China(电子科技大学) Qianyuan Laboratory(钱元实验室) Southwest Jiaotong University(西南交通大学) Independent Researcher(独立研究者)

AI总结 DMAligner通过扩散模型基于视角合成的方法提升图像对齐效果,解决传统光流方法在遮挡和光照变化下的局限性,提出动态感知扩散训练和动态场景图像对齐数据集。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08881 2026-03-27 cs.CV cs.AI

TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts

TAG-MoE:基于任务的门控用于统一的生成混合专家

Yu Xu, Hongbin Yan, Juan Cao, Yiji Cheng, Tiankai Hang, Runze He, Zijin Yin, Shiyi Zhang, Yuxin Zhang, Jintao Li, Chunyu Wang, Qinglin Lu, Tong-Yee Lee, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文言) National Cheng-Kung University(国立成功大学)

AI总结 本文提出TAG-MoE框架,通过引入层次化任务语义标注方案和预测对齐正则化,解决密集扩散变换器架构中任务干扰问题,提升生成质量和保真度。

Comments Accept by CVPR 2026. Project page: https://yuci-gpt.github.io/TAG-MoE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00393 2026-03-27 cs.CV

NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos

NeoVerse:基于真实世界单目视频增强4D世界模型

Yuxue Yang, Lue Fan, Ziqi Shi, Junran Peng, Feng Wang, Zhaoxiang Zhang

机构 * NLPR & MAIS, CASIA(国家工程实验室与机器智能研究所,中国科学院)

AI总结 本文提出NeoVerse,一种能实现4D重建、生成新颖轨迹视频及多种下游应用的 versatile 4D 世界模型。通过解决现有方法在可扩展性上的局限,NeoVerse 基于单目视频构建可扩展的全流程,实现高泛化能力与高性能。

Comments CVPR 2026; Project Page: https://neoverse-4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13303 2026-03-27 cs.CV

ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement

ShowTable:通过协作反思与精炼解锁创意表格可视化

Zhihang Liu, Xiaoyi Bao, Pandeng Li, Junjie Zhou, Zhaohe Liao, Yefei He, Kaixun Jiang, Chen-Wei Xie, Yun Zheng, Hongtao Xie

机构 * USTC(中国科学技术大学) CASIA(中国科学院自动化研究所) NJU(南京大学) SJTU(上海交通大学) ZJU(浙江大学) FDU(福建师范大学) Tongyi Lab(通义实验室)

AI总结 本文提出ShowTable框架,结合大语言模型与扩散模型,通过逐步自我纠正过程实现创意表格可视化,引入TableVisBench基准测试,展示其在多模态推理、生成和纠错方面的优势。

Comments Accepted to CVPR 2026, project page: https://lntzm.github.io/showtable-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20525 2026-03-27 cs.CV

Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videos

错误归因:第一性错误理解在第一人称视频中

Yayuan Li, Aadit Jain, Filippos Bellos, Jason J. Corso

机构 * University of Michigan(密歇根大学) Voxel51

AI总结 本文提出MATT任务,通过细粒度分析第一人称视频中的人类错误,开发MisEngine数据引擎生成带有归因注释的错误样本,并提出MisFormer模型在语义、时间和空间维度上实现统一的错误归因,实验表明其在视频语言理解等任务上优于现有方法。

Comments 12 pages, 5 figures, 7 tables. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02803 2026-03-27 cs.CV cs.GR

HyperGaussians: High-Dimensional Gaussian Splatting for High-Fidelity Animatable Face Avatars

HyperGaussians: 高维高斯点云用于高质量可动画人脸仿生体

Gent Serifi, Marcel C. Buehler

机构 * ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出HyperGaussians,一种高维多变量高斯点云的扩展,用于生成高质量可动画人脸仿生体。通过引入可学习的局部嵌入条件,提升表达能力,解决传统3DGS在非线性变形和细节表现上的不足。

Comments CVPR 2026, Project page: https://gserifi.github.io/HyperGaussians, Code: https://github.com/gserifi/HyperGaussians

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07507 2026-03-27 cs.CV

PE3R: Perception-Efficient 3D Reconstruction

PE3R:感知高效的3D重建

Jie Hu, Shizun Wang, Xinchao Wang

机构 * xML Lab, National University of Singapore(新加坡国立大学xML实验室)

AI总结 PE3R提出一种无需调优的框架,通过集成多视图几何与2D语义先验,实现跨场景的高效3D语义重建,提升推理速度并取得新的SOTA精度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24571 2026-03-26 cs.CV

Towards Training-Free Scene Text Editing

无训练场景文本编辑

Yubo Li, Xugong Qin, Peng Zhang, Hailun Lin, Gangyan Zeng, Kexin Zhang

机构 * School of Cyber Science and Engineering(网络安全科学与工程学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 本文提出TextFlow框架,通过结合Attention Boost和Flow Manifold Steering方法,实现无需额外训练的高保真文本编辑,实验表明其在视觉质量和文本准确性上优于传统方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24570 2026-03-26 cs.CV cs.AI

Anti-I2V: Safeguarding your photos from malicious image-to-video generation

Anti-I2V: 保护您的照片免受恶意图像到视频生成的威胁

Duc Vu, Anh Nguyen, Chi Tran, Anh Tran

机构 * Qualcomm AI Research(高通人工智能研究)

AI总结 针对图像到视频扩散模型的恶意生成问题,Anti-I2V在L*a*b*和频域中操作,提升鲁棒性并聚焦显著像素,通过优化训练目标提升时间一致性与生成保真度,展现先进防御性能。

Comments Accepted to CVPR 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24558 2026-03-26 cs.CV cs.AI

LensWalk: Agentic Video Understanding by Planning How You See in Videos

LensWalk: 通过规划如何在视频中观看实现代理视频理解

Keliang Li, Yansong Li, Hongze Shen, Mengdi Liu, Hong Chang, Shiguang Shan

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peng Cheng Laboratory(鹏城实验室) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 LensWalk通过建立紧密的推理-计划-观察循环,使大语言模型能够主动控制视觉观察,提升视频理解的准确性和鲁棒性。

Comments To be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏