arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2512.01236 2026-04-10 cs.CV

PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards

PSR: 通过成对主体一致性奖励实现多主体个性化图像生成的扩展

Shulei Wang, Longhui Wei, Xin He, Jianbo Ouyang, Hui Lu, Zhou Zhao, Qi Tian

机构 * Zhejiang University(浙江大学) Huawei Inc.(华为技术有限公司)

AI总结 本文提出PSR框架,通过多主体数据生成管道和强化学习策略,提升多主体个性化图像生成的性能和一致性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18787 2026-04-10 cs.CV cs.LG

Understanding Task Transfer in Vision-Language Models

理解视觉-语言模型中的任务迁移

Bhuvan Sachdeva, Karan Uppal, Abhinav Java, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软研究院印度)

AI总结 本文研究视觉-语言模型中任务迁移的系统性影响,提出PGF指标衡量任务迁移对性能的影响,揭示任务间的正负迁移关系,指导更高效的模型训练。

Comments CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08016 2026-04-10 cs.CV cs.LG

Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs

视频并行扩展:聚合多样化的帧子集用于VideoLLMs

Hyungjin Chung, Hyelin Nam, Jiyeon Kim, Hyojun Go, Byeongjun Park, Junho Kim, Joonseok Lee, Seongsu Ha, Byung-Hoon Kim

机构 * EverEx University of Michigan(密歇根大学) KAIST(韩国科学技术院) ETH Zürich(苏黎世联邦理工学院) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Yonsei University(延世大学)

AI总结 本文提出Video Parallel Scaling方法,通过并行处理不同帧子集提升VideoLLMs的时序推理能力,实验表明其在不同模型架构和规模上均显著提升性能,且比其他并行方法更高效。

Comments CVPR Findings 2026; code: https://github.com/hyungjin-chung/VPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04678 2026-04-10 cs.CV

ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Sensing

ChangeBridge: 多模态控制下的遥感时空图像生成

Zhenghui Zhao, Chen Wu, Xiangyong Cao, Di Wang, Hongruixuan Chen, Datao Tang, Liangpei Zhang, Zhuo Zheng

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) Graduate School of Frontier Sciences, The University of Tokyo(东京大学新领域创成科学研究科) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

AI总结 本文提出ChangeBridge模型,通过多模态事件控制生成时空一致的遥感图像,解决了现有方法在跨时间变化建模上的不足,提升了土地利用规划和变化检测任务的数据生成能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05398 2026-04-10 cs.GR

2ndMatch: Finetuning Pruned Diffusion Models via Second-Order Jacobian Matching

2ndMatch: 通过二阶雅可比匹配进行剪枝扩散模型的微调

Caleb Zheng, Eli Shlizerman

AI总结 本文提出2ndMatch框架,通过二阶雅可比匹配损失提升剪枝扩散模型性能,实验表明其能显著改善输出质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24499 2026-04-10 cs.CV

Reason-SVG: Enhancing Structured Reasoning for Vector Graphics Generation with Reinforcement Learning

Reason-SVG:通过强化学习增强向量图形生成的结构化推理

Ximing Xing, Ziteng Xue, Yandong Guan, Jing Zhang, Dong Xu, Qian Yu

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 Reason-SVG通过引入Drawing-with-Thought范式和混合奖励机制,提升大语言模型生成高质量SVG的能力,实现结构化推理与视觉一致性。

Comments Accepted by CVPR 2026. 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17732 2026-04-10 cs.CV cs.AI cs.LG

RQR3D: Reparametrizing the regression targets for BEV-based 3D object detection

RQR3D:基于鸟瞰图的3D目标检测的回归目标重新参数化

Ozsel Kilinc, Cem Tarhan

机构 * Amazon Lab 126(亚马逊126实验室) Togg/Trutek AI Team(Togg/Trutek人工智能团队)

AI总结 本文提出RQR3D方法,通过重新参数化回归目标将旋转目标检测转化为关键点回归任务,实现高效且准确的3D目标检测,适用于自动驾驶场景。

Comments To appear in proceedings of CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08637 2026-04-10 cs.CV cs.AI cs.LG

DMin: Scalable Training Data Influence Estimation for Diffusion Models

DMin:用于扩散模型的可扩展训练数据影响估计

Huawei Lin, Yingjie Lao, Weijie Zhao

机构 * Rochester Institute of Technology(罗切斯特理工学院) Tufts University(塔夫茨大学)

AI总结 本文提出DMin框架,用于高效估计扩散模型中每个训练样本对生成图像的影响,解决了传统方法在大规模模型上的计算限制问题,实现了存储和计算效率的显著提升。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07097 2026-04-09 cs.CV

Novel Anomaly Detection Scenarios and Evaluation Metrics to Address the Ambiguity in the Definition of Normal Samples

新颖的异常检测场景和评估指标以解决正常样本定义的模糊性

Reiji Saito, Satoshi Kamiya, Kazuhiro Hotta

机构 * Meijo University(名城大学)

AI总结 本文提出新颖的异常检测场景和评估指标,以应对实际应用中正常样本定义的模糊性,并通过RePaste方法提升学习效果,实验证明其在MVTec AD基准上的优越性能。

Comments Accepted by CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06830 2026-04-09 cs.CV cs.RO

VGGT-SLAM++

VGGT-SLAM++:基于视觉几何基础变换器的视觉SLAM系统

Avilasha Mandal, Rajesh Kumar, Sudarshan Sunil Harithas, Chetan Arora

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) Addverb Technologies Brown University(布朗大学)

AI总结 VGGT-SLAM++结合视觉几何基础变换器的几何丰富输出,通过空间校正后端实现高频率局部捆绑调整,提升大规模映射精度与内存效率。

Comments 8 pages (main paper) + supplementary material. Accepted at CVPR 2026 Workshop (VOCVALC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06824 2026-04-09 cs.CV

Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning

生成、分析与优化:基于MLLM元推理的无训练声源定位

Subin Park, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学)

AI总结 本文提出无训练的声源定位框架,利用多模态大语言模型的推理能力,通过生成-分析-优化流程实现声源定位,实验表明在单源和多源基准上表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06795 2026-04-09 cs.CV cs.AI

FedDAP: Domain-Aware Prototype Learning for Federated Learning under Domain Shift

FedDAP: 面向领域偏移的联邦学习中的领域感知原型学习

Huy Q. Le, Loc X. Nguyen, Yu Qiao, Seong Tae Kim, Eui-Nam Huh, Choong Seon Hong

机构 * G-LAMP NEXUS Institute, Kyung Hee University(庆熙大学G-LAMP NEXUS研究所) Kyung Hee University(庆熙大学)

AI总结 FedDAP通过构建领域特定的全局原型,解决联邦学习中因领域偏移导致的模型性能下降问题,通过领域感知的原型对齐提升本地学习和全局泛化能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06662 2026-04-09 cs.CV cs.LG

Towards Robust Content Watermarking Against Removal and Forgery Attacks

面向对抗性移除与伪造攻击的鲁棒内容水印技术

Yifan Zhu, Yihan Wang, Xiao-Shan Gao

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Chinese Academy of Sciences(中国科学院大学) University of Waterloo(滑铁卢大学)

AI总结 本文提出Instance-Specific watermarking with Two-Sided detection方法,通过动态控制水印注入时间和模式提升鲁棒性,有效对抗移除和伪造攻击。

Comments 14 pages, 5 figures, CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06631 2026-04-09 cs.LG cs.AI cs.CV

SubFLOT: Submodel Extraction for Efficient and Personalized Federated Learning via Optimal Transport

SubFLOT:通过最优传输实现高效且个性化的联邦学习子模型提取

Zheng Jiang, Nan He, Yiming Chen, Lifeng Sun

机构 * Tsinghua University(清华大学) Beijing University of Technology(北京工业大学) Key Laboratory of Pervasive Computing, Ministry of Education(普适计算教育部重点实验室)

AI总结 SubFLOT通过最优传输增强剪枝模块生成定制化子模型,结合缩放适应正则化模块缓解参数分歧,实现高效个性化联邦学习。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06467 2026-04-09 cs.CV

PhysHead: Simulation-Ready Gaussian Head Avatars

PhysHead: 可模拟的高斯头部化身

Berna Kabadayi, Vanessa Sklyarova, Wojciech Zielonka, Justus Thies, Gerard Pons-Moll

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ETH Zürich(苏黎世联邦理工学院) University of Tübingen(图宾根大学) Technical University of Darmstadt(达姆施塔特工业大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

AI总结 本文提出PhysHead,一种结合3D参数网格和发丝的混合表示方法,用于生成具有真实发丝动态的可动画头部化身,通过多视角视频学习实现逼真发丝运动。

Comments Project Page: see https://phys-head.github.io/; Youtube Video: see https://www.youtube.com/watch?v=k68fsSSwzc0; Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06349 2026-04-09 cs.LG cs.AI cs.CV

Bi-Level Optimization for Single Domain Generalization

双层优化用于单一领域泛化

Marzi Heidari, Hanping Zhang, Hao Yan, Yuhong Guo

机构 * School of Computer Science, Carleton University(卡尔顿大学计算机科学学院) Amii(阿尔伯塔机器智能研究所)

AI总结 本文提出BiSDG框架,通过双层优化分离任务学习与领域建模,利用模拟分布偏移的替代领域提升泛化能力,实验表明在单一领域泛化任务中优于现有方法。

Comments CVPR Findings Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06245 2026-04-09 cs.CV

CraterBench-R: Instance-Level Crater Retrieval for Planetary Scale

CraterBench-R: 行为级陨石坑检索用于行星尺度

Jichao Fang, Lei Zhang, Michael Phillips, Wei Luo

机构 * Northern Illinois University(北伊利诺伊大学) University of Arizona(亚利桑那大学)

AI总结 本文提出CraterBench-R,通过实例级图像检索解决行星表面陨石坑分析问题,展示自监督Vision Transformers在陨石坑检索中的优势,并提出实例-令牌聚合方法提升效率。

Comments Accepted at the EarthVision 2026 Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05743 2026-04-09 cs.CV cs.AI

On the Robustness of Diffusion-Based Image Compression to Bit-Flip Errors

扩散基图像压缩对位翻转错误的鲁棒性

Amit Vaisman, Gal Pomerants, Raz Lapid

机构 * Technion - Israel Institute of Technology(以色列理工学院) Deepkeep

AI总结 研究探讨了基于扩散的图像压缩在位翻转错误下的鲁棒性,提出更稳健的Turbo-DDCM变体,改进鲁棒性的同时保持率-失真-感知权衡。

Comments Accepted at AIGENS @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05584 2026-04-09 cs.CV

Purify-then-Align: Towards Robust Human Sensing under Modality Missing with Knowledge Distillation from Noisy Multimodal Teacher

在模态缺失情况下通过知识蒸馏从噪声多模态教师中实现鲁棒的人体感知:Purify-then-Align

Pengcheng Weng, Yanyu Qian, Yangxin Xu, Fei Wang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) Institute of Computer Science, Universität Bern(伯尔尼大学计算机科学研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出PTA框架,通过元学习和知识扩散解决多模态人体感知中模态缺失问题,通过净化知识源和对齐模态提升单模态模型鲁棒性。

Comments Accepted by CVPR 2026 Workshop On Any-to-Any Multimodal Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26588 2026-04-09 cs.CV cs.LG

From Synthetic Data to Real Restorations: Diffusion Model for Patient-specific Dental Crown Completion

从合成数据到真实修复:一种针对患者特定牙齿冠的扩散模型

Dávid Pukanec, Tibor Kubík, Michal Španěl

机构 * Department of Computer Graphics and Multimedia, Brno University of Technology, Czechia(捷克布尔诺科技大学计算机图形与多媒体系)

AI总结 本文提出ToothCraft模型,通过合成数据生成患者特定的牙齿冠修复,解决训练数据不足问题,实验显示其在IoU和CD指标上的优异表现。

Comments VISAPP 2026 Conference / CVPR Workshop GenRecon3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26167 2026-04-09 cs.CV cs.CR

Gaussian Shannon: High-Precision Diffusion Model Watermarking Based on Communication

高斯香农:基于通信的高精度扩散模型水印技术

Yi Zhang, Hongbo Huang, Liang-Jie Zhang

AI总结 本文提出Gaussian Shannon水印框架,通过将扩散过程视为噪声通信信道,实现鲁棒追踪和精确位恢复,适用于无损元数据应用。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20284 2026-04-09 cs.CV cs.GR eess.IV

STAC: Plug-and-Play Spatio-Temporal Aware Cache Compression for Streaming 3D Reconstruction

STAC:用于流式3D重建的时空感知缓存压缩

Runze Wang, Yuxuan Song, Youcheng Cai, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出STAC框架,通过时空感知缓存机制提升流式3D重建的内存效率和重建质量,减少内存消耗并加速推理。

Comments 10 pages, 6 figures. Accepted by CVPR 2026. This version includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07527 2026-04-09 cs.CV cs.GR

From Orbit to Ground: Generative City Photogrammetry from Extreme Off-Nadir Satellite Images

从轨道到地面:从极端俯仰角卫星图像生成城市光束摄影测量

Fei Yu, Yu Liu, Luyang Tang, Mingchao Sun, Zengye Ge, Rui Bu, Yuchao Jin, Haisen Zhao, He Sun, Yangyan Li, Mu Xu, Wenzheng Chen, Baoquan Chen

机构 * Peking University(北京大学) AMAP(高德地图) Ant Group(蚂蚁集团) Shandong University(山东大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文提出两种设计选择,通过2.5D高度图和可微渲染技术,解决从稀疏轨道图像合成地面视图的挑战,实现大规模城市重建。

Comments Accepted by CVPR 2026 Findings. Project page: https://pku-vcl-geometry.github.io/Orbit2Ground/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22396 2026-04-09 cs.CV cs.AI

Asking like Socrates: Socrates helps VLMs understand remote sensing images

像苏格拉底提问:苏格拉底帮助VLMs理解遥感图像

Run Shao, Ziyu Li, Zhaoyang Zhang, Linrui Xu, Xinran He, Hongyuan Yuan, Bolei He, Yongxing Dai, Yiming Yan, Yijun Chen, Wang Guo, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Baidu Inc.(百度公司) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

AI总结 本文提出RS-EoT方法,通过迭代视觉证据寻求机制和两阶段强化学习策略,解决遥感图像中伪推理问题,提升视觉证据基础的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15510 2026-04-09 cs.CV cs.RO

Exploring Conditions for Diffusion models in Robotic Control

探索扩散模型在机器人控制中的条件

Heeseong Shin, Byeongho Heo, Dongyoon Han, Seungryong Kim, Taekyung Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) NAVER AI Lab(NAVER人工智能实验室)

AI总结 本文研究利用预训练文本到图像扩散模型获取任务适应的视觉表示,提出ORCA方法以动态视觉信息提升机器人控制性能。

Comments Accepted to CVPR 2026. Project page: https://orca-rc.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04880 2026-04-09 cs.CV eess.IV

MozzaVID: Mozzarella Volumetric Image Dataset

MozzaVID:莫扎瑞拉奶酪体积分类数据集

Pawel Tomasz Pieta, Peter Winkel Rasmussen, Anders Bjorholm Dahl, Jeppe Revall Frisvad, Siavash Arjomand Bigdeli, Carsten Gundlach, Anders Nymark Christensen

机构 * Technical University of Denmark(丹麦技术大学)

AI总结 本文提出MozzaVID数据集,用于体积分类任务,包含25种奶酪类型和149个样本,提供三种分辨率的数据,旨在促进体积分类算法的发展和食品结构研究。

Comments Accepted at MetaFood (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16240 2026-04-09 cs.LG

AFL: A Single-Round Analytic Approach for Federated Learning with Pre-trained Models

AFL:基于预训练模型的联邦学习单轮分析方法

Run He, Kai Tong, Di Fang, Han Sun, Ziqian Zeng, Haoran Li, Tianyi Chen, Huiping Zhuang

机构 * South China University of Technology(华南理工大学) Tsinghua University(清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) The Hong Kong University of Science and Technology(香港科技大学) Microsoft(微软)

AI总结 本文提出AFL,一种利用分析解的联邦学习方法,通过单轮训练和绝对聚合法则,减少通信开销并提升收敛速度,具有数据分区不变性。

Comments Published in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07306 2026-04-09 cs.CV cs.LG

Beyond Loss Values: Robust Dynamic Pruning via Loss Trajectory Alignment

超越损失值:通过损失轨迹对齐实现鲁棒动态剪枝

Huaiyuan Qin, Muli Yang, Gabriel James Goenawan, Kai Wang, Zheng Wang, Peng Hu, Xi Peng, Hongyuan Zhu

机构 * National University of Singapore(新加坡国立大学) Wuhan University(武汉大学) Sichuan University(四川大学)

AI总结 本文提出AlignPrune模块,通过动态对齐得分改进动态剪枝在标签噪声下的鲁棒性,实验表明其在多个基准上提升精度达6.3%。

Comments Published in CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07220 2026-04-09 cs.IR

HIVE: Query, Hypothesize, Verify An LLM Framework for Multimodal Reasoning-Intensive Retrieval

HIVE:一种用于多模态推理密集检索的LLM框架

Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Mohamed Mahmoud, Mostafa Farouk Senussi, Abdelrahman Abdallah, Hyun-Soo Kang

AI总结 HIVE通过引入LLM进行显式视觉-文本推理,提升多模态检索效果,达到41.7的nDCG@10,优于现有文本和多模态模型。

Comments accepted at CVPR 2026 Workshop GRAIL-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07201 2026-04-09 cs.IR cs.CV

BRIDGE: Multimodal-to-Text Retrieval via Reinforcement-Learned Query Alignment

BRIDGE:通过强化学习查询对齐实现多模态到文本检索

Mohamed Darwish Mounis, Mohamed Mahmoud, Shaimaa Sedek, Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Abdelrahman Abdallah, Hyun-Soo Kang

机构 * High institute for computer & information systems(高等计算机与信息系统学院) Chungbuk National University(忠北大学) Assiut University(艾斯尤特大学) University of Innsbruck(因斯布鲁克大学)

AI总结 BRIDGE通过强化学习查询对齐模型和增强神经搜索检索器,解决多模态查询在文本库中的检索问题,实现优于多模态编码器的nDCG@10性能。

Comments Accepted at CVPR 2026 Workshop GRAIL-V

详情

展开后加载摘要…

URL PDF HTML 收藏