arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

International Conference on Computer Vision · 会议 · Computer Vision

至 收录 4770
2503.10200 2025-12-23 cs.CV

LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents

LVAgent: 通过多轮动态协作的MLLM代理实现长视频理解

Boyu Chen, Zhengrong Yue, Siran Chen, Zikang Wang, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 LVAgent通过多轮动态协作的MLLM代理提升长视频理解性能,实现80%的准确率并在LongVideoBench上提升13.3%

Comments accepted in ICCV 2025

URL PDF HTML 收藏
2412.09921 2025-12-23 cs.CV

FaceShield: Defending Facial Image against Deepfake Threats

FaceShield:防御面部图像 against 深度伪造威胁

Jaehwan Jeong, Sumin In, Sieun Kim, Hannie Shin, Jongheon Jeong, Sang Ho Yoon, Jaewook Chung, Sangpil Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Samsung Research(三星研究)

AI总结 FaceShield通过操控扩散模型的注意力机制和面部特征提取器,提出了一种主动防御深度伪造的方案,有效提升对抗性扰动的鲁棒性和不可察觉性。

Comments Accepted to ICCV 2025. Keywords: Deepfake, Adversarial Attack, Diffusion Models, GANs, Face Swap, Proactive Defense

URL PDF HTML 收藏
2512.03508 2025-12-19 cs.CV

Exploiting Domain Properties in Language-Driven Domain Generalization for Semantic Segmentation

利用领域特性进行语言驱动的领域泛化以实现语义分割

Seogkyu Jeon, Kibeom Hong, Hyeran Byun

机构 * Yonsei University(延世大学) Sookmyung Women’s University(淑明女子大学)

AI总结 本文提出DPMFormer框架,通过领域感知提示学习和对比学习提升语义分割的领域泛化能力。

Comments ICCV 2025 (poster)

URL PDF HTML 收藏
2512.15608 2025-12-18 cs.CV

Robust Multi-view Camera Calibration from Dense Matches

鲁棒的多视角相机校准从密集匹配

Johannes Hägerlind, Bao-Long Tran, Urs Waldmann, Per-Erik Forssén

机构 * Linköping University(_linköping大学)

AI总结 本文提出了一种鲁棒的多视角相机校准方法,通过优化密集匹配的子采样和视图增量选择,提升了在强径向畸变下的校准精度,适用于动物行为和视频监控分析。

Comments This paper has been accepted for publication at the 21st International Conference on Computer Vision Theory and Applications (VISAPP 2026). Conference website: https://visapp.scitevents.org

URL PDF HTML 收藏
2510.15022 2025-12-18 cs.CV

LoRAverse: A Submodular Framework to Retrieve Diverse Adapters for Diffusion Models

LoRAverse:一种子模框架用于检索扩散模型的多样化适配器

Mert Sonmezer, Matthew Zheng, Pinar Yanardag

机构 * Middle East Technical University(美索不达米亚技术大学) Virginia Tech(弗吉尼亚理工大学)

AI总结 LoRAverse通过子模框架解决从大量LoRA适配器中检索多样化模型的问题,提升扩散模型的个性化应用效果。

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 17879-17888

URL PDF HTML 收藏
2405.20336 2025-12-16 cs.CV cs.SD eess.AS

RapVerse: Coherent Vocals and Whole-Body Motions Generations from Text

RapVerse: 从文本歌词生成连贯的唱声与全身动作

Jiaben Chen, Xin Yan, Yihang Chen, Siyuan Cen, Zixin Wang, Qinwei Ma, Haoyu Zhen, Kaizhi Qian, Lie Lu, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) Wuhan University(武汉大学) UC San Diego(加州大学圣地亚哥分校) Tsinghua University(清华大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Dolby Laboratories(杜比实验室)

AI总结 RapVerse通过统一生成框架,从文本歌词生成连贯唱声与全身动作,实现多模态统一建模,提升生成效果与基准性能。

Comments ICCV 2025, Project website: https://jiabenchen.github.io/RapVerse/

URL PDF HTML 收藏
2512.11874 2025-12-16 cs.CV

Pseudo-Label Refinement for Robust Wheat Head Segmentation via Two-Stage Hybrid Training

通过两阶段混合训练实现鲁棒小麦穗分割的伪标签细化

Jiahao Jiang, Zhangrui Yang, Xuanhan Wang, Jingkuan Song

机构 * Tongji University(同济大学)

AI总结 本文提出了一种基于两阶段混合训练和伪标签细化的自我训练框架,用于提升小麦穗分割的鲁棒性。

Comments 3 pages,3 figures, Extended abstract submitted to the 10th Computer Vision in Plant Phenotyping and Agriculture (CVPPA) Workshop, held in conjunction with ICCV 2025

URL PDF HTML 收藏
2512.10252 2025-12-12 cs.CV

GDKVM: Echocardiography Video Segmentation via Spatiotemporal Key-Value Memory with Gated Delta Rule

GDKVM:基于时空关键值记忆与门控delta规则的超声视频分割

Rui Wang, Yimu Sun, Jingxing Guo, Huisi Wu, Jing Qin

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Centre for Smart Health, School of Nursing, The Hong Kong Polytechnic University(香港理工大学智能健康中心)

AI总结 GDKVM通过时空关键值记忆与门控delta规则提升超声视频分割的精度与鲁棒性,实现高效实时分割。

Comments Accepted to ICCV 2025

URL PDF HTML 收藏
2505.19148 2025-12-11 cs.CV

DISTA-Net: Dynamic Closely-Spaced Infrared Small Target Unmixing

DISTA-Net:动态紧密空间红外小目标解混

Shengdong Han, Shangdong Yang, Xin Zhang, Yuxuan Li, Xiang Li, Jian Yang, Ming-Ming Cheng, Yimian Dai

机构 * School of Computer Science, Nanjing University of Posts and Telecommunications(南京邮电大学计算机科学学院) VCIP, CS, Nankai University(南开大学) NKIARI, Futian, Shenzhen(深圳南山区NKIARI)

AI总结 DISTA-Net通过动态迭代收缩阈值网络实现紧密排列红外小目标的解混,首次提出该领域深度学习模型并建立开源生态系统。

Comments Accepted by ICCV 2025. This updated version fixed the bug in SSIM, while the conclusion remains the same

URL PDF HTML 收藏
2503.05122 2025-12-11 cs.CV

EDM: Efficient Deep Feature Matching

EDM: 高效深度特征匹配

Xi Li, Tong Rao, Cihui Pan

机构 * Realsee

AI总结 EDM通过高效深度特征匹配网络提升匹配精度与效率,采用多尺度特征聚合和轻量级回归头实现快速准确的对应预测。

Journal ref https://openaccess.thecvf.com/content/ICCV2025/papers/Li_EDM_Efficient_Deep_Feature_Matching_ICCV_2025_paper.pdf

URL PDF HTML 收藏
2508.00518 2025-12-10 cs.CV cs.CL

Fine-grained Spatiotemporal Grounding on Egocentric Videos

细粒度眼动视频时空定位

Shuo Liang, Yiwu Zhong, Zi-Yuan Hu, Yeyao Tao, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出EgoMask基准和EgoMask-Train数据集,针对眼动视频细粒度时空定位的挑战,通过微调提升模型性能。

Comments Accepted by ICCV 2025

URL PDF HTML 收藏
2411.17473 2025-12-09 cs.CV

TinyViM: Frequency Decoupling for Tiny Hybrid Vision Mamba

TinyViM: 频率解耦用于小型混合视觉Mamba

Xiaowen Ma, Zhenliang Ni, Xinghao Chen

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 TinyViM通过频率解耦和高效混合器提升小型混合视觉Mamba的性能

Comments ICCV 2025

URL PDF HTML 收藏
2503.16832 2025-12-08 cs.CV

Joint Self-Supervised Video Alignment and Action Segmentation

联合自监督视频对齐与动作分割

Ali Shah Ali, Syed Ahmed Mahmood, Mubin Saeed, Andrey Konin, M. Zeeshan Zia, Quoc-Huy Tran

机构 * Retrocausal, Inc.(Retrocausal公司)

AI总结 本文提出了一种统一最优传输框架,用于联合自监督视频对齐与动作分割,实现了高效训练和更优的分割性能。

Comments Accepted to ICCV 2025

URL PDF HTML 收藏
2507.17665 2025-12-08 cs.CV cs.RO

Perspective-Invariant 3D Object Detection

视角不变的3D物体检测

Ao Liang, Lingdong Kong, Dongyue Lu, Youquan Liu, Jian Fang, Huaici Zhao, Wei Tsang Ooi

AI总结 本文提出Pi3DET数据集和跨平台适应框架,实现视角不变的3D物体检测,推动非车辆平台的3D检测研究。

Comments ICCV 2025; 54 pages, 18 figures, 22 tables; Project Page at https://pi3det.github.io

URL PDF HTML 收藏
2503.11056 2025-12-04 cs.CV

Flow to the Mode: Mode-Seeking Diffusion Autoencoders for State-of-the-Art Image Tokenization

流到模式:用于最新图像标记化的模式寻求扩散自编码器

Kyle Sargent, Kyle Hsu, Justin Johnson, Li Fei-Fei, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Michigan(密歇根大学)

AI总结 FlowMo是一种基于Transformer的扩散自编码器,通过模式匹配和模式寻求阶段实现图像标记化的新SOTA,无需卷积、对抗损失等。

Comments ICCV 2025, 19 pages

URL PDF HTML 收藏
2411.18011 2025-12-02 cs.CV

Manual-PA: Learning 3D Part Assembly from Instruction Diagrams

Manual-PA: 从指令图中学习3D部件组装

Jiahao Zhang, Anoop Cherian, Cristian Rodriguez, Weijian Deng, Stephen Gould

机构 * The Australian National University(澳大利亚国立大学) Mitsubishi Electric Research Labs(三菱电机研究实验室) The Australian Institute for Machine Learning(澳大利亚机器学习研究所)

AI总结 Manual-PA通过利用图示手册中的线索,将家具组装问题分为离散和连续阶段,利用对比学习框架实现3D部件的语义对齐和姿态预测,显著提升了组装性能并实现了对现实家具的泛化。

Comments Accepted to ICCV'25

URL PDF HTML 收藏
2507.03657 2025-12-02 cs.CV

Dynamic Multimodal Prototype Learning in Vision-Language Models

视觉-语言模型中的动态多模态原型学习

Xingyu Zhu, Shuo Wang, Beier Zhu, Miaoge Li, Yunfan Li, Junfeng Fang, Zhicai Wang, Dongsheng Wang, Hanwang Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学) National University of Singapore(新加坡国立大学) Shenzhen University(深圳大学)

AI总结 本文提出ProtoMM框架,通过动态更新视觉粒子和多模态原型学习,提升视觉-语言模型在测试时的适应性能。

Comments ICCV 2025

URL PDF HTML 收藏
2512.00305 2025-12-02 cs.AI

ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning

ChartPoint: 通过 grounding 反射引导 MLLMs 进行图表推理

Zhengzhuo Xu, SiNan Du, Yiyan Qi, SiwenLu, Chengjin Xu, Chun Yuan, Jian Guo

机构 * Tsinghua University(清华大学) International Digital Economy Academy(国际数字经济学院) Beihang University(北航) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 ChartPoint通过引入 grounding 反射机制,提升 MLLMs 在图表推理中的表现,开发了两个指令微调模型,在多个图表基准上取得显著提升。

Comments Accepted by ICCV 2025

URL PDF HTML 收藏
2512.00084 2025-12-02 cs.CV cs.LG

A Fast and Efficient Modern BERT based Text-Conditioned Diffusion Model for Medical Image Segmentation

一种快速且高效的基于现代BERT的文本条件扩散模型用于医学图像分割

Venkata Siddharth Dhara, Pawan Kumar

机构 * International Institute of Information Technology, Hyderabad, 500032, India(国际信息科技学院,海得拉巴)

AI总结 本文提出FastTextDiff,利用ModernBERT提升医学图像分割的效率和准确性,通过整合文本注释和多模态注意力机制改进传统扩散模型。

Comments 15 pages, 3 figures, Accepted in Slide 3 10th International Conference on Computer Vision & Image Processing (CVIP 2026)

URL PDF HTML 收藏
2510.19622 2025-12-02 cs.CV

Augmenting Moment Retrieval: Zero-Dependency Two-Stage Learning

增强时刻检索:零依赖两阶段学习

Zhengxuan Wei, Jiajin Tang, Sibei Yang

机构 * ShanghaiTech University(上海科技大学) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

AI总结 本文提出AMR框架,通过两阶段训练解决时刻检索中的数据稀缺、边界模糊和细粒度语义区分问题,提升模型在真实场景下的泛化能力。

Comments This work is accepted by ICCV 2025

URL PDF HTML 收藏
2505.18151 2025-12-02 cs.GR cs.AI cs.CV

WonderPlay: Dynamic 3D Scene Generation from a Single Image and Actions

WonderPlay:从单张图像和动作生成动态3D场景

Zizhang Li, Hong-Xing Yu, Wei Liu, Yin Yang, Charles Herrmann, Gordon Wetzstein, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Utah(犹他大学)

AI总结 WonderPlay通过结合物理模拟与视频生成,实现从单张图像和动作生成多样化动态3D场景。

Comments ICCV 2025 (Highlight). The first two authors contributed equally. Project website: https://kyleleey.github.io/WonderPlay/

URL PDF HTML 收藏
2504.00983 2025-12-02 cs.GR cs.AI cs.CV

WorldScore: A Unified Evaluation Benchmark for World Generation

WorldScore: 一个用于世界生成的统一评估基准

Haoyi Duan, Hong-Xing Yu, Sirui Chen, Li Fei-Fei, Jiajun Wu

机构 * Stanford University(斯坦福大学)

AI总结 WorldScore提出一个统一评估基准,用于评估不同世界生成方法,涵盖3D、4D场景生成及视频生成,通过可控性、质量和动态性三个维度评估19种模型。

Comments ICCV 2025. Project website: https://haoyi-duan.github.io/WorldScore/ The first two authors contributed equally

URL PDF HTML 收藏
2503.16177 2025-12-02 cs.GR cs.CV

OccluGaussian: Occlusion-Aware Gaussian Splatting for Large Scene Reconstruction and Rendering

OccluGaussian:面向大场景重建与渲染的遮挡感知高斯点云技术

Shiyong Liu, Xiao Tang, Zhihao Li, Yingfan He, Chongjie Ye, Jianzhuang Liu, Binxiao Huang, Shunbo Zhou, Xiaofei Wu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) The University of Hong Kong(香港大学) Huawei Embodied Intelligence Lab(华为具身智能实验室)

AI总结 OccluGaussian通过遮挡感知的场景划分和区域渲染技术,提升大规模场景重建与渲染的质量和效率。

Comments Accepted to ICCV 2025. Project website: https://occlugaussian.github.io

URL PDF HTML 收藏
2511.22615 2025-12-01 cs.CV cs.LG

Stable-Drift: A Patient-Aware Latent Drift Replay Method for Stabilizing Representations in Continual Learning

Stable-Drift: 一种患者感知的潜在漂移重放方法,用于持续学习中稳定表示

Paraskevi-Antonia Theofilou, Anuhya Thota, Stefanos Kollias, Mamatha Thota

机构 * National Technical University of Athens(希腊国家技术大学) London School of Economics and Political Science(伦敦政治经济学院) University of Lincoln(林肯大学)

AI总结 Stable-Drift方法通过患者感知的潜在漂移重放,有效减少持续学习中的灾难性遗忘,提升医学影像任务的鲁棒性。

Comments 8 pages, 2 figures

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision, 2025, 7340--7349

URL PDF HTML 收藏
2411.16786 2025-12-01 cs.DC

Staleness-Centric Optimizations for Parallel Diffusion MoE Inference

以 staleness 为中心的并行扩散 MoE 推理优化

Jiajun Luo, Lizhuo Luo, Jianru Xu, Jiajun Song, Rongwei Lu, Chen Tang, Zhi Wang

AI总结 DICE 提出了一种以 staleness 为中心的优化框架,通过交错并行性、选择性同步和条件通信减少 staleness,实现 1.26 倍速度提升并保持高质量。

Comments Accepted by ICCV 2025

URL PDF HTML 收藏
2507.03394 2025-11-27 cs.CV

Learning Normals of Noisy Points by Local Gradient-Aware Surface Filtering

通过局部梯度感知的表面过滤学习噪声点的法线

Qing Li, Huifang Feng, Xun Gong, Yu-Shen Liu

机构 * Southwest Jiaotong University(西南交通大学) Xihua University(西华大学) Tsinghua University(清华大学)

AI总结 本文提出一种基于局部梯度感知的表面过滤方法,用于从噪声点云中学习法线,通过隐式函数和投影约束提升法线估计和表面重建性能。

Comments Accepted by ICCV 2025. Project page: https://leoqli.github.io/LGSF/

URL PDF HTML 收藏
2503.10959 2025-11-27 cs.CV cs.AI

OuroMamba: A Data-Free Quantization Framework for Vision Mamba

OuroMamba:一种无需数据的视觉Mamba量化框架

Akshat Ramachandran, Mingyu Lee, Huan Xu, Souvik Kundu, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Intel Labs(英特尔实验室)

AI总结 OuroMamba提出一种无需数据的视觉Mamba量化方法,通过生成语义丰富的合成数据和混合精度量化技术,实现高效的模型压缩与性能提升。

Comments Accepted to ICCV 2025

URL PDF HTML 收藏
2511.20280 2025-11-26 cs.CV

Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-Refinement

通过VLM引导的迭代自优化提升物理导向的视频生成

Yang Liu, Xilin Zhao, Peisong Wen, Siran Dai, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 本文提出一种通过VLM引导的迭代自优化方法,提升视频生成的物理一致性,实验显示在PhyIQ基准上得分提升明显。

Comments ICCV 2025 Physics-IQ Challenge Third Place Solution

URL PDF HTML 收藏
2510.17201 2025-11-26 cs.CV

Optimizing DINOv2 with Registers for Face Anti-Spoofing

通过寄存器优化DINOv2用于面部反伪装

Mika Feng, Pierre Gallin-Martel, Koichi Ito, Takafumi Aoki

机构 * Graduate School of Information Sciences, Tohoku University, Japan(信息科学研究生院,东北大学,日本)

AI总结 本文提出基于DINOv2的面部反伪装方法,通过优化注意力机制以检测活体与伪装面部图像的细微差异。

Comments ICCV 2025 Workshop FAS

URL PDF HTML 收藏
2501.06250 2025-11-26 cs.CV cs.AI cs.HC

Generative AI for Cel-Animation: A Survey

生成式AI用于动画:一种调查

Yolo Y. Tang, Junjia Guo, Pinxin Liu, Zhiyuan Wang, Hang Hua, Jia-Xing Zhong, Yunzhong Xiao, Chao Huang, Luchuan Song, Susan Liang, Yizhi Song, Liu He, Jing Bi, Mingqian Feng, Xinyang Li, Zeliang Zhang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) UCSB University of Oxford(牛津大学) CMU(卡内基梅隆大学) Purdue University(普渡大学)

AI总结 本文调查生成式AI如何通过自动化任务革新传统动画流程,降低技术门槛,扩大创作者群体,并促进艺术创新。

Comments Accepted by ICCV 2025 AISTORY Workshop

URL PDF HTML 收藏