arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11877
2505.16980 2025-05-23 cs.CV cs.MM

Pursuing Temporal-Consistent Video Virtual Try-On via Dynamic Pose Interaction

Dong Li, Wenqi Zhong, Wei Yu, Yingwei Pan, Dingwen Zhang, Ting Yao, Junwei Han, Tao Mei

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16971 2025-05-23 cs.CV

UniPhy: Learning a Unified Constitutive Model for Inverse Physics Simulation

Himangi Mittal, Peiye Zhuang, Hsin-Ying Lee, Shubham Tulsiani

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16811 2025-05-23 cs.CV

Semi-Supervised State-Space Model with Dynamic Stacking Filter for Real-World Video Deraining

Shangquan Sun, Wenqi Ren, Juxiang Zhou, Shu Wang, Jianhou Gan, Xiaochun Cao

Comments 11 Pages, 8 figures, CVPR 2025 Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16805 2025-05-23 cs.CV

SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving

Xuesong Chen, Linjiang Huang, Tao Ma, Rongyao Fang, Shaoshuai Shi, Hongsheng Li

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16778 2025-05-23 cs.CV

Single Domain Generalization for Few-Shot Counting via Universal Representation Matching

Xianing Chen, Si Huo, Borui Jiang, Hailin Hu, Xinghao Chen

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16399 2025-05-23 cs.CV

Sketchy Bounding-box Supervision for 3D Instance Segmentation

Qian Deng, Le Hui, Jin Xie, Jian Yang

机构 * PCA Lab, College of Computer Science, Nankai University(南开大学计算机科学学院PCA实验室) School of Electronics and Information, Northwestern Polytechnical University(西北工业大学电子与信息学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16376 2025-05-23 cs.CV cs.AI

DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos

Zijia Lu, A S M Iftekhar, Gaurav Mittal, Tianjian Meng, Xiawei Wang, Cheng Zhao, Rohith Kukkala, Ehsan Elhamifar, Mei Chen

机构 * Microsoft(微软公司) Northeastern University(东北大学)

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15970 2025-05-23 cs.CV cs.LG

Analyzing Hierarchical Structure in Vision Models with Sparse Autoencoders

Matthew Lyle Olson, Musashi Hinck, Neale Ratzlaff, Changbai Li, Phillip Howard, Vasudev Lal, Shao-Yen Tseng

Comments (Oral) CVPR 2025 Workshop on Mechanistic Interpretability for Vision. Authors 1 and 2 contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14716 2025-05-23 cs.CV cs.LG cs.RO

VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving

Haiming Zhang, Wending Zhou, Yiyao Zhu, Xu Yan, Jiantao Gao, Dongfeng Bai, Yingjie Cai, Bingbing Liu, Shuguang Cui, Zhen Li

机构 * CUHK-Shenzhen(香港中文大学(深圳)) SSE(深圳大学) HKUST(香港科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10510 2025-05-23 cs.LG

SmoothCache: A Universal Inference Acceleration Technique for Diffusion Transformers

Joseph Liu, Joshua Geddes, Ziyu Guo, Haomiao Jiang, Mahesh Kumar Nandwana

机构 * Roblox(Roblox公司) Queen’s University(女王大学)

Comments Code can be found at https://github.com/Roblox/SmoothCache. Accepted at CVPR eLVM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01237 2025-05-22 cs.MM cs.CV cs.SD eess.AS

CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment

Edson Araujo, Andrew Rouditchenko, Yuan Gong, Saurabhchand Bhati, Samuel Thomas, Brian Kingsbury, Leonid Karlinsky, Rogerio Feris, James R. Glass, Hilde Kuehne

机构 * Goethe University of Frankfurt(法兰克福歌德大学) MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

Comments To be published at CVPR 2025, code available at https://github.com/edsonroteia/cav-mae-sync

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15414 2025-05-22 cs.CV

Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks

Uranik Berisha, Jens Mehnert, Alexandru Paul Condurache

机构 * Automated Driving Research, Robert Bosch GmbH(罗伯特博世集团自动化驾驶研究部) Institute for Signal Processing, University of Lübeck(吕贝克大学信号处理研究所)

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14638 2025-05-21 cs.CV cs.CL cs.LG

Dual Precision Quantization for Efficient and Accurate Deep Neural Networks Inference

Tomer Gafni, Asaf Karnieli, Yair Hanani

机构 * Intel, Israel(英特尔(以色列))

Comments Accepted at eLVM Workshop, CVPR, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14541 2025-05-21 eess.IV cs.CV

Neural Video Compression with Context Modulation

Chuanbo Tang, Zhuoyuan Li, Yifan Bian, Li Li, Dong Liu

机构 * MOE Key Laboratory of Brain-Inspired Intelligent Perception and Cognition(脑启发智能感知与认知MOE实验室)

Comments 11 pages, 8 figures, accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16282 2025-05-21 cs.CV

Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language Model

Zhaochong An, Guolei Sun, Yun Liu, Runjia Li, Junlin Han, Ender Konukoglu, Serge Belongie

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) Computer Vision Laboratory, ETH Zurich(苏黎世联邦理工学院计算机视觉实验室) College of Computer Science, Nankai University(南开大学计算机学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系)

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14028 2025-05-21 cs.CV

OmniStyle: Filtering High Quality Style Transfer Data at Scale

Ye Wang, Ruiqi Liu, Jiang Lin, Fei Liu, Zili Yi, Yilin Wang, Rui Ma

机构 * Jilin University(吉林大学) Nanjing University(南京大学) ByteDance(字节跳动) Adobe Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China Project page(知识驱动人机智能工程研究中心,中国)

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13788 2025-05-21 cs.CV

Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels

Yongshuo Zong, Qin Zhang, Dongsheng An, Zhihua Li, Xiang Xu, Linghan Xu, Zhuowen Tu, Yifan Xing, Onkar Dabeer

机构 * University of Edinburgh(爱丁堡大学) AWS AI Labs(AWS人工智能实验室)

Comments Accepted to CVPR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13437 2025-05-20 cs.CV cs.AI

FinePhys: Fine-grained Human Action Generation by Explicitly Incorporating Physical Laws for Effective Skeletal Guidance

Dian Shao, Mingfei Shi, Shengda Xu, Haodong Chen, Yongle Huang, Binglu Wang

机构 * Unmanned System Research Institute, Northwestern Polytechnical University, Xi’an, China(无人系统研究院、西北工业大学、西安,中国) School of Software, Northwestern Polytechnical University, Xi’an, China(软件学院、西北工业大学、西安,中国) School of Automation, Northwestern Polytechnical University, Xi’an, China(自动化学院、西北工业大学、西安,中国) School of Astronautics, Northwestern Polytechnical University, Xi’an, China(航天学院、西北工业大学、西安,中国)

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12854 2025-05-20 cs.CV

The Way Up: A Dataset for Hold Usage Detection in Sport Climbing

Anna Maschek, David C. Schedl

机构 * University of Applied Sciences Upper Austria(上奥地利应用科技大学)

Comments accepted at the International Workshop on Computer Vision in Sports (CVsports) at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12745 2025-05-20 cs.LG cs.AI

PEER pressure: Model-to-Model Regularization for Single Source Domain Generalization

Dong Kyu Cho, Inwoo Hwang, Sanghack Lee

机构 * New York University(纽约大学) Columbia University(哥伦比亚大学) Seoul National University(首尔国立大学)

Comments 21 pages, 9 figures, Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10412 2025-05-20 cs.LG cs.AI

dFLMoE: Decentralized Federated Learning via Mixture of Experts for Medical Data Analysis

Luyuan Xie, Tianyu Luan, Wenyuan Cai, Guochen Yan, Zhaoyu Chen, Nan Xi, Yuejian Fang, Qingni Shen, Zhonghai Wu, Junsong Yuan

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) PKU-OCTA Laboratory for Blockchain and Privacy Computing(区块链与隐私计算实验室) National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心) State University of New York at Buffalo(纽约州立大学布法罗分校)

Comments Accapted by CVPR 2025

Journal ref Accapted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16401 2025-05-20 cs.CV cs.LG

Understanding the Effect of using Semantically Meaningful Tokens for Visual Representation Learning

Neha Kalibhat, Priyatham Kattakinda, Sumit Nawathe, Arman Zarei, Nikita Seleznev, Samuel Sharpe, Senthil Kumar, Soheil Feizi

Comments Published at CVPR Workshops 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12685 2025-05-20 cs.CV

Mamba-Adaptor: State Space Model Adaptor for Visual Recognition

Fei Xie, Jiahao Nie, Yujin Tang, Wenkang Zhang, Hongshen Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Hangzhou Dianzi University(杭州电子科技大学) Southeast University(东南大学)

Comments CVPR paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12632 2025-05-20 cs.CV cs.AI cs.CL cs.LG

Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents

Yunseok Jang, Yeda Song, Sungryull Sohn, Lajanugen Logeswaran, Tiange Luo, Dong-Ki Kim, Kyunghoon Bae, Honglak Lee

机构 * University of Michigan(密歇根大学) LG AI Research(LG人工智能研究)

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12630 2025-05-20 cs.CV cs.AI

Degradation-Aware Feature Perturbation for All-in-One Image Restoration

Xiangpeng Tian, Xiangyu Liao, Xiao Liu, Meng Li, Chao Ren

机构 * College of Electronics and Information Engineering, Sichuan University(电子信息工程学院,四川大学)

Comments Accepted to CVPR 2025. 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12486 2025-05-20 cs.CV

Guiding Diffusion with Deep Geometric Moments: Balancing Fidelity and Variation

Sangmin Jung, Utkarsh Nath, Yezhou Yang, Giulia Pedrielli, Joydeep Biswas, Amy Zhang, Hassan Ghasemzadeh, Pavan Turaga

机构 * Arizona State University(亚利桑那州立大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

Comments Accepted in CVPR Workshop GMCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12154 2025-05-20 cs.CV cs.SD eess.AS

Learning to Highlight Audio by Watching Movies

Chao Huang, Ruohan Gao, J. M. F. Tsang, Jan Kurcius, Cagdas Bilen, Chenliang Xu, Anurag Kumar, Sanjeel Parekh

机构 * University of Rochester(罗切斯特大学) University of Maryland, College Park(马里兰大学学院公园分校) Meta Reality Labs Research(Meta现实实验室)

Comments CVPR 2025. Project page: https://wikichao.github.io/VisAH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12137 2025-05-20 cs.LG cond-mat.mtrl-sci

Understanding the Capabilities of Molecular Graph Neural Networks in Materials Science Through Multimodal Learning and Physical Context Encoding

Can Polat, Hasan Kurban, Erchin Serpedin, Mustafa Kurban

机构 * Dept. of Electrical and Computer Engineering, Texas A&M University, College Station, TX 77843, USA(电气与计算机工程系,德克萨斯A&M大学) College of Science and Engineering, Hamad Bin Khalifa University, Doha, Qatar(科学与工程学院,哈马德·本·卡西姆大学) Dept. of Prosthetics and Orthotics, Ankara University, Ankara, Turkey(假肢与矫形学系,安卡拉大学)

Comments Accepted Spotlight Paper at CVPR 2025 for MM4Mat

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11934 2025-05-20 cs.CV

iSegMan: Interactive Segment-and-Manipulate 3D Gaussians

Yian Zhao, Wanshi Xu, Ruochong Zheng, Pengchong Qiao, Chang Liu, Jie Chen

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院) Pengcheng Laboratory, Shenzhen, China(鹏城实验室) AI for Science (AI4S)-Preferred Program, Peking University Shenzhen Graduate School, China(北京大学深圳研究生院) Department of Automation and BNRist, Tsinghua University, Beijing, China(清华大学自动化系)

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11800 2025-05-20 cs.CV eess.IV

Self-Learning Hyperspectral and Multispectral Image Fusion via Adaptive Residual Guided Subspace Diffusion Model

Jian Zhu, He Wang, Yang Xu, Zebin Wu, Zhihui Wei

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology, Nanjing, China(计算机科学与工程学院,南京理工大学,南京,中国)

Comments cvpr

详情

展开后加载摘要…

URL PDF HTML 收藏