arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11877
2503.19443 2025-03-27 cs.CV

COB-GS: Clear Object Boundaries in 3DGS Segmentation Based on Boundary-Adaptive Gaussian Splitting

Jiaxin Zhang, Junjun Jiang, Youyu Chen, Kui Jiang, Xianming Liu

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19357 2025-03-27 cs.CV

Correcting Deviations from Normality: A Reformulated Diffusion Model for Multi-Class Unsupervised Anomaly Detection

Farzad Beizaee, Gregory A. Lodygensky, Christian Desrosiers, Jose Dolz

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14945 2025-03-27 cs.CV

Generating Multimodal Driving Scenes via Next-Scene Prediction

Yanhao Wu, Haoyang Zhang, Tianwei Lin, Lichao Huang, Shujie Luo, Rui Wu, Congpei Qiu, Wei Ke, Tong Zhang

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08497 2025-03-27 cs.LG cs.CV

MMRL: Multi-Modal Representation Learning for Vision-Language Models

Yuncheng Guo, Xiaodong Gu

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05186 2025-03-27 cs.CV

Narrating the Video: Boosting Text-Video Retrieval via Comprehensive Utilization of Frame-Level Captions

Chan Hur, Jeong-hun Hong, Dong-hun Lee, Dabin Kang, Semin Myeong, Sang-hyo Park, Hyeyoung Park

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16550 2025-03-27 cs.GR cs.CV

PhysAnimator: Physics-Guided Generative Cartoon Animation

Tianyi Xie, Yiwei Zhao, Ying Jiang, Chenfanfu Jiang

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18597 2025-03-27 cs.CV cs.AI cs.MM

DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation

Minghong Cai, Xiaodong Cun, Xiaoyu Li, Wenze Liu, Zhaoyang Zhang, Yong Zhang, Ying Shan, Xiangyu Yue

Comments CVPR 2025; 21 pages, 23 figures, Project page: https://onevfall.github.io/project_page/ditctrl ; GitHub repository: https://github.com/TencentARC/DiTCtrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08687 2025-03-27 cs.CV

VisionArena: 230K Real World User-VLM Conversations with Preference Labels

Christopher Chou, Lisa Dunlap, Koki Mashita, Krishna Mandal, Trevor Darrell, Ion Stoica, Joseph E. Gonzalez, Wei-Lin Chiang

Comments updated for CVPR Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04234 2025-03-27 cs.CV cs.AI

DEIM: DETR with Improved Matching for Fast Convergence

Shihua Huang, Zhichao Lu, Xiaodong Cun, Yongjun Yu, Xiao Zhou, Xi Shen

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02071 2025-03-27 cs.CV

Progress-Aware Video Frame Captioning

Zihui Xue, Joungbin An, Xitong Yang, Kristen Grauman

Comments Accepted by CVPR 2025, Project website: https://vision.cs.utexas.edu/projects/ProgressCaptioner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01814 2025-03-27 cs.CV cs.AI cs.CL cs.LG

COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training

Sanghwan Kim, Rui Xiao, Mariana-Iuliana Georgescu, Stephan Alaniz, Zeynep Akata

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17440 2025-03-27 cs.CV cs.MM

Identity-Preserving Text-to-Video Generation by Frequency Decomposition

Shenghai Yuan, Jinfa Huang, Xianyi He, Yunyuan Ge, Yujun Shi, Liuhan Chen, Jiebo Luo, Li Yuan

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16805 2025-03-27 cs.AI cs.CV

Human Motion Instruction Tuning

Lei Li, Sen Jia, Jianhao Wang, Zhongyu Jiang, Feng Zhou, Ju Dai, Tianfang Zhang, Zongkai Wu, Jenq-Neng Hwang

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16129 2025-03-27 cs.CV

Three Cars Approaching within 100m! Enhancing Distant Geometry by Tri-Axis Voxel Scanning for Camera-based Semantic Scene Completion

Jongseong Bae, Junwoo Ha, Ha Young Kim

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09390 2025-03-27 cs.CV cs.LG

LLAVIDAL: A Large LAnguage VIsion Model for Daily Activities of Living

Dominick Reilly, Rajatsubhra Chakraborty, Arkaprava Sinha, Manish Kumar Govind, Pu Wang, Francois Bremond, Le Xue, Srijan Das

Comments CVPR 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04910 2025-03-27 cs.CV

MonoTAKD: Teaching Assistant Knowledge Distillation for Monocular 3D Object Detection

Hou-I Liu, Christine Wu, Jen-Hao Cheng, Wenhao Chai, Shian-Yun Wang, Gaowen Liu, Hugo Latapie, Jhih-Ciang Wu, Jenq-Neng Hwang, Hong-Han Shuai, Wen-Huang Cheng

Comments Accepted by CVPR 2025. Our code is available at https://github.com/hoiliu-0801/MonoTAKD

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06370 2025-03-27 cs.CV

Robust Multiview Multimodal Driver Monitoring System Using Masked Multi-Head Self-Attention

Yiming Ma, Victor Sanchez, Soodeh Nikan, Devesh Upadhyay, Bhushan Atote, Tanaya Guha

Comments 9 pages (1 for reference); accepted by the 6th Multimodal Learning and Applications Workshop (MULA) at CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19916 2025-03-26 cs.CV cs.RO

EventFly: Event Camera Perception from Ground to the Sky

Lingdong Kong, Dongyue Lu, Xiang Xu, Lai Xing Ng, Wei Tsang Ooi, Benoit R. Cottereau

Comments CVPR 2025; 30 pages, 8 figures, 16 tables; Project Page at https://event-fly.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19913 2025-03-26 cs.CV

PartRM: Modeling Part-Level Dynamics with Large Cross-State Reconstruction Model

Mingju Gao, Yike Pan, Huan-ang Gao, Zongzheng Zhang, Wenyi Li, Hao Dong, Hao Tang, Li Yi, Hao Zhao

Comments Accepted to CVPR 2025. Project Page: https://partrm.c7w.tech/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19910 2025-03-26 cs.CV cs.IR

CoLLM: A Large Language Model for Composed Image Retrieval

Chuong Huynh, Jinyu Yang, Ashish Tawari, Mubarak Shah, Son Tran, Raffay Hamid, Trishul Chilimbi, Abhinav Shrivastava

Comments CVPR 2025. Project page: https://collm-cvpr25.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19904 2025-03-26 cs.CV cs.LG

Tracktention: Leveraging Point Tracking to Attend Videos Faster and Better

Zihang Lai, Andrea Vedaldi

Comments CVPR 2025. Project website: zlai0.github.io/TrackTention

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19897 2025-03-26 cs.CV

Scaling Down Text Encoders of Text-to-Image Diffusion Models

Lifu Wang, Daqing Liu, Xinchen Liu, Xiaodong He

Comments accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19881 2025-03-26 cs.CV

Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation

Tianhao Qi, Jianlong Yuan, Wanquan Feng, Shancheng Fang, Jiawei Liu, SiYu Zhou, Qian He, Hongtao Xie, Yongdong Zhang

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07761 2025-03-26 cs.CV

Repurposing Pre-trained Video Diffusion Models for Event-based Video Interpolation

Jingxi Chen, Brandon Y. Feng, Haoming Cai, Tianfu Wang, Levi Burner, Dehao Yuan, Cornelia Fermuller, Christopher A. Metzler, Yiannis Aloimonos

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17646 2025-03-26 cs.CV

SAMWISE: Infusing Wisdom in SAM2 for Text-Driven Video Segmentation

Claudia Cuttano, Gabriele Trivigno, Gabriele Rosi, Carlo Masone, Giuseppe Averta

Comments CVPR 2025. Project page: https://claudiacuttano.github.io/SAMWISE

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08083 2025-03-26 cs.CV

MambaVision: A Hybrid Mamba-Transformer Vision Backbone

Ali Hatamizadeh, Jan Kautz

Comments Accepted to CVPR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04314 2025-03-26 cs.CV

Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization

Zhanhao Liang, Yuhui Yuan, Shuyang Gu, Bohan Chen, Tiankai Hang, Mingxi Cheng, Ji Li, Liang Zheng

Comments CVPR 2025. Project Page: https://rockeycoss.github.io/spo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19783 2025-03-26 cs.CV

Fine-Grained Erasure in Text-to-Image Diffusion-based Foundation Models

Kartik Thakral, Tamar Glaser, Tal Hassner, Mayank Vatsa, Richa Singh

Comments Published in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19731 2025-03-26 cs.CV

PCM : Picard Consistency Model for Fast Parallel Sampling of Diffusion Models

Junhyuk So, Jiwoong Shin, Chaeyeon Jang, Eunhyeok Park

Comments Accepted to the CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19673 2025-03-26 cs.GR cs.CV

MultimodalStudio: A Heterogeneous Sensor Dataset and Framework for Neural Rendering across Multiple Imaging Modalities

Federico Lincetto, Gianluca Agresti, Mattia Rossi, Pietro Zanuttigh

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏