arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-10-10 至 2025-10-10 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 4 篇

2510.07345 2025-10-10 q-bio.QM cs.AI eess.IV 83%

Mitigating Surgical Data Imbalance with Dual-Prediction Video Diffusion Model

Danush Kumar Venkatesh, Adam Schmidt, Muhammad Abdullah Jamal, Omid Mohareri

机构 * a Department of Translational Surgical Oncology, NCT/UCC Dresden, a partnership between DKFZ, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden,HZDR, Germany(a 转化外科肿瘤学部,NCT/UCC 德累斯顿,DKFZ、医学院和卡尔·古斯塔夫·卡尔斯医院、德累斯顿技术大学、HZDR 的联合体,德国) b Intuitive Surgical, Inc., Sunnyvale, CA, United States(b 直觉手术公司,美国加利福尼亚州 Sunnyvale)

专题命中 视频扩散模型 :video diffusion(title,abstract);video understanding(abstract);分类 eess.IV

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08530 2025-10-10 cs.GR cs.CV 70%

X2Video: Adapting Diffusion Models for Multimodal Controllable Neural Video Rendering

Zhitong Huang, Mohan Zhang, Renhan Wang, Rui Tang, Hao Zhu, Jing Liao

机构 * City University of Hong Kong(香港城市大学) WeChat, Tencent Inc(微信、腾讯公司) Manycore Tech Inc(很多核科技公司)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

Comments Code, model, and dataset will be released at project page soon: https://luckyhzt.github.io/x2video

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07654 2025-10-10 cs.CV 57%

Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance Injection

Yanjie Pan, Qingdong He, Lidong Wang, Bo Peng, Mingmin Chi

机构 * School of computer science, Shanghai key laboratory of data science, Fudan University, China(计算机学院、数据科学重点实验室、复旦大学) Tencent Youtu Lab, China(腾讯优图实验室) Shanghai Ocean University, China(上海海洋大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 5 pages (including references), 4 figures. Code and models will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15742 2025-10-10 cs.CV 57%

Uncertainty-Aware Diffusion Guided Refinement of 3D Scenes

Sarosij Bose, Arindam Dutta, Sayak Nag, Junge Zhang, Jiachen Li, Konstantinos Karydis, Amit K. Roy Chowdhury

机构 * University of California, Riverside, USA(加州大学河滨分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏