arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-08-20 至 2025-08-20 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2 篇

2508.14033 2025-08-20 cs.CV 74%

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Shaoshu Yang, Zhe Kong, Feng Gao, Meng Cheng, Xiangyu Liu, Yong Zhang, Zhuoliang Kang, Wenhan Luo, Xunliang Cai, Ran He, Xiaoming Wei

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Meituan New Laboratory of Pattern Recognition (NLPR), CASIA(美团模式识别新实验室(NLPR),中国科学院自动化所) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Meituan Division of AMC and Department of ECE, HKUST(美团AMC部门和香港科技大学电子与计算机工程系) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中国科学院自动化所) Meituan School of Artificial Intelligence, University of Chinese Academy of Sciences(美团人工智能学院,中国科学院大学) Meituan(美团)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13797 2025-08-20 cs.GR cs.CV 57%

Sketch3DVE: Sketch-based 3D-Aware Scene Video Editing

Feng-Lin Liu, Shi-Yang Li, Yan-Pei Cao, Hongbo Fu, Lin Gao

机构 * Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Hong Kong University of Science(香港科学大学)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

Comments SIGGRAPH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏