arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-18 至 2025-12-18 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2 篇

2512.14938 2025-12-18 cs.CV cs.AI cs.MM cs.SD 84%

TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation

TalkVerse:民主化分钟级音频驱动视频生成

Zhenzhi Wang, Jian Wang, Ke Ma, Dahua Lin, Bing Zhou

机构 * The Chinese University of Hong Kong(香港中文大学) Snap Inc.(Snap公司)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV、cs.MM

AI总结 TalkVerse通过大规模开放数据和高效模型,实现了分钟级音频驱动视频生成,降低研究门槛,提升生成质量与效率。

Comments open-sourced single-person full-body talking video generation dataset, training code and checkpoints

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15716 2025-12-18 cs.CV cs.AI 79%

Spatia: Video Generation with Updatable Spatial Memory

基于可更新空间记忆的视频生成

Jinjing Zhao, Fangyun Wei, Zhening Liu, Hongyang Zhang, Chang Xu, Yan Lu

机构 * The University of Sydney(悉尼大学) Microsoft Research(微软研究院) HKUST(香港科技大学) University of Waterloo(滑铁卢大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Spatia通过可更新的空间记忆机制,实现视频生成中的长期空间与时间一致性,支持动态实体生成和3D交互编辑。

Comments Project page: https://zhaojingjing713.github.io/Spatia/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 1 篇

2512.15262 2025-12-18 eess.IV cs.MM 62%

Audio-Visual Cross-Modal Compression for Generative Face Video Coding

音频-视觉跨模态压缩用于生成式面部视频编码

Youmin Xu, Mengxi Guo, Shijie Zhao, Weiqi Li, Junlin Li, Li Zhang, Jian Zhang

专题命中 视频扩散模型 :video diffusion(abstract);分类 eess.IV、cs.MM

AI总结 本文提出AVCC框架,通过联合压缩音频和视频流,提升生成式面部视频编码的率-失真性能。

Comments Accepted as a PAPER and for publication in the DCC 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 2 篇

2512.15524 2025-12-18 cs.CV 57%

DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion Representations

DeX-Portrait: 通过显式和潜在运动表示实现解耦且表达性的肖像动画

Yuxiang Shi, Zhe Li, Yanwen Wang, Hao Zhu, Xun Cao, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究所) Nanjing University(南京大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 DeX-Portrait通过显式和潜在运动表示生成解耦且表达性的肖像动画,提升动画质量和可控性。

Comments Projectpage: https://syx132.github.io/DeX-Portrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15386 2025-12-18 cs.CV 57%

See It Before You Grab It: Deep Learning-based Action Anticipation in Basketball

在抓取之前看到它:基于深度学习的篮球运动预测

Arnau Barrera Roy, Albert Clapés Sintes

机构 * Universitat de Barcelona(巴塞罗那大学) Universitat de Barcelona Computer Vision Center(巴塞罗那大学计算机视觉中心)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出篮球动作预测任务,利用深度学习技术预测投篮后球权归属,构建了首个篮球反弹预测数据集,展示了该数据集在篮球视频理解中的广泛应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2512.15066 2025-12-18 cs.CV cs.AI 79%

Tracking spatial temporal details in ultrasound long video via wavelet analysis and memory bank

通过小波分析和记忆库实现超声长视频中空间时间细节的跟踪

Chenxiao Zhang, Runshi Zhang, Junchen Wang

机构 * School of Mechanical Engineering and Automation, Beihang University(机械工程与自动化学院,北航)

专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV

AI总结 本文提出基于记忆库的小波过滤和融合网络,用于提高超声长视频中细粒度空间特征提取和小物体分割的精度。

Comments Chenxiao Zhang and Runshi Zhang contributed equally to this work. 14 pages, 11 figures

Journal ref Medical Image Analysis 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2508.07981 2025-12-18 cs.CV cs.AI 57%

Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation

Omni-Effects: 统一且空间可控的视觉效果生成

Fangyuan Mao, Aiming Hao, Jintao Chen, Dongxia Liu, Xiaokun Feng, Jiashu Zhu, Meiqi Wu, Chubin Chen, Jiahong Wu, Xiangxiang Chu

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 Omni-Effects通过统一框架实现空间可控的多效果生成,结合LoRA-MoE和SAP技术,提升视觉效果生成的精度和多样性。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏