arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-11-04 至 2025-11-04 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 3 篇

2510.24448 2025-11-04 cs.CV cs.AI 57%

Rethinking Visual Intelligence: Insights from Video Pretraining

Pablo Acuaviva, Aram Davtyan, Mariam Hassan, Sebastian Stapf, Ahmad Rahimi, Alexandre Alahi, Paolo Favaro

机构 * Computer Vision Group, University of Bern(伯尔尼大学计算机视觉组) VITA Lab, EPFL(苏黎世联邦理工学院VITA实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Updated version from preprint arXiv:2506.07280 (Gen2Gen) focused on visual intelligence. This work can be considered as v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08271 2025-11-04 cs.GR cs.CV cs.LG 57%

SViM3D: Stable Video Material Diffusion for Single Image 3D Generation

Andreas Engelhardt, Mark Boss, Vikram Voleti, Chun-Han Yao, Hendrik P. A. Lensch, Varun Jampani

机构 * Stability AI University of Tübingen(图宾根大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by International Conference on Computer Vision (ICCV 2025). Project page: http://svim3d.aengelhardt.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02608 2025-11-04 cs.LG physics.flu-dyn 50%

Lost in Latent Space: An Empirical Study of Latent Diffusion Models for Physics Emulation

François Rozet, Ruben Ohana, Michael McCabe, Gilles Louppe, François Lanusse, Shirley Ho

机构 * Polymathic AI Flatiron Institute University of Liège(列日大学) New York University(纽约大学) Princeton University(普林斯顿大学) Université Paris-Saclay, Université Paris Cité, CEA, CNRS, AIM(巴黎-萨克莱大学、巴黎-cite大学、CEA、CNRS、AIM)

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏