arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-11-26 至 2025-11-26 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 2 篇

2505.23738 2025-11-26 cs.CV cs.GR 70%

How Animals Dance (When You're Not Looking)

动物跳舞(当你不在看的时候)

Xiaojuan Wang, Aleksander Holynski, Brian Curless, Ira Kemelmacher, Steve Seitz

机构 * University of Washington(华盛顿大学) Columbia University(哥伦比亚大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 该研究提出了一种生成音乐同步且具有舞蹈意识的动物跳舞视频的框架,通过引入舞蹈模式和图优化问题实现高效舞蹈合成。

Comments Project page: https://how-animals-dance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16565 2025-11-26 cs.CV 57%

M2SVid: End-to-End Inpainting and Refinement for Monocular-to-Stereo Video Conversion

M2SVid:单目到立体视频转换的端到端修复与细化

Nina Shvetsova, Goutam Bhat, Prune Truong, Hilde Kuehne, Federico Tombari

机构 * Google(谷歌) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学) Goethe University Frankfurt(法兰克福歌德大学) MPI for Informatics, Saarland Informatics Campus(信息研究所,萨尔兰信息校区) Technical University of Munich(慕尼黑技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 M2SVid通过端到端修复和细化技术,实现单目到立体视频转换,生成高质量右视图并提升效率。

Comments To be published at 3DV 2026, project webpage https://m2svid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏