arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-16 至 2025-12-16 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 8 篇

2503.14505 2025-12-16 cs.CV cs.AI cs.LG 83%

MusicInfuser: Making Video Diffusion Listen and Dance

MusicInfuser: 使视频扩散模型听音乐并跳舞

Susung Hong, Ira Kemelmacher-Shlizerman, Brian Curless, Steven M. Seitz

机构 * University of Washington(华盛顿大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 MusicInfuser通过调整预训练视频扩散模型,使视频能与指定音乐同步生成舞蹈,无需运动数据,训练高效且泛化能力强。

Comments Project page: https://susunghong.github.io/MusicInfuser

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12375 2025-12-16 cs.CV 79%

V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping

V-Warper:通过价值扭曲实现外观一致的视频扩散个性化

Hyunkoo Lee, Wooseok Jang, Jini Yang, Taehwan Kim, Sangoh Kim, Sangwon Jung, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Korea University(韩国大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 V-Warper通过价值扭曲实现视频扩散模型的无训练粗到细个性化,提升外观一致性与生成质量。

Comments Project Page: https://cvlab-kaist.github.io/V-Warper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11203 2025-12-16 cs.CV 79%

AutoRefiner: Improving Autoregressive Video Diffusion Models via Reflective Refinement Over the Stochastic Sampling Path

AutoRefiner: 通过在随机采样路径上的反思细化改进自回归视频扩散模型

Zhengyang Yu, Akio Hayakawa, Masato Ishii, Qingtao Yu, Takashi Shibuya, Jing Zhang, Yuki Mitsufuji

机构 * Australian National University(澳大利亚国立大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 AutoRefiner通过路径噪声细化和反射式KV缓存改进AR-VDMs的样本保真度

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12080 2025-12-16 cs.CV cs.LG 79%

BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models

BAgger: 逆向聚合用于缓解自回归视频扩散模型中的漂移

Ryan Po, Eric Ryan Chan, Changan Chen, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video diffusion(title);text-to-video(abstract);分类 cs.CV

AI总结 BAgger通过自监督方法缓解自回归视频扩散模型中的漂移问题,利用标准分数或流匹配目标提升长期运动稳定性与视觉一致性。

Comments Project page here: https://ryanpo.com/bagger

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00227 2025-12-16 cs.CV cs.AI cs.RO 70%

Ctrl-Crash: Controllable Diffusion for Realistic Car Crashes

Ctrl-Crash: 可控扩散用于逼真汽车碰撞

Anthony Gosselin, Ge Ya Luo, Luis Lara, Florian Golemo, Derek Nowrouzezahrai, Liam Paull, Alexia Jolicoeur-Martineau, Christopher Pal

机构 * McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能 chair)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 Ctrl-Crash通过可控扩散生成逼真汽车碰撞视频,提升交通安全模拟的可控性和真实性。

Comments Under review at Pattern Recognition Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13690 2025-12-16 cs.CV cs.AI cs.GR cs.LG 57%

DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders

DiffusionBrowser: 通过多分支解码器实现交互式扩散预览

Susung Hong, Chongjian Ge, Zhifei Zhang, Jui-Hsien Wang

机构 * University of Washington(华盛顿大学) Adobe Research(Adobe研究)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DiffusionBrowser通过多分支解码器实现交互式视频生成预览,提升生成效率与可控性。

Comments Project page: https://susunghong.github.io/DiffusionBrowser

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13290 2025-12-16 cs.CV cs.AI cs.LG 57%

LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models

LINA: 为扩散模型中的物理对齐和泛化学习适应性干预

Shu Yu, Chaochao Lu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 LINA通过学习适应性干预,提升扩散模型在物理对齐和超出分布指令跟随方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12508 2025-12-16 cs.CV cs.LG 57%

Generative Spatiotemporal Data Augmentation

生成性时空数据增强

Jinfan Zhou, Lixin Luo, Sungmin Eum, Heesung Kwon, Jeong Joon Park

机构 * University of Chicago(芝加哥大学) University of Michigan, Ann Arbor(安娜堡大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出利用视频扩散模型生成时空数据以增强模型性能,尤其在数据稀缺情况下提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏