arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-17 至 2026-02-17 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 5 篇

2601.13190 2026-02-17 cs.LG physics.flu-dyn 82%

LAViG-FLOW: Latent Autoregressive Video Generation for Fluid Flow Simulations

LAViG-FLOW:用于流体流动模拟的潜在自回归视频生成

Vittoria De Pellegrini, Tariq Alkhalifah

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract)

AI总结 LAViG-FLOW通过潜在自回归视频生成框架高效模拟流体流动,实现比传统方法快百倍的饱和度和压力场生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14941 2026-02-17 cs.CV cs.AI 79%

AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories

AnchorWeave: 通过检索的局部空间记忆实现世界一致的视频生成

Zun Wang, Han Lin, Jaehong Yoon, Jaemin Cho, Yue Zhang, Mohit Bansal

机构 * Department of Computer Science, University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AnchorWeave通过检索局部空间记忆提升视频生成的长期场景一致性与视觉质量。

Comments Project website: https://zunwang1.github.io/AnchorWeave

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13637 2026-02-17 cs.CV 79%

DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation

DCDM:分而治之扩散模型用于保持一致性视频生成

Haoyu Zhao, Yuang Zhang, Junqi Cheng, Jiaxi Gu, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DCDM通过分而治之的扩散模型,解决视频生成中的语义、几何和身份一致性问题,提升视频生成的连贯性和可控性。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03796 2026-02-17 cs.CV 79%

3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation

面向视图自适应的人体视频生成的3D感知隐式运动控制

Zhixue Fang, Xu He, Songlin Tang, Haoxian Zhang, Qingfeng Li, Xiaoqiang Liu, Pengfei Wan, Kun Gai

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) Tsinghua University(清华大学) CASIA

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 3DiMo通过隐式运动表示和视图丰富监督,提升视频生成中的人体运动保真度和视觉质量。

Comments Project Page: https://hjrphoebus.github.io/3DiMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14902 2026-02-17 cs.IR cs.CV 57%

U-MARVEL: Unveiling Key Factors for Universal Multimodal Retrieval via Embedding Learning with MLLMs

通过嵌入学习与大语言模型揭示通用多模态检索的关键因素:U-MARVEL

Xiaojie Li, Chu Li, Shi-Zhe Chen, Xi Chen

机构 * Tencent PCG(腾讯PCG) Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 U-MARVEL通过嵌入学习与大语言模型揭示通用多模态检索的关键因素,实现超越现有方法的性能。

Comments Accepted to ICLR 2026

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏