arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-12 至 2026-01-12 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2 篇

2504.17816 2026-01-12 cs.CV eess.IV 81%

Subject-driven Video Generation via Disentangled Identity and Motion

通过解耦身份和运动实现主体驱动的视频生成

Daneul Kim, Jingxu Zhang, Wonjoon Jin, Sunghyun Cho, Qi Dai, Jaesik Park, Chong Luo

机构 * Seoul National University(首尔国立大学) POSTECH Microsoft Research Asia(微软亚洲研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

AI总结 本文提出一种通过解耦身份和运动实现主体驱动视频生成的方法,在零样本条件下优于现有模型。

Comments [v2 updated] Project Page : https://carpedkm.github.io/projects/disentangled_sub/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21541 2026-01-12 cs.CV 79%

Video Generation Models Are Good Latent Reward Models

视频生成模型是良好的潜在奖励模型

Xiaoyue Mi, Wenqing Yu, Jiesong Lian, Shibo Jie, Ruizhe Zhong, Zijun Liu, Guozhen Zhang, Zixiang Zhou, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PRFL框架,利用预训练视频生成模型在噪声潜在空间中进行奖励建模,实现高效去噪和降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏