arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-12 至 2026-01-12 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2601.05495 2026-01-12 cs.CV cs.CL 83%

MMViR: A Multi-Modal and Multi-Granularity Representation for Long-range Video Understanding

MMViR:一种多模态和多粒度表示用于长视频理解

Zizhong Li, Haopeng Zhang, Jiawei Zhang

机构 * IFM Lab, University of California, Davis(加州大学戴维斯分校信息融合实验室) ALOHA Lab, University of Hawaii at Mānoa(夏威夷大学马诺阿分校ALOHA实验室)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 MMViR通过多模态和多粒度表示提升长视频理解,实现更高效的检索和更优的性能表现。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05511 2026-01-12 cs.CV 57%

GaussianSwap: Animatable Video Face Swapping with 3D Gaussian Splatting

GaussianSwap: 基于3D高斯点云的可动画视频人脸交换

Xuan Cheng, Jiahao Rao, Chengyang Li, Wenhao Wang, Weilin Chen, Lvqing Yang

机构 * School of Informatics, Xiamen University(信息学院,厦门大学)

专题命中 视频理解 :video generation(abstract);分类 cs.CV

AI总结 GaussianSwap通过3D高斯点云构建可动画视频人脸交换虚拟角色,实现身份保持与高保真视觉效果,支持交互式应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2504.17816 2026-01-12 cs.CV eess.IV 81%

Subject-driven Video Generation via Disentangled Identity and Motion

通过解耦身份和运动实现主体驱动的视频生成

Daneul Kim, Jingxu Zhang, Wonjoon Jin, Sunghyun Cho, Qi Dai, Jaesik Park, Chong Luo

机构 * Seoul National University(首尔国立大学) POSTECH Microsoft Research Asia(微软亚洲研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

AI总结 本文提出一种通过解耦身份和运动实现主体驱动视频生成的方法,在零样本条件下优于现有模型。

Comments [v2 updated] Project Page : https://carpedkm.github.io/projects/disentangled_sub/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21541 2026-01-12 cs.CV 79%

Video Generation Models Are Good Latent Reward Models

视频生成模型是良好的潜在奖励模型

Xiaoyue Mi, Wenqing Yu, Jiesong Lian, Shibo Jie, Ruizhe Zhong, Zijun Liu, Guozhen Zhang, Zixiang Zhou, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PRFL框架,利用预训练视频生成模型在噪声潜在空间中进行奖励建模,实现高效去噪和降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2601.05722 2026-01-12 cs.CV 83%

Rotate Your Character: Revisiting Video Diffusion Models for High-Quality 3D Character Generation

旋转你的角色:重新审视视频扩散模型用于高质量3D角色生成

Jin Wang, Jianxiang Lu, Comi Chen, Guangzheng Xu, Haoyu Yang, Peng Chen, Na Zhang, Yifan Xu, Longhuang Wu, Shuai Shao, Qinglin Lu, Ping Luo

机构 * Hunyuan, Tencent(腾讯文予实验室) The University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出RCM模型,通过旋转角色姿势实现高质量3D角色生成和新视角合成,支持多视角输入和高分辨率视频生成。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21855 2026-01-12 cs.CV 83%

ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling

ReVision: 通过显式3D运动建模改进视频扩散

Qihao Liu, Ju He, Qihang Yu, Liang-Chieh Chen, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 ReVision通过整合参数化的3D运动模型,提升视频生成中复杂动作和交互的真实性和可控性。

Comments TMLR camera-ready version. Project Page: https://revision-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏