arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-12 至 2026-01-12 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2601.05495 2026-01-12 cs.CV cs.CL 83%

MMViR: A Multi-Modal and Multi-Granularity Representation for Long-range Video Understanding

MMViR:一种多模态和多粒度表示用于长视频理解

Zizhong Li, Haopeng Zhang, Jiawei Zhang

机构 * IFM Lab, University of California, Davis(加州大学戴维斯分校信息融合实验室) ALOHA Lab, University of Hawaii at Mānoa(夏威夷大学马诺阿分校ALOHA实验室)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 MMViR通过多模态和多粒度表示提升长视频理解,实现更高效的检索和更优的性能表现。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05511 2026-01-12 cs.CV 57%

GaussianSwap: Animatable Video Face Swapping with 3D Gaussian Splatting

GaussianSwap: 基于3D高斯点云的可动画视频人脸交换

Xuan Cheng, Jiahao Rao, Chengyang Li, Wenhao Wang, Weilin Chen, Lvqing Yang

机构 * School of Informatics, Xiamen University(信息学院,厦门大学)

专题命中 视频理解 :video generation(abstract);分类 cs.CV

AI总结 GaussianSwap通过3D高斯点云构建可动画视频人脸交换虚拟角色,实现身份保持与高保真视觉效果,支持交互式应用。

详情

展开后加载摘要…

URL PDF HTML 收藏