arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-10 至 2025-12-10 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 2 篇

2508.21058 2025-12-10 cs.GR cs.AI cs.CV 88%

Mixture of Contexts for Long Video Generation

上下文混合用于长视频生成

Shengqu Cai, Ceyuan Yang, Lvmin Zhang, Yuwei Guo, Junfei Xiao, Ziyan Yang, Yinghao Xu, Zhenheng Yang, Alan Yuille, Leonidas Guibas, Maneesh Agrawala, Lu Jiang, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出上下文混合(MoC)模块,通过稀疏注意力路由解决长视频生成中的长上下文记忆问题,提升模型在长序列中的效率与一致性。

Comments Project page: https://primecai.github.io/moc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07720 2025-12-10 cs.CV 70%

ViSA: 3D-Aware Video Shading for Real-Time Upper-Body Avatar Creation

ViSA: 一种3D感知的视频着色方法用于实时上半身数字人生成

Fan Yang, Heyuan Li, Peihao Li, Weihao Yuan, Lingteng Qiu, Chaoyue Song, Cheng Chen, Yisheng He, Shifeng Zhang, Xiaoguang Han, Steven Hoi, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 长视频与时序推理 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 ViSA结合3D重建与视频生成技术,实时生成高质量上半身数字人,减少模糊和僵硬问题,提升视觉质量。

Comments Project page: \url{https://lhyfst.github.io/visa}

详情

展开后加载摘要…

URL PDF HTML 收藏