arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-05 至 2025-12-05 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 3 篇

2512.05081 2025-12-05 cs.CV 88%

Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative Compression

深度强制:免训练 长视频生成与深度Sink和参与性压缩

Jung Yi, Wooseok Jang, Paul Hyunbin Cho, Jisu Nam, Heeji Yoon, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title);video diffusion(abstract);分类 cs.CV

AI总结 深度强制通过深度Sink和参与性压缩机制,在无需微调的情况下实现长视频生成,提升生成质量与动态效果。

Comments Project Page: https://cvlab-kaist.github.io/DeepForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04519 2025-12-05 cs.CV 88%

VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory

VideoSSM:基于混合状态-空间记忆的自回归长视频生成

Yifei Yu, Xiaoshan Wu, Xinting Hu, Tao Hu, Yangtian Sun, Xiaoyang Lyu, Bo Wang, Lin Ma, Yuewen Ma, Zhongrui Wang, Xiaojuan Qi

机构 * HKU(香港大学) PICO, ByteDance(字节跳动PICO) SUSTech(南方科技大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 VideoSSM通过结合自回归扩散与混合状态空间记忆,实现了具有全局一致性和运动稳定性的长视频生成,支持提示自适应交互并提升内容多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04515 2025-12-05 cs.CV 83%

EgoLCD: Egocentric Video Generation with Long Context Diffusion

EgoLCD:基于长上下文扩散的自体视频生成

Liuzhou Zhang, Jiarui Ye, Yuanlei Wang, Ming Zhong, Mingju Cao, Wanke Xia, Bowen Zeng, Zeyu Zhang, Hao Tang

机构 * Peking University(北京大学) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 EgoLCD通过结合长时稀疏KV缓存和LoRA扩展的注意力机制,实现了高效稳定的自体长上下文视频生成,提升了感知质量和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏