arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-17 至 2025-12-17 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 3 篇

2512.04540 2025-12-17 cs.CV 88%

VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management

VideoMem: 通过自适应内存管理增强超长视频理解

Hongbo Jin, Qingyuan Wang, Wenhao Zhang, Yang Liu, Sijie Cheng

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 VideoMem通过自适应内存管理框架,有效提升超长视频理解任务的性能,采用PRPO算法和两个核心模块实现高效训练和长期记忆保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14699 2025-12-17 cs.CV 79%

MemFlow: Flowing Adaptive Memory for Consistent and Efficient Long Video Narratives

MemFlow: 流动适应性记忆用于一致且高效的长视频叙述

Sihui Ji, Xi Chen, Shuai Yang, Xin Tao, Pengfei Wan, Hengshuang Zhao

机构 * HKU(香港大学) Kling Team, Kuaishou Technology(快手技术 Kling 团队) HKUST(GZ)(香港科技大学(广州))

专题命中 长视频与时序推理 :long video(title);video generation(abstract);分类 cs.CV

AI总结 MemFlow通过动态更新内存库和选择性激活令牌,实现长视频生成中的一致性和高效性。

Comments Project Page: https://sihuiji.github.io/MemFlow.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14284 2025-12-17 cs.CV 57%

SS4D: Native 4D Generative Model via Structured Spacetime Latents

SS4D:通过结构化时空潜在变量实现的原生4D生成模型

Zhibing Li, Mengchen Zhang, Tong Wu, Jing Tan, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Stanford University(斯坦福大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 SS4D通过结构化时空潜在变量实现原生4D生成模型,直接从单目视频合成动态3D物体,提升时间一致性和结构一致性。

Comments ToG(Siggraph Asia 2025)

Journal ref ACM Transactions on Graphics, 44(6): Article 244, 12 pages, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏