arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-10-22 至 2025-10-22 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2 篇

2510.18692 2025-10-22 cs.CV 88%

MoGA: Mixture-of-Groups Attention for End-to-End Long Video Generation

Weinan Jia, Yuning Lu, Mengqi Huang, Hualiang Wang, Binyuan Huang, Nan Chen, Mu Liu, Jidong Jiang, Zhendong Mao

机构 * University of Science and Technology of China(科学技术大学) Hong Kong University of Science and Technology(香港科学与技术大学) Wuhan University(武汉大学)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18775 2025-10-22 cs.CV 79%

UltraGen: High-Resolution Video Generation with Hierarchical Attention

Teng Hu, Jiangning Zhang, Zihan Su, Ran Yi

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频数据与评测 1 篇

2510.17305 2025-10-22 cs.CV cs.MM 81%

LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding

ZhaoYang Han, Qihan Lin, Hao Liang, Bowen Chen, Zhou Liu, Wentao Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学)

专题命中 视频数据与评测 :video understanding(title);long video(abstract);分类 cs.CV、cs.MM

Comments Submitted to ARR Rolling Review

详情

展开后加载摘要…

URL PDF HTML 收藏