arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-09-11 至 2025-09-11 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2504.02438 2025-09-11 cs.CL cs.AI 85%

Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation

Chuanqi Cheng, Jian Guan, Wei Wu, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 视频理解 :video-language(title,abstract);video understanding(abstract);long video(abstract)

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08621 2025-09-11 cs.CV 74%

AdsQA: Towards Advertisement Video Understanding

Xinwei Long, Kai Tian, Peng Xu, Guoli Jia, Jingxuan Li, Sa Yang, Yihua Shao, Kaiyan Zhang, Che Jiang, Hao Xu, Yang Liu, Jiaheng Ma, Bowen Zhou

机构 * Tsinghua University(清华大学) Peking University(北京大学) CASIA(中国科学院自动化所) Harvard University(哈佛大学) Shanghai Artificial Intelligence Lab(上海人工智能实验室)

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments ICCV-2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2503.09151 2025-09-11 cs.CV cs.AI 83%

Reangle-A-Video: 4D Video Generation as Video-to-Video Translation

Hyeonho Jeong, Suhyeon Lee, Jong Chul Ye

机构 * KAIST(韩国科学技术院) Adobe Research(Adobe研究)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

Comments ICCV 2025, Project page: https://hyeonho99.github.io/reangle-a-video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08519 2025-09-11 cs.CV cs.MM 81%

HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning

Liyang Chen, Tianxiang Ma, Jiawei Liu, Bingchuan Li, Zhuowei Chen, Lijie Liu, Xu He, Gen Li, Qian He, Zhiyong Wu

机构 * Tsinghua University(清华大学) Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08826 2025-09-11 cs.CV 70%

RewardDance: Reward Scaling in Visual Generation

Jie Wu, Yu Gao, Zilyu Ye, Ming Li, Liang Li, Hanzhong Guo, Jie Liu, Zeyue Xue, Xiaoxia Hou, Wei Liu, Yan Zeng, Weilin Huang

机构 * ByteDance Seed(字节跳动种子)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Bytedance Seed Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长视频与时序推理 2 篇

2506.14107 2025-09-11 cs.DC cs.CV 79%

Déjà Vu: Efficient Video-Language Query Engine with Learning-based Inter-Frame Computation Reuse

Jinwoo Hwang, Daeun Kim, Sangyeop Lee, Yoonsung Kim, Guseul Heo, Hojoon Kim, Yunseok Jeong, Tadiwos Meaza, Eunhyeok Park, Jeongseob Ahn, Jongse Park

机构 * Korea University(韩国大学)

专题命中 长视频与时序推理 :video-language(title,abstract);分类 cs.CV

Comments Accepted to 2025 VLDB

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02733 2025-09-11 cs.CV cs.AI 57%

UAR-NVC: A Unified AutoRegressive Framework for Memory-Efficient Neural Video Compression

Jia Wang, Xinfeng Zhang, Gai Zhang, Jun Zhu, Lv Tang, Li Zhang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(计算机科学与技术学院,中国科学院大学) Bytedance Inc.(字节跳动公司)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Comments Accepted to TCSVT2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 1 篇

2509.08818 2025-09-11 cs.CV 57%

GeneVA: A Dataset of Human Annotations for Generative Text to Video Artifacts

Jenna Kang, Maria Silva, Patsorn Sangkloy, Kenneth Chen, Niall Williams, Qi Sun

机构 * New York University(纽约大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏