arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-09-26 至 2025-09-26 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2509.17084 2025-09-26 cs.CV 57%

MoCLIP-Lite: Efficient Video Recognition by Fusing CLIP with Motion Vectors

Binhua Huang, Ni Wang, Arjun Pakrashi, Soumyabrata Dev

机构 * The ADAPT SFI Research Centre(ADAPT SFI研究机构) School of Computer Science, University College Dublin(大学学院计算机科学系) Amazon Development Center Germany GmbH(亚马逊德国开发中心) Beijing-Dublin International College(北京-都柏林国际学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14096 2025-09-26 cs.CV 57%

VideoPASTA: 7K Preference Pairs That Matter for Video-LLM Alignment

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视频理解 :video-language(abstract);分类 cs.CV

Comments EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2509.21119 2025-09-26 cs.CV 74%

MotionFlow:Learning Implicit Motion Flow for Complex Camera Trajectory Control in Video Generation

Guojun Lei, Chi Wang, Yikai Wang, Hong Li, Ying Song, Weiwei Xu

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) Beihang University(北航) Zhejiang Gongshang University(浙江工商大学) ShengShu(盛舒)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments ICME2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15269 2025-09-26 cs.CV cs.AI 74%

Conditional Video Generation for High-Efficiency Video Compression

Fangqiu Yi, Jingyu Xu, Jiawei Shao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院)

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02045 2025-09-26 cs.GR cs.CV 57%

Generating 360° Video is What You Need For a 3D Scene

Zhaoyang Zhang, Yannick Hold-Geoffroy, Miloš Hašan, Ziwen Chen, Fujun Luan, Julie Dorsey, Yiwei Hu

机构 * Yale University(耶鲁大学) Adobe Research(Adobe研究) Oregon State University(俄勒冈州立大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments SIGGRAPH Asia 2025. Project Page: https://zhaoyangzh.github.io/projects/worldprompter/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长视频与时序推理 2 篇

2509.16421 2025-09-26 cs.CV cs.AI 70%

AHA -- Predicting What Matters Next: Online Highlight Detection Without Looking Ahead

Aiden Chang, Celso De Melo, Stephanie M. Lukin

机构 * University of Southern California(南加州大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 长视频与时序推理 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2025, 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21100 2025-09-26 cs.CV 57%

VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception

Ziang Yan, Xinhao Li, Yinan He, Zhengrong Yue, Xiangyu Zeng, Yali Wang, Yu Qiao, Limin Wang, Yi Wang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏