arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-07-30 至 2025-07-30 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2506.19651 2025-07-30 cs.CV cs.LG cs.PF 70%

PEVLM: Parallel Encoding for Vision-Language Models

Letian Kang, Shixian Luo, Yiqiang Li, Yuxin Yin, Shenxuan Zhou, Xiaoyang Yu, Jin Yang, Yong Wu

机构 * Li Auto Inc.(利自动公司)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03248 2025-07-30 cs.CV cs.AI cs.CL 70%

AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning

Yiwu Zhong, Zhuoming Liu, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 1 篇

2503.09631 2025-07-30 cs.GR eess.IV 57%

V2M4: 4D Mesh Animation Reconstruction from a Single Monocular Video

Jianqi Chen, Biao Zhang, Xiangjun Tang, Peter Wonka

专题命中 视频生成 :video generation(abstract);分类 eess.IV

Comments Accepted by ICCV 2025. Project page: https://windvchen.github.io/V2M4/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 1 篇

2507.21353 2025-07-30 cs.CV cs.LG 57%

Group Relative Augmentation for Data Efficient Action Detection

Deep Anil Patel, Iain Melvin, Zachary Izzo, Martin Renqiang Min

机构 * NEC Laboratories America(NEC美洲实验室)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2410.16268 2025-07-30 cs.CV 74%

SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree

Shuangrui Ding, Rui Qian, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Yuwei Guo, Dahua Lin, Jiaqi Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII)

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

Comments ICCV 2025, Project page: https://mark12ding.github.io/project/SAM2Long/ ; github page: https://github.com/Mark12Ding/SAM2Long/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 4 篇

2507.20987 2025-07-30 cs.CV cs.AI 57%

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1

Xinhan Di, Kristin Qi, Pengqian Yu

机构 * Computer Science, University of Massachusetts Boston(马萨诸塞大学波士顿分校计算机科学系) National University of Singapore(新加坡国立大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments WiCV @ ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09081 2025-07-30 cs.CV cs.AI cs.CL 57%

FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation

Zheqi He, Yesheng Liu, Jing-shu Zheng, Xuejing Li, Jin-Ge Yao, Bowen Qin, Richeng Xuan, Xi Yang

机构 * BAAI FlagEval Team(BAAI 评测团队)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments Accepted by ACL 2025 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02733 2025-07-30 cs.CV cs.AI 57%

LinkTo-Anime: A 2D Animation Optical Flow Dataset from 3D Model Rendering

Xiaoyi Feng, Kaifeng Zou, Caichun Cen, Tao Huang, Hui Guo, Zizhou Huang, Yingli Zhao, Mingqing Zhang, Ziyuan Zheng, Diwei Wang, Yuntao Zou, Dagang Li

机构 * Link-To, Shenzhen, China(深圳Link-To) Macau University of Science and Technology, Macau, China(澳门科学技术大学) The Chinese University of Hong Kong, HongKong, China(香港中文大学) Wuzhou University, Guangxi, China(梧州大学) Université de Strasbourg, France(斯特拉斯堡大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07327 2025-07-30 cs.IR cs.CV 57%

Generative Ghost: Investigating Ranking Bias Hidden in AI-Generated Videos

Haowen Gao, Liang Pang, Shicheng Xu, Leigang Qu, Tat-Seng Chua, Huawei Shen, Xueqi Cheng

机构 * State Key Lab of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments 13 pages, Accepted at ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏