arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6790 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 578 篇

2406.13123 2024-12-17 cs.AI cs.CV 70%

ViLCo-Bench: VIdeo Language COntinual learning Benchmark

Tianqi Tang, Shohreh Deldari, Hao Xue, Celso De Melo, Flora D. Salim

专题命中 视频数据与评测 :video-language(abstract);long video(abstract);分类 cs.CV

Comments 14 pages, 4 figures, 8 tables, Accepted at NeurIPS Dataset and Benchmark Track 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13503 2024-11-21 cs.CV 70%

VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models

Ziqi Huang, Fan Zhang, Xiaojie Xu, Yinan He, Jiashuo Yu, Ziyue Dong, Qianli Ma, Nattapol Chanpaisit, Chenyang Si, Yuming Jiang, Yaohui Wang, Xinyuan Chen, Ying-Cong Chen, Limin Wang, Dahua Lin, Yu Qiao, Ziwei Liu

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Leaderboard: https://huggingface.co/spaces/Vchitect/VBench_Leaderboard Code: https://github.com/Vchitect/VBench Project page: https://vchitect.github.io/VBench-project/ extension of arXiv:2311.17982. arXiv admin note: substantial text overlap with arXiv:2311.17982

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04485 2024-11-12 cs.AI cs.CV 70%

GenAI Arena: An Open Evaluation Platform for Generative Models

Dongfu Jiang, Max Ku, Tianle Li, Yuansheng Ni, Shizhuo Sun, Rongqi Fan, Wenhu Chen

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 9 pages,7 figures

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10816 2024-10-15 cs.CV cs.AI cs.LG 70%

LVD-2M: A Long-take Video Dataset with Temporally Dense Captions

Tianwei Xiong, Yuqing Wang, Daquan Zhou, Zhijie Lin, Jiashi Feng, Xihui Liu

专题命中 视频数据与评测 :video generation(abstract);long video(abstract);分类 cs.CV

Comments NeurIPS 2024 Dataset and Benchmark Track. Project page: https://silentview.github.io/LVD-2M/ . Code: https://github.com/SilentView/LVD-2M

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00634 2024-09-25 cs.CV cs.LG 70%

Tarsier: Recipes for Training and Evaluating Large Video Description Models

Jiawei Wang, Liping Yuan, Yuchen Zhang, Haomiao Sun

专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11606 2023-10-13 cs.CV cs.CL 70%

StoryBench: A Multifaceted Benchmark for Continuous Story Visualization

Emanuele Bugliarello, Hernan Moraldo, Ruben Villegas, Mohammad Babaeizadeh, Mohammad Taghi Saffar, Han Zhang, Dumitru Erhan, Vittorio Ferrari, Pieter-Jan Kindermans, Paul Voigtlaender

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments NeurIPS D&B 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13952 2023-09-26 cs.CV cs.AI cs.CL cs.LG 70%

VidChapters-7M: Video Chapters at Scale

Antoine Yang, Arsha Nagrani, Ivan Laptev, Josef Sivic, Cordelia Schmid

专题命中 视频数据与评测 :video-language(abstract);long video(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2023 Track on Datasets and Benchmarks; Project Webpage: https://antoyang.github.io/vidchapters.html ; 31 pages; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09126 2023-08-21 cs.CV cs.AI cs.CL 70%

EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding

Karttikeya Mangalam, Raiymbek Akshulakov, Jitendra Malik

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments https://egoschema.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14717 2023-03-28 cs.CV 70%

CelebV-Text: A Large-Scale Facial Text-Video Dataset

Jianhui Yu, Hao Zhu, Liming Jiang, Chen Change Loy, Weidong Cai, Wayne Wu

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by CVPR2023. Project Page: https://celebv-text.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03929 2022-10-11 cs.CV cs.AI cs.CL cs.LG 70%

EgoTaskQA: Understanding Human Tasks in Egocentric Videos

Baoxiong Jia, Ting Lei, Song-Chun Zhu, Siyuan Huang

专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

Comments Published at NeurIPS Track on Datasets and Benchmarks 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.14806 2021-05-03 cs.CV 70%

GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions

Chenfei Wu, Lun Huang, Qianxi Zhang, Binyang Li, Lei Ji, Fan Yang, Guillermo Sapiro, Nan Duan

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.10937 2020-07-22 cs.CV 70%

MovieNet: A Holistic Dataset for Movie Understanding

Qingqiu Huang, Yu Xiong, Anyi Rao, Jiaze Wang, Dahua Lin

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted by ECCV2020 as spotlight presentation. Project page: http://movienet.site

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11341 2025-07-15 cs.MM cs.CL cs.CV cs.LG eess.IV 67%

MSVD-Indonesian: A Benchmark for Multimodal Video-Text Tasks in Indonesian

Willy Fitra Hendria

机构 * Independent Researcher(独立研究者)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV、eess.IV、cs.MM

Comments 10 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08259 2025-03-27 cs.HC 67%

VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation

Zhiqiang Yuan, Jiapei Zhang, Ying Deng, Yeshuang Zhu, Jie Zhou, Jinchao Zhang

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17901 2026-06-23 cs.CV cs.MM cs.SD 版本更新 62%

Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施

Geewook Kim, Minjoon Seo

机构 * NAVER Cloud AI(NAVER云AI) KAIST AI(韩国国立庆北大学AI)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06926 2026-06-18 cs.CV cs.MM 新提交 62%

SVHighlights: Towards Extremely Long Sport Video Highlight Detection

SVHighlights: 迈向极长体育视频精彩片段检测

Donggyu Lee, Youngbin Ki, Jeonghun Kang, Taehwan Kim

机构 * Ulsan National Institute of Science and Technology(釜山国立科学研究院)

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

AI总结 针对现有方法无法处理超长视频精彩片段检测的问题,提出首个基准SVHighlights(包含320个平均时长2小时的体育视频)以及无训练的分段方法TF-SELECTOR,通过大语言模型融合多模态信息预测片段级显著性分数,在多个指标上超越现有基线。

Comments Accepted to KDD 2026 (Datasets and Benchmarks Track). Project Page: https://leedongkyu2019.github.io/SVHighlights/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00873 2026-06-16 cs.MM cs.AI cs.CV 版本更新 62%

BRITE: A Benchmark for Reliable and Interpretable T2V Evaluation on Implausible Scenarios

BRITE:面向不可信场景的可靠可解释文本到视频评估基准

Advait Tilak, Jiwon Choi, Nazifa Mouli, Wei Le

机构 * Department of Computer Science, Iowa State University, Ames, Iowa, USA(计算机科学系,爱荷华州立大学,爱荷华州阿姆斯,美国)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 提出BRITE基准,通过人工参与协议统一不可信提示、细粒度音视频一致性评估和可解释QA评估,揭示现有模型在对象-动作绑定和音视频同步上的显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07541 2026-06-09 cs.HC cs.AI cs.CV cs.CY cs.MM 新提交 62%

Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation

多模态大语言模型作为视频研究中的合成参与者:一项评估

Prabal Shrestha, Bohan Jiang, Haoning Xue, Huan Liu, Xinyi Zhou

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本研究评估多模态大语言模型在视频感知任务中模拟人类主观评分的表现,发现模型存在偏差且与人类一致性有限。

Comments Accepted to SocialLLM @ ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14698 2026-03-27 cs.CV cs.AI cs.CL cs.MM 62%

TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

TimeLens:重新思考视频时间接地与多模态大语言模型

Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang

机构 * Nanjing University(南京大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本文提出TimeLens,通过数据质量和算法设计两个维度系统研究多模态大语言模型的视频时间接地能力,构建高质量数据集并提出有效训练方法,实现开源模型在视频时间接地任务上的领先性能。

Comments CVPR 2026. Website: https://timelens-arc-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16966 2026-03-19 cs.CV cs.AI cs.MM cs.SD eess.AS 62%

CineSRD: Leveraging Visual, Acoustic, and Linguistic Cues for Open-World Visual Media Speaker Diarization

CineSRD:利用视觉、听觉和语言线索进行开放世界视觉媒体说话人聚类

Liangbin Huang, Xiaohua Liao, Chaoqun Cui, Shijing Wang, Zhaolong Huang, Yanlong Du, Wenji Mao

机构 * Hujing Digital Media and Entertainment Group(华景数字媒体与娱乐集团) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 CineSRD通过整合视觉、听觉和语言线索,解决开放世界视觉媒体中说话人识别的挑战,提出统一多模态框架并构建专用基准数据集,验证其在复杂场景下的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19236 2026-01-28 cs.CV cs.MM 62%

VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics

VC-Bench:开创视频连接基准的Dataset与评估指标

Zhiyu Yin, Zhipeng Liu, Kehai Chen, Lemao Liu, Jin Liu, Hong-Dong Li, Yang Xiang, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(计算机科学与技术学院,哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 VC-Bench提出一个用于视频连接任务的新型基准,包含多样化视频数据和综合评估指标,评估现有视频生成模型并揭示其在连贯性和流畅性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15376 2025-09-01 cs.CV cs.AI cs.CL cs.LG cs.MM 62%

Towards Understanding Camera Motions in Any Video

Zhiqiu Lin, Siyuan Cen, Daniel Jiang, Jay Karhade, Hewei Wang, Chancharik Mitra, Tiffany Ling, Yuhan Huang, Sifan Liu, Mingyu Chen, Rushikesh Zawar, Xue Bai, Yilun Du, Chuang Gan, Deva Ramanan

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV、cs.MM

Comments Project site: https://linzhiqiu.github.io/papers/camerabench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20368 2025-07-29 cs.CV cs.MM 62%

MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation

Shuolin Xu, Bingyuan Wang, Zeyu Cai, Fangteng Fu, Yue Ma, Tongyi Lee, Hongchuan Yu, Zeyu Wang

机构 * National Centre for Computer Animation, Bournemouth University(伯恩茅斯大学计算机动画国家中心) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学) Department of Computer Science and Information Engineering, National Cheng Kung University(国立成功大学计算机科学与信息工程系)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、cs.MM

Comments 8 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20124 2025-06-10 cs.CV cs.MM 62%

TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos

Fanheng Kong, Jingyuan Zhang, Hongzhi Zhang, Shi Feng, Daling Wang, Linhao Yu, Xingguang Ji, Yu Tian, Victoria W., Fuzheng Zhang

机构 * Northeastern University(东北大学) Kuaishou Technology(快手科技)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

Comments Accepted to ACL 2025 Main. Project page: https://friedrichor.github.io/projects/TUNA

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03161 2025-05-30 cs.CV cs.CL cs.MM 62%

BioVL-QR: Egocentric Biochemical Vision-and-Language Dataset Using Micro QR Codes

Tomohiro Nishimoto, Taichi Nishimura, Koki Yamamoto, Keisuke Shirai, Hirotaka Kameko, Yuto Haneji, Tomoya Yoshida, Keiya Kajimura, Taiyu Cui, Chihiro Nishiwaki, Eriko Daikoku, Natsuko Okuda, Fumihito Ono, Shinsuke Mori

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

Comments ICIP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11425 2025-05-19 cs.CV cs.MM 62%

Face Consistency Benchmark for GenAI Video

Michal Podstawski, Malgorzata Kudelska, Haohong Wang

机构 * TCL Research Europe(TCL欧洲研究中心) TCL Research America(TCL美国研究中心)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13281 2025-03-25 cs.CV cs.AI cs.CL cs.MM 62%

VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation

Ziyang Luo, Haoning Wu, Dongxu Li, Jing Ma, Mohan Kankanhalli, Junnan Li

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

Comments CVPR 2025, Project Page: https://videoautoarena.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18709 2025-03-04 cs.CV cs.LG cs.MM cs.SD eess.AS 62%

Audio-Visual Instance Segmentation

Ruohao Guo, Xianghua Ying, Yaru Chen, Dantong Niu, Guangyao Li, Liao Qu, Yanyu Qi, Jinxing Zhou, Bowei Xing, Wenzhen Yue, Ji Shi, Qixun Wang, Peiliang Zhang, Buwen Liang

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20962 2024-12-18 cs.CV cs.MM cs.SD eess.AS 62%

MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions

Xiaowei Chi, Yatian Wang, Aosong Cheng, Pengjun Fang, Zeyue Tian, Yingqing He, Zhaoyang Liu, Xingqun Qi, Jiahao Pan, Rongyu Zhang, Mengfei Li, Ruibin Yuan, Yanbing Jiang, Wei Xue, Wenhan Luo, Qifeng Chen, Shanghang Zhang, Qifeng Liu, Yike Guo

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV、cs.MM

Comments 15 Pages. Dataset report

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13743 2024-11-05 cs.CV cs.AI cs.CL cs.LG cs.MM 62%

GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation

Baiqi Li, Zhiqiu Lin, Deepak Pathak, Jiayao Li, Yixin Fei, Kewen Wu, Tiffany Ling, Xide Xia, Pengchuan Zhang, Graham Neubig, Deva Ramanan

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、cs.MM

Comments We open-source our dataset, model, and code at: https://linzhiqiu.github.io/papers/genai_bench ; Project page: https://linzhiqiu.github.io/papers/genai_bench ; GenAI-Bench was first introduced in arxiv:2404.01291. This article extends it with an additional GenAI-Rank benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏