arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6790 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 578 篇

2507.20987 2025-07-30 cs.CV cs.AI 57%

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1

Xinhan Di, Kristin Qi, Pengqian Yu

机构 * Computer Science, University of Massachusetts Boston(马萨诸塞大学波士顿分校计算机科学系) National University of Singapore(新加坡国立大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments WiCV @ ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09081 2025-07-30 cs.CV cs.AI cs.CL 57%

FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation

Zheqi He, Yesheng Liu, Jing-shu Zheng, Xuejing Li, Jin-Ge Yao, Bowen Qin, Richeng Xuan, Xi Yang

机构 * BAAI FlagEval Team(BAAI 评测团队)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments Accepted by ACL 2025 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02733 2025-07-30 cs.CV cs.AI 57%

LinkTo-Anime: A 2D Animation Optical Flow Dataset from 3D Model Rendering

Xiaoyi Feng, Kaifeng Zou, Caichun Cen, Tao Huang, Hui Guo, Zizhou Huang, Yingli Zhao, Mingqing Zhang, Ziyuan Zheng, Diwei Wang, Yuntao Zou, Dagang Li

机构 * Link-To, Shenzhen, China(深圳Link-To) Macau University of Science and Technology, Macau, China(澳门科学技术大学) The Chinese University of Hong Kong, HongKong, China(香港中文大学) Wuzhou University, Guangxi, China(梧州大学) Université de Strasbourg, France(斯特拉斯堡大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07327 2025-07-30 cs.IR cs.CV 57%

Generative Ghost: Investigating Ranking Bias Hidden in AI-Generated Videos

Haowen Gao, Liang Pang, Shicheng Xu, Leigang Qu, Tat-Seng Chua, Huawei Shen, Xueqi Cheng

机构 * State Key Lab of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments 13 pages, Accepted at ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16878 2025-07-24 cs.CV cs.AI 57%

CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos

Xuchen Li, Xuzhao Li, Shiyu Hu, Kaiqi Huang, Wentao Zhang

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16151 2025-07-23 cs.CV cs.AI 57%

SPACT18: Spiking Human Action Recognition Benchmark Dataset with Complementary RGB and Thermal Modalities

Yasser Ashraf, Ahmed Sharshar, Velibor Bojkovic, Bin Gu

机构 * Department of Machine Learning(机器学习系) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13684 2025-07-23 cs.CV 57%

FiVE: A Fine-grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow Models

Minghan Li, Chenxi Xie, Yichen Wu, Lei Zhang, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛人工智能与机器人实验室,哈佛大学) Broad Institute(博德研究所) Hong Kong Polytechnic University(香港理工大学) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) City University of Hong Kong(香港城市大学) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(自然与人工智能研究学院,哈佛大学)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments 24 pages, 14 figures, 16 tables

Journal ref ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00574 2025-07-15 cs.CV cs.LG 57%

VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling

Xinhao Li, Yi Wang, Jiashuo Yu, Xiangyu Zeng, Yuhan Zhu, Haian Huang, Jianfei Gao, Kunchang Li, Yinan He, Chenting Wang, Yu Qiao, Yali Wang, Limin Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06732 2025-07-10 cs.CV 57%

Hierarchical Feature Alignment for Gloss-Free Sign Language Translation

Sobhan Asasi, Mohamed Ilyes Lakhal, Richard Bowden

机构 * University of Surrey(塞弗里大学)

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

Comments Accepted in SLTAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04976 2025-07-08 cs.CV cs.CL 57%

Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models

Eunseop Yoon, Hee Suk Yoon, Mark A. Hasegawa-Johnson, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) University of Illinois at Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02316 2025-07-04 cs.CV 57%

Are Synthetic Videos Useful? A Benchmark for Retrieval-Centric Evaluation of Synthetic Videos

Zecheng Zhao, Selena Song, Tong Chen, Zhi Chen, Shazia Sadiq, Yadan Luo

机构 * The University of Queensland(昆士兰大学) The University of Southern Queensland(南方昆士兰大学)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments 7 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01949 2025-07-03 cs.CV 57%

Kwai Keye-VL Technical Report

Kwai Keye Team, Biao Yang, Bin Wen, Changyi Liu, Chenglong Chu, Chengru Song, Chongling Rao, Chuan Yi, Da Li, Dunju Zang, Fan Yang, Guorui Zhou, Hao Peng, Haojie Ding, Jiaming Huang, Jiangxia Cao, Jiankang Chen, Jingyun Hua, Jin Ouyang, Kaibing Chen, Kaiyu Jiang, Kaiyu Tang, Kun Gai, Shengnan Zhang, Siyang Mao, Sui Huang, Tianke Zhang, Tingting Gao, Wei Chen, Wei Yuan, Xiangyu Wu, Xiao Hu, Xingyu Lu, Yang Zhou, Yi-Fan Zhang, Yiping Yang, Yulong Chen, Zhenhua Wu, Zhenyu Li, Zhixin Ling, Ziming Li, Dehua Ma, Di Xu, Haixuan Gao, Hang Li, Jiawei Guo, Jing Wang, Lejian Ren, Muhao Wei, Qianqian Wang, Qigen Hu, Shiyao Wang, Tao Yu, Xinchen Luo, Yan Li, Yiming Liang, Yuhang Hu, Zeyi Lu, Zhuoran Yang, Zixing Zhang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Technical Report: https://github.com/Kwai-Keye/Keye

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01938 2025-07-03 cs.CV 57%

CI-VID: A Coherent Interleaved Text-Video Dataset

Yiming Ju, Jijin Hu, Zhengxiong Luo, Haoge Deng, hanyu Zhao, Li Du, Chengwei Wu, Donglin Hao, Xinlong Wang, Tengfei Pan

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01255 2025-07-03 cs.CV 57%

AIGVE-MACS: Unified Multi-Aspect Commenting and Scoring Model for AI-Generated Video Evaluation

Xiao Liu, Jiawei Zhang

机构 * IFM Lab, University of California, Davis(信息与媒体实验室,加州大学戴维斯分校)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments Working in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20103 2025-06-26 cs.CV cs.AI 57%

BrokenVideos: A Benchmark Dataset for Fine-Grained Artifact Localization in AI-Generated Videos

Jiahao Lin, Weixuan Peng, Bojia Zi, Yifeng Gao, Xianbiao Qi, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shenzhen University(深圳大学) The Chinese University of Hong Kong(香港中文大学) IntelliFusion Inc.(IntelliFusion公司)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments 7 page,4 figures,2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16141 2025-06-23 cs.CV cs.AI cs.CL cs.LG 57%

GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning

Yi Chen, Yuying Ge, Rui Wang, Yixiao Ge, Junhao Cheng, Ying Shan, Xihui Liu

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Code released at: https://github.com/TencentARC/GRPO-CARE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14827 2025-06-19 cs.CV cs.AI 57%

DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning

Yifeng Gao, Yifan Ding, Hongyu Su, Juncheng Li, Yunhan Zhao, Lin Luo, Zixing Chen, Li Wang, Xin Wang, Yixu Wang, Xingjun Ma, Yu-Gang Jiang

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07603 2025-06-17 cs.CV cs.AI 57%

SurgBench: A Unified Large-Scale Benchmark for Surgical Video Analysis

Jianhui Wei, Zikai Xiao, Danyu Sun, Luqi Gong, Zongxin Yang, Zuozhu Liu, Jian Wu

机构 * Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室) Harvard University(哈佛大学) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02357 2025-06-17 cs.CV 57%

Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content

Zicheng Zhang, Tengchuan Kou, Shushi Wang, Chunyi Li, Wei Sun, Wei Wang, Xiaoyu Li, Zongyu Wang, Xuezhi Cao, Xiongkuo Min, Xiaohong Liu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments CVPR 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06733 2025-06-12 cs.CV 57%

RecipeGen: A Step-Aligned Multimodal Benchmark for Real-World Recipe Generation

Ruoxuan Zhang, Jidong Gao, Bin Wen, Hongxia Xie, Chenming Zhang, Hong-Han Shuai, Wen-Huang Cheng

机构 * Jilin University(吉林大学) Guangdong University of Technology(广东工业大学) National Chiao Tung University(交通大学) National Taiwan University(国立台湾大学)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments This is an extended version of arXiv:2503.05228

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18223 2025-06-05 cs.CV cs.IR q-bio.NC q-bio.QM 57%

MammAlps: A multi-view video behavior monitoring dataset of wild mammals in the Swiss Alps

Valentin Gabeff, Haozhe Qi, Brendan Flaherty, Gencer Sumbül, Alexander Mathis, Devis Tuia

机构 * EPFL(苏黎世联邦理工学院)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments CVPR 2025; Benchmark and code at: https://github.com/eceo-epfl/MammAlps. After submission of v1, we noticed that a few audio files were not correctly aligned with the corresponding video. We fixed the issue, which had little to no impact on performance. We also now report results for three runs

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10691 2025-06-05 cs.CV 57%

Reasoning is All You Need for Video Generalization: A Counterfactual Benchmark with Sub-question Evaluation

Qiji Zhou, Yifan Gong, Guangsheng Bao, Hongjie Qiu, Jinqiang Li, Xiangrong Zhu, Huajian Zhang, Yue Zhang

机构 * School of Engineering, Westlake University(西拉丘学院,西湖大学) College of Computer Science and Technology, Hangzhou Dianzi University(计算机科学与技术学院,杭州电子科技大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments It has been accepted to the ACL-2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03635 2025-05-28 cs.AI cs.CL cs.CV cs.LG stat.ML 57%

CLEVRER-Humans: Describing Physical and Causal Events the Human Way

Jiayuan Mao, Xuelin Yang, Xikun Zhang, Noah D. Goodman, Jiajun Wu

机构 * MIT(麻省理工学院) Stanford University(斯坦福大学)

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

Comments Version 3. NeurIPS 2022 (Dataset and Benchmark Track). First two authors contributed equally. Project page: https://sites.google.com/stanford.edu/clevrer-humans/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19125 2025-05-27 cs.CV 57%

RTime-QA: A Benchmark for Atomic Temporal Event Understanding in Large Multi-modal Models

Yuqi Liu, Qin Jin, Tianyuan Qu, Xuan Liu, Yang Du, Bei Yu, Jiaya Jia

机构 * CUHK(香港中文大学) HKUST(香港理工大学) RUC(中国人民大学)

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14391 2025-05-23 cs.CV 57%

How Well Can General Vision-Language Models Learn Medicine By Watching Public Educational Videos?

Rahul Thapa, Andrew Li, Qingyang Wu, Bryan He, Yuki Sahashi, Christina Binder, Angela Zhang, Ben Athiwaratkun, Shuaiwen Leon Song, David Ouyang, James Zou

机构 * Stanford University(斯坦福大学) Together AI University of California, Berkeley(加州大学伯克利分校) Cedars-Sinai Medical Center(西德斯-西奈医学中心) University of California, San Francisco(加州大学旧金山分校)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15145 2025-05-22 cs.CV 57%

CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation

Xinran Wang, Songyu Xu, Xiangxuan Shan, Yuxuan Zhang, Muxi Diao, Xueyan Duan, Yanhua Huang, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Mobile Research Institute(中国移动研究院)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14231 2025-05-21 cs.CV 57%

UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning

Sule Bai, Mingxing Li, Yong Liu, Jing Tang, Haoji Zhang, Lei Sun, Xiangxiang Chu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) AMAP, Alibaba Group(阿里云研究院)

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15270 2025-05-20 cs.CV 57%

FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning

Shiyu Hu, Xuchen Li, Xuzhao Li, Jing Zhang, Yipei Wang, Xin Zhao, Kang Hao Cheong

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11838 2025-05-20 cs.CV 57%

RVTBench: A Benchmark for Visual Reasoning Tasks

Yiqing Shen, Chenjia Li, Chenxiao Fan, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21435 2025-05-14 cs.CV cs.AI cs.CL 57%

SeriesBench: A Benchmark for Narrative-Driven Drama Series Understanding

Chenkai Zhang, Yiming Lei, Zeming Liu, Haitao Leng, Shaoguo Liu, Tingting Gao, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Hangzhou Innovation Institute, Beihang University(杭州创新研究院) Kuaishou Technology(快手科技)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments 29 pages, 15 figures, CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏