arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6790 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 578 篇

2505.03829 2025-05-08 cs.CV cs.AI 57%

VideoLLM Benchmarks and Evaluation: A Survey

Yogesh Kumar

机构 * Indian Institute of Technology Jodhpur(印度理工学院朱达普尔)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments 12 pages, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21334 2025-05-01 cs.CV 57%

Simple Visual Artifact Detection in Sora-Generated Videos

Misora Sugiyama, Hirokatsu Kataoka

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17132 2025-04-29 cs.CV 57%

Latent Video Dataset Distillation

Ning Li, Antai Andy Liu, Jingran Zhang, Justin Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments https://openreview.net/forum?id=i665TIHv92

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08260 2025-04-29 cs.CV cs.AI 57%

Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content

Qiuheng Wang, Yukai Shi, Jiarong Ou, Rui Chen, Ke Lin, Jiahao Wang, Boyuan Jiang, Haotian Yang, Mingwu Zheng, Xin Tao, Fei Yang, Pengfei Wan, Di Zhang

机构 * Shenzhen University(深圳大学) Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments Accepted by CVPR2025. Project page: https://koala36m.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17343 2025-04-25 cs.CV 57%

TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos

Linli Yao, Yicheng Li, Yuancheng Wei, Lei Li, Shuhuai Ren, Yuanxin Liu, Kun Ouyang, Lean Wang, Shicheng Li, Sida Li, Lingpeng Kong, Qi Liu, Yuanxing Zhang, Xu Sun

机构 * Peking University(北京大学) South China University of Technology(华南理工大学) The University of Hong Kong(香港大学) Kuaishou Technology(快手科技)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15415 2025-04-23 cs.CV cs.CL 57%

IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs

David Ma, Yuanxing Zhang, Jincheng Ren, Jarvis Guo, Yifan Yao, Zhenlin Wei, Zhenzhu Yang, Zhongyuan Peng, Boyu Feng, Jun Ma, Xiao Gu, Zhoufutu Wen, King Zhu, Yancheng He, Meng Cao, Shiwen Ni, Jiaheng Liu, Wenhao Huang, Ge Zhang, Xiaojie Jin

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14429 2025-04-22 cs.CV cs.AI 57%

ResNetVLLM-2: Addressing ResNetVLLM's Multi-Modal Hallucinations

Ahmad Khalil, Mahmoud Khalil, Alioune Ngom

机构 * University of Windsor(温莎大学)

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06163 2025-04-22 cs.AI cs.CV stat.AP 57%

VACT: A Video Automatic Causal Testing System and a Benchmark

Haotong Yang, Qingyuan Zheng, Yunjian Gao, Yongkun Yang, Yangbo He, Zhouchen Lin, Muhan Zhang

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments A preliminary version of this paper has been accepted by workshop SCSL@ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10358 2025-04-15 cs.CV cs.AI 57%

FingER: Content Aware Fine-grained Evaluation with Reasoning for AI-Generated Videos

Rui Chen, Lei Sun, Jing Tang, Geng Li, Xiangxiang Chu

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08212 2025-04-14 cs.CV 57%

RealCam-Vid: High-resolution Video Dataset with Dynamic Scenes and Metric-scale Camera Movements

Guangcong Zheng, Teng Li, Xianpan Zhou, Xi Li

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07956 2025-04-11 cs.CV cs.AI cs.CL 57%

VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning

Yukun Qi, Yiming Zhao, Yu Zeng, Xikun Bao, Wenxuan Huang, Lin Chen, Zehui Chen, Jie Zhao, Zhongang Qi, Feng Zhao

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07745 2025-04-11 cs.CV cs.AI 57%

SF2T: Self-supervised Fragment Finetuning of Video-LLMs for Fine-Grained Understanding

Yangliu Hu, Zikai Song, Na Feng, Yawei Luo, Junqing Yu, Yi-Ping Phoebe Chen, Wei Yang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03051 2025-04-10 cs.CV 57%

AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark

Wenhao Chai, Enxin Song, Yilun Du, Chenlin Meng, Vashisht Madhavan, Omer Bar-Tal, Jenq-Neng Hwang, Saining Xie, Christopher D. Manning

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted to ICLR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://rese1f.github.io/aurora-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22952 2025-04-01 cs.CV 57%

OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts

Yuxuan Wang, Yueqian Wang, Bo Chen, Tong Wu, Dongyan Zhao, Zilong Zheng

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments To appear at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00599 2025-03-26 cs.CV cs.AI cs.LG 57%

VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM

Yuqian Yuan, Hang Zhang, Wentong Li, Zesen Cheng, Boqiang Zhang, Long Li, Xin Li, Deli Zhao, Wenqiao Zhang, Yueting Zhuang, Jianke Zhu, Lidong Bing

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments 17 pages, 14 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14935 2025-03-20 cs.CV cs.AI 57%

FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding

Chongjun Tu, Lin Zhang, Pengtao Chen, Peng Ye, Xianfang Zeng, Wei Cheng, Gang Yu, Tao Chen

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments FAVOR-Bench project page: https://favor-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14064 2025-03-19 cs.CV 57%

AIGVE-Tool: AI-Generated Video Evaluation Toolkit with Multifaceted Benchmark

Xinhao Xiang, Xiao Liu, Zizhong Li, Zhuosheng Liu, Jiawei Zhang

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12769 2025-03-18 cs.CV 57%

ViSpeak: Visual Instruction Feedback in Streaming Videos

Shenghao Fu, Qize Yang, Yuan-Ming Li, Yi-Xing Peng, Kun-Yu Lin, Xihan Wei, Jian-Fang Hu, Xiaohua Xie, Wei-Shi Zheng

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14468 2025-03-18 cs.AI cs.CV cs.HC 57%

K-Sort Arena: Efficient and Reliable Benchmarking for Generative Models via K-wise Human Preferences

Zhikai Li, Xuewen Liu, Dongrong Joe Fu, Jianquan Li, Qingyi Gu, Kurt Keutzer, Zhen Dong

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://huggingface.co/spaces/ksort/K-Sort-Arena

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06171 2025-03-17 cs.CV 57%

Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity

Huaxin Zhang, Xiaohao Xu, Xiang Wang, Jialong Zuo, Xiaonan Huang, Changxin Gao, Shanjun Zhang, Li Yu, Nong Sang

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12448 2025-02-21 cs.CV 57%

Infrared Small Target Detection in Satellite Videos: A New Dataset and A Novel Recurrent Feature Refinement Framework

Xinyi Ying, Li Liu, Zaipin Lin, Yangsi Shi, Yingqian Wang, Ruojing Li, Xu Cao, Boyang Li, Shilin Zhou, Wei An

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10300 2025-02-06 cs.CV 57%

Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos

Mingfei Han, Linjie Yang, Xiaojun Chang, Lina Yao, Heng Wang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments ICLR 2025. Extended annotation with 43K multi-shot videos in total. https://mingfei.info/shot2story for updates and more information

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09668 2025-01-22 cs.CV 57%

EditBoard: Towards a Comprehensive Evaluation Benchmark for Text-Based Video Editing Models

Yupeng Chen, Penglin Chen, Xiaoyu Zhang, Yixian Huang, Qian Xie

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07978 2025-01-15 cs.CV cs.AI 57%

Facial Dynamics in Video: Instruction Tuning for Improved Facial Expression Perception and Contextual Awareness

Jiaxing Zhao, Boyuan Sun, Xiang Chen, Xihan Wei

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14965 2025-01-14 cs.CV cs.AI cs.CL 57%

Movie2Story: A framework for understanding videos and telling stories in the form of novel text

Kangning Li, Zheyang Jia, Anyu Ying

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21408 2024-12-30 cs.CV 57%

Benchmarking Multi-dimensional AIGC Video Quality Assessment: A Dataset and Unified Model

Zhichao Zhang, Wei Sun, Xinyue Li, Jun Jia, Xiongkuo Min, Zicheng Zhang, Chunyi Li, Zijian Chen, Puyi Wang, Fengyu Sun, Shangling Jui, Guangtao Zhai

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04915 2024-12-09 cs.CV 57%

Beyond Boxes: Mask-Guided Spatio-Temporal Feature Aggregation for Video Object Detection

Khurram Azeem Hashmi, Talha Uddin Sheikh, Didier Stricker, Muhammad Zeshan Afzal

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments To appear in WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01800 2024-12-03 cs.CV 57%

PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videos

Meng Cao, Haoran Tang, Haoze Zhao, Hangyu Guo, Jiaheng Liu, Ge Zhang, Ruyang Liu, Qiang Sun, Ian Reid, Xiaodan Liang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12789 2024-12-03 cs.CV 57%

Anticipating Object State Changes in Long Procedural Videos

Victoria Manousaki, Konstantinos Bacharidis, Filippos Gouidis, Konstantinos Papoutsakis, Dimitris Plexousakis, Antonis Argyros

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17438 2024-11-22 cs.CV cs.AI cs.LG 57%

HumanVid: Demystifying Training Data for Camera-controllable Human Image Animation

Zhenzhi Wang, Yixuan Li, Yanhong Zeng, Youqing Fang, Yuwei Guo, Wenran Liu, Jing Tan, Kai Chen, Tianfan Xue, Bo Dai, Dahua Lin

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments NeurIPS D&B Track 2024 camera ready version, TL;DR: the first large-scale dataset for camera controllable human image animation task, and a baseline method

详情

展开后加载摘要…

URL PDF HTML 收藏