arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1388 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1388 篇

2511.18463 2026-03-13 cs.CV 74%

Decoupling Perception from Reasoning for Hallucination-Resistant Video Understanding

解耦感知与推理以实现抗幻觉的视频理解

Bowei Pu, Chuanbin Liu, Yifan Ge, Peicheng Zhou, Yiwei Sun, Zhiying Lu, Zhangchi Hu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 本文提出DPL模型,通过解耦感知与推理以提升视频理解的抗幻觉能力,引入感知奖励和FAE评估器,有效提高训练后性能和数据效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18977 2026-02-24 cs.CV 74%

Frame2Freq: Spectral Adapters for Fine-Grained Video Understanding

Frame2Freq: 用于细粒度视频理解的频谱适配器

Thinesh Thiyakesan Ponbagavathi, Constantin Seibold, Alina Roitberg

机构 * Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) University Hospital Heidelberg, Diagnostic and Interventional Radiology(海德堡大学医院放射诊断与介入科) Intelligent Assistive Systems Lab, University of Hildesheim(希尔德斯海姆大学智能辅助系统实验室)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 Frame2Freq通过频谱编码提升细粒度视频理解,利用FFT和频率带嵌入改进动作识别性能。

Comments Accepted to CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16545 2026-02-19 cs.CV cs.LG 74%

Let's Split Up: Zero-Shot Classifier Edits for Fine-Grained Video Understanding

让我们拆分:用于细粒度视频理解的零样本分类器编辑

Kaiting Liu, Hazel Doughty

机构 * Leiden University(莱顿大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 本文提出零样本分类器编辑方法,通过细粒度视频理解提升分类精度,优于视觉-语言基线。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14236 2026-02-17 cs.CV cs.AI cs.LG cs.PF 74%

Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models

双信号自适应KV缓存优化用于视觉-语言模型中长形式视频理解

Vishnu Sai, Dheeraj Sai, Srinath B, Girish Varma, Priyesh Shukla

机构 * International Institute of Information Technology(国际信息研究所)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 Sali-Cache通过双信号自适应缓存优化,提升视觉-语言模型处理长形式视频的内存效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07625 2026-02-10 cs.CV cs.AI 74%

AD-MIR: Bridging the Gap from Perception to Persuasion in Advertising Video Understanding via Structured Reasoning

AD-MIR:通过结构化推理弥合从感知到说服的广告视频理解鸿沟

Binxiao Xu, Junyu Feng, Xiaopeng Lin, Haodong Li, Zhiyuan Feng, Bohan Zeng, Shaolin Lu, Ming Lu, Qi She, Wentao Zhang

机构 * Peking University, Beijing, China(北京大学) Tsinghua University, Beijing, China(清华大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) South China University of Technology, Guangzhou, China(华南理工大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 AD-MIR通过结构化推理框架,结合语义检索与精确关键词匹配,有效解码广告意图,提升广告视频理解的准确性与说服策略分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08408 2026-01-14 cs.CV cs.RO 74%

Edge-Optimized Multimodal Learning for UAV Video Understanding via BLIP-2

边缘优化的多模态学习用于无人机视频理解 via BLIP-2

Yizhan Feng, Hichem Snoussi, Jing Teng, Jian Liu, Yuyang Wang, Abel Cherouat, Tian Wang

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 本文提出基于BLIP-2的轻量级多模态学习平台,通过集成YOLO模型实现无人机视频理解的高效处理与多任务适应。

Comments The Tenth International Conference on Data Mining and Big Data (DMBD'2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11399 2026-01-09 cs.CL cs.CV 74%

Minimal Clips, Maximum Salience: Long Video Summarization via Key Moment Extraction

最短片段,最大显著性:通过关键时刻提取实现长视频摘要

Galann Pennec, Zhengyuan Liu, Nicholas Asher, Philippe Muller, Nancy F. Chen

专题命中 视频理解 :long video(title);分类 cs.CV

AI总结 本文提出了一种通过关键时刻提取实现长视频多模态摘要的方法,利用轻量级模型和大型语言模型实现高效摘要生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09282 2025-10-14 cs.CV 74%

VideoAds for Fast-Paced Video Understanding

Zheyuan Zhang, Monica Dou, Linkai Peng, Hongyi Pan, Ulas Bagci, Boqing Gong

机构 * Northwestern University(西北大学) Boston University(波士顿大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08665 2025-10-06 cs.CV 74%

SkillFormer: Unified Multi-View Video Understanding for Proficiency Estimation

Edoardo Bianchi, Antonio Liotta

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments Accepted at the 2025 18th International Conference on Machine Vision. Project page at https://edowhite.github.io/SkillFormer

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08621 2025-09-11 cs.CV 74%

AdsQA: Towards Advertisement Video Understanding

Xinwei Long, Kai Tian, Peng Xu, Guoli Jia, Jingxuan Li, Sa Yang, Yihua Shao, Kaiyan Zhang, Che Jiang, Hao Xu, Yang Liu, Jiaheng Ma, Bowen Zhou

机构 * Tsinghua University(清华大学) Peking University(北京大学) CASIA(中国科学院自动化所) Harvard University(哈佛大学) Shanghai Artificial Intelligence Lab(上海人工智能实验室)

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments ICCV-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12687 2025-08-26 cs.AI cs.CV 74%

EGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding

Ashish Seth, Utkarsh Tyagi, Ramaneswaran Selvakumar, Nishit Anand, Sonal Kumar, Sreyan Ghosh, Ramani Duraiswami, Chirag Agarwal, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Virginia(弗吉尼亚大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03531 2025-07-08 cs.CV cs.AI 74%

Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding

Namho Kim, Junhwa Kim

机构 * Korean Broadcasting System(KBS)(韩国广播系统) Department of Artificial Intelligence(人工智能系) Konyang University(全南大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03097 2025-06-04 cs.CV cs.AI 74%

EgoVLM: Policy Optimization for Egocentric Video Understanding

Ashwin Vinod, Shrey Pandit, Aditya Vavre, Linshen Liu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments Our Code can be found at https://github.com/adityavavre/VidEgoVLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24690 2025-06-02 cs.CV 74%

Learning reusable concepts across different egocentric video understanding tasks

Simone Alberto Peirone, Francesca Pistilli, Antonio Alliegro, Tatiana Tommasi, Giuseppe Averta

机构 * Politecnico di Torino(托里诺理工学院)

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments Extended abstract derived from arXiv:2502.02487. Presented at the Second Joint Egocentric Vision (EgoVis) Workshop (CVPR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09573 2025-04-29 cs.CV cs.CL cs.LG 74%

Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering

Mark Beliaev, Victor Yang, Madhura Raju, Jiachen Sun, Xinghai Hu

机构 * Tiktok Inc.(字节跳动公司)

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18152 2025-04-28 cs.CV 74%

ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding

Yi-Xing Peng, Qize Yang, Yu-Ming Tang, Shenghao Fu, Kun-Yu Lin, Xihan Wei, Wei-Shi Zheng

机构 * Sun Yat-sen University, China(中山大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室)

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11223 2025-03-19 cs.CV 74%

Efficient Transfer Learning for Video-language Foundation Models

Haoxing Chen, Zizheng Huang, Yan Hong, Yanshuo Wang, Zhongcai Lyu, Zhuoer Xu, Jun Lan, Zhangxuan Gu

专题命中 视频理解 :video-language(title);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00162 2025-03-04 cs.CV cs.AI cs.CL cs.MA 74%

PreMind: Multi-Agent Video Understanding for Advanced Indexing of Presentation-style Videos

Kangda Wei, Zhengyu Zhou, Bingqing Wang, Jun Araki, Lukas Lange, Ruihong Huang, Zhe Feng

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15111 2025-01-28 cs.CV 74%

HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding

Jiaxing Zhao, Qize Yang, Yixing Peng, Detao Bai, Shimin Yao, Boyuan Sun, Xiang Chen, Shenghao Fu, Weixuan chen, Xihan Wei, Liefeng Bo

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11021 2024-12-04 cs.CV cs.AI 74%

Towards Neuro-Symbolic Video Understanding

Minkyu Choi, Harsh Goel, Mohammad Omama, Yunhao Yang, Sahil Shah, Sandeep Chinchali

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments Accepted by The European Conference on Computer Vision (ECCV) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03531 2024-11-07 cs.CV cs.AI 74%

Personalized Video Summarization by Multimodal Video Understanding

Brian Chen, Xiangyuan Zhao, Yingnan Zhu

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments In Proceedings of CIKM 2024 Applied Research Track

Journal ref 33rd ACM International Conference on Information and Knowledge Management (CIKM 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17987 2024-09-27 cs.CV cs.HC 74%

LLM4Brain: Training a Large Language Model for Brain Video Understanding

Ruizhe Zheng, Lichao Sun

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments ECCV2024 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13606 2024-09-23 cs.CV cs.LG 74%

Towards Child-Inclusive Clinical Video Understanding for Autism Spectrum Disorder

Aditya Kommineni, Digbalay Bose, Tiantian Feng, So Hyun Kim, Helen Tager-Flusberg, Somer Bishop, Catherine Lord, Sudarsana Kadiri, Shrikanth Narayanan

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08150 2024-09-06 cs.CV 74%

Hypergraph Multi-modal Large Language Model: Exploiting EEG and Eye-tracking Modalities to Evaluate Heterogeneous Responses for Video Understanding

Minghui Wu, Chenxu Zhao, Anyang Su, Donglin Di, Tianyu Fu, Da An, Min He, Ya Gao, Meng Ma, Kun Yan, Ping Wang

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments Accepted by ACM MULTIMEDIA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08024 2024-06-13 cs.CV cs.AI 74%

Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models

Shimin Chen, Yitian Yuan, Shaoxiang Chen, Zequn Jie, Lin Ma

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05424 2024-06-11 cs.CV 74%

Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models

Muhammad Maaz, Hanoona Rasheed, Salman Khan, Fahad Shahbaz Khan

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments ACL 2024 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00322 2024-04-02 cs.CV 74%

Instrument-tissue Interaction Detection Framework for Surgical Video Understanding

Wenjun Lin, Yan Hu, Huazhu Fu, Mingming Yang, Chin-Boon Chng, Ryo Kawasaki, Cheekong Chui, Jiang Liu

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03050 2024-03-18 cs.CV 74%

HIG: Hierarchical Interlacement Graph Approach to Scene Graph Generation in Video Understanding

Trong-Thuan Nguyen, Pha Nguyen, Khoa Luu

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15313 2023-09-28 cs.CV 74%

M$^{3}$3D: Learning 3D priors using Multi-Modal Masked Autoencoders for 2D image and video understanding

Muhammad Abdullah Jamal, Omid Mohareri

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11244 2023-08-23 cs.CV 74%

Are current long-term video understanding datasets long-term?

Ombretta Strafforello, Klamer Schutte, Jan van Gemert

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏