arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1388 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1388 篇

2512.18750 2025-12-23 cs.CV 57%

Context-Aware Network Based on Multi-scale Spatio-temporal Attention for Action Recognition in Videos

基于多尺度时空注意力的上下文感知网络用于视频动作识别

Xiaoyang Li, Wenzhu Yang, Kanglin Wang, Tiebiao Wang, Qingsong Fei

机构 * School of Cyber Security and Computer(网络安全与计算机学院) Hebei University(河北省大学) Machine Vision Engineering Research Center(机器视觉工程研究中心)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出基于多尺度时空注意力的上下文感知网络,通过多尺度时间与空间线索模块提升视频动作识别的准确率。

Comments 21 pages, 4 figures. Preprint under review for journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11187 2025-12-16 cs.CV 57%

FastVID: Dynamic Density Pruning for Fast Video Large Language Models

FastVID: 动态密度修剪用于快速视频大语言模型

Leqi Shen, Guoqiang Gong, Tao He, Yifeng Zhang, Pengzhang Liu, Sicheng Zhao, Guiguang Ding

机构 * School of Software, Tsinghua University(清华大学软件学院) BNRist, Tsinghua University(清华大学BNRist) GRG Banking Equipment Co., Ltd.(GRG银行设备有限公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 FastVID通过动态密度修剪技术,显著降低视频大语言模型的计算开销,同时保持高准确性,实现高效的视频处理性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02427 2025-12-12 cs.CV cs.RO 57%

From the Laboratory to Real-World Application: Evaluating Zero-Shot Scene Interpretation on Edge Devices for Mobile Robotics

从实验室到现实应用:评估边缘设备上用于移动机器人的零样本场景解读

Nicolas Schuler, Lea Dewald, Nick Baldig, Jürgen Graf

机构 * Laboratories for Cognitive Systems and Robotics(认知系统与机器人实验室) University of Luxembourg(卢森堡大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文评估了适用于移动机器人边缘设备的小型视觉语言模型在零样本场景解读任务中的性能与应用潜力。

Comments 15 pages, 6 figures, 1 table; accepted for AI-2025 Forty-fifth SGAI International Conference on Artificial Intelligence CAMBRIDGE, ENGLAND 16-18 DECEMBER 2025

Journal ref Artificial Intelligence XLII. SGAI-AI 2025. Lecture Notes in Computer Science, vol 16302. Springer, Cham (2026), pp 301-315

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08979 2025-12-11 cs.CV cs.AI 57%

What Happens When: Learning Temporal Orders of Events in Videos

当什么发生时:学习视频中事件的时间顺序

Daechul Ahn, Yura Choi, Hyeonbeom Choi, Seongwon Cho, San Kim, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) Imperial College London(帝国理工学院伦敦分校)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出MECOT方法,通过事件级描述训练和思维链提示提升视频模型对事件时间顺序的理解能力。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07747 2025-12-09 cs.CV 57%

Unison: A Fully Automatic, Task-Universal, and Low-Cost Framework for Unified Understanding and Generation

Unison: 一个完全自动、任务通用且低成本的统一理解和生成框架

Shihao Zhao, Yitong Chen, Zeyinzi Jiang, Bojia Zi, Shaozhe Hao, Yu Liu, Chaojie Mao, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 Unison提出一个低成本、全自动的多模态理解和生成框架,通过两阶段方案实现任务自适应,覆盖多种理解和生成任务,提升生成质量与自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18405 2025-12-09 cs.CV cs.LG 57%

Iwin Transformer: Hierarchical Vision Transformer using Interleaved Windows

Iwin Transformer:基于交错窗口的分层视觉Transformer

Simin Huo, Ning Li

专题命中 视频理解 :video generation(abstract);分类 cs.CV

AI总结 Iwin Transformer通过交错窗口注意力和深度可分离卷积实现无位置嵌入的分层视觉Transformer,提升图像分类、语义分割和视频动作识别等任务的性能。

Comments 17 pages, 12 figures, Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence. Add additional video experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04643 2025-12-05 cs.CV cs.AI cs.CL cs.LG 57%

SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding

SEASON: 通过自诊断对比解码缓解视频大语言模型中的时间幻觉

Chang-Hsun Wu, Kai-Po Chang, Yu-Yang Sheng, Hung-Kai Chung, Kuei-Chun Wang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 SEASON通过自诊断对比解码方法,无需训练即可提升视频大语言模型在时间信息处理上的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01853 2025-12-03 cs.CV 57%

COACH: Collaborative Agents for Contextual Highlighting -- A Multi-Agent Framework for Sports Video Analysis

COACH:基于上下文高亮的协作代理——一种多代理框架用于体育视频分析

Tsz-To Wong, Ching-Chun Huang, Hong-Han Shuai

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 COACH提出一种多代理框架,通过协作代理实现体育视频分析中的上下文高亮,提升时间层次结构的理解与跨任务适应性。

Comments Accepted by AAAI 2026 Workshop LaMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01949 2025-12-02 cs.CV 57%

Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models

脚本:图结构和查询条件的语义令牌修剪用于多模态大语言模型

Zhongyu Yang, Dannong Xu, Wei Pang, Yingfang Yuan

机构 * BCML, Heriot-Watt University(赫瑞瓦德大学BCML中心)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 Script通过图结构和查询条件的语义令牌修剪,提升多模态大语言模型的效率和准确性,实现显著的性能提升。

Comments Published in Transactions on Machine Learning Research, Project in https://01yzzyu.github.io/script.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00024 2025-12-02 cs.RO cs.CV 57%

Learning from Watching: Scalable Extraction of Manipulation Trajectories from Human Videos

通过观看学习:从人类视频中可扩展地提取操作轨迹

X. Hu, G. Ye

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出结合大规模基础模型与点跟踪技术,从人类视频中提取操作轨迹,以实现更高效的数据收集和机器人学习。

Comments Accepted to RSS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00279 2025-12-01 cs.MM cs.AI cs.CL cs.DC cs.LG cs.SD 57%

LongCat-Flash-Omni Technical Report

LongCat-Flash-Omni 技术报告

Meituan LongCat Team, Bairui Wang, Bayan, Bin Xiao, Bo Zhang, Bolin Rong, Borun Chen, Chang Wan, Chao Zhang, Chen Huang, Chen Chen, Chen Chen, Chengxu Yang, Chengzuo Yang, Cong Han, Dandan Peng, Delian Ruan, Detai Xin, Disong Wang, Dongchao Yang, Fanfan Liu, Fengjiao Chen, Fengyu Yang, Gan Dong, Gang Huang, Gang Xu, Guanglu Wan, Guoqiang Tan, Guoqiao Yu, Haibo Qiu, Hao Lu, Hongbo Liu, Hongyu Xiang, Jiaheng Wu, Jian Yang, Jiaxing Liu, Jing Huang, Jingang Wang, Jinrui Ding, Juchao Jiang, Jun Kuang, Jun Wang, Junhui Mei, Ke Ding, Kefeng Zhang, Lei Chen, Liang Shi, Limeng Qiao, Liming Zheng, Lin Ma, Liuyang Guo, Liya Ma, Luying Sun, Man Gao, Mengshen Zhu, Miao Cao, Minliang Lin, Nuo Xu, Peng Shi, Qi Zhang, Qian Fang, Qian Wang, Qian Yang, Quanxiu Wang, Rongxiang Weng, Rongxin Guo, Ruoxuan Liang, Senbin Yang, Shanbo Xu, Shanglin Lei, Shengze Ye, Shimin Chen, Shuaiqi Chen, Shujie Hu, Shuo Li, Siqi Yang, Siyu Xu, Siyu Ren, Song Li, Songxiang Liu, Tianhao Bai, Tianye Dai, Wei Hong, Wei Wang, Weixiao Zhao, Wengang Cao, Wenlong Zhu, Wenlong He, Xi Su, Xi Nan, Xiaohan Zhao, Xiaohao Wang, Xiaoyu Zhao, Xiaoyu Wang, Xiaoyu Li, Xin Pan, Xin Chen, Xiusong Sun, Xu Xiang, Xudong Xing, Xuezhi Cao, Xunliang Cai, Yang Yang, Yanli Tan, Yao Yao, Yerui Sun, Yi Chen, Yifan Lu, Yin Gong, Yining Zhang, Yitian Chen, Yiyang Gan, Yuchen Tang, Yuchen Xie, Yueqian Wang, Yuewen Zheng, Yufei Zhang, Yufeng Zhong, Yulei Qian, Yuqi Peng, Yuqian Li, Yuwei Jiang, Zeyang Hu, Zheng Zhang, Zhengkun Tian, Zhiqing Hong, Zhixiong Zeng, Zhuqi Mi, Ziran Li, Ziwen Wang, Ziyi Zhao, Ziyuan Zhuang, Zizhe Zhao

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 视频理解 :video understanding(abstract);分类 cs.MM

AI总结 LongCat-Flash-Omni 是一个具有5600亿参数的开源多模态模型,通过课程启发式训练策略实现高效实时音频视觉交互,具备强大的多模态和单模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10068 2025-12-01 cs.CV cs.AI cs.CL 57%

Mavors: Multi-granularity Video Representation for Multimodal Large Language Model

Mavors:多粒度视频表示用于多模态大语言模型

Yang Shi, Jiaheng Liu, Yushuo Guan, Zhenhua Wu, Yuanxing Zhang, Zihao Wang, Weihong Lin, Jingyun Hua, Zekun Wang, Xinlong Chen, Bohan Zeng, Wentao Zhang, Fuzheng Zhang, Wenjing Yang, Di Zhang

机构 * Peking University(北京大学) Kling Team(Kling团队) Nanjing University(南京大学) CASIA(中国科学院自动化研究所)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 Mavors通过多粒度视频表示方法,提升多模态大语言模型在长视频理解中的时空模式保留与计算效率平衡能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21783 2025-11-25 cs.CV 57%

Prompt-guided Disentangled Representation for Action Recognition

基于提示的解耦表示用于动作识别

Tianci Wu, Guangming Zhu, Jiang Lu, Siyuan Wang, Ning Wang, Nuoye Xiong, Zhang Liang

机构 * School of Computer Science and Technology, Xidian University(电子科技大学计算机科学与技术学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出ProDA框架,通过动态提示模块和空间时间场景图实现动作解耦,提升多动作场景下的动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14446 2025-11-19 cs.CV cs.AI 57%

Agentic Video Intelligence: A Flexible Framework for Advanced Video Exploration and Understanding

Hong Gao, Yiming Bao, Xuezhen Tu, Yutong Xu, Yue Jin, Yiyang Mu, Bin Zhong, Linan Yue, Min-Ling Zhang

机构 * SouthEast University(东南大学) ZTE Corporation(中兴通讯)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14120 2025-11-19 cs.CV cs.AI 57%

Multi-view Phase-aware Pedestrian-Vehicle Incident Reasoning Framework with Vision-Language Models

Hao Zhen, Yunxiang Yang, Jidong J. Yang

机构 * College of Engineering University of Georgia(工程学院 乔治亚大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 23 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14454 2025-11-19 cs.CV 57%

Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models

Xuyang Liu, Yiyu Wang, Junpeng Ma, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Fudan University(复旦大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23447 2025-11-18 cs.CV 57%

CA^2ST: Cross-Attention in Audio, Space, and Time for Holistic Video Recognition

Jongseo Lee, Joohyun Chang, Dongho Lee, Jinwoo Choi

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Our paper has been accepted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18094 2025-11-11 cs.CV cs.AI 57%

UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning

Ye Liu, Zongyang Ma, Junfu Pu, Zhongang Qi, Yang Wu, Ying Shan, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) vivo Mobile Communication Co.(vivo移动通信公司) MindWingman Technology (Shenzhen) Co., Ltd.(深圳MindWingman技术有限公司)

专题命中 视频理解 :video-language(abstract);分类 cs.CV

Comments NeurIPS 2025 Camera Ready. Project Page: https://polyu-chenlab.github.io/unipixel/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05833 2025-11-11 cs.CV 57%

TYrPPG: Uncomplicated and Enhanced Learning Capability rPPG for Remote Heart Rate Estimation

Taixi Chen, Yiu-ming Cheung

机构 * School of Computing, Binghamton University(计算学院,宾夕法尼亚州立大学) Department of Computer Science, Hong Kong Baptist University(计算机科学系,香港 Baptist 大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments The 6th International Workshop on AI for Social Good in the Connected World (AI4SG)@ IEEE WI-IAT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21657 2025-11-03 cs.CV 57%

FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction

Yixiang Dai, Fan Jiang, Chiyu Wang, Mu Xu, Yonggang Qi

机构 * AMAP, Alibaba Group(阿里集团AMAP) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26027 2025-10-31 cs.CV 57%

Enhancing Temporal Understanding in Video-LLMs through Stacked Temporal Attention in Vision Encoders

Ali Rasekh, Erfan Bagheri Soula, Omid Daliran, Simon Gottschalk, Mohsen Fayyaz

机构 * Leibniz University Hannover(莱比锡大学汉诺威分校) L3S Research Center(L3S研究中心) Microsoft(微软公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23569 2025-10-28 cs.CV 57%

EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT

Baoqi Pei, Yifei Huang, Jilan Xu, Yuping He, Guo Chen, Fei Wu, Yu Qiao, Jiangmiao Pang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) The University of Tokyo(东京大学) Fudan University(复旦大学) Nanjing University(南京大学)

专题命中 视频理解 :video reasoning(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23473 2025-10-28 cs.CV 57%

Video-Thinker: Sparking "Thinking with Videos" via Reinforcement Learning

Shijian Wang, Jiarui Jin, Xingjian Wang, Linxin Song, Runhao Fu, Hecheng Wang, Zongyuan Ge, Yuan Lu, Xuelian Cheng

机构 * Southeast University(东南大学) Monash University(墨尔本大学) Xiaohongshu Inc.(小红书公司) University of Southern California(南加州大学) Fudan University(复旦大学)

专题命中 视频理解 :video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23397 2025-10-28 cs.CV 57%

VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations

Lu Dong, Haiyu Zhang, Han Lin, Ziang Yan, Xiangyu Zeng, Hongjie Zhang, Yifei Huang, Yi Wang, Zhen-Hua Ling, Limin Wang, Yali Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03885 2025-10-24 cs.CV 57%

Video, How Do Your Tokens Merge?

Sam Pollard, Michael Wray

机构 * University of Bristol(布里斯托大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted at eLVM workshop at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19150 2025-10-23 cs.CV cs.AI cs.LG 57%

X-Ego: Acquiring Team-Level Tactical Situational Awareness via Cross-Egocentric Contrastive Video Representation Learning

Yunzhe Wang, Soham Hans, Volkan Ustun

机构 * University of Southern California(南加州大学) USC Institute for Creative Technologies(USC创意技术研究所)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16209 2025-10-21 cs.CV 57%

StretchySnake: Flexible SSM Training Unlocks Action Recognition Across Spatio-Temporal Scales

Nyle Siddiqui, Rohit Gupta, Sirnam Swetha, Mubarak Shah

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16836 2025-10-16 cs.CV cs.AI 57%

Fact-R1: Towards Explainable Video Misinformation Detection with Deep Reasoning

Fanrui Zhang, Dian Li, Qiang Zhang, Jun Chen, Gang Liu, Junxiong Lin, Jiahong Yan, Jiawei Liu, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, USTC(脑启发智能感知与认知国家重点实验室,中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Tencent QQ(腾讯QQ) Fudan University(复旦大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 34 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11907 2025-10-15 cs.CV 57%

Task-Specific Dual-Model Framework for Comprehensive Traffic Safety Video Description and Analysis

Blessing Agyei Kyem, Neema Jakisa Owor, Andrews Danyo, Joshua Kofi Asamoah, Eugene Denteh, Tanner Muturi, Anthony Dontoh, Yaw Adu-Gyamfi, Armstrong Aboah

机构 * North Dakota State University(北达科塔州立大学) University of Missouri–Columbia(密苏里大学哥伦比亚分校) University of Memphis(孟菲斯大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments This paper was accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10986 2025-10-14 cs.CV 57%

Mixup Helps Understanding Multimodal Video Better

Xiaoyu Ma, Ding Ding, Hao Chen

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(计算机科学与工程学院,东南大学,南京,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用关键实验室(东南大学),教育部,中国)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏