arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-23 至 2025-12-23 共收录 19 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 6 篇

2503.10200 2025-12-23 cs.CV 88%

LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents

LVAgent: 通过多轮动态协作的MLLM代理实现长视频理解

Boyu Chen, Zhengrong Yue, Siran Chen, Zikang Wang, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 LVAgent通过多轮动态协作的MLLM代理提升长视频理解性能,实现80%的准确率并在LongVideoBench上提升13.3%

Comments accepted in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18671 2025-12-23 cs.CV 79%

SmartSight: Mitigating Hallucination in Video-LLMs Without Compromising Video Understanding via Temporal Attention Collapse

SmartSight: 通过时间注意力崩溃缓解视频大语言模型中的幻觉而不影响视频理解

Yiming Sun, Mi Zhang, Feifei Li, Geng Hong, Min Yang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 SmartSight通过时间注意力崩溃技术,在不牺牲视频理解能力的前提下,有效降低视频大语言模型的幻觉问题。

Comments AAAI26 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07576 2025-12-23 cs.CV 79%

Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding

超级编码网络:多模态编码器的递归关联用于视频理解

Boyu Chen, Siran Chen, Kunchang Li, Qinglin Xu, Yu Qiao, Yali Wang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出超级编码网络,通过递归关联多模态编码器提升视频理解性能,显著提升跟踪、识别、聊天和编辑等任务效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19687 2025-12-23 cs.SD cs.CV cs.LG 57%

Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learning

推动音频视觉感知前沿:大规模多模态对应学习

Apoorv Vyas, Heng-Jui Chang, Cheng-Fu Yang, Po-Yao Huang, Luya Gao, Julius Richter, Sanyuan Chen, Matt Le, Piotr Dollár, Christoph Feichtenhofer, Ann Lee, Wei-Ning Hsu

机构 * Meta Superintelligence Labs(Meta超级智能实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 PE-AV通过大规模多模态对应学习提升音频视频理解,支持跨模态嵌入并实现语音检索等新任务,同时开发PE-A-Frame实现细粒度音频-文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18878 2025-12-23 cs.CV cs.AI 57%

CrashChat: A Multimodal Large Language Model for Multitask Traffic Crash Video Analysis

CrashChat: 一种多模态大语言模型用于多任务交通事故视频分析

Kaidi Liang, Ke Li, Xianbiao Hu, Ruwen Qin

机构 * Stony Brook University(石溪大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 CrashChat是一种多模态大语言模型,用于多任务交通事故视频分析,通过任务解耦和分组策略提升事故识别、定位等任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18750 2025-12-23 cs.CV 57%

Context-Aware Network Based on Multi-scale Spatio-temporal Attention for Action Recognition in Videos

基于多尺度时空注意力的上下文感知网络用于视频动作识别

Xiaoyang Li, Wenzhu Yang, Kanglin Wang, Tiebiao Wang, Qingsong Fei

机构 * School of Cyber Security and Computer(网络安全与计算机学院) Hebei University(河北省大学) Machine Vision Engineering Research Center(机器视觉工程研究中心)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出基于多尺度时空注意力的上下文感知网络,通过多尺度时间与空间线索模块提升视频动作识别的准确率。

Comments 21 pages, 4 figures. Preprint under review for journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 7 篇

2503.02341 2025-12-23 cs.CV cs.AI cs.LG 86%

GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning

GRADEO: 通过多步骤推理实现文本到视频生成的人类级评估

Zhun Mou, Bin Xia, Zhengchao Huang, Wenming Yang, Jiaya Jia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) CSE department, The Chinese University of Hong Kong, Hong Kong,China(中国香港大学计算机科学与工程系,中国香港,中国) Department of Computer Science(计算机科学系) Engineering, The Hong Kong University of Science(工程,香港科学大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV

AI总结 GRADEO通过多步骤推理实现文本到视频生成的人类级评估,提出多维评估数据集和专门设计的视频评估模型,提升评估的可解释性和与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19020 2025-12-23 cs.CV cs.LG 83%

CETCAM: Camera-Controllable Video Generation via Consistent and Extensible Tokenization

CETCAM: 通过一致且可扩展的分词实现相机可控的视频生成

Zelin Zhao, Xinyu Gong, Bangya Liu, Ziyang Song, Jun Zhang, Suhui Wu, Yongxin Chen, Hao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) ByteDance(字节跳动) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 CETCAM通过一致且可扩展的分词方案实现相机可控的视频生成,提高了几何一致性和视觉真实性,同时支持额外的控制模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14428 2025-12-23 cs.CV cs.AI 83%

Comp-Attn: Present-and-Align Attention for Compositional Video Generation

Comp-Attn: 为组合视频生成的呈现与对齐注意力

Hongyu Zhang, Yufan Deng, Shenghai Yuan, Yian Zhao, Peng Jin, Xuehan Hou, Chang Liu, Jie Chen

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Tsinghua University, Beijing, China(清华大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 Comp-Attn通过呈现与对齐范式解决T2V生成中主体存在与关系对齐问题,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21559 2025-12-23 cs.CV 79%

X-CoT: Explainable Text-to-Video Retrieval via LLM-based Chain-of-Thought Reasoning

X-CoT:基于LLM链式推理的可解释文本到视频检索

Prasanna Reddy Pulakurthi, Jiamian Wang, Majid Rabbani, Sohail Dianat, Raghuveer Rao, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 X-CoT通过基于LLM的链式推理实现文本到视频检索的可解释性,提升检索性能并提供详细的推理依据。

Comments 12 pages, 7 figures. Accepted at EMNLP 2025 (Main Conference)

Journal ref Proc. EMNLP 2025, pages 31172-31183, Suzhou, China, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13704 2025-12-23 cs.CV 79%

TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models

TiViBench: 用于视频生成模型的视频推理基准测试

Harold Haodong Chen, Disen Lan, Wen-Jie Shu, Qingyang Liu, Zihan Wang, Sirui Chen, Wenkai Cheng, Kanghao Chen, Hongfei Zhang, Zixin Zhang, Rongjin Guo, Yu Cheng, Ying-Cong Chen

专题命中 视频生成 :video reasoning(title);video generation(abstract);分类 cs.CV

AI总结 TiViBench提出用于评估视频生成模型的推理能力,结合VideoTPO提升推理性能,揭示商业与开源模型在推理潜力上的差异。

Comments Project: https://haroldchen19.github.io/TiViBench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19048 2025-12-23 cs.CV 70%

WaTeRFlow: Watermark Temporal Robustness via Flow Consistency

WaTeRFlow:通过流一致性实现水印时间鲁棒性

Utae Jeong, Sumin In, Hyunju Ryu, Jaewan Choi, Feng Yang, Jongheon Jeong, Seungryong Kim, Sangpil Kim

机构 * Korea University(韩国大学) Google DeepMind(谷歌DeepMind) KAIST AI(韩国科学技术院人工智能)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 WaTeRFlow通过流一致性提升I2V场景下的水印鲁棒性,结合FUSE引擎、时间一致性损失和语义保持损失,实现跨模态水印恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18614 2025-12-23 cs.CV cs.AI 70%

PTTA: A Pure Text-to-Animation Framework for High-Quality Creation

PTTA: 一种用于高质量动画创作的纯文本到动画框架

Ruiqi Chen, Kaitong Cai, Yijia Fan, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 PTTA是一种纯文本到动画框架,通过微调HunyuanVideo模型实现高质量动画生成,优于现有基线方法。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2512.18772 2025-12-23 cs.CV 83%

In-Context Audio Control of Video Diffusion Transformers

上下文音频控制视频扩散变换器

Wenze Liu, Weicai Ye, Minghong Cai, Quande Liu, Xintao Wang, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出ICAC框架,通过三维注意力机制实现音频驱动的视频生成,解决时间同步信号在视频扩散模型中的整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12898 2025-12-23 cs.LG cs.AI cs.CV cs.RO 79%

Vidar: Embodied Video Diffusion Model for Generalist Manipulation

Vidar:面向通用操作的具身视频扩散模型

Yao Feng, Hengkai Tan, Xinyi Mao, Chendong Xiang, Guodong Liu, Shuhe Huang, Hang Su, Jun Zhu

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 Vidar通过具身视频扩散模型和掩码逆动力学模型,实现了在不同机器人形态上的通用操作,仅需少量人类演示即可超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19678 2025-12-23 cs.CV cs.AI 74%

WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion

WorldWarp: 通过异步视频扩散传播3D几何

Hanyang Kong, Xingyi Yang, Xiaoxu Zheng, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 WorldWarp通过结合3D结构锚和2D生成细化器,利用时空扩散模型实现几何一致的视频生成,解决遮挡和复杂轨迹问题。

Comments Project page: https://hyokong.github.io/worldwarp-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18814 2025-12-23 cs.CV 57%

EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer

EchoMotion: 通过双模态扩散变换器实现统一的人体视频与运动生成

Yuxiao Yang, Hualian Sheng, Sijia Cai, Jing Lin, Jiahao Wang, Bing Deng, Junzhe Lu, Haoqian Wang, Jieping Ye

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Nanyang Technology University(南阳技术大学) Xi’an Jiaotong University(西安交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 EchoMotion通过双模态扩散变换器统一生成人体视频与运动,提升复杂人类动作视频的连贯性与合理性。

Comments 26 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 2 篇

2512.19539 2025-12-23 cs.CV 83%

StoryMem: Multi-shot Long Video Storytelling with Memory

StoryMem: 基于记忆的多镜头长视频叙事

Kaiwen Zhang, Liming Jiang, Angtian Wang, Jacob Zhiyuan Fang, Tiancheng Zhi, Qing Yan, Hao Kang, Xin Lu, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 长视频与时序推理 :long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 StoryMem通过基于记忆的迭代镜头合成,实现了高质量多镜头视频叙事,提升了跨镜头一致性与审美质量。

Comments Project page: https://kevin-thu.github.io/StoryMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17020 2025-12-23 cs.CV 79%

CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms

CrossLMM: 通过双交叉注意力机制解耦长视频序列与LMMs

Shilin Yan, Jiaming Han, Joey Tsai, Hongwei Xue, Rongyao Fang, Lingyi Hong, Ziyu Guo, Ray Zhang

机构 * Accio Team, Alibaba Group(阿里集团阿奇奥团队) CUHK MMLab(CUHK多模态实验室) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV

AI总结 CrossLMM通过双交叉注意力机制解耦长视频序列,有效减少视觉token数量并保持性能,适用于多种视频多模态模型基准测试。

Comments Project page: https://github.com/shilinyan99/CrossLMM

详情

展开后加载摘要…

URL PDF HTML 收藏