arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-09 至 2025-12-09 共收录 22 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2511.23478 2025-12-09 cs.CV 70%

Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models

Video-R2: 通过强化一致性和基于现实的推理提升多模态语言模型

Muhammad Maaz, Hanoona Rasheed, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Linköping University(林肯皮大学) Australian National University(澳大利亚国立大学)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 Video-R2通过强化学习提升多模态模型在视频推理中的时间对齐和逻辑一致性,提高准确性和可信度。

Comments Video-R2 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06866 2025-12-09 cs.CV cs.AI cs.CL cs.LG 70%

Less Is More, but Where? Dynamic Token Compression via LLM-Guided Keyframe Prior

少即是多,但在哪里?通过LLM引导的关键帧先验实现动态令牌压缩

Yulin Li, Haokun Gui, Ziyang Fan, Junjie Wang, Bin Kang, Bin Chen, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出DyToK方法,通过LLM引导的关键帧先验实现动态令牌压缩,提升视频处理效率和准确性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21699 2025-12-09 cs.MM cs.AI cs.CV cs.SD eess.AS 62%

MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX

MAVERIX:多模态音频视觉评估与识别指数

Liuyue Xie, Avik Kuthiala, George Z. Wei, Ce Zheng, Ananya Bal, Mosam Dabhi, Liting Wen, Taru Rustagi, Ethan Lai, Sushil Khyalia, Rohan Choudhury, Morteza Ziyadi, Xu Zhang, Hao Yang, László A. Jeni

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 MAVERIX是一个用于评估多模态模型音频视觉整合能力的统一基准,通过精心设计的问题展示模型在跨模态理解上的性能,揭示了与人类水平的显著差距。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07747 2025-12-09 cs.CV 57%

Unison: A Fully Automatic, Task-Universal, and Low-Cost Framework for Unified Understanding and Generation

Unison: 一个完全自动、任务通用且低成本的统一理解和生成框架

Shihao Zhao, Yitong Chen, Zeyinzi Jiang, Bojia Zi, Shaozhe Hao, Yu Liu, Chaojie Mao, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 Unison提出一个低成本、全自动的多模态理解和生成框架,通过两阶段方案实现任务自适应,覆盖多种理解和生成任务,提升生成质量与自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 9 篇

2512.07328 2025-12-09 cs.CV cs.AI 88%

ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation

ContextAnyone: 基于上下文的扩散模型用于一致的文本到视频生成

Ziyang Mai, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 ContextAnyone通过上下文感知扩散模型实现从文本和参考图像生成一致的角色视频,结合双引导损失和Gap-RoPE位置嵌入提升视觉质量和身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07831 2025-12-09 cs.CV 79%

UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation

UnityVideo: 一体化多模态多任务学习以增强世界感知视频生成

Jiehui Huang, Yuechen Zhang, Xu He, Yuan Gao, Zhi Cen, Bin Xia, Yan Zhou, Xin Tao, Pengfei Wan, Jiaya Jia

机构 * HKUST(香港科技大学) CUHK(香港中文大学) Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 UnityVideo通过一体化多模态多任务学习提升视频生成的世界感知能力,引入动态噪声化和模态切换器,实现更全面的世界知识表示。

Comments Project Website https://jackailab.github.io/Projects/UnityVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07821 2025-12-09 cs.CV cs.AI 79%

WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling

WorldReel:基于一致几何和运动建模的4D视频生成

Shaoheng Fang, Hanwen Jiang, Yunpeng Bai, Niloy J. Mitra, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(Adobe研究) University College London(伦敦大学学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 WorldReel通过联合生成RGB帧和4D场景表示,实现了动态场景和移动摄像机下的4D一致视频生成,提升了几何一致性与运动一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07802 2025-12-09 cs.CV 79%

OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory

OneStory: 通过自适应记忆实现连贯的多镜头视频生成

Zhaochong An, Menglin Jia, Haonan Qiu, Zijian Zhou, Xiaoke Huang, Zhiheng Liu, Weiming Ren, Kumara Kahatapitiya, Ding Liu, Sen He, Chenyang Zhang, Tao Xiang, Fanny Yang, Serge Belongie, Tian Xie

机构 * University of Copenhagen(哥本哈根大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 OneStory通过自适应记忆实现多镜头视频生成,提升叙事连贯性和生成质量。

Comments Project Page: https://zhaochongan.github.io/projects/OneStory

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06905 2025-12-09 cs.CV 79%

Scaling Zero-Shot Reference-to-Video Generation

缩放零样本参考到视频生成

Zijian Zhou, Shikun Liu, Haozhe Liu, Haonan Qiu, Zhaochong An, Weiming Ren, Zhiheng Liu, Xiaoke Huang, Kam Woh Ng, Tian Xie, Xiao Han, Yuren Cong, Hang Li, Chuyan Zhu, Aditya Patel, Tao Xiang, Sen He

机构 * Meta AI King's College London

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Saber通过零样本框架实现高效参考到视频生成,无需显式数据,通过掩码训练和注意力模型提升泛化能力。

Comments Website: https://franciszzj.github.io/Saber/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06963 2025-12-09 cs.RO cs.AI cs.CV 57%

VideoVLA: Video Generators Can Be Generalizable Robot Manipulators

VideoVLA: 视频生成器可以成为通用的机器人操作器

Yichao Shen, Fangyun Wei, Zhiying Du, Yaobo Liang, Yan Lu, Jiaolong Yang, Nanning Zheng, Baining Guo

机构 * IAIR, Xi’an Jiaotong University(人工智能研究院、西安交通大学) Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 VideoVLA通过将视频生成模型转化为机器人VLA操作器,实现了动作与视觉后果的双预测,提升机器人操作的泛化能力。

Comments Project page: https://videovla-nips2025.github.io

Journal ref The Thirty-ninth Annual Conference on Neural Information Processing Systems(NeurIPS2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06674 2025-12-09 cs.CV 57%

RunawayEvil: Jailbreaking the Image-to-Video Generative Models

RunawayEvil: 对图像到视频生成模型的劫持

Songping Wang, Rufan Qian, Yueming Lyu, Qinglong Liu, Linzhuang Zou, Jie Qin, Songhua Liu, Caifeng Shan

机构 * PRLab, Nanjing University(南京大学PRLab) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 RunawayEvil是一种针对图像到视频生成模型的多模态劫持框架,通过自我进化机制实现动态攻击策略,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06022 2025-12-09 cs.SD cs.MM 57%

DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation

DreamFoley: 用于高保真视频到音频生成的可扩展视觉-语言模型

Fu Li, Weichao Zhao, You Li, Zhichao Zhou, Dongliang He

机构 * Bytedance Intelligent Creation Lab(字节跳动智能创作实验室) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(abstract);分类 cs.MM

AI总结 DreamFoley通过结合视觉-语言模型,提出了一种可扩展的视频到音频生成方法,实现了高保真音频生成并优化了训练效率与质量的平衡。

Comments 10 pages; Bytedance

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05969 2025-12-09 cs.CV cs.AI 57%

Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven' Matrices

视频模型开始解决国际象棋、迷宫、数独、心理旋转和雷文矩阵任务

Hokin Deng

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 视频模型通过强化学习提升推理能力,在多项任务上达到60%的成功率。

Comments See $\href{https://grow-ai-like-a-child.com/video-reason/}{results}$ and $\href{https://github.com/hokindeng/VMEvalKit}{code}$

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2512.07350 2025-12-09 cs.DC 82%

Communication-Efficient Serving for Video Diffusion Models with Latent Parallelism

面向视频扩散模型的通信高效服务与潜在并行性

Zhiyuan Wu, Shuai Wang, Li Chen, Kaihui Gao, Dan Li, Yanyu Ren, Qiming Zhang, Yong Wang

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)

AI总结 本文提出潜在并行性策略,通过动态旋转潜在空间维度,显著降低视频扩散模型服务的通信开销,同时保持生成质量。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05952 2025-12-09 cs.CV 57%

Coefficients-Preserving Sampling for Reinforcement Learning with Flow Matching

为流匹配强化学习中的系数保持采样

Feng Wang, Zihao Yu

机构 * CreateAI

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 通过系数保持采样方法,减少流匹配强化学习中的噪声伪影,提升奖励建模精度和优化器收敛稳定性。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10963 2025-12-09 cs.CV 57%

EVCtrl: Efficient Control Adapter for Visual Generation

EVCtrl: 用于视觉生成的高效控制适配器

Zixiang Yang, Yue Ma, Yinhan Zhang, Shanhui Mo, Dongrui Liu, Linfeng Zhang

机构 * UESTC(电子科技大学) HKUST(香港科技大学) SJTU(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 EVCtrl通过轻量级控制适配器提升视觉生成效率,实现高效可控生成,无需重新训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2512.06158 2025-12-09 cs.CV 70%

Tracking-Guided 4D Generation: Foundation-Tracker Motion Priors for 3D Model Animation

基于跟踪的4D生成:用于3D模型动画的基础跟踪器运动先验

Su Sun, Cheng Zhao, Himangi Mittal, Gaurav Mittal, Rohith Kukkala, Yingjie Victor Chen, Mei Chen

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 Track4DGen通过结合基础跟踪器和混合4D高斯点划法,提升多视角视频生成和4D生成的稳定性与精度。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 2 篇

2506.19852 2025-12-09 cs.CV cs.AI cs.LG 89%

Radial Attention: $O(n\log n)$ Sparse Attention with Energy Decay for Long Video Generation

径向注意力:具有能量衰减的 $O(n\log n)$ 稀疏注意力用于长视频生成

Xingyang Li, Muyang Li, Tianle Cai, Haocheng Xi, Shuo Yang, Yujun Lin, Lvmin Zhang, Songlin Yang, Jinbo Hu, Kelly Peng, Maneesh Agrawala, Ion Stoica, Kurt Keutzer, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达) Princeton(普林斯顿大学) UC Berkeley(加州大学伯克利分校) Stanford(斯坦福大学) First Intelligence(第一智能)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出径向注意力,通过能量衰减机制实现高效的长视频生成,显著提升生成速度并降低计算成本。

Comments Accepted to NeurIPS 2025, Code: https://github.com/mit-han-lab/radial-attention

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26360 2025-12-09 cs.CV cs.AI 83%

TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos

TimeScope: 向长视频中面向任务的时序定位迈进

Xiangrui Liu, Minghao Qin, Yan Shu, Zhengyang Liang, Yang Tian, Chen Jason Zhang, Bo Zhao, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) University of Trento(特伦多大学) Singapore Management University(新加坡管理大学)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 TimeScope通过逐步推理实现长视频中面向任务的时序定位,提升定位精度并增强下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 3 篇

2512.06376 2025-12-09 cs.CV 70%

Are AI-Generated Driving Videos Ready for Autonomous Driving? A Diagnostic Evaluation Framework

AI生成的驾驶视频是否准备好用于自动驾驶?一种诊断评估框架

Xinhao Xiang, Abhijeet Rastogi, Jiawei Zhang

机构 * IFM Lab, University of California, Davis(加州大学戴维斯分校IFM实验室)

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出了一种诊断评估框架,系统研究AI生成驾驶视频在自动驾驶训练和评估中的可靠性,通过分析失败模式和构建基准测试,验证了过滤AIGVs可提升性能并补充现实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06921 2025-12-09 cs.CV cs.AI cs.CL 57%

NeuroABench: A Multimodal Evaluation Benchmark for Neurosurgical Anatomy Identification

NeuroABench: 一种多模态评估基准,用于神经外科解剖识别

Ziyang Song, Zelin Zang, Xiaofan Ye, Boqiang Xu, Long Bai, Jinlin Wu, Hongliang Ren, Hongbin Liu, Jiebo Luo, Zhen Lei

机构 * Hong Kong Institute of Science and Innovation(香港科学与创新研究院) The University of Hong Kong-Shenzhen Hospital(香港大学深圳医院) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 NeuroABench是首个用于评估神经外科领域解剖理解的多模态基准,通过实验揭示了MLLMs在解剖识别任务中的局限性,并展示了人类表现与模型之间的差距。

Comments Accepted by IEEE ICIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06810 2025-12-09 cs.CV cs.CL 57%

MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning

MMDuet2:通过多轮强化学习增强视频MLLMs的主动交互

Yueqian Wang, Songxiang Liu, Disong Wang, Nuo Xu, Guanglu Wan, Huishuai Zhang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 MMDuet2通过多轮强化学习方法,实现了视频MLLMs在多轮对话中的主动交互,提升了回复时机和质量,达到ProactiveVideoQA基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏