arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-01 至 2026-01-01 共收录 16 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2512.24271 2026-01-01 cs.CV cs.AI 86%

Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation

驯服幻觉:通过反事实视频生成提升MLLMs的视频理解

Zhe Huang, Hao Wen, Aiming Hao, Bingze Song, Meiqi Wu, Jiahong Wu, Xiangxiang Chu, Sheng Lu, Haoqian Wang

机构 * Tsinghua University(清华大学) Beihang University(北航) AMAP, Alibaba Group(阿里妈妈实验室,阿里巴巴集团)

专题命中 视频理解 :video understanding(title,abstract);video generation(title);分类 cs.CV

AI总结 通过反事实视频生成和对比训练,提升MLLMs对视频的理解能力并减少幻觉。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24097 2026-01-01 cs.CV cs.AI cs.CL cs.MM 84%

Factorized Learning for Temporally Grounded Video-Language Models

分解学习用于时间感知的视频-语言模型

Wenzheng Zeng, Difei Gao, Mike Zheng Shou, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学)

专题命中 视频理解 :video-language(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本文提出D$^2$VLM框架,通过分解学习方法提升视频-语言模型在时间定位和文本响应任务中的性能,引入证据标记和FPO算法以优化学习过程。

Comments ICCV 2025 paper. This arXiv version updates Figure 1 to include the concurrent work Qwen2.5-VL to ensure consistency with Table 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03183 2026-01-01 cs.CV cs.LG 83%

MaxInfo: A Training-Free Key-Frame Selection Method Using Maximum Volume for Enhanced Video Understanding

MaxInfo: 一种基于最大体积的无训练关键帧选择方法以提升视频理解

Pengyi Li, Irina Abdullaeva, Alexander Gambashidze, Andrey Kuznetsov, Ivan Oseledets

机构 * AXXX, Russia(AXXX, 俄罗斯) FusionBrain Lab, Russia(融合脑实验室, 俄罗斯) Institute of Numerical Mathematics, Russia(数值数学研究所, 俄罗斯) Innopolis University, Russia(因诺波利斯大学, 俄罗斯)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 MaxInfo是一种基于最大体积原理的无训练关键帧选择方法,通过提升视频理解性能,有效减少冗余并保持多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2512.21776 2026-01-01 cs.CV cs.AI 83%

Inference-based GAN Video Generation

基于推断的GAN视频生成

Jingbo Yang, Adrian G. Bors

机构 * Department of Computer Science, University of York(计算机科学系,约克大学)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出了一种基于对抗的VAE-GAN混合结构,通过马尔可夫链框架实现长视频生成,解决时序扩展难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24766 2026-01-01 cs.RO cs.AI cs.CV 79%

Dream2Flow: Bridging Video Generation and Open-World Manipulation with 3D Object Flow

Dream2Flow: 通过3D物体流连接视频生成与开放世界操控

Karthik Dharmarajan, Wenlong Huang, Jiajun Wu, Li Fei-Fei, Ruohan Zhang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Dream2Flow通过3D物体流连接视频生成与开放世界操控,实现零样本操控不同类别的物体。

Comments Project website: https://dream2flow.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24724 2026-01-01 cs.CV 74%

FlowBlending: Stage-Aware Multi-Model Sampling for Fast and High-Fidelity Video Generation

FlowBlending: 时序感知多模型采样用于快速且高保真的视频生成

Jibin Song, Mingi Kwon, Jaeseok Jeong, Youngjung Uh

机构 * Yonsei University(延世大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 FlowBlending通过时序感知的多模型采样策略,在保持视觉质量的同时,显著提升视频生成的推理速度和效率。

Comments Project page: https://jibin86.github.io/flowblending_project_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24026 2026-01-01 cs.CV cs.AI 57%

PipeFlow: Pipelined Processing and Motion-Aware Frame Selection for Long-Form Video Editing

PipeFlow: 管道处理与运动感知帧选择用于长格式视频编辑

Mustafa Munir, Md Mostafijur Rahman, Kartikeya Bhardwaj, Paul Whatmough, Radu Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Qualcomm AI Research(高通人工智能研究)

专题命中 视频生成 :long video(abstract);分类 cs.CV

AI总结 PipeFlow通过运动感知帧选择和流水线任务调度,实现长格式视频编辑的高效处理,相比现有方法速度提升达9.6至31.7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20000 2026-01-01 cs.CV 57%

Few-Shot-Based Modular Image-to-Video Adapter for Diffusion Models

基于少样本的模块化图像到视频适配器用于扩散模型

Zhenhao Li, Shaohan Yi, Zheng Liu, Leonartinus Gao, Minh Ngoc Le, Ambrose Ling, Zhuoran Wang, Md Amirul Islam, Zhixiang Chi, Yuanhao Yu

机构 * Huawei Technologies Canada(华为加拿大技术有限公司) University of Waterloo(滑铁卢大学) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出MIVA,一种轻量级模块化适配器,用于在扩散模型中实现更精确的运动控制,同时保持或提升生成质量。

Comments GitHub page: https://github.com/yishaohan/MIVA

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 5 篇

2412.15159 2026-01-01 cs.CV 85%

OnlineVPO: Align Video Diffusion Model with Online Video-Centric Preference Optimization

OnlineVPO: 对齐视频扩散模型与在线视频中心偏好优化

Jiacheng Zhang, Jie Wu, Weifeng Chen, Yatai Ji, Xuefeng Xiao, Weilin Huang, Kai Han

机构 * The University of Hong Kong(香港大学) ByteDance Project Page(字节跳动项目)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 OnlineVPO通过改进反馈源和调节方法,提出一种针对视频扩散模型的高效偏好学习框架,提升视频生成质量与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24227 2026-01-01 cs.CV 83%

Mirage: One-Step Video Diffusion for Photorealistic and Coherent Asset Editing in Driving Scenes

Mirage: 驾驶场景中光实且一致的资产编辑一步视频扩散

Shuyun Wang, Haiyang Sun, Bing Wang, Hangjun Ye, Xin Yu

机构 * The University of Queensland(昆士兰大学) Xiaomi EV(小米电动车)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 Mirage提出了一种用于驾驶场景中光实且一致的资产编辑的一步视频扩散模型,通过引入时序无关的潜在特征和两阶段数据对齐策略,提升了视觉保真度和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01085 2026-01-01 cs.CV 79%

Bidirectional Sparse Attention for Faster Video Diffusion Training

双向稀疏注意力用于更快的视频扩散训练

Chenlu Zhan, Wen Li, Chuyu Shen, Jun Zhang, Suhui Wu, Hao Zhang

机构 * ByteDance(字节跳动)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出双向稀疏注意力框架,通过动态稀疏化查询和键值对,显著提升视频扩散模型的训练效率,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23983 2026-01-01 cs.CV 57%

DriveExplorer: Images-Only Decoupled 4D Reconstruction with Progressive Restoration for Driving View Extrapolation

DriveExplorer: 基于图像的解耦4D重建与渐进修复用于驾驶视角外推

Yuang Jia, Jinlong Wang, Jiayi Zhao, Chunlam Li, Shunzhou Wang, Wei Gao

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省级超高清沉浸媒体技术重点实验室) School of Electronic and Computer Engineering(电子与计算机工程学院) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DriveExplorer通过图像解耦和渐进修复实现驾驶视角外推,利用4D高斯框架和扩散模型提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03119 2026-01-01 cs.CV 57%

Controllable Human-centric Keyframe Interpolation with Generative Prior

可控的人本关键帧插值与生成先验

Zujin Guo, Size Wu, Zhongang Cai, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出PoseFuse3D-KI框架,通过整合3D人体指导信号提升关键帧插值的可控性和保真度,实验表明其在PSNR和LPIPS指标上均优于现有方法。

Comments Project Page: https://gseancdat.github.io/projects/PoseFuse3D_KI

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2512.24323 2026-01-01 cs.CV 57%

Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention

通过双模态因果干预实现鲁棒的自我参照视频目标分割

Haijing Liu, Zhiyuan Song, Hefeng Wu, Tao Pu, Keze Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 CERES通过双模态因果干预方法,在自我参照视频中实现鲁棒的目标分割,提升对快速运动和遮挡的鲁棒性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 2 篇

2512.25075 2026-01-01 cs.CV cs.AI cs.RO 57%

SpaceTimePilot: Generative Rendering of Dynamic Scenes Across Space and Time

SpaceTimePilot: 动态场景在时空上的生成渲染

Zhening Huang, Hyeonho Jeong, Xuelin Chen, Yulia Gryaditskaya, Tuanfeng Y. Wang, Joan Lasenby, Chun-Hao Huang

机构 * University of Cambridge(剑桥大学) Adobe Research(Adobe研究院)

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

AI总结 SpaceTimePilot通过解耦空间和时间实现动态场景的可控生成渲染,结合时序扭曲训练和CamxTime数据集提升时间控制精度。

Comments Project page: https://zheninghuang.github.io/Space-Time-Pilot/ Code: https://github.com/ZheningHuang/spacetimepilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18113 2026-01-01 cs.CV 57%

Chrono: A Simple Blueprint for Representing Time in MLLMs

Chrono: 一种用于多模态大语言模型中表示时间的简单蓝图

Hector Rodriguez, Boris Meinardus, Anil Batra, Anna Rohrbach, Marcus Rohrbach

专题命中 长视频与时序推理 :video-language(abstract);分类 cs.CV

AI总结 Chrono提出了一种简单通用的序列蓝图,用于提升多模态大语言模型在视频时间定位和 grounded 视频问答任务中的性能。

Comments Code: https://github.com/sudo-Boris/mr-Blip. Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Under review

详情

展开后加载摘要…

URL PDF HTML 收藏