arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-01 至 2026-01-01 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2512.24271 2026-01-01 cs.CV cs.AI 86%

Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation

驯服幻觉:通过反事实视频生成提升MLLMs的视频理解

Zhe Huang, Hao Wen, Aiming Hao, Bingze Song, Meiqi Wu, Jiahong Wu, Xiangxiang Chu, Sheng Lu, Haoqian Wang

机构 * Tsinghua University(清华大学) Beihang University(北航) AMAP, Alibaba Group(阿里妈妈实验室,阿里巴巴集团)

专题命中 视频理解 :video understanding(title,abstract);video generation(title);分类 cs.CV

AI总结 通过反事实视频生成和对比训练,提升MLLMs对视频的理解能力并减少幻觉。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24097 2026-01-01 cs.CV cs.AI cs.CL cs.MM 84%

Factorized Learning for Temporally Grounded Video-Language Models

分解学习用于时间感知的视频-语言模型

Wenzheng Zeng, Difei Gao, Mike Zheng Shou, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学)

专题命中 视频理解 :video-language(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本文提出D$^2$VLM框架,通过分解学习方法提升视频-语言模型在时间定位和文本响应任务中的性能,引入证据标记和FPO算法以优化学习过程。

Comments ICCV 2025 paper. This arXiv version updates Figure 1 to include the concurrent work Qwen2.5-VL to ensure consistency with Table 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03183 2026-01-01 cs.CV cs.LG 83%

MaxInfo: A Training-Free Key-Frame Selection Method Using Maximum Volume for Enhanced Video Understanding

MaxInfo: 一种基于最大体积的无训练关键帧选择方法以提升视频理解

Pengyi Li, Irina Abdullaeva, Alexander Gambashidze, Andrey Kuznetsov, Ivan Oseledets

机构 * AXXX, Russia(AXXX, 俄罗斯) FusionBrain Lab, Russia(融合脑实验室, 俄罗斯) Institute of Numerical Mathematics, Russia(数值数学研究所, 俄罗斯) Innopolis University, Russia(因诺波利斯大学, 俄罗斯)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 MaxInfo是一种基于最大体积原理的无训练关键帧选择方法,通过提升视频理解性能,有效减少冗余并保持多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏