arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-27 至 2026-08-27 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2608.25729 2026-08-27 cs.CV 新提交 86%

LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding

LongVU-TTT:用于长视频理解中视觉重采样的因果测试时训练方法

Mahmoud Ahmed, Sameh Abdulah, Olatunji Ruwase, Sam Ade Jacobs, Mathis Bode, Mohamed Elhoseiny

机构 * KAUST(阿卜杜拉国王科技大学) Snowflake(雪花公司) Microsoft Inc.(微软公司) Jülich Supercomputing Centre, Forschungszentrum Jülich(于利希研究中心于利希超级计算中心)

专题命中 视频理解 :video understanding(title,abstract);long video(title);分类 cs.CV

AI总结 LongVU-TTT在视觉编码器与LLM间插入带因果快速权重更新的卷积TTT重采样器,通过混合选择器保留帧证据,在五个视频理解基准测试中性能具竞争力,较多种基线方法有明显提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25529 2026-08-27 cs.CV 新提交 79%

Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios

Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力

Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng, Xiaoxing Hu, Yuhao Dong, Mengdan Zhang, Yunhang Shen, Haoyu Cao, Wei Liu, Weibo Gu, Xing Sun, Shengjie Zhao

机构 * TJU(天津大学) Tencent Youtu Lab(腾讯优图实验室) SJTU(上海交通大学) Tencent Hunyuan(腾讯混元) CUHK(香港中文大学) NTU(南洋理工大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文推出Video-IFBench基准,构建含四类模板的指令分类体系与半自动数据 pipeline,评估20余种MLLMs的视频指令遵循能力,发现当前模型在复杂指令上仍具挑战,推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25356 2026-08-27 cs.CV 新提交 79%

Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding

关注何处至关重要:面向长视频理解的策略内自蒸馏

Kaishen Wang, Dongdi Zhao, Yijun Liang, Dingqiang Ye, Ruibo Chen, Heng Huang, Di Fu

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 该研究针对长视频理解中全视频冗余干扰问题,提出Clue-OPSD线索特权策略内自蒸馏框架,无需线索标注,可提升模型准确率并优于相关基线。

Comments 15 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25559 2026-08-27 cs.CV cs.AI 新提交 57%

AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research

AdaVDR:面向视频深度研究的自适应工具使用与反思

Xintong Zhang, Xiaomeng Fan, Shilin Yan, Ekko He, Zicheng Liu, Zijian Zou, Guannan Zhang, Yuwei Wu, Zhi Gao, Hongwei Xue

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出AdaVDR自适应视频深度研究智能体,通过自适应工具调用与反思解决视频深度研究的不当工具调用等问题,构建相关基准并在VDR-EE、VideoDR上取得优于基础模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏