arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-31 至 2026-08-31 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 7 篇

2608.27871 2026-08-31 cs.CV 新提交 83%

Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding

时序思维树:面向长视频理解的推理引导型视觉线索搜索

Ziling Huang, Shin'ichi Satoh

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 该研究针对MLLMs长视频理解的时序组织缺失问题,提出无训练的T³框架,通过分层时序树与“回答-检索-探索”循环实现粗到细的线索搜索,在三个基准数据集上提升了Qwen2.5-VL-7B的性能。

Comments Accept by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27929 2026-08-31 cs.CV 新提交 79%

Training-Free Temporal Abstraction for General Video Understanding

用于通用视频理解的无训练时间抽象

Etienne Casanova, Sevan Brodjian, Pietro Perona

机构 * California Institute of Technology(加州理工学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出无训练的STITCH方法,将视频划分为语义时间块,在三个视频理解任务上表现具竞争力,为通用视频理解提供新方向。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27881 2026-08-31 cs.CV 新提交 79%

StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models

StreamEMS:面向视觉语言模型的自演进记忆方案的流视频理解

Yuxin Liu, Peiqin Zhuang, Yali Wang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本研究提出StreamEMS机制,通过语义与先验感知两个演进模块优化记忆表征,在OVO-Bench等数据集上优于现有方法,高token下降率下仍具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10221 2026-08-31 cs.CV cs.AI cs.CL 版本更新 79%

Long Story Short: Story-level Video Understanding from 20K Short Films

长话短说:基于2万部短片的故事级视频理解

Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

机构 * Ecole Polytechnique(巴黎综合理工学院) IP Paris(巴黎理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对现有视频理解数据集的局限,本文构建了2万部业余电影组成的SF20K数据集及配套问答基准,验证其数据泄露有限,证明指令微调可提升VLMs在长期视频理解上的性能。

Comments International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28138 2026-08-31 cs.CV 新提交 57%

Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models

令牌预算蒸馏:将全令牌语义迁移至压缩视频视觉语言模型

Xiaoyang Guo, Guoping Luo, Jusheng Zhang, Keze Wang, Wenhao Wang

机构 * Sun Yat-sen University(中山大学) The University of British Columbia(不列颠哥伦比亚大学) Vast Intelligence Lab(威斯特智能实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出令牌预算蒸馏(TBD)框架,通过双路径师生设计结合LoRA适配器与FlashVID压缩,在固定令牌预算下适配视频VLMs,大幅压缩令牌时仍能保留高语义性能,在多基准测试中优于仅压缩基线。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28008 2026-08-31 cs.CV 新提交 57%

Visual Token Coding for Video Multimodal Large Language Models

面向视频多模态大语言模型的视觉令牌编码

Chenxin Fang, Tao Chen, JunChao You, Jun Peng, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出面向视频多模态大语言模型的视觉令牌编码VTC,新增动态设计得到$VTC_{Dy}$,在Qwen3-VL等模型上实验显示其在低令牌预算下仍保持高性能,且为即插即用设计无需额外调优。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13569 2026-08-31 cs.CV cs.AI 版本更新 57%

GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning

GHR-VLM:通过基于视觉基础的混合推理实现零样本公交视频分析

Kaicong Huang, Weiheng Oh, Jack M. Reilly, Thomas Guggisberg, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 研究旨在实现零样本公交视频分析,提出GHR-VLM框架,利用边缘-云设计,通过轻量级边缘监视器跟踪门状态、分割乘客片段,后端VLM经两阶段细化识别乘客与支付行为,减少云推理,评估显示其在公交支付分析中有潜力且面临视频条件挑战。

Comments Accepted by 2026 IEEE/ACM Symposium on Edge Computing (SEC)

详情

展开后加载摘要…

URL PDF HTML 收藏