arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-31 至 2026-08-31 共收录 10 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2608.27871 2026-08-31 cs.CV 新提交 83%

Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding

时序思维树:面向长视频理解的推理引导型视觉线索搜索

Ziling Huang, Shin'ichi Satoh

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 该研究针对MLLMs长视频理解的时序组织缺失问题,提出无训练的T³框架,通过分层时序树与“回答-检索-探索”循环实现粗到细的线索搜索,在三个基准数据集上提升了Qwen2.5-VL-7B的性能。

Comments Accept by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27929 2026-08-31 cs.CV 新提交 79%

Training-Free Temporal Abstraction for General Video Understanding

用于通用视频理解的无训练时间抽象

Etienne Casanova, Sevan Brodjian, Pietro Perona

机构 * California Institute of Technology(加州理工学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出无训练的STITCH方法,将视频划分为语义时间块,在三个视频理解任务上表现具竞争力,为通用视频理解提供新方向。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27881 2026-08-31 cs.CV 新提交 79%

StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models

StreamEMS:面向视觉语言模型的自演进记忆方案的流视频理解

Yuxin Liu, Peiqin Zhuang, Yali Wang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本研究提出StreamEMS机制,通过语义与先验感知两个演进模块优化记忆表征,在OVO-Bench等数据集上优于现有方法,高token下降率下仍具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28138 2026-08-31 cs.CV 新提交 57%

Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models

令牌预算蒸馏:将全令牌语义迁移至压缩视频视觉语言模型

Xiaoyang Guo, Guoping Luo, Jusheng Zhang, Keze Wang, Wenhao Wang

机构 * Sun Yat-sen University(中山大学) The University of British Columbia(不列颠哥伦比亚大学) Vast Intelligence Lab(威斯特智能实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出令牌预算蒸馏(TBD)框架,通过双路径师生设计结合LoRA适配器与FlashVID压缩,在固定令牌预算下适配视频VLMs,大幅压缩令牌时仍能保留高语义性能,在多基准测试中优于仅压缩基线。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28008 2026-08-31 cs.CV 新提交 57%

Visual Token Coding for Video Multimodal Large Language Models

面向视频多模态大语言模型的视觉令牌编码

Chenxin Fang, Tao Chen, JunChao You, Jun Peng, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出面向视频多模态大语言模型的视觉令牌编码VTC,新增动态设计得到$VTC_{Dy}$,在Qwen3-VL等模型上实验显示其在低令牌预算下仍保持高性能,且为即插即用设计无需额外调优。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2608.27922 2026-08-31 cs.CV 新提交 88%

DensityKV: Density-Guided KV Cache Compression for Long Video Generation

DensityKV:面向长视频生成的密度引导式KV缓存压缩

Wenqu Zhao, Xuemin Chi, Xin Zhang, Guoqing Ma, Baorun Li, Jianjie Fang, Peizhi Tang, Chen Gao, Wei Wu

机构 * Manifold AI(流形人工智能) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract);分类 cs.CV

AI总结 DensityKV是一种无需训练的历史KV库管理策略,通过密度引导压缩KV缓存,提升长视频生成的时序一致性与稳定性,且存储不随推演长度增长。

Comments 17 pages, 9 figures, 2 tables. Code: this https URL (https://github.com/ZhaoWQQ/DensityKV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28460 2026-08-31 cs.CV 新提交 83%

LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video Generation

LayerRecall:用于视频生成中长时序一致性的状态条件化记忆路由

Yixuan Ding, Jiahao Kong, Wei Huang, Ruijie Quan, Yi Yang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出LayerRecall记忆路由与CHPM训练方法,在不牺牲局部连续性的前提下提升视频生成长程一致性,在MemoBench、MovieBench等数据集上取得最优结果,且具备跨主干可移植性与低推理开销。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2608.28404 2026-08-31 cs.CV 新提交 83%

How Far Can 5,500 Hours of Driving Take You? A Scaling Law Analysis of Video Diffusion Models

5500小时驾驶数据能带来多大提升?视频扩散模型的缩放定律分析

Victor Besnier, Anh-Quan Cao, Elias Ramzi, Spyros Gidaris, Tuan-Hung Vu, Andrei Bursuc, Eloi Zablocki, Matthieu Cord

机构 * Sorbonne Université(索邦大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本研究针对自动驾驶视频生成,通过对100万至90亿参数的视频扩散模型开展缩放定律分析,明确训练时长、模型规模、数据量的影响,训练出的90亿参数模型在nuScenes上达到开源最优。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2608.28406 2026-08-31 cs.CV cs.LG 新提交 70%

Post-Training VLMs for Video Mistake Detection

用于视频错误检测的后训练视觉语言模型

Federico Spurio, Olga Zatsarynna, Lars Doorenbos, Emad Bahrami, Gianpiero Francesca, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Toyota Motor Europe Belgium(丰田汽车欧洲比利时公司)

专题命中 视频问答 :video-language(abstract,abstract_cn);分类 cs.CV

AI总结 针对视频错误检测的闭集方法泛化性差的问题,提出首个VLM后训练技术,采用定制奖励函数,在EP-VQA上较最佳基线提升11.6%,实现更好的泛化。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2608.27529 2026-08-31 cs.CV 新提交 57%

Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction

重新审视长时序流3D重建中的局部上下文

Jiarong Han, Jincheng Xiong, Yuzhou Liu, Linzhe Shi, Changjie Wu, Ning Guo, Mu Xu, Hang Zhang, Ming Qian

机构 * Alibaba Group(阿里巴巴集团)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出ABot-Recon流3D重建模型,仅缓存前11帧KV特征,通过局部上下文减少累积漂移,在Oxford Spires数据集上将ATE、RPE-R误差降低约40%,提升了长时序性能。

Comments Project Page: this https URL (https://amap-cvlab.github.io/ABot-Recon-html/), Code: this https URL (https://github.com/amap-cvlab/ABot-Recon)

详情

展开后加载摘要…

URL PDF HTML 收藏