arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-09-01 至 2026-09-01 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 8 篇

2608.29958 2026-09-01 cs.CV 新提交 86%

RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding

RIDGE:用于长视频理解的区域感知导数引导证据选择

Shanqing Xu, Meng Luo, Mengchen Qian, Yuhui Gao, Siyue Peng, Xiaohan Zhong, Xiaojin Zhang, Zhongyu Wei, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 视频理解 :long video(title,abstract);video understanding(title);分类 cs.CV

AI总结 针对长视频理解中视觉内容超出LVLM固定token预算的问题,提出RIDGE框架,通过将帧-查询相似性曲线作为时间信号划分区域并选择证据,在多基准和主干上取得最优性能。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30294 2026-09-01 cs.CV 新提交 83%

Dynamic Hub-and-Spoke Memory for Streaming Video Understanding

用于流视频理解的动态轮辐式记忆

Xinru Jiang, Lin Zhao, Xi Xiao, Yunbei Zhang, Janet Wang, Chenrui Ma, Haolin Li, Yanzhi Wang, Yifan Gong, Octavia Camps

机构 * Northeastern University(东北大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Tulane University(杜兰大学) University of Virginia(弗吉尼亚大学) Adobe Research(奥多比研究院)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 针对流视频理解需同时紧凑记忆长程历史与高效检索相关证据的挑战,提出动态轮辐式记忆(D-HSM)框架,结合结构化文本记忆与近期视觉标记,在基准上提升VLM性能并优于现有基线。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28666 2026-09-01 cs.CV 新提交 83%

Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting

通过结构化视频提示提升视频-语言模型的时空推理能力

Sadegh Mohammadian

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 视频理解 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 该研究提出无需训练的结构化视频提示方法,在推理时通过为视频添加时空结构锚点,提升视频-语言模型在时空推理任务上的性能,为改进视频理解提供了实用方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18586 2026-09-01 cs.CV cs.AI 版本更新 79%

APT: Atomic Physical Transitions for Causal Video-Language Understanding

APT: 用于因果视频语言理解的原子物理转变

Shang Wu, Haoran Lu, Songling Liu, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 视频理解 :video-language(title);video understanding(abstract);分类 cs.CV

AI总结 提出原子物理转变(APT)作为视频中因果状态变化的显式表示,并构建混合来源数据集,通过APT-Tune微调方法使VLM学习物理转变而不遗忘事件级知识。

Comments v2:Expanded the experiment section with more baselines. Expand supplementary materials and LLM usage--corrected some typographical errors, and corrected author-affiliation information that was inaccurate in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12335 2026-09-01 cs.CV cs.LG 版本更新 79%

SynMulti: Synthetic-to-Real Learning for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 14 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30279 2026-09-01 cs.CV 新提交 74%

Motion-Saliency Complementary Masked Modeling for Point Cloud Video Understanding

面向点云视频理解的运动显著性互补掩码建模

Wei Wang, Yiding Sun, Yuyan Wang, Zhuoyue Zhang, Zhengqiao Li, Dongfu Yin, Chen Li

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) State Key Laboratory of Intelligent Geotechnics and Tunnelling (FSDI)(智能岩土与隧道工程国家重点实验室) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) School of Information and Communication Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 该研究提出MoSaiC框架,结合CMSM、NFM、CTCP组件实现自监督点云视频表示学习,在多个下游任务上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23649 2026-09-01 cs.RO cs.CV 版本更新 57%

RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion

RoboMirror: 在模仿之前理解以实现视频到仿人运动

Zhe Li, Boan Zhu, Yangyang Wei, Shuanghao Bai, Yuheng Ji, Yibo Peng, Tao Huang, Pengwei Wang, Zhongyuan Wang, S. -H. Gary Chan, Chang Xu, Cheng Chi, Jianfei Yang, Shanghang Zhang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29711 2026-09-01 cs.CL 新提交 50%

DVBench: Benchmarking MLLMs for Understanding Dynamic Charts and Narratives in Data Videos

DVBench:用于评估多模态大语言模型(MLLMs)理解数据视频中动态图表与叙事的基准

Bomiao Wang, Zekai Shao, Jiexiang Lan, Xiaoliang Fu, Xingchen Zeng, Siming Chen

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频理解 :video understanding(abstract)

AI总结 本研究推出DVBench基准,评估MLLMs在结合动态图表与叙事的数据视频理解上的表现,发现开源模型性能不严格随参数规模扩展等现象,为MLLM发展提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏