arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-09-01 至 2026-09-01 共收录 19 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2608.29958 2026-09-01 cs.CV 新提交 86%

RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding

RIDGE:用于长视频理解的区域感知导数引导证据选择

Shanqing Xu, Meng Luo, Mengchen Qian, Yuhui Gao, Siyue Peng, Xiaohan Zhong, Xiaojin Zhang, Zhongyu Wei, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 视频理解 :long video(title,abstract);video understanding(title);分类 cs.CV

AI总结 针对长视频理解中视觉内容超出LVLM固定token预算的问题,提出RIDGE框架,通过将帧-查询相似性曲线作为时间信号划分区域并选择证据,在多基准和主干上取得最优性能。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30294 2026-09-01 cs.CV 新提交 83%

Dynamic Hub-and-Spoke Memory for Streaming Video Understanding

用于流视频理解的动态轮辐式记忆

Xinru Jiang, Lin Zhao, Xi Xiao, Yunbei Zhang, Janet Wang, Chenrui Ma, Haolin Li, Yanzhi Wang, Yifan Gong, Octavia Camps

机构 * Northeastern University(东北大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Tulane University(杜兰大学) University of Virginia(弗吉尼亚大学) Adobe Research(奥多比研究院)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 针对流视频理解需同时紧凑记忆长程历史与高效检索相关证据的挑战,提出动态轮辐式记忆(D-HSM)框架,结合结构化文本记忆与近期视觉标记,在基准上提升VLM性能并优于现有基线。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28666 2026-09-01 cs.CV 新提交 83%

Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting

通过结构化视频提示提升视频-语言模型的时空推理能力

Sadegh Mohammadian

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 视频理解 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 该研究提出无需训练的结构化视频提示方法,在推理时通过为视频添加时空结构锚点,提升视频-语言模型在时空推理任务上的性能,为改进视频理解提供了实用方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30279 2026-09-01 cs.CV 新提交 74%

Motion-Saliency Complementary Masked Modeling for Point Cloud Video Understanding

面向点云视频理解的运动显著性互补掩码建模

Wei Wang, Yiding Sun, Yuyan Wang, Zhuoyue Zhang, Zhengqiao Li, Dongfu Yin, Chen Li

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) State Key Laboratory of Intelligent Geotechnics and Tunnelling (FSDI)(智能岩土与隧道工程国家重点实验室) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) School of Information and Communication Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 该研究提出MoSaiC框架,结合CMSM、NFM、CTCP组件实现自监督点云视频表示学习,在多个下游任务上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29711 2026-09-01 cs.CL 新提交 50%

DVBench: Benchmarking MLLMs for Understanding Dynamic Charts and Narratives in Data Videos

DVBench:用于评估多模态大语言模型(MLLMs)理解数据视频中动态图表与叙事的基准

Bomiao Wang, Zekai Shao, Jiexiang Lan, Xiaoliang Fu, Xingchen Zeng, Siming Chen

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频理解 :video understanding(abstract)

AI总结 本研究推出DVBench基准,评估MLLMs在结合动态图表与叙事的数据视频理解上的表现,发现开源模型性能不严格随参数规模扩展等现象,为MLLM发展提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 6 篇

2608.30194 2026-09-01 cs.CV 新提交 88%

NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation

NoisEasier:用于文本到视频生成的测试时噪声优化

Yujiang Pu, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本研究提出NoisEasier框架,通过测试时噪声优化提升文本到视频生成的组合对齐效果,在多数据集实验中取得超10%平均增益,为可控文本到视频生成提供有效新范式。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31106 2026-09-01 cs.CV cs.SD 新提交 79%

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

DreamX-Creator:实现2K分辨率原生音视频生成的民主化

Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang, Bingze Song, Jiachen Lei, Ruimin Lin, Jiahong Wu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DreamX-Creator 1.0是基于7B生成器的紧凑原生联合音视频生成系统,通过多阶段训练与2K细化流水线实现2K分辨率同步音视频生成,性能达开源先进水平,旨在推动该领域研究民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29621 2026-09-01 cs.CV cs.AI 新提交 79%

CineForge: Self-Improving Agents for Long-Horizon Video Generation

CineForge:用于长时序视频生成的自改进智能体

Junxiang Liu, Lin Wang, Haiyu Shi, Hongxu Ma, Xiaoyu Yang, Chunjie Chen, Xiaoxiao Xu, Kaiqiao Zhan, Boao Wang, Shuizhou Shi, Tianyun Zhu, Jie Li, Jiangtong Li

机构 * Tongji University(同济大学) Kuaishou Technology(快手科技) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本研究提出CineForge框架,结合CineForge-Produce与CineForge-Evolve,通过CPPE策略演进机制提升长时序故事驱动视频生成效果,在CineScope指标及基准测试中表现优于现有方法,减少了审查LLM调用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28694 2026-09-01 cs.CV 新提交 79%

SNF-Bench: Separating Static Drift from Natural Flow in Long-Horizon Fixed-Camera Video Generation

SNF-Bench:分离长视野固定相机视频生成中的静态漂移与自然流动

Matiur Rahman Minar, Seunghun Oh, Ganghyeon Jeong, Unsang Park

机构 * Sogang University(西江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SNF-Bench 是针对长视野固定相机视频生成的评估框架,可分离静态漂移与自然流动,实验发现全帧运动与静态区域漂移对输出排序几乎相反,其指标能针对性评估对应因素。

Comments Project page: https://minar09.github.io/snfbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29123 2026-09-01 cs.CV 新提交 74%

Dancing Stick Figures: An Introductory Dataset for Training Video Generation Models

跳舞的简笔画人物:用于训练视频生成模型的入门级数据集

Jin Hyuk Cho

机构 * Sprited(斯普里特公司) Dataset(数据集机构)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文针对视频生成模型训练的反馈循环长、数据难获取、评分粗糙三大痛点,构建了跳舞的简笔画人物数据集,该数据集规模适配单GPU训练,提供低预算训练流程,且含丰富标注以支持精准评估。

Comments 9 pages, 4 figures. Dataset, code, reference models, and Colab notebook are linked from the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29469 2026-09-01 physics.optics 新提交 50%

Artificial Intelligence in a Photonic Temporal Processor

光子时间处理器中的人工智能

Youlve Chen, Jinlong Xiang, Yimin Hu, Yuchen Yin, Chaojun Xu, Zhengshun Lei, Xin Wang, Yufeng Zhang, Yixiao Zhu, Qunbi Zhuge, Junwen Zhang, Wei Chu, Tao Lin, Yikai Su, Zhipei Sun, Xuhan Guo

专题命中 视频生成 :video generation(abstract)

AI总结 该研究提出光子时间处理器,通过时空对偶性实现可扩展的光学神经网络,完成分类、图像视频生成等任务,性能优于现有系统,为下一代机器智能提供了新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2608.29598 2026-09-01 cs.LG 新提交 88%

On the Resilience of Text-to-Video Diffusion Models to Hardware Faults

文本到视频扩散模型对硬件故障的鲁棒性研究

Zachary Coalson, A M Aahad, Stella Doehring, Zane Ma, Sanghyun Hong

机构 * Oregon State University(俄勒冈州立大学)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract)

AI总结 本研究首次系统性探究文本到视频(T2V)扩散模型对硬件故障的鲁棒性,发现单个故障可降低性能、改变语义,内存故障危害更大,揭示了已部署T2V系统的可靠性风险。

Comments Accepted to ICML 2026 Workshop on From Frames to Stories (F2S)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29322 2026-09-01 cs.CV 新提交 79%

Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling

基于诊断引导候选回收的视频扩散模型测试时缩放

Hangzhou He, Lunhao Duan, Shanshan Zhao, Kaiwen Li, Qing-Guo Chen, Weihua Luo, Yanye Lu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对视频扩散模型测试时缩放的“生成-丢弃”范式缺陷,提出无需训练的 GEARS 框架,通过阶段感知调度器与候选回收器提升轻量模型性能,在 VBench 上使 13 亿参数模型得分接近 140 亿参数模型。

Comments Accepted by ACM TOG (SIGGRAPH Asia 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28670 2026-09-01 cs.CV 新提交 57%

Memory-Efficient Training-Free Acceleration of Diffusion Transformers with BaryCache

基于BaryCache的内存高效无训练扩散Transformer加速方法

Chengjie Lu, Tianchi Deng, Zhengqi He, Zhijian Gao, Huisi Wu, Xueliang Li

机构 * College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本研究提出无训练加速方法BaryCache,采用重心外推器缓解扩散Transformer采样的振荡伪影,在图像与视频生成中实现最高3.30倍采样加速,兼顾内存与感知质量。

Comments Accepted by ICITES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 2 篇

2608.28675 2026-09-01 cs.CV cs.CL 新提交 79%

Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning

用于视频推理的多智能体自增强强化学习

Mingwen Zhang, Jisheng Dang, Minqiang Yang, Bimei Wang, Bin Hu, Tat-Seng Chua

机构 * Lanzhou University(兰州大学) National University of Singapore(新加坡国立大学)

专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV

AI总结 该研究提出结合可训练Grounder与冻结Verifier的多智能体强化学习框架,在20亿参数规模下实现视频推理任务零样本迁移,相关指标优于同等规模基线,验证了冻结验证作为证据选择训练信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30716 2026-09-01 cs.CL cs.CV 新提交 57%

SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

SocialReasonBench:基于反事实叙事视频的社会推理视频问答基准

Zheyu Huang, Zijing Shi, Haozhe Luo, Huadong Tang, Mingyu Liu, Meng Fang, Ling Chen

机构 * AAII, University of Technology Sydney(悉尼科技大学AAII(先进人工智能研究所)) Northeastern University(东北大学) Fudan University(复旦大学) University of Liverpool(利物浦大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 研究人员推出SocialReasonBench基准,评估LMMs的社会推理能力,发现其在反事实和因果推理上表现不佳,凸显了模型在潜在社会状态推理上的不足。

Comments Accepted to Findings of EMNLP 2026. 24 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 1 篇

2608.30897 2026-09-01 cs.AI 新提交 50%

CAER: Causal Action Effect Reweighting for World Model Training

CAER:面向世界模型训练的因果动作效应重加权

Jianjie Fang, Xvyuan Liu, Ziyou Wang, Rongze Tang, Zhaolu Wang, Zhuohang Li, Xin Zhang, Haisheng Su, Chen Gao, Wei Wu, Xinlei Chen, Yong Li

专题命中 动作与事件理解 :video generation(abstract)

AI总结 针对现有动作条件世界模型训练中交互动态未充分优化的问题,提出CAER范式,通过在线定位动作因果影响的令牌并重加权,提升了生成视频的物理一致性、可控性与视觉质量。

Comments 14 pages, 8 figures. Project page: https://manifoldai-research.github.io/CAER/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 长视频与时序推理 1 篇

2608.29910 2026-09-01 cs.CV 新提交 57%

Matrix-Game 3.5: Enhancing Real-Time Streaming Interactive World Models with Patch Memory

Matrix-Game 3.5:利用补丁内存增强实时流式交互式世界模型

Runjia Qian, Zile Wang, Jihai Zhang, Kai Zou, Wei Yu, Jiaxing Li, Zexiang Liu, Yaokun Li, Fei Kang, Kaichen Huang, Mengyin An, Haobo Zhang, Biao Jiang, Jiahua Wang, Haofeng Sun, Yang Liu, Yangguang Li

机构 * Riemann Dynamics(黎曼动力学)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 Matrix-Game 3.5通过三项关键改进优化交互式世界模型,实现稳定长时序实时交互式生成,在多类任务上表现出色。

Comments https://matrix-game-v3-5.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 视频数据与评测 1 篇

2608.28784 2026-09-01 cs.CV 新提交 70%

ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement

ClearText-Video:连接视频修复与场景文本增强的大规模以文本为中心的视频数据集

Jinlong Li, Jiaming Ding, Dingfu Lu, Malcolm Hsiu, Chuang Ke, Kangning Yang, Bochen Guan, Lan Fu, Jie Cai, Huiming Sun, Zibo Meng

机构 * OPPO US AI Center(OPPO美国人工智能中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 研究团队推出ClearText-Video数据集,评估发现视觉增强未必提升文本推理,仅OCR管道远逊于多模态推理,为相关系统提供基础。

Comments This paper is accepted by 2026 Proceedings of the European Conference on Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏