arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-27 至 2026-08-27 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2608.25729 2026-08-27 cs.CV 新提交 86%

LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding

LongVU-TTT:用于长视频理解中视觉重采样的因果测试时训练方法

Mahmoud Ahmed, Sameh Abdulah, Olatunji Ruwase, Sam Ade Jacobs, Mathis Bode, Mohamed Elhoseiny

机构 * KAUST(阿卜杜拉国王科技大学) Snowflake(雪花公司) Microsoft Inc.(微软公司) Jülich Supercomputing Centre, Forschungszentrum Jülich(于利希研究中心于利希超级计算中心)

专题命中 视频理解 :video understanding(title,abstract);long video(title);分类 cs.CV

AI总结 LongVU-TTT在视觉编码器与LLM间插入带因果快速权重更新的卷积TTT重采样器,通过混合选择器保留帧证据,在五个视频理解基准测试中性能具竞争力,较多种基线方法有明显提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25529 2026-08-27 cs.CV 新提交 79%

Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios

Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力

Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng, Xiaoxing Hu, Yuhao Dong, Mengdan Zhang, Yunhang Shen, Haoyu Cao, Wei Liu, Weibo Gu, Xing Sun, Shengjie Zhao

机构 * TJU(天津大学) Tencent Youtu Lab(腾讯优图实验室) SJTU(上海交通大学) Tencent Hunyuan(腾讯混元) CUHK(香港中文大学) NTU(南洋理工大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文推出Video-IFBench基准,构建含四类模板的指令分类体系与半自动数据 pipeline,评估20余种MLLMs的视频指令遵循能力,发现当前模型在复杂指令上仍具挑战,推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25356 2026-08-27 cs.CV 新提交 79%

Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding

关注何处至关重要:面向长视频理解的策略内自蒸馏

Kaishen Wang, Dongdi Zhao, Yijun Liang, Dingqiang Ye, Ruibo Chen, Heng Huang, Di Fu

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 该研究针对长视频理解中全视频冗余干扰问题,提出Clue-OPSD线索特权策略内自蒸馏框架,无需线索标注,可提升模型准确率并优于相关基线。

Comments 15 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25559 2026-08-27 cs.CV cs.AI 新提交 57%

AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research

AdaVDR:面向视频深度研究的自适应工具使用与反思

Xintong Zhang, Xiaomeng Fan, Shilin Yan, Ekko He, Zicheng Liu, Zijian Zou, Guannan Zhang, Yuwei Wu, Zhi Gao, Hongwei Xue

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出AdaVDR自适应视频深度研究智能体,通过自适应工具调用与反思解决视频深度研究的不当工具调用等问题,构建相关基准并在VDR-EE、VideoDR上取得优于基础模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2608.25479 2026-08-27 cs.CV cs.AI 新提交 83%

4DStreamCtrl: Interactive Video Generation with Online 4D Control

4DStreamCtrl:基于在线4D控制的交互式视频生成

Shiqian Li, Chenguo Lin, Zhiguang Liu, Yu Tang, Jiarong Ou, Rui Chen, Yixin Zhu

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯混元)

专题命中 视频生成 :video generation(title);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 4DStreamCtrl将相机运动、物体轨迹与深度统一为3D点轨迹表示,结合蒸馏的因果流式模型,首次实现交互式4D可控实时视频生成,精度与效率均优于现有方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26105 2026-08-27 cs.CV cs.AI cs.LG cs.MM cs.RO 新提交 62%

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

VBVR-Pro:用于原生视觉推理的可扩展且可验证工具套件

Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou, Chenyang Gu, Jing Zuo, Hongcan Xiao, Yimeng Geng, Wanqi Yin, Wei Chen, Oscar Qian, Zhengan Yan, Ziqi Huang, Haiwen Diao, Liang Pan, Bo Li, Xiangyu Fan, Dezhi Luo, Fengyuan Yu, Zehong Zhao, Qingying Gao, Tinghui Zhu, Yilan Zhang, Jingqi Tong, Pinyuan Feng, Zhengze Jiang, Letian Wang, Ziyu Guo, Renrui Zhang, Jieneng Chen, Sonia Joseph, Constantin Venhoff, Saman Motamed, Mengyue Yang, Chandra Sripada, Alan Yuille, Philip Torr, Lvmin Zhang, Vikash Kumar, Daniel Khashabi, Nikolaus Kriegeskorte, Raphaël Millière, Vincent C. Müller, Anyi Rao, Quan Wang, Ziwei Liu, Dahua Lin, Lei Yang, Hokin Deng, Zhongang Cai

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo(东京大学) The Chinese University of Hong Kong(香港中文大学) University of Michigan(密歇根大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Davis(加州大学戴维斯分校) University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学) University of Toronto(多伦多大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 本研究提出VBVR-Pro,一个可扩展可验证的原生视觉推理闭环测试平台,含300个生成任务、确定性评分器及多生成器机制研究,训练模型在多视觉推理基准上迁移性强,发布全部相关资源。

Comments Homepage: this https URL (https://video-reason.com/)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2608.25380 2026-08-27 cs.AR 新提交 50%

APT: Accelerating Diffusion Transformers via Attention Probability-Guided Pruning and Quantization

APT:基于注意力概率引导剪枝与量化的扩散Transformer加速方案

Sungyeob Yoo, Seeyeon Kim, Joonyong Park, Seunghee Han, Joo-Young Kim

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文提出软硬件协同设计的APT加速器,通过APDT与TAFA优化DiTs的自注意力计算,在多款SOTA DiT模型上实现显著加速与能效提升。

Comments 9 pages, 17 figures, 3 tables. Accepted to the IEEE/ACM International Conference on Computer-Aided Design (ICCAD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 1 篇

2608.25452 2026-08-27 cs.CV cs.AI 新提交 57%

VGA-BenchV2: An Expanded Unified Benchmark and Multi-Model Framework for Evaluating Video Aesthetics and Generation Quality

VGA-BenchV2:用于评估视频美学与生成质量的扩展统一基准及多模型框架

Longteng Jiang, DanDan Zheng, Qianqian Qiao, Heng Huang, Huaye Wang, Yihang Bo, Bao Peng, Jingdong Chen, Jun Zhou, Xin Jin

机构 * Ant Group(蚂蚁集团) Beijing Film Academy(北京电影学院) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 该研究提出扩展的视频评估基准VGA-BenchV2,构建混合评估器架构,并将其作为奖励模型优化视频生成器,实现从基准到模型优化的闭环,提升视频的美学质量与人类偏好对齐性。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏