arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-26 至 2026-08-26 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 5 篇

2608.24674 2026-08-26 cs.CV 新提交 79%

TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation

TurboT2VA:基于分数正则化一致性蒸馏的快速大规模文本-视频-音频生成

Xiaoda Yang, Yuxiang Liu, Kaiwen Zheng, Yuan Liu, Yibo Lai, Shengpeng Ji, Kai Jiang, Jianfei Chen, Xiaobin Hu, Shuicheng Yan, Jintao Zhang, Jun Zhu, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Tsinghua University(清华大学) Qingdao University(青岛大学) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出TurboT2VA框架,通过多模态归一化与渐进式课程方案,在保持音视频生成质量的同时,大幅加速190亿参数联合T2VA模型的推理,在不同分辨率下实现最高54.67倍的生成器加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21580 2026-08-26 cs.CV cs.AI 版本更新 79%

GraphVid: Interactive Graph-Controllable Video Generation

GraphVid:交互式图可控视频生成

Vedant Shah, Onkar Susladkar, Tushar Prakash, Kiet Nguyen, Tianjiao Yu, Adheesh Juvekar, Muntasir Wahed, Ismini Lourentzou

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究如何实现可控视频生成,提出基于图条件的GraphVid模型及相关数据集,通过结构化交互图实现灵活精确控制,相比其他方法在减少训练数据和参数的情况下,提升了视频生成的可控性与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09057 2026-08-26 cs.CV cs.MM cs.SD 版本更新 76%

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence

Tora3:基于轨迹的音频视频生成与物理一致性

Junchao Liao, Zhenghao Zhang, Xiangyu Meng, Litao Li, Ziying Zhang, Siyu Zhu, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

AI总结 Tora3通过引入轨迹作为共享的运动先验,提升音频视频生成的物理一致性,采用轨迹对齐的运动表示和混合流匹配方案,改进运动真实性和运动-声音同步性。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20809 2026-08-26 cs.CV 版本更新 57%

Layer-Aware Video Composition via Split-then-Merge

通过分割后再融合的分层视频合成

Ozgur Kara, Yujia Chen, Ming-Hsuan Yang, James M. Rehg, Wen-Sheng Chu, Du Tran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 StM通过分割未标注视频并融合动态前景与背景层,提升生成视频合成的控制能力和数据效率。

Comments Project Webpage: this https URL (https://split-then-merge.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24329 2026-08-26 cs.HC 新提交 50%

How Do Professional Editors Evaluate the Editing Quality of AI-Generated Cinematic Video Ads?

专业编辑如何评估AI生成的影视视频广告的剪辑质量?

Po-Ming Law, Weizhi Li, Arpit Narechania

专题命中 视频生成 :video generation(abstract)

AI总结 该研究针对AI生成影视广告缺乏细粒度评估框架的问题,构建两阶段生成流程,通过专业编辑评价得出六个剪辑质量维度,为相关评估与生成提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏