arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-25 至 2026-08-25 共收录 12 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 12 篇

2602.24289 2026-08-25 cs.CV cs.LG 版本更新 88%

Mode Seeking meets Mean Seeking for Fast Long Video Generation

模式寻求与均值寻求的结合用于快速长视频生成

Shengqu Cai, Weili Nie, Chao Liu, Julius Berner, Lvmin Zhang, Nanye Ma, Hansheng Chen, Maneesh Agrawala, Leonidas Guibas, Gordon Wetzstein, Arash Vahdat

机构 * Stanford University, California, USA(斯坦福大学) NVIDIA Research, California, USA(NVIDIA研究)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出一种结合模式寻求与均值寻求的解耦扩散变换器,通过监督学习生成快速长视频,提升长距离连贯性和局部真实感。

Comments Project website: this https URL (https://primecai.github.io/mmm/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21424 2026-08-25 cs.CV cs.GR cs.HC cs.LG cs.MM 新提交 84%

EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing

EditStream:用于交互式视频生成与编辑的统一自回归框架

Yuqian Zhou, Zhenghong Zhou, Zongze Wu, Cameron Smith, Richard Zhang, Jiebo Luo, Eli Shechtman, Zhe Lin

机构 * Adobe Research(Adobe研究院) University of Rochester(罗切斯特大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 本研究提出EditStream框架,整合多类视频生成编辑任务,通过两阶段蒸馏方法优化自回归模型,实现高质量交互式视频创作,填补了扩散模型与创意工作流的衔接空白。

Comments 25 pages, 12 figures, Project page: this https URL (https://real-time-video-research.github.io/editstream/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22819 2026-08-25 cs.CV 新提交 79%

Direct, Parallel, or Sequential? A Comparative Study of Training-Free Multi-Subject Image-to-Video Generation

直接式、并行式还是顺序式?无训练多主体图像到视频生成的对比研究

Yanliang Qi, Kexi Chen, Muchao Ye, Haomiao Ni

机构 * University of Memphis(孟菲斯大学) University of Pennsylvania(宾夕法尼亚大学) University of Iowa(爱荷华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文对比研究直接、并行、顺序三种无训练多主体图像到视频生成范式,通过实证评估明确各范式的优劣势,为可控多主体视频生成系统设计提供实用见解。

Comments ACM Multimedia Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21839 2026-08-25 cs.CV 新提交 79%

FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling

FIRM-Video:可靠文本到视频奖励建模的评分前检查机制

Peiyuan Zhang, Xiangyu Zhao, Hongbo Liu, Xiaoxing Hu, Mingxin Liu, Shuran Ma, Yunhang Shen, Jian Hu, Haihan Gao, Haoyu Cao, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Tongji University(同济大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出基于“评分前检查”的FIRM-Video框架,构建相关数据集与基准,其衍生模型在文本到视频奖励建模相关任务上取得最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21425 2026-08-25 cs.CV cs.AI 新提交 79%

Aligning Human Sense: Calibrated Distributional Reward Learning for Video Generation

对齐人类感知:用于视频生成的校准分布奖励学习

Nai-Xin Zhai, Weihua Cheng, Dexu Yu, Yikai Gu, Hanwen Du, Junchen Fu, Chenxi Huang, Yingwei Song, Liyuan Lillian Ma, Yang Ran, Youhua Li, Yongxin Ni

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文针对视频生成中奖励信号不可靠、偏好维度权衡丢失、KL散度难捕捉偏好全局结构的问题,提出统一偏好感知学习框架,通过精英过滤、分布建模与Wasserstein对齐改进,提升了奖励可靠性与视频感知一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19583 2026-08-25 cs.CV cs.AI 版本更新 79%

VGI-Bench: Probing Visual Intelligence in Video Generation Models

VGI-BENCH:探究视频生成模型的视觉智能

Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Massachusetts Institute of Technology(麻省理工学院) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(矢量研究所) Microsoft Research(微软研究院) Etude AI

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本研究推出VGI-bench基准,含27项任务810个实例,评估视频生成模型视觉推理能力,发现最强模型Seedance~2.0仅达51.0%,将推动下一代视频生成模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08712 2026-08-25 cs.CV 版本更新 79%

From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation

从运动学至路由视觉控制:用于动作条件化外科视频生成

Bohan Li, Shuojue Yang, Baorui Peng, Xianda Guo, Erli Zhang, Youqi Tao, Junfeng Duan, Daguang Xu, Qi Dou, Xin Jin, Wenjun Zeng, Hao Zhao, Yueming Jin

机构 * SJTU(上海交通大学) NUS(国立新加坡大学) THU(清华大学) EIT(欧洲研究所) WHU(武汉大学) Harvard(哈佛大学) NVIDIA(NVIDIA公司) CUHK(香港大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种运动学至视觉提升范式,通过五种图像对齐的控制模态生成动作条件化外科视频,采用分层路由框架提升控制精度与效率,构建新基准并验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18422 2026-08-25 cs.CV 版本更新 79%

Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control

生成现实:基于交互式视频生成的人本世界模拟

Linxi Xie, Lisong C. Sun, Ashley Neall, Tong Wu, Shengqu Cai, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) NYU Shanghai(纽约大学上海分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于交互式视频生成的人本世界模拟系统,通过结合头部和手部姿态控制,提升虚拟环境的交互性和用户控制感。

Comments Project page here: this https URL (https://codeysun.github.io/generated-reality)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05076 2026-08-25 cs.CV 版本更新 79%

BulletTime: Decoupled Control of Time and Camera Pose for Video Generation

BulletTime: 分离时间与相机姿态的视频生成控制

Yiming Wang, Qihang Zhang, Shengqu Cai, Tong Wu, Jan Ackermann, Zhengfei Kuang, Yang Zheng, Frano Rajič, Siyu Tang, Gordon Wetzstein

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 BulletTime通过分离时间与相机姿态,实现了视频生成的精细控制与高质量生成。

Comments CVPR 2026, Project Page: this https URL (https://19reborn.github.io/Bullet4D/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23090 2026-08-25 cs.CV 新提交 57%

Loopy: Seamless Video Loop Generation via Anchored Looping Shift of Positional Embedding

Loopy:通过位置嵌入的锚定循环偏移实现无缝视频生成

Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Xin Wang, Di Lin

机构 * Tianjin University(天津大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究针对现有循环视频生成质量差的问题,提出Loopy框架,通过锚定DiT的位置嵌入偏移策略,实现高质量、支持多格式及高级AIGC功能的循环视频生成,提升了时间一致性与视觉保真度。

Comments 15 pages, 21 figures, accepted by ACM TOG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23070 2026-08-25 cs.AI cs.CV 新提交 57%

From Generation to Simulation: How Far Are World Models from Being True Simulators?

从生成到模拟:世界模型距离真正的模拟器还有多远?

Tong Wang, Huan Deng, Mucheng Yang, Yang He, Xiaohui Kuang, Gang Zhao

机构 * Institute of Systems Engineering, Academy of Military Sciences(军事科学院系统工程研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究通过系统评估200篇相关成果,分析了潜在动力学等3条技术路线的世界模型在传统模拟器8项能力上的表现,指出其在状态反馈等方面的缺陷并提出6个研究方向。

Comments 42 pages, 23 figures, 2 tables. Project page: this https URL (https://github.com/AtongWang/world-model-simulators)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11421 2026-08-25 cs.CV 版本更新 57%

ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation

ShotVerse: 提升文本驱动多镜头视频创作的电影级摄像机控制

Songlin Yang, Zhe Wang, Xuyi Yang, Songchun Zhang, Xianghao Kong, Taiyi Wu, Xiaotong Zhao, Ran Zhang, Alan Zhao, Anyi Rao

机构 * Tencent Video AI Center, PCG, Tencent(腾讯视频AI中心)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ShotVerse通过'计划然后控制'框架,结合视觉语言模型和摄像机适配器,实现多镜头视频创作中精准的摄像机控制与高保真电影效果。

Comments SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏