arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-16 至 2025-12-16 共收录 12 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 12 篇

2512.12209 2025-12-16 cs.CV 84%

CineLOG: A Training Free Approach for Cinematic Long Video Generation

CineLOG: 一种无需训练的电影长视频生成方法

Zahra Dehghanian, Morteza Abolghasemi, Hamid Beigy, Hamid R. Rabiee

机构 * Sharif University of Technology(沙斐大学)

专题命中 视频生成 :video generation(title);long video(title);分类 cs.CV

AI总结 CineLOG通过构建高质量、平衡的数据集和创新的生成管道,实现了对电影长视频中摄像机轨迹和类型等属性的精准控制,优于现有端到端模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13019 2025-12-16 cs.CV 83%

SneakPeek: Future-Guided Instructional Streaming Video Generation

SneakPeek: 基于未来的指导性视频生成

Cheeun Hong, German Barquero, Fadime Sener, Markos Georgopoulos, Edgar Schönfeld, Stefan Popov, Yuming Du, Oscar Mañas, Albert Pumarola

机构 * Meta Superintelligence Labs(Meta超智能实验室) Seoul National University(首尔国立大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 SneakPeek通过预测因果适应、未来引导自我强制和多提示条件,实现了基于未来的指导性视频生成,提高了时间一致性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12193 2025-12-16 cs.CV 83%

SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation

SMRABooth: 主体和运动表示对齐用于定制视频生成

Xuancheng Xu, Yaning Li, Sisi You, Bing-Kun Bao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 SMRABooth通过自监督和光流编码器对齐主体和运动表示,提升定制视频生成中主体外观和运动模式的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13492 2025-12-16 cs.CV 79%

Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$

训练变换器:加速 naive 4K 视频生成超过 10$\times$

Jiangning Zhang, Junwei Zhu, Teng Hu, Yabiao Wang, Donghao Luo, Weijian Cao, Zhenye Gan, Xiaobin Hu, Zhucun Xue, Chengjie Wang

机构 * Youtu Lab, Tencent(腾讯优设实验室) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 T3-Video 通过优化全注意力机制,显著提升 4K 视频生成效率,实现性能与速度的双重突破

Comments Project page: https://zhangzjn.github.io/projects/T3-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13465 2025-12-16 cs.CV 79%

PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal Coherence

PoseAnything: 通用姿态引导视频生成与部分感知时间一致性

Ruiyan Wang, Teng Hu, Kaihui Huang, Zihan Su, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PoseAnything是一种通用姿态引导视频生成框架,能够处理人类和非人类角色,通过引入部分感知时间一致性模块和解耦CFG策略,提升了视频生成的精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12751 2025-12-16 cs.CV 79%

GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation

GenieDrive: 向具有物理意识的驾驶世界模型迈进:基于4D占用的视频生成

Zhenya Yang, Zhe Liu, Yuxiang Lu, Liping Hou, Chenxuan Miao, Siyi Peng, Bailan Feng, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GenieDrive通过4D占用引导的视频生成,实现物理意识的驾驶视频生成,提升预测精度和视频质量。

Comments The project page is available at https://huster-yzy.github.io/geniedrive_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17756 2025-12-16 cs.LG cs.SY eess.SY 78%

SuperGen: An Efficient Ultra-high-resolution Video Generation System with Sketching and Tiling

SuperGen: 一种高效的超高清视频生成系统,支持草图和分块

Fanjiang Ye, Zepeng Zhao, Yi Mu, Jucheng Shen, Renjie Li, Kaijian Wang, Saurabh Agarwal, Myungjin Lee, Triston Cao, Aditya Akella, Arvind Krishnamurthy, T. S. Eugene Ng, Zhengzhong Tu, Yuke Wang

机构 * Rice University(里士满大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Texas A&M University(德克萨斯农工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cisco(思科公司) NVIDIA(英伟达公司) University of Washington(华盛顿大学)

专题命中 视频生成 :video generation(title,abstract)

AI总结 SuperGen通过分块技术实现高效超高清视频生成,无需额外训练,降低计算和内存成本,提升生成速度和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12196 2025-12-16 cs.MM cs.CV cs.SD eess.AS 76%

AutoMV: An Automatic Multi-Agent System for Music Video Generation

AutoMV: 一种自动多智能体系统用于音乐视频生成

Xiaoxuan Tang, Xinping Lei, Chaoran Zhu, Shiyun Chen, Ruibin Yuan, Yizhi Li, Changjae Oh, Ge Zhang, Wenhao Huang, Emmanouil Benetos, Yang Liu, Jiaheng Liu, Yinghao Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学) Queen Mary University of London(伦敦大学女王学院) Hong Kong University of Science and Technology(香港科技大学) University of Manchester(曼彻斯特大学)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

AI总结 AutoMV通过多智能体协作生成完整音乐视频,优于现有方法并接近专业水准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14945 2025-12-16 cs.CV 74%

3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation

用于场景一致的摄像机可控视频生成的3D场景提示

JoungBin Lee, Jaewoo Jung, Jisang Han, Takuya Narihira, Kazumi Fukuda, Junyoung Seo, Sunghwan Hong, Yuki Mitsufuji, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Sony AI(索尼人工智能研究所) ETH Zürich(苏黎世联邦理工学院) Sony Group Corporation(索尼集团)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 3DScenePrompt通过双时空条件化和3D场景记忆实现场景一致且可控的视频生成,提升生成质量与摄像机控制精度。

Comments Project page : https://cvlab-kaist.github.io/3DScenePrompt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13015 2025-12-16 cs.CV 70%

What Happens Next? Next Scene Prediction with a Unified Video Model

接下来会发生什么?一种统一的视频模型用于下一场景预测

Xinjie Li, Zhimin Chen, Rui Zhao, Florian Schiffers, Zhenyu Liao, Vimal Bhat

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出Next Scene Prediction任务,通过联合框架结合Qwen-VL和LTX,利用预训练、监督微调和强化学习提升视频模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13313 2025-12-16 cs.CV 57%

KlingAvatar 2.0 Technical Report

KlingAvatar 2.0 技术报告

Kling Team, Jialu Chen, Yikang Ding, Zhixue Fang, Kun Gai, Yuan Gao, Kang He, Jingyun Hua, Boyuan Jiang, Mingming Lao, Xiaohan Li, Hui Liu, Jiwen Liu, Xiaoqiang Liu, Yuan Liu, Shun Lu, Yongsen Mao, Yingchao Shao, Huafeng Shi, Xiaoyu Shi, Peiqin Sun, Songlin Tang, Pengfei Wan, Chao Wang, Xuebo Wang, Haoxian Zhang, Yuanxing Zhang, Yan Zhou

机构 * Kuaishou Technology(快手科技)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 KlingAvatar 2.0 通过时空级联框架和多模态指令融合技术,实现了高效且高质量的长视频生成,提升了视觉清晰度和多模态对齐能力。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05115 2025-12-16 cs.CV 57%

Light-X: Generative 4D Video Rendering with Camera and Illumination Control

Light-X:具有摄像机和照明控制的生成式4D视频渲染

Tianqi Liu, Zhaoxi Chen, Zihao Huang, Shaocong Xu, Saining Zhang, Chongjie Ye, Bohan Li, Zhiguo Cao, Wei Li, Hao Zhao, Ziwei Liu

机构 * S-Lab, NTU(NTU的S-Lab) BAAI HUST(华中科技大学) AIR,THU(清华大学人工智能研究院) FNii, CUHKSZ(CUHKSZ的FNii) SJTU(上海交通大学) EIT (Ningbo)(宁波工程学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Light-X通过联合控制摄像机轨迹和光照,实现高质量4D视频生成,优于现有方法。

Comments Project Page: https://lightx-ai.github.io/ , Code: https://github.com/TQTQliu/Light-X

详情

展开后加载摘要…

URL PDF HTML 收藏