arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-16 至 2025-12-16 共收录 28 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2512.12560 2025-12-16 cs.CV cs.AI 79%

StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding

StreamingAssistant: 为加速在线视频理解的高效视觉标记修剪

Xinqi Jin, Hanxun Yu, Bohan Yu, Kebin Liu, Jian Liu, Keda Tao, Yixuan Pei, Huan Wang, Fan Dang, Jiangchuan Liu, Weiqiang Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Westlake University(西湖大学) Beijing Jiaotong University(北京交通大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 StreamingAssistant通过高效视觉标记修剪技术,提升在线视频理解的准确性和效率,减少GPU内存使用和计算延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11187 2025-12-16 cs.CV 57%

FastVID: Dynamic Density Pruning for Fast Video Large Language Models

FastVID: 动态密度修剪用于快速视频大语言模型

Leqi Shen, Guoqiang Gong, Tao He, Yifeng Zhang, Pengzhang Liu, Sicheng Zhao, Guiguang Ding

机构 * School of Software, Tsinghua University(清华大学软件学院) BNRist, Tsinghua University(清华大学BNRist) GRG Banking Equipment Co., Ltd.(GRG银行设备有限公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 FastVID通过动态密度修剪技术,显著降低视频大语言模型的计算开销,同时保持高准确性,实现高效的视频处理性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 12 篇

2512.12209 2025-12-16 cs.CV 84%

CineLOG: A Training Free Approach for Cinematic Long Video Generation

CineLOG: 一种无需训练的电影长视频生成方法

Zahra Dehghanian, Morteza Abolghasemi, Hamid Beigy, Hamid R. Rabiee

机构 * Sharif University of Technology(沙斐大学)

专题命中 视频生成 :video generation(title);long video(title);分类 cs.CV

AI总结 CineLOG通过构建高质量、平衡的数据集和创新的生成管道,实现了对电影长视频中摄像机轨迹和类型等属性的精准控制,优于现有端到端模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13019 2025-12-16 cs.CV 83%

SneakPeek: Future-Guided Instructional Streaming Video Generation

SneakPeek: 基于未来的指导性视频生成

Cheeun Hong, German Barquero, Fadime Sener, Markos Georgopoulos, Edgar Schönfeld, Stefan Popov, Yuming Du, Oscar Mañas, Albert Pumarola

机构 * Meta Superintelligence Labs(Meta超智能实验室) Seoul National University(首尔国立大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 SneakPeek通过预测因果适应、未来引导自我强制和多提示条件,实现了基于未来的指导性视频生成,提高了时间一致性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12193 2025-12-16 cs.CV 83%

SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation

SMRABooth: 主体和运动表示对齐用于定制视频生成

Xuancheng Xu, Yaning Li, Sisi You, Bing-Kun Bao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 SMRABooth通过自监督和光流编码器对齐主体和运动表示,提升定制视频生成中主体外观和运动模式的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13492 2025-12-16 cs.CV 79%

Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$

训练变换器:加速 naive 4K 视频生成超过 10$\times$

Jiangning Zhang, Junwei Zhu, Teng Hu, Yabiao Wang, Donghao Luo, Weijian Cao, Zhenye Gan, Xiaobin Hu, Zhucun Xue, Chengjie Wang

机构 * Youtu Lab, Tencent(腾讯优设实验室) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 T3-Video 通过优化全注意力机制,显著提升 4K 视频生成效率,实现性能与速度的双重突破

Comments Project page: https://zhangzjn.github.io/projects/T3-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13465 2025-12-16 cs.CV 79%

PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal Coherence

PoseAnything: 通用姿态引导视频生成与部分感知时间一致性

Ruiyan Wang, Teng Hu, Kaihui Huang, Zihan Su, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PoseAnything是一种通用姿态引导视频生成框架,能够处理人类和非人类角色,通过引入部分感知时间一致性模块和解耦CFG策略,提升了视频生成的精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12751 2025-12-16 cs.CV 79%

GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation

GenieDrive: 向具有物理意识的驾驶世界模型迈进:基于4D占用的视频生成

Zhenya Yang, Zhe Liu, Yuxiang Lu, Liping Hou, Chenxuan Miao, Siyi Peng, Bailan Feng, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GenieDrive通过4D占用引导的视频生成,实现物理意识的驾驶视频生成,提升预测精度和视频质量。

Comments The project page is available at https://huster-yzy.github.io/geniedrive_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17756 2025-12-16 cs.LG cs.SY eess.SY 78%

SuperGen: An Efficient Ultra-high-resolution Video Generation System with Sketching and Tiling

SuperGen: 一种高效的超高清视频生成系统,支持草图和分块

Fanjiang Ye, Zepeng Zhao, Yi Mu, Jucheng Shen, Renjie Li, Kaijian Wang, Saurabh Agarwal, Myungjin Lee, Triston Cao, Aditya Akella, Arvind Krishnamurthy, T. S. Eugene Ng, Zhengzhong Tu, Yuke Wang

机构 * Rice University(里士满大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Texas A&M University(德克萨斯农工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cisco(思科公司) NVIDIA(英伟达公司) University of Washington(华盛顿大学)

专题命中 视频生成 :video generation(title,abstract)

AI总结 SuperGen通过分块技术实现高效超高清视频生成,无需额外训练,降低计算和内存成本,提升生成速度和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12196 2025-12-16 cs.MM cs.CV cs.SD eess.AS 76%

AutoMV: An Automatic Multi-Agent System for Music Video Generation

AutoMV: 一种自动多智能体系统用于音乐视频生成

Xiaoxuan Tang, Xinping Lei, Chaoran Zhu, Shiyun Chen, Ruibin Yuan, Yizhi Li, Changjae Oh, Ge Zhang, Wenhao Huang, Emmanouil Benetos, Yang Liu, Jiaheng Liu, Yinghao Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学) Queen Mary University of London(伦敦大学女王学院) Hong Kong University of Science and Technology(香港科技大学) University of Manchester(曼彻斯特大学)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

AI总结 AutoMV通过多智能体协作生成完整音乐视频,优于现有方法并接近专业水准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14945 2025-12-16 cs.CV 74%

3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation

用于场景一致的摄像机可控视频生成的3D场景提示

JoungBin Lee, Jaewoo Jung, Jisang Han, Takuya Narihira, Kazumi Fukuda, Junyoung Seo, Sunghwan Hong, Yuki Mitsufuji, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Sony AI(索尼人工智能研究所) ETH Zürich(苏黎世联邦理工学院) Sony Group Corporation(索尼集团)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 3DScenePrompt通过双时空条件化和3D场景记忆实现场景一致且可控的视频生成,提升生成质量与摄像机控制精度。

Comments Project page : https://cvlab-kaist.github.io/3DScenePrompt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13015 2025-12-16 cs.CV 70%

What Happens Next? Next Scene Prediction with a Unified Video Model

接下来会发生什么?一种统一的视频模型用于下一场景预测

Xinjie Li, Zhimin Chen, Rui Zhao, Florian Schiffers, Zhenyu Liao, Vimal Bhat

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出Next Scene Prediction任务,通过联合框架结合Qwen-VL和LTX,利用预训练、监督微调和强化学习提升视频模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13313 2025-12-16 cs.CV 57%

KlingAvatar 2.0 Technical Report

KlingAvatar 2.0 技术报告

Kling Team, Jialu Chen, Yikang Ding, Zhixue Fang, Kun Gai, Yuan Gao, Kang He, Jingyun Hua, Boyuan Jiang, Mingming Lao, Xiaohan Li, Hui Liu, Jiwen Liu, Xiaoqiang Liu, Yuan Liu, Shun Lu, Yongsen Mao, Yingchao Shao, Huafeng Shi, Xiaoyu Shi, Peiqin Sun, Songlin Tang, Pengfei Wan, Chao Wang, Xuebo Wang, Haoxian Zhang, Yuanxing Zhang, Yan Zhou

机构 * Kuaishou Technology(快手科技)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 KlingAvatar 2.0 通过时空级联框架和多模态指令融合技术,实现了高效且高质量的长视频生成,提升了视觉清晰度和多模态对齐能力。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05115 2025-12-16 cs.CV 57%

Light-X: Generative 4D Video Rendering with Camera and Illumination Control

Light-X:具有摄像机和照明控制的生成式4D视频渲染

Tianqi Liu, Zhaoxi Chen, Zihao Huang, Shaocong Xu, Saining Zhang, Chongjie Ye, Bohan Li, Zhiguo Cao, Wei Li, Hao Zhao, Ziwei Liu

机构 * S-Lab, NTU(NTU的S-Lab) BAAI HUST(华中科技大学) AIR,THU(清华大学人工智能研究院) FNii, CUHKSZ(CUHKSZ的FNii) SJTU(上海交通大学) EIT (Ningbo)(宁波工程学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Light-X通过联合控制摄像机轨迹和光照,实现高质量4D视频生成,优于现有方法。

Comments Project Page: https://lightx-ai.github.io/ , Code: https://github.com/TQTQliu/Light-X

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 8 篇

2503.14505 2025-12-16 cs.CV cs.AI cs.LG 83%

MusicInfuser: Making Video Diffusion Listen and Dance

MusicInfuser: 使视频扩散模型听音乐并跳舞

Susung Hong, Ira Kemelmacher-Shlizerman, Brian Curless, Steven M. Seitz

机构 * University of Washington(华盛顿大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 MusicInfuser通过调整预训练视频扩散模型,使视频能与指定音乐同步生成舞蹈,无需运动数据,训练高效且泛化能力强。

Comments Project page: https://susunghong.github.io/MusicInfuser

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12375 2025-12-16 cs.CV 79%

V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping

V-Warper:通过价值扭曲实现外观一致的视频扩散个性化

Hyunkoo Lee, Wooseok Jang, Jini Yang, Taehwan Kim, Sangoh Kim, Sangwon Jung, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Korea University(韩国大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 V-Warper通过价值扭曲实现视频扩散模型的无训练粗到细个性化,提升外观一致性与生成质量。

Comments Project Page: https://cvlab-kaist.github.io/V-Warper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11203 2025-12-16 cs.CV 79%

AutoRefiner: Improving Autoregressive Video Diffusion Models via Reflective Refinement Over the Stochastic Sampling Path

AutoRefiner: 通过在随机采样路径上的反思细化改进自回归视频扩散模型

Zhengyang Yu, Akio Hayakawa, Masato Ishii, Qingtao Yu, Takashi Shibuya, Jing Zhang, Yuki Mitsufuji

机构 * Australian National University(澳大利亚国立大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 AutoRefiner通过路径噪声细化和反射式KV缓存改进AR-VDMs的样本保真度

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12080 2025-12-16 cs.CV cs.LG 79%

BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models

BAgger: 逆向聚合用于缓解自回归视频扩散模型中的漂移

Ryan Po, Eric Ryan Chan, Changan Chen, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video diffusion(title);text-to-video(abstract);分类 cs.CV

AI总结 BAgger通过自监督方法缓解自回归视频扩散模型中的漂移问题,利用标准分数或流匹配目标提升长期运动稳定性与视觉一致性。

Comments Project page here: https://ryanpo.com/bagger

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00227 2025-12-16 cs.CV cs.AI cs.RO 70%

Ctrl-Crash: Controllable Diffusion for Realistic Car Crashes

Ctrl-Crash: 可控扩散用于逼真汽车碰撞

Anthony Gosselin, Ge Ya Luo, Luis Lara, Florian Golemo, Derek Nowrouzezahrai, Liam Paull, Alexia Jolicoeur-Martineau, Christopher Pal

机构 * McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能 chair)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 Ctrl-Crash通过可控扩散生成逼真汽车碰撞视频,提升交通安全模拟的可控性和真实性。

Comments Under review at Pattern Recognition Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13690 2025-12-16 cs.CV cs.AI cs.GR cs.LG 57%

DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders

DiffusionBrowser: 通过多分支解码器实现交互式扩散预览

Susung Hong, Chongjian Ge, Zhifei Zhang, Jui-Hsien Wang

机构 * University of Washington(华盛顿大学) Adobe Research(Adobe研究)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DiffusionBrowser通过多分支解码器实现交互式视频生成预览,提升生成效率与可控性。

Comments Project page: https://susunghong.github.io/DiffusionBrowser

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13290 2025-12-16 cs.CV cs.AI cs.LG 57%

LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models

LINA: 为扩散模型中的物理对齐和泛化学习适应性干预

Shu Yu, Chaochao Lu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 LINA通过学习适应性干预,提升扩散模型在物理对齐和超出分布指令跟随方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12508 2025-12-16 cs.CV cs.LG 57%

Generative Spatiotemporal Data Augmentation

生成性时空数据增强

Jinfan Zhou, Lixin Luo, Sungmin Eum, Heesung Kwon, Jeong Joon Park

机构 * University of Chicago(芝加哥大学) University of Michigan, Ann Arbor(安娜堡大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出利用视频扩散模型生成时空数据以增强模型性能,尤其在数据稀缺情况下提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 3 篇

2512.12534 2025-12-16 cs.CV cs.GR cs.LG 70%

Animus3D: Text-driven 3D Animation via Motion Score Distillation

Animus3D: 通过运动分数蒸馏实现文本驱动的3D动画

Qi Sun, Can Wang, Jiaxiang Shang, Wensen Feng, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

专题命中 动作与事件理解 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 Animus3D通过运动分数蒸馏技术实现文本驱动的3D动画生成,提升运动细节与视觉完整性。

Comments SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12060 2025-12-16 cs.CV cs.LG cs.MM 62%

CreativeVR: Diffusion-Prior-Guided Approach for Structure and Motion Restoration in Generative and Real Videos

CreativeVR: 一种基于扩散先验的结构与运动修复方法用于生成视频和真实视频

Tejas Panambur, Ishan Rajendrakumar Dave, Chongjian Ge, Ersin Yumer, Xue Bai

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe(Adobe公司)

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 CreativeVR通过扩散先验引导方法,有效修复AI生成和真实视频中的结构与运动伪影,实现高质量视频修复。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16020 2025-12-16 cs.CV cs.AI 57%

Physically Realistic Sequence-Level Adversarial Clothing for Robust Human-Detection Evasion

物理真实序列级对抗性服装用于鲁棒的人体检测规避

Dingkun Zhou, Patrick P. K. Chan, Hengxu Wu, Shikang Zheng, Ruiqi Huang, Yuanjie Zhao

机构 * School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) Institute for Interdisciplinary Information Sciences, Tsinghua University(交叉信息研究院,清华大学)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 本研究提出序列级优化框架,生成可打印的对抗性服装纹理,以实现在数字和物理环境中对人类检测的鲁棒规避。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 2 篇

2512.12430 2025-12-16 cs.CV 86%

Endless World: Real-Time 3D-Aware Long Video Generation

无限世界:实时3D感知长视频生成

Ke Zhang, Yiqun Mei, Jiacong Xu, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Adobe Research(Adobe研究)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title);分类 cs.CV

AI总结 Endless World通过实时3D感知机制生成无限长且连贯的视频,解决长视频生成中的3D一致性与动态场景合成问题。

Comments 10 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13604 2025-12-16 cs.CV 79%

LongVie 2: Multimodal Controllable Ultra-Long Video World Model

LongVie 2: 多模态可控超长视频世界模型

Jianxiong Gao, Zhaoxi Chen, Xian Liu, Junhao Zhuang, Chengming Xu, Jianfeng Feng, Yu Qiao, Yanwei Fu, Chenyang Si, Ziwei Liu

机构 * FDU(福建大学) NJU(南京大学) NTU(National University of Taiwan) NVIDIA(英伟达) THU(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 长视频与时序推理 :long video(title);video generation(abstract);分类 cs.CV

AI总结 LongVie 2通过多模态引导、退化感知训练和历史-上下文引导,实现了超长视频的可控生成,支持连续视频生成长达五分钟,推动视频世界建模的统一发展。

Comments Project Page: https://vchitect.github.io/LongVie2-project/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 1 篇

2512.13238 2025-12-16 cs.CV 79%

Ego-EXTRA: video-language Egocentric Dataset for EXpert-TRAinee assistance

Ego-EXTRA:视频语言眼动数据集用于专家-学员协助

Francesco Ragusa, Michele Mazzamuto, Rosario Forte, Irene D'Ambra, James Fort, Jakob Engel, Antonino Furnari, Giovanni Maria Farinella

机构 * Department of Mathematics and Computer Science - University of Catania(数学与计算机科学系 - 卡塔尼亚大学) Next Vision s.r.l. - Spinoff of the University of Catania(Next Vision公司 - 卡塔尼亚大学衍生机构) Meta Reality Labs Research(Meta现实实验室)

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

AI总结 Ego-EXTRA数据集通过专家-学员双向对话评估多模态大语言模型,揭示其在专家级帮助中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏