arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-30 至 2025-12-30 共收录 18 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2512.22226 2025-12-30 cs.CV cs.AI cs.CL cs.LG 83%

VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs

VideoScaffold: 基于弹性尺度的视觉层次结构用于多模态大语言模型中的流媒体视频理解

Naishan Zheng, Jie Huang, Qingpei Guo, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Ant Group(蚂蚁集团)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 VideoScaffold通过弹性尺度事件分割和层次事件整合,实现了流媒体视频理解中的细粒度到抽象事件推理的动态转换,提升多模态大语言模型的视频处理性能。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2512.04678 2025-12-30 cs.CV 83%

Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation

奖励强制:基于奖励分布匹配蒸馏的高效流式视频生成

Yunhong Lu, Yanhong Zeng, Haobo Li, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Jiapeng Zhu, Hengyuan Cao, Zhipeng Zhang, Xing Zhu, Yujun Shen, Min Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) SIAS-ZJU SJTU(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 奖励强制通过EMA-Sink和Re-DMD提升流式视频生成效率与质量,实现23.1 FPS的高性能视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22536 2025-12-30 cs.CV cs.AI 83%

CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation

CoAgent:协作规划与一致性代理用于连贯视频生成

Qinglin Zeng, Kaitong Cai, Ruiqi Chen, Qinhan Lv, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 CoAgent通过协作框架提升视频生成的连贯性与一致性,采用计划-合成-验证流程优化长视频的叙事质量与视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23222 2025-12-30 cs.CV cs.MM 81%

Bridging Your Imagination with Audio-Video Generation via a Unified Director

通过统一导演模型实现想象力与音频视频生成的连接

Jiaxu Zhang, Tianshu Hu, Yuan Zhang, Zenan Li, Linjie Luo, Guosheng Lin, Xin Chen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 UniMAGE通过统一导演模型整合脚本起草与关键帧生成,提升非专业人士制作多镜头电影的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22310 2025-12-30 cs.CV 79%

MoFu: Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video Generation

MoFu: 多主体视频生成的尺度感知调制与傅里叶融合

Run Ling, Ke Cao, Jian Lu, Ao Ma, Haowei Liu, Runze He, Changwei Wang, Rongtao Xu, Yihua Shao, Zhanjie Zhang, Peng Wu, Guibing Guo, Wei Feng, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Xingwei Wang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 MoFu通过尺度感知调制和傅里叶融合解决多主体视频生成中的尺度不一致和排列敏感性问题,提升生成质量。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 8 篇

2512.23576 2025-12-30 cs.CV 85%

LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation

LiveTalk: 通过改进的在线策略蒸馏实现实时多模态交互视频扩散

Ethan Chern, Zhulin Hu, Bohao Tang, Jiadi Su, Steffi Chern, Zhijie Deng, Pengfei Liu

机构 * SII SJTU GAIR

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出LiveTalk系统,通过改进的在线策略蒸馏实现实时多模态交互视频生成,显著提升效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22175 2025-12-30 cs.CV cs.AI eess.IV 84%

Characterizing Motion Encoding in Video Diffusion Timesteps

视频扩散时间步中的运动编码表征

Vatsal Baherwani, Yixuan Ren, Abhinav Shrivastava

机构 * University of Maryland(马里兰大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV、eess.IV

AI总结 本文通过分析视频扩散模型中时间步的运动与外观编码特性,发现早期时间步主导运动,后期主导外观,并提出受限于运动主导阶段的运动定制方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22626 2025-12-30 cs.CV 83%

Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion

Envision:通过目标图像视频扩散进行具身视觉规划

Yuming Gu, Yizhi Wang, Yining Hong, Yipeng Gao, Hao Jiang, Angtian Wang, Bo Liu, Nathaniel S. Dennler, Zhengfei Kuang, Hao Li, Gordon Wetzstein, Chongyang Ma

机构 * University of Southern California(南加州大学) ByteDance(字节跳动) Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) MBZUAI

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 Envision 通过目标图像视频扩散模型实现具身视觉规划,提升目标对齐和空间一致性,支持下游机器人任务。

Comments Page: https://envision-paper.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10704 2025-12-30 cs.CV cs.MM 81%

Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework

自回归视频扩散模型的误差分析:一个统一的框架

Jing Wang, Fengzhuo Zhang, Xiaoli Li, Vincent Y. F. Tan, Tianyu Pang, Chao Du, Aixin Sun, Zhuoran Yang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Singapore University of Technology and Design(新加坡科技设计大学) Sea AI Lab(海思人工智能实验室) Yale University(耶鲁大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Meta-ARVDM框架,通过分析自回归视频扩散模型的历史遗忘与时间退化现象,揭示其理论机制并提出新的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23705 2025-12-30 cs.CV 79%

Diffusion Knows Transparency: Repurposing Video Diffusion for Transparent Object Depth and Normal Estimation

扩散知道透明:将视频扩散用于透明物体深度和法线估计

Shaocong Xu, Songlin Wei, Qizhe Wei, Zheng Geng, Hong Li, Licheng Shen, Qianpu Sun, Shu Han, Bin Ma, Bohan Li, Chongjie Ye, Yuhang Zheng, Nan Wang, Saining Zhang, Hao Zhao

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Southern California(南加州大学) Tsinghua University(清华大学) Beihang University(北航) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) European Institute of Innovation and Technology Ningbo(创新与技术欧洲研究所宁波) FNii, The Chinese University of Hong Kong, Shenzhen(FNii,香港中文大学(深圳)) National University of Singapore(新加坡国立大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DKT模型,利用视频扩散模型估计透明物体的深度和法线,实现零样本SOTA,提升现实和合成视频中的透明感知性能。

Comments Project Page: https://daniellli.github.io/projects/DKT/; Code: https://github.com/Daniellli/DKT; Dataset: https://huggingface.co/datasets/Daniellesry/TransPhy3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21734 2025-12-30 cs.CV 79%

Knot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait Animation

结绳强制:驯服自回归视频扩散模型以实现实时无限交互肖像动画

Steven Xiao, Xindi Zhang, Dechao Meng, Qi Wang, Peng Zhang, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里集团)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 Knot Forcing通过分块生成、时间结模块和提前运行机制,解决实时肖像动画中的时间一致性、误差累积和长期一致性问题,实现高保真、低延迟的无限交互动画。

Comments Project Page: https://humanaigc.github.io/knot_forcing_demo_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19823 2025-12-30 cs.CV 79%

Learning to Refocus with Video Diffusion Models

利用视频扩散模型学习重聚焦

SaiKiran Tedla, Zhoutong Zhang, Xuaner Zhang, Shumian Xin

机构 * Adobe, USA \& York University Canada Adobe USA Adobe, USA \& York University Adobe

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用视频扩散模型实现拍摄后重聚焦,生成感知准确的焦点堆栈,提升日常摄影的聚焦编辑能力。

Comments Code and data are available at https://learn2refocus.github.io . SIGGRAPH Asia 2025, Dec. 2025

Journal ref Proceedings of the SIGGRAPH Asia 2025, pp. 1-11, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15560 2025-12-30 cs.CV 77%

GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models

GRAN-TED: 生成稳健、对齐且细腻的文本嵌入以用于扩散模型

Bozhou Li, Sihan Yang, Yushuo Guan, Ruichuan An, Xinlong Chen, Yang Shi, Pengfei Wan, Wentao Zhang, Yuanxing zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence, UCAS(清华大学人工智能学院)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 GRAN-TED提出了一种生成稳健、对齐且细腻的文本嵌入以用于扩散模型的范式,通过TED-6K基准提升文本编码器性能,显著加快扩散模型训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2506.10516 2025-12-30 cs.CV cs.AI 57%

CogStream: Context-guided Streaming Video Question Answering

CogStream: 基于上下文的流视频问答

Zicheng Zhao, Kangyu Wang, Shijie Li, Rui Qian, Weiyao Lin, Huabin Liu

专题命中 视频问答 :video reasoning(abstract);分类 cs.CV

AI总结 本文提出CogStream任务,通过视觉流压缩和历史对话检索,解决流视频中关键信息识别与问答问题。

Comments Project page: https://github.com/LiamZhao326/CogStream

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 2 篇

2507.05822 2025-12-30 cs.CV 57%

Video Event Reasoning and Prediction by Fusing World Knowledge from LLMs with Vision Foundation Models

通过融合来自LLM的世界知识与视觉基础模型进行视频事件推理与预测

L'ea Dubois, Klaus Schmidt, Chengyu Wang, Ji-Hoon Park, Lin Wang, Santiago Munoz

机构 * INRIA(法国国家信息与自动化研究所) Max Planck Institute for Intelligent Systems(人工智能研究所) San Francisco State University(旧金山州立大学) Seoul AI Institute (SAII)(首尔人工智能研究所) Vision & Robotics Center, Tsinghua University(清华大学视觉与机器人中心) Polytechnic University of Madrid(马德里理工大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出融合视觉基础模型与LLM的世界知识,以提升视频事件推理与预测能力,实现从简单识别到高级认知理解的突破。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22688 2025-12-30 cs.CV 57%

Autoregressive Flow Matching for Motion Prediction

自回归流匹配用于运动预测

Johnathan Xie, Stefan Stojanov, Cristobal Eyzaguirre, Daniel L. K. Yamins, Jiajun Wu

机构 * Stanford University(斯坦福大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 ARFM通过自回归流匹配方法,利用多样化视频数据集预测复杂运动,提升机器人和人类动作预测的下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 长视频与时序推理 2 篇

2512.22315 2025-12-30 cs.CV cs.AI 88%

VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning

VideoZoomer: 用于长视频推理的强化学习时序聚焦

Yang Ding, Yizhen Zhang, Xin Lai, Ruihang Chu, Yujiu Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 长视频与时序推理 :long video(title,abstract);video reasoning(title);video understanding(abstract);分类 cs.CV

AI总结 VideoZoomer通过强化学习实现动态时序聚焦,提升长视频推理性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23483 2025-12-30 cs.CV 83%

TV-RAG: A Temporal-aware and Semantic Entropy-Weighted Framework for Long Video Retrieval and Understanding

TV-RAG:一种具有时间意识和语义熵权的长视频检索与理解框架

Zongsheng Cao, Yangfan He, Anran Liu, Feng Chen, Zepeng Wang, Jun Xie

机构 * Researcher(研究者)

专题命中 长视频与时序推理 :long video(title);video language model(abstract);video reasoning(abstract);分类 cs.CV

AI总结 TV-RAG通过时间衰减检索和熵加权关键帧采样,提升长视频检索与理解性能,无需重新训练即可集成至现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏