arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-09 至 2026-03-09 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 4 篇

2603.06533 2026-03-09 cs.CV 84%

NEGATE: Constrained Semantic Guidance for Linguistic Negation in Text-to-Video Diffusion

NEGATE: 用于文本到视频扩散中的语义约束指导以处理语言否定

Taewon Kang, Ming C. Lin

机构 * University of Maryland at College Park(马里兰大学 College Park 分校)

专题命中 视频扩散模型 :video diffusion(title);text-to-video(title);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的语义约束指导方法,用于处理文本到视频生成中的语言否定问题,通过结构化约束实现否定的统一建模。

Comments 50 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11512 2026-03-09 cs.CV cs.AI 79%

LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference

LikePhys: 通过似然偏好评估视频扩散模型中的直观物理理解

Jianhao Yuan, Fabio Pizzati, Francesco Pinto, Lars Kunze, Ivan Laptev, Paul Newman, Philip Torr, Daniele De Martini

机构 * University of Oxford(牛津大学) MBZUAI(穆斯林人工智能研究所) University of Chicago(芝加哥大学) UWE Bristol(布里斯托尔大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 LikePhys通过似然偏好评估视频扩散模型的直观物理理解,展示其与人类偏好一致,优于现有基线,并揭示模型设计和推理设置对物理理解的影响。

Comments 23 pages, 9 figures, Project Page: https://yuanjianhao508.github.io/LikePhys/

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18663 2026-03-09 cs.CV 79%

DVD-Quant: Data-free Video Diffusion Transformers Quantization

DVD-Quant: 数据无依赖的视频扩散变换器量化

Zhiteng Li, Hanxuan Li, Junyi Wu, Kai Liu, Haotong Qin, Linghe Kong, Guihai Chen, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 DVD-Quant通过无数据量化框架实现视频DiT模型的高效量化,提升运行速度并保持视觉质量。

Comments Code and models will be available at https://github.com/lhxcs/DVD-Quant

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22654 2026-03-09 cs.CV 57%

Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache

去噪作为路径规划:通过DPCache实现扩散模型的训练免费加速

Bowen Cui, Yuanbin Wang, Huajiang Xu, Biaolong Chen, Aixi Zhang, Hao Jiang, Zhengzheng Jin, Xu Liu, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 DPCache通过全局路径规划框架实现扩散模型的高效加速,减少计算开销并提升生成质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏