arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-25 至 2026-08-25 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 6 篇

2608.21849 2026-08-25 cs.CV 新提交 83%

GaussVid: Sparse-View Gaussian Splatting with 3D-Aware Video Diffusion Priors

GaussVid:结合3D感知视频扩散先验的稀疏视图高斯溅射

Xinhui Liu, Can Wang, Wei Jiang, Wei Wang, Dong Xu

机构 * The University of Hong Kong(香港大学) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Futurewei Technologies Inc(华为主流技术公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本研究提出结合3D感知视频扩散先验的GaussVid框架,构建3DGS视频数据集并引入相机条件几何先验,提升稀疏视图3DGS重建的像素、结构保真度与多视图一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17825 2026-08-25 cs.CV 版本更新 83%

Steering Video Diffusion Transformers with Massive Activations

通过大规模激活引导视频扩散变换器

Xianhang Cheng, Yujian Zheng, Zhenyu Xie, Tingting Liao, Hao Li

机构 * MBZUAI

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 研究视频扩散变换器中大规模激活的作用,提出STAS方法通过引导首帧和边界token的激活值提升视频生成质量与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26203 2026-08-25 cs.CV 版本更新 79%

WildShadowRemover: In-the-Wild Video Shadow Removal via Detail-Preserving Video Diffusion Models

WildShadowRemover:基于细节保留视频扩散模型的野外视频阴影去除方法

Jiamin Xu, Cong Wang, Zheng Dong, Chi Wang, Renshu Gu, Weiwei Xu, Gang Xu

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 针对野外视频阴影去除难题,提出WildShadowRemover框架,通过LoRA微调适配视频扩散模型,结合细节注入、频率分解调制及Depth Anything 3深度先验,构建对应数据集,在阴影去除质量与时间一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21812 2026-08-25 physics.ao-ph 新提交 71%

Video Diffusion for Satellite-based High-Dynamical-Fidelity Precipitation (HiDFiP) Field Generation

用于卫星基高动态保真降水(HiDFiP)场生成的视频扩散模型

Runze Li, Yan Xia, Yongquan Qu, Dongwei Fu, Clement Guilloteau, Judy Hoffman, Stephan Mandt, Pierre Gentine, Efi Foufoula-Georgiou

专题命中 视频扩散模型 :video diffusion(title)

AI总结 本研究提出一种视频扩散框架,以IMERG为数据源、ERA5/ERA5-Land补充环境信息,生成卫星基HiDFiP降水场,其时空保真度优于基线方法,可泛化至新区域,为全球雷达级降水记录提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-08-25 cs.CV 版本更新 57%

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Accepted by ECCV 2026. Project Page: this https URL (https://yunhe24.github.io/langdrivectrl/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20756 2026-08-25 cs.CV 版本更新 57%

StereoDiff: Stereo-Diffusion Synergy for Video Depth Estimation

StereoDiff:用于视频深度估计的立体-扩散协同框架

Haodong Li, Chen Wang, Jiahui Lei, Kostas Daniilidis, Lingjie Liu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 StereoDiff将立体匹配与视频深度扩散协同,针对视频静态和动态区域分别采用对应技术,在真实世界动态视频深度基准上实现了当前最优的零样本估计性能。

Comments We no longer wish this manuscript to stand as an active preprint and will not be maintaining or updating it further; we would prefer it not be cited as current work. It has not been published or accepted at any journal or conference, so the request is not motivated by publication elsewhere. We are requesting a standard withdrawal, not a full removal

详情

展开后加载摘要…

URL PDF HTML 收藏