arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-26 至 2026-01-26 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 2 篇

2512.10940 2026-01-26 cs.CV cs.AI 70%

OmniView: An All-Seeing Diffusion Model for 3D and 4D View Synthesis

OmniView: 一种用于3D和4D视图合成的全视角扩散模型

Xiang Fan, Sharath Girish, Vivek Ramanujan, Chaoyang Wang, Ashkan Mirzaei, Petr Sushko, Aliaksandr Siarohin, Sergey Tulyakov, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Snap Inc.(Snap公司)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 OmniView是一种统一的扩散模型,能够泛化多种4D一致性任务,通过空间、时间和视图条件的灵活组合提升视频生成质量与相机控制精度。

Comments Project page: https://snap-research.github.io/OmniView/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14172 2026-01-26 eess.IV 57%

TaQ-DiT: Time-aware Quantization for Diffusion Transformers

TaQ-DiT: 时感知量化用于扩散变换器

Xinyan Liu, Huihong Shi, Yang Xu, Zhongfeng Wang

专题命中 视频扩散模型 :video generation(abstract);分类 eess.IV

AI总结 TaQ-DiT通过引入时感知量化方法,解决扩散变换器中权重和激活的非收敛问题及不同层的量化敏感性差异,提升量化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏