arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-13 至 2026-01-13 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 2 篇

2601.07287 2026-01-13 cs.CV 74%

Focal Guidance: Unlocking Controllability from Semantic-Weak Layers in Video Diffusion Models

焦点引导:从语义弱层中解锁视频扩散模型的可控性

Yuanyang Yin, Yufan Deng, Shenghai Yuan, Kaipeng Zhang, Xiao Yang, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(BIPC联合实验室,中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) ByteDance China(字节跳动中国)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出Focal Guidance方法,通过细粒度语义引导和注意力缓存增强视频扩散模型中语义弱层的可控性,提升对文本提示的遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07396 2026-01-13 cs.CV 57%

Forecast the Principal, Stabilize the Residual: Subspace-Aware Feature Caching for Efficient Diffusion Transformers

预测主成分,稳定残差:面向高效扩散变换器的子空间感知特征缓存

Guantao Chen, Shikang Zheng, Yuqi Lin, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Sun Yat-Sen University(中山大学) South China University of Technology(华南理工大学) Jilin University(吉林大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出SVD-Cache方法,通过子空间感知的特征缓存技术提升扩散变换器的推理效率,实现近无损效果并支持多种加速技术。

详情

展开后加载摘要…

URL PDF HTML 收藏