arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-17 至 2026-02-17 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 3 篇

2602.14381 2026-02-17 cs.CV cs.AI 79%

Adapting VACE for Real-Time Autoregressive Video Diffusion

为实时自回归视频扩散适应VACE

Ryan Fosdick

机构 * Daydream

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 VACE被适配用于实时自回归视频生成,通过调整参考帧路径以兼容因果注意力,保留固定分块大小和KV缓存,同时增加20-30%的延迟开销,但显存成本低,参考到视频的保真度下降。

Comments 10 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08431 2026-02-17 cs.CV cs.LG 57%

Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency

大规模扩散蒸馏的连续时间一致性 via 分数正则化

Kaiwen Zheng, Yuji Wang, Qianli Ma, Huayu Chen, Jintao Zhang, Yogesh Balaji, Jianfei Chen, Ming-Yu Liu, Jun Zhu, Qinsheng Zhang

机构 * Dept. of Comp. Sci. & Tech., BNRist Center, THU-Bosch ML Center, AI Institute, Tsinghua(清华大学计算机科学与技术系,BNRist中心,THU-Bosch机器学习中心,人工智能研究院) NVIDIA

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出分数正则化的连续时间一致性模型(rCM),通过引入分数蒸馏作为长跳正则化器,改进了sCM在细节生成和多样性方面的性能,适用于大规模图像和视频扩散任务。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13515 2026-02-17 cs.CV cs.LG 57%

SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning

SpargeAttention2: 通过混合Top-k+Top-p掩码和蒸馏微调实现可训练稀疏注意力

Jintao Zhang, Kai Jiang, Chendong Xiang, Weiqi Feng, Yuezhou Hu, Haocheng Xi, Jianfei Chen, Jun Zhu

机构 * Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 SpargeAttention2通过混合Top-k+Top-p掩码和蒸馏微调,实现高稀疏性且不降低生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏