arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-25 至 2025-12-25 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 2 篇

2512.21268 2025-12-25 cs.CV 83%

ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision

ACD: 通过注意力监督实现视频扩散模型的直接条件控制

Weiqi Li, Zehao Zhang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Yonsei University(延世大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 ACD通过注意力监督实现视频扩散模型的直接条件控制,引入稀疏3D-aware对象布局和专用布局控制网络,提升视频生成的可控性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04332 2025-12-25 cs.LG 50%

Data-regularized Reinforcement Learning for Diffusion Models at Scale

大规模扩散模型中的数据正则化强化学习

Haotian Ye, Kaiwen Zheng, Jiashu Xu, Puheng Li, Huayu Chen, Jiaqi Han, Sheng Liu, Qinsheng Zhang, Hanzi Mao, Zekun Hao, Prithvijit Chattopadhyay, Dinghao Yang, Liang Feng, Maosheng Liao, Junjie Bai, Ming-Yu Liu, James Zou, Stefano Ermon

机构 * Stanford University(斯坦福大学) NVIDIA Tsinghua University(清华大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 DDRL通过数据正则化方法提升扩散模型的奖励表现,有效缓解奖励黑客问题,实现高分辨率视频生成中的高人偏好和可扩展训练。

详情

展开后加载摘要…

URL PDF HTML 收藏