Journal refIn L. Calatroni, M. Donatelli, S. Morigi, M. Prato, M. Santacesaria (Eds.): Scale Space and Variational Methods in Computer Vision. Lecture Notes in Computer Science, Vol. 14009. Springer, Cham, 588-600, 2023
Comments21 pages, 8 figures, 3 tables. The manuscript is currently under review at the 2026 4th International Conference on Data, Information and Computing Science (https://www.cdics.org/)
IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation
IP-Adapter 就够了:迈向免微调扩散模型的人脸说话视频生成
Hao Wu, Xiangyang Luo, Hao Wang, Jiawei Zhang, Yi Zhang, Jinwei Wang
机构
*
Information Engineering University(信息工程大学)
;
Huai’an University(淮安大学)
;
Chongqing University of Post and Telecommunications(重庆邮电大学)
;
Nankai University(南开大学)
机构
*
Computer Science Department, Morgan State University(莫尔甘州大学计算机科学系)
;
International Organization for Migration (IOM)(国际移民组织)
;
Electrical & Computer Engineering Department, Morgan State University(莫尔甘州大学电气与计算机工程系)
Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators
实时音乐扩散模型:交互式音乐生成扩散模型的高效微调与后训练
Zachary Novack, Stephen Brade, Haven Kim, Hugo Flores García, Nithya Shikarpur, Chinmay Talegaonkar, Suwan Kim, Valerie K. Chen, Julian McAuley, Taylor Berg-Kirkpatrick, Cheng-Zhi Anna Huang
机构
*
UC San Diego(加州大学圣迭戈分校)
;
MIT(麻省理工学院)
;
Adobe(Adobe公司)
专题命中
扩散模型
:diffusion(title,summary_cn);分类 cs.MM
AI总结
本文研究了音频扩散模型能否通过块级KV缓存高效地转化为交互式模型,从而在消费级硬件上实现。提出的Live Music Diffusion Models (LMDMs)通过块级KV缓存恢复并超越了离散Live Music Models (LMMs)的推理复杂度,并通过ARC-Forcing范式实现稳定的后训练对齐,从而在无需显式RL或奖励模型的情况下减少误差累积。