Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping
文本到图像模型的强化后训练与超线性优势塑造
机构 * Nanyang Technological University(南洋理工大学) ; Baidu Inc.(百度公司) ; Zhejiang University(浙江大学) ; City University of Hong Kong(香港城市大学) ; Tsinghua University(清华大学) ; Jimei University(集美大学)
AI总结 本文提出超线性优势塑造方法,通过信息几何视角优化文本到图像模型的后训练过程,提升训练效率和生成质量,减少奖励黑客问题。