GDRO: Group-level Reward Post-training Suitable for Diffusion Models
GDRO:适用于扩散模型的组级奖励后训练
机构 * The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tongyi Lab(通义实验室)
AI总结 GDRO通过组级奖励后训练优化,提升扩散模型奖励分数并增强抗奖励黑客能力。
高校专区
GDRO:适用于扩散模型的组级奖励后训练
机构 * The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tongyi Lab(通义实验室)
AI总结 GDRO通过组级奖励后训练优化,提升扩散模型奖励分数并增强抗奖励黑客能力。
UCO:一种用于基于大语言模型的自适应教学的多轮交互强化学习方法
机构 * East China Normal University(东华大学) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 UCO通过多轮交互强化学习方法,利用进展奖励和支架奖励函数,提升大语言模型在教育场景中的自适应教学能力。
注意你的推理:一种用于多模态立场检测双推理的元认知直观-反思网络
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 MIND通过元认知直观-反思机制,在多模态立场检测中实现双推理,提升立场判断的准确性和泛化能力。
通过重叠局部步骤加速去中心化优化
机构 * School of Data Science(数据科学学院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 OLDSGD通过计算-通信重叠技术,加速去中心化优化,提升收敛速度并保持理论保证。
EgoReAct:基于第一人称视频的3D人体反应生成
机构 * THU(清华大学) ; Brown(布朗大学) ; Georgia Tech(佐治亚理工学院) ; Cambridge(剑桥大学) ; HKU(香港大学) ; NJU(南京大学) ; CUHK(香港中文大学) ; HKUST(香港科技大学) ; TAMU(德克萨斯大学奥斯汀分校) ; PKU(北京大学) ; MIT(麻省理工学院)
AI总结 EgoReAct通过构建HRD数据集,首次实现从第一人称视频实时生成3D对齐的人体反应运动,提升生成的现实感和空间一致性。
Comments 12 pages, 9 figures
混合与单位元PEFT用于资源高效的大型语言模型
机构 * Department of Information Engineering, The Chinese University of Hong Kong, Hong Kong(信息工程系,香港中文大学) ; Department of Electrical and Computer Engineering, University of California San Diego, USA(电气与计算机工程系,加州大学圣地亚哥分校) ; Department of Computer Science, University of Copenhagen, Denmark(计算机科学系,哥本哈根大学) ; Department of Electrical Engineering, Columbia University, USA(电气工程系,哥伦比亚大学)
AI总结 本文提出混合与单位元PEFT方法,通过结合BOFT和LoRA-GA的优势,提升LLM微调效率,减少训练时间和内存使用,适用于资源受限场景。
Comments 11 pages, 2 figures and 7 table
Journal ref American Journal of Computer Science and Technology (Volume 8, Issue 4, 2025)