Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization
机构 * AiLECS Lab, Monash University Melbourne, Australia(墨尔本大学AiLECS实验室,澳大利亚) ; AiLECS Lab, Monash University, Australia ICMEC Australia, Sydney, Australia(墨尔本大学AiLECS实验室,澳大利亚 ICMEC澳大利亚,悉尼,澳大利亚)
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract);large language model(abstract);pretraining(abstract)
Comments Accepted for publication in the Proceedings of the 8th International Conference on Algorithms, Computing and Artificial Intelligence (ACAI 2025)