S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models
S2H-DPO:面向视觉-语言模型的硬度感知偏好优化
机构 * Michigan State University(密歇根州立大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract)
AI总结 本文提出S2H-DPO框架,通过三级层次推理构建多图象偏好数据,提升多图象推理性能,同时保持单图象推理能力,推动视觉偏好对齐的前沿发展。
Journal ref Findings of the Association for Computational Linguistics: ACL 2026