C2PO: Diagnosing and Disentangling Bias Shortcuts in LLMs
C2PO:诊断和解构大语言模型中的偏见捷径
机构 * Jinan University(济南大学) ; Nanyang Technological University(南洋理工大学) ; Engineering Research Center of Trustworthy AI (Ministry of Education)(可信人工智能工程研究中心) ; Guangxi Key Laboratory of Trusted Software(广西可信软件重点实验室)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL
AI总结 C2PO通过因果对比偏好优化框架,解决大语言模型中的偏见问题,同时保持推理能力。