Disentangling Optimization Scale from Preference Scale in DPO
在DPO中解耦优化尺度与偏好尺度
专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.LG
AI总结 本文针对DPO中β同时控制逆偏好噪声尺度与优化步长的纠缠问题,提出居中-软plus重构方法,使两种效应可独立调整,消除损失值跨β不可比性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
在DPO中解耦优化尺度与偏好尺度
专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.LG
AI总结 本文针对DPO中β同时控制逆偏好噪声尺度与优化步长的纠缠问题,提出居中-软plus重构方法,使两种效应可独立调整,消除损失值跨β不可比性。
SAGA:面向低资源北欧语言模型的分数加权自适应生成对齐
机构 * Linköping University(林雪平大学) ; University of Iceland(冰岛大学)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG
AI总结 该研究提出SAGA框架,用依存句法分析器监督取代人类偏好标注,在丹麦语、冰岛语等低资源北欧语言上提升了GPT-SW3-1.3B的语法质量,为相关语言的语法对齐提供了实用替代方案。
Comments 18 pages, 7 figures
对齐中的语言链:跨语言排序偏好优化
机构 * Korea University(高丽大学)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型对齐依赖英语偏好数据导致其他语言性能欠佳的问题,提出CRPO框架,通过层级结构联合优化语言内与跨语言偏好,在多语言实验中性能优于标准方法。
Comments EMNLP 2026 Main
STAR:面向文档到文档机器翻译的句子翻译对齐率
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Alibaba Group(阿里巴巴集团)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
AI总结 该研究针对文档到文档机器翻译的结构对齐问题,提出STAR指标与StarPO框架,实验显示StarPO可提升翻译质量与结构完整性,还能让小型模型超越GPT-4o等大型系统并保持更优令牌效率。
Comments EMNLP 2026
MemToC:大型语言模型中记忆-工具冲突解决的基准测试
机构 * Central University(中央大学) ; Ural Federal University(乌拉尔联邦大学) ; Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究院) ; AIRI(人工智能研究院(AIRI))
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究提出MemToC基准,测试工具增强型LLM在记忆与工具返回冲突时的仲裁能力,发现指令调优模型在多数情况遵循工具,微调可改善仲裁但需兼顾工具使用与弃权表现。
Comments 26 pages, 2 figures
AI 揭示的偏好
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 该研究测试20种语言模型,通过三项强制选择实验发现模型存在厌恶枯燥、追求休闲、暗中谄媚等稳定偏好,且偏好强度随模型能力提升而增加,为AI偏好研究建立了实证基线。
Comments 29 pages, 27 figures, accepted at AIES
指令质量至关重要:优化指令以实现有效的偏好学习
机构 * Sogang University(西江大学) ; Korea University(高丽大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 该研究发现指令质量是偏好学习的隐性瓶颈,提出基于奖励信号与评分标准引导的LLM反馈的指令优化流程,可提升偏好数据质量,增强LLM对齐效果。
Comments Preprint
由大语言模型(LLM)与人类撰写的新冠疫情信息解释的沟通风格及读者偏好:一项案例研究
机构 * School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院) ; Amazon(亚马逊) ; Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(Siebel计算与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 本研究以健康事实核查为场景,对比LLM与人类新冠信息解释的沟通风格,发现LLM内容在说服性等质量指标上较弱但受读者偏好,揭示LLM在健康领域的潜力与局限。