Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph
超越成对:你的语言模型其实是在优化一个偏好图
机构 * Amazon(亚马逊)
AI总结 本文提出GraphDPO,通过构建偏好图结构优化语言模型,解决传统成对优化在处理多轮次数据时的局限性,提升模型在推理和编程任务中的性能。
大厂专区
超越成对:你的语言模型其实是在优化一个偏好图
机构 * Amazon(亚马逊)
AI总结 本文提出GraphDPO,通过构建偏好图结构优化语言模型,解决传统成对优化在处理多轮次数据时的局限性,提升模型在推理和编程任务中的性能。
重新思考LLM策略优化中的重要性采样:从累积token视角
机构 * UIUC(伊利诺伊大学香槟分校) ; University of Michigan(密歇根大学) ; Amazon(亚马逊)
AI总结 本文提出CTPO,通过累积token重要性采样比解决偏倚-方差困境,结合位置自适应裁剪提升稳定性,实现更一致的正则化,在数学推理基准上表现最佳。
AGWM:基于 affordance 的世界模型用于具有组合前提条件的环境
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; University of Hong Kong(香港大学) ; Columbia University(哥伦比亚大学) ; Amazon(亚马逊) ; City University of Hong Kong(香港城市大学)
AI总结 本文提出 AGWM 模型,通过学习抽象 affordance 结构来跟踪动作的动态可执行性,以解决传统世界模型在多步预测中的误差累积问题。
Comments 16 pages, 3 figures, 4 tables. Appendix on pages 11-16 (main text is self-contained)
基于分类器引导的germline吸收离散扩散的抗体序列生成
机构 * Paul G. Allen School of Computer Science and Engineering, University of Washington(华盛顿大学保罗·G·艾伦计算机科学与工程学院) ; Life Sciences, Amazon Web Services(亚马逊网络服务生命科学)
AI总结 本文提出germline吸收扩散模型,通过离散扩散微调提升抗体序列生成性能,有效减少germline偏差,改进非germline残基预测准确率,并在条件生成任务中优于现有方法。
Comments 9 pages, 2 figures, 2 tables
MolmoAct2:面向现实部署的动作推理模型
机构 * Allen Institute for AI(艾伦人工智能研究所) ; University of Washington(华盛顿大学) ; National University of Singapore(新加坡国立大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Amazon(亚马逊公司) ; University of Michigan(密歇根大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 本文提出MolmoAct2,一个完全开放的动作推理模型,通过改进架构和引入新数据集,在五个方面提升性能,展示了在多个基准测试中优于现有模型的成果。
Comments 31 pages, project page: https://allenai.org/blog/molmoact2
MaPPO:结合先验知识的最大后验偏好优化
机构 * Purdue University(普渡大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Amazon(亚马逊) ; Meta, FAIR ; Yonsei University(延世大学)
AI总结 MaPPO通过整合先验奖励知识优化偏好学习,提升对齐性能,无需额外超参数,适用于离线和在线设置,支持DPO变体插件,实验显示在多个基准上效果显著。