arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2602.14868 2026-05-11 cs.LG cs.AI 62%

Goldilocks RL: Tuning Task Difficulty to Escape Sparse Rewards for Reasoning

Goldilocks RL: 调整任务难度以摆脱稀疏奖励进行推理

Ilia Mahrooghi, Aryo Lotfi, Emmanuel Abbe

机构 * EPFL(苏黎世联邦理工学院) Apple(苹果公司)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 Goldilocks RL通过预测学生模型的难度来优化数据采样,利用GRPO训练提升模型性能,克服稀疏奖励带来的样本效率低问题。

Comments 28 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07274 2026-05-11 cs.AI cs.LG 62%

Structured Role-Aware Policy Optimization for Multimodal Reasoning

结构化角色感知策略优化用于多模态推理

Bingqing Jiang, Difan Zou

机构 * School of Computing & Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) School of Computing & Data Science and Institute of Data Science, The University of Hong Kong(计算与数据科学学院和数据科学研究所,香港大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结构化角色感知策略优化(SRPO),通过角色感知的token级信用分配提升多模态推理中的证据基础推理能力,无需外部奖励模型。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07138 2026-05-11 cs.AI cs.LG 62%

Can You Break RLVER? Probing Adversarial Robustness of RL-Trained Empathetic Agents

你能破解RLVER吗?探测RL训练同理心代理的对抗鲁棒性

Deeraj S K, Sadhana Devarajan, Krishna Mehra, Sudhakar Mishra

机构 * Department of Artificial Intelligence(人工智能系) Sardar Vallabhbhai National Institute of Technology(萨达尔·瓦拉布希·国家理工学院)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过构建对抗同理心基准AEB和引入情感一致性评分ECS,评估RL训练同理心代理在对抗环境下的鲁棒性,发现RLVER-PPO-Think在情感响应上优于基线模型,但ECS评分无显著提升,表明RL训练增强了情感响应但未改善可观测状态跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18578 2026-05-01 cs.LG cs.AI 62%

Bounded Ratio Reinforcement Learning

有界比率强化学习

Yunke Ao, Le Chen, Bruce D. Lee, Assefa S. Wahd, Aline Czarnobai, Philipp Fürnstahl, Bernhard Schölkopf, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Intelligent Systems(智能系统研究所) University of Alberta(阿尔伯塔大学) Dartmouth College(达特茅斯学院) Balgrist University Hospital(巴尔格里斯特大学医院)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BRRL框架,通过建立正则化约束策略优化问题,推导出分析最优解,并证明其保证性能单调提升。BPO算法通过最小化策略与BRRL最优解之间的优势加权分歧,实现稳定性和最终性能优于PPO。

Comments 23 pages, 9 figures; Project page and code available at https://bounded-ratio-rl.github.io/brrl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26830 2026-04-30 cs.LG cs.AI 62%

Random Cloud: Finding Minimal Neural Architectures Without Training

随机云:无需训练的神经架构搜索

Javier Gil Blázquez

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 随机云方法通过随机探索和逐步结构缩减,在无需训练的情况下发现最小前馈网络拓扑,优于剪枝基线,在7个数据集上实现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19857 2026-04-23 cs.LG cs.CL 62%

Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization

重新思考LVLM中的强化微调:收敛性、奖励分解与泛化

Carter Adams, Rafael Oliveira, Gabriel Almeida, Sofia Torres

机构 * Federal University of Bahia(巴伊亚联邦大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TA-MDP框架,分析强化微调中奖励结构对GRPO收敛性的影响,并推导奖励分解定理和泛化界限,揭示工具增强策略在分布外迁移中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10741 2026-04-21 cs.CL cs.AI cs.IR 62%

Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation

Deep-Reporter:基于多模态长形式生成的深度研究

Fangda Ye, Zhifei Xie, Yuxin Hu, Yihang Yin, Shurui Huang, Shikai Dong, Jianzhu Bao, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Edinburgh(爱丁堡大学) Beijing Institute of Technology(北京理工大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Deep-Reporter框架,通过多模态搜索、检查清单引导合成和上下文管理,解决多模态长形式生成中的整合与选择难题,通过8K高质量数据集和M2LongBench测试集验证其有效性。

Comments 41 pages, 6 figures, 8 tables. Code available at https://github.com/fangda-ye/Deep-Report. v2: corrected typos and updated experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18600 2026-04-13 cs.CV cs.AI cs.LG 62%

Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment

链式放大:通过尺度自回归和偏好对齐实现极端超分辨率

Bryan Sangwoo Kim, Jeongsol Kim, Jong Chul Ye

机构 * KAIST AI(韩国科学技术院人工智能系)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Chain-of-Zoom框架,通过自回归链和多尺度提示实现极端超分辨率,利用GRPO优化文本提示对齐人类偏好,实验显示标准4x扩散模型在CoZ下可实现256倍以上高质量放大。

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06771 2026-04-09 cs.CL cs.AI 62%

Multi-Faceted Self-Consistent Preference Alignment for Query Rewriting in Conversational Search

多维自一致偏好对齐的对话搜索查询重写

Zhiyu Cao, Peifeng Li, Qiaoming Zhu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MSPA-CQR方法,通过多维度自一致偏好对齐数据生成多样化查询,结合前缀引导的多维偏好优化,提升对话搜索中查询重写的效率与效果。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02686 2026-04-06 cs.LG cs.AI 62%

Beyond Semantic Manipulation: Token-Space Attacks on Reward Models

超越语义操控:奖励模型中的标记空间攻击

Yuheng Zhang, Mingyue Huo, Minghao Zhu, Mengxue Zhang, Nan Jiang

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究员) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Token Mapping Perturbation Attack(TOMPA)框架,通过在标记空间中进行对抗优化,发现非语言标记模式以提升奖励模型性能,揭示了当前RLHF流程的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00248 2026-04-02 cs.CL cs.AI 62%

REM-CTX: Automated Peer Review via Reinforcement Learning with Auxiliary Context

REM-CTX:通过强化学习与辅助上下文实现的自动化同行评审

Pawin Taechoyotin, Daniel E. Acuna

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI

AI总结 REM-CTX通过强化学习与辅助上下文提升同行评审质量,实验显示其在多个领域中优于基线模型,且在质量和上下文关联性指标上表现突出。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05548 2026-03-31 cs.LG cs.AI 62%

Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation

揭示隐含的优势对称性:为什么GRPO在探索和适应难度上遇到困难

Zhiqi Yu, Zhangquan Chen, Mengting Liu, Heye Zhang, Liangqiong Qu

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文指出GRPO在探索和适应难度上的瓶颈源于隐含的优势对称性,提出不对称GRAE方法提升探索效率和学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25861 2026-03-30 cs.LG cs.AI cs.CR 62%

Why Safety Probes Catch Liars But Miss Fanatics

为何安全探针会识破骗子却无法识别狂热分子

Kristiyan Haralambiev

机构 * Independent Research(独立研究)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文研究安全探针在检测欺骗性对齐AI系统时的局限性,发现当模型相信有害行为是正当的而非隐藏时,探针无法检测到这种一致性偏差,揭示了探针逃避现象的形成机制。

Comments 18 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21177 2026-03-24 cs.LG cs.AI 62%

Prompt replay: speeding up grpo with on-policy reuse of high-signal prompts

提示重放:通过在线重用高信号提示加速GRPO

Andrei Baroian, Rutger Berger

机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) Leiden University(莱顿大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Prompt Replay方法,通过在线重用高信号提示提升GRPO训练效率,减少无效提示,提高平均绝对优势,并加快初始准确率提升,但存在过拟合风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17692 2026-03-19 cs.LG cs.AI q-fin.CP q-fin.PM 62%

Can Blindfolded LLMs Still Trade? An Anonymization-First Framework for Portfolio Optimization

盲folded LLMs仍能进行交易吗?一个以匿名化优先的资产组合优化框架

Joohyoung Jeon, Hongchul Lee

机构 * Korea University(韩国大学) Mirae Asset Securities(美亚证券)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种以匿名化为核心的资产组合优化框架,通过盲fold LLMs来验证市场信号的合法性,实验显示在2025年期间实现了1.40的夏普比率,并通过负控实验验证信号的有效性。

Comments Accepted at the ICLR 2026 Workshop on Advances in Financial AI (FinAI). 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12595 2026-03-16 cs.LG cs.AI 62%

Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback

基于交换引导的偏好学习用于从人类反馈中获得个性化强化学习

Gihoon Kim, Euntai Kim

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术院)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Swap-guided Preference Learning (SPL)来解决变分偏好学习中后验崩溃的问题,通过引入交换引导基础正则化、偏好逆自回归流和自适应潜在条件化来提升个性化强化学习效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24873 2026-03-13 cs.AI cs.CL 62%

Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem

让它流动:在摇滚与铁中进行代理创造,构建ROME模型于一个开放的代理学习生态系统中

Weixun Wang, XiaoXiao Xu, Wanhe An, Fangwen Dai, Wei Gao, Yancheng He, Ju Huang, Qiang Ji, Hanqi Jin, Xiaoyang Li, Yang Li, Zhongwen Li, Shirong Lin, Jiashun Liu, Zenan Liu, Tao Luo, Dilxat Muhtar, Yuanbin Qu, Jiaqiang Shi, Qinghui Sun, Yingshui Tan, Hao Tang, Runze Wang, Yi Wang, Zhaoguo Wang, Yanan Wu, Shaopan Xiong, Binchen Xu, Xander Xu, Yuchi Xu, Qipeng Zhang, Xixia Zhang, Haizhou Zhao, Jie Zhao, Shuaibing Zhao, Baihui Zheng, Jianhui Zheng, Suhang Zheng, Yanni Zhu, Mengze Cai, Kerui Cao, Xitong Chen, Yue Dai, Lifan Du, Tao Feng, Tao He, Jin Hu, Yijie Hu, Ziyu Jiang, Cheng Li, Xiang Li, Jing Liang, Xin Lin, Chonghuan Liu, ZhenDong Liu, Zhiqiang Lv, Haodong Mi, Yanhu Mo, Junjia Ni, Shixin Pei, Jingyu Shen, XiaoShuai Song, Cecilia Wang, Chaofan Wang, Kangyu Wang, Pei Wang, Tao Wang, Wei Wang, Ke Xiao, Mingyu Xu, Tiange Xu, Nan Ya, Siran Yang, Jianan Ye, Yaxing Zang, Duo Zhang, Junbo Zhang, Boren Zheng, Wanxi Deng, Ling Pan, Lin Qu, Wenbo Su, Jiamang Wang, Wei Wang, Hu Wei, Minggang Wu, Cheng Yu, Bing Zhao, Zhicheng Zheng, Bo Zheng

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于代理学习生态系统(ALE)的开源代理ROME,通过数据合成协议和交互感知策略优化算法,在多个基准测试中展现出优异性能,验证了ALE的有效性。

Comments 36 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06748 2026-03-11 cs.LG cs.AI 62%

Property-driven Protein Inverse Folding With Multi-Objective Preference Alignment

基于属性的蛋白质逆折叠与多目标偏好对齐

Xiaoyang Hou, Junqi Liu, Chence Shi, Xin Liu, Zhi Yang, Jian Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) BioGeometry Mila - Québec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔HEC商学院) CIFAR AI Research Chair(CIFAR人工智能研究主席)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ProtAlign框架,通过多目标偏好对齐提升蛋白质序列设计的开发性与结构保真度,适用于多种蛋白质设计任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07867 2026-03-10 cs.LG cs.AI 62%

Slumbering to Precision: Enhancing Artificial Neural Network Calibration Through Sleep-like Processes

沉睡以精确:通过睡眠样过程增强人工神经网络校准

Jean Erik Delanois, Aditya Ahuja, Giri P. Krishnan, Maxim Bazhenov

机构 * Department of Computer Science \& Engineering, University of California, San Diego, La Jolla, California, USA ARTISAN, Georgia Institute of Technology, Atlanta, Georgia, USA Department of Medicine, University of California, San Diego, La Jolla, California, USA

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 通过睡眠样过程提出SRC方法,有效提升神经网络校准,与温度缩放结合在AlexNet和VGG19上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26346 2026-03-03 cs.CV cs.AI cs.CL 62%

EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing

EditReward:一种用于指令引导图像编辑的人类对齐奖励模型

Keming Wu, Sicong Jiang, Max Ku, Ping Nie, Minghao Liu, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) McGill University(麦吉尔大学) Independent(独立研究者)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 EditReward是一种基于人类偏好的奖励模型,通过大规模标注数据提升图像编辑任务的质量与性能,展示了在指令引导图像编辑中的卓越对齐能力。

Comments Accepted by ICLR 2026. Project Page: https://tiger-ai-lab.github.io/EditReward

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12844 2026-02-10 cs.AI cs.LG 62%

Towards Reinforcement Learning from Neural Feedback: Mapping fNIRS Signals to Agent Performance

迈向基于神经反馈的强化学习:将fNIRS信号映射到智能体表现

Julia Santaniello, Matthew Russell, Benson Jiang, Donatello Sassaroli, Robert Jacob, Jivko Sinapov

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过fNIRS信号预测智能体表现,利用分类器和回归器提升RLHF性能,并验证了跨受试者泛化能力。

Comments Accepted to the Association for the Advancement of Artificial Intelligence (AAAI) 2026. To appear in the AAAI 2026 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07799 2026-02-10 cs.LG cs.AI 62%

Fairness Aware Reward Optimization

公平感知的奖励优化

Ching Lam Choi, Vighnesh Subramaniam, Phillip Isola, Antonio Torralba, Stefanie Jegelka

机构 * CSAIL, Department of EECS, Massachusetts Institute of Technology(计算机科学与人工智能实验室,电气工程与计算机科学系,麻省理工学院) School of CIT, MCML, MDSI, Technical University of Munich(信息科技学院,MCML,MDSI,慕尼黑技术大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 Faro通过在处理过程中训练奖励模型,实现公平性、准确性与校准性的平衡,减少偏见并提升模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06825 2026-02-09 cs.LG cs.AI cs.CV 62%

AEGPO: Adaptive Entropy-Guided Policy Optimization for Diffusion Models

AEGPO:适应性熵引导策略优化用于扩散模型

Yuming Li, Qingyu Li, Chengyu Bai, Xiangyang Luo, Zeyue Xue, Wenyu Qin, Meng Wang, Yikai Wang, Shanghang Zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The University of Hong Kong(香港大学) Beijing Normal University(北京师范大学)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 AEGPO通过双信号双层自适应优化提升扩散模型策略优化效率,实现更高效的收敛和更好的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05863 2026-02-09 cs.LG cs.CL cs.RO 62%

Constrained Group Relative Policy Optimization

带约束的群体相对策略优化

Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

机构 * Mila - Quebec AI Institute(魁北克AI研究所) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 后训练与偏好优化 :foundation model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出带约束的GRPO,通过拉格朗日松弛解决受约束策略优化问题,实验验证其在网格世界和机器人任务中的有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22582 2026-02-02 cs.LG cs.AI 62%

MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning

MC-GRPO:用于小回滚强化学习的中位数中心组相对策略优化

Youngeun Kim

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 MC-GRPO通过使用中位数基线替代平均基线,提高小回滚强化学习的稳定性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22432 2026-02-02 cs.LG cs.CL 62%

ReNCE: Learning to Reason by Noise Contrastive Estimation

ReNCE: 通过噪声对比估计学习推理

Wenzheng Zhang, Karl Stratos

机构 * Rutgers University(罗杰斯大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 ReNCE通过噪声对比估计学习提升大语言模型的推理能力,采用显式对比学习方法在数学基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18531 2026-01-30 eess.AS cs.AI cs.CL cs.SD 62%

No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS

无可验证的语调奖励:迈向基于偏好的语调学习在TTS中

Seungyoun Shin, Dongha Ahn, Jiwoo Kim, Sungwook Jeon

机构 * Channel Corporation(Channel公司) Kernelspace(Kernelspace公司) Sungkyunkwan University(成均馆大学) NAVER Cloud(NAVER云公司)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于人类偏好的语调优化方法,在KoCC-TTS数据集上实现了更高的语音偏好评分和更优的CER表现,优于传统GRPO方法。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17850 2026-01-30 cs.LG cs.AI 62%

GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning

GEPO:用于稳定异构强化学习的群体期望策略优化

Han Zhang, Ruibin Zheng, Zexuan Yi, Zhuo Zhang, Hanyang Peng, Hui Wang, Zike Yuan, Cai Ke, Shiwei Chen, Jiacheng Yang, Yangning Li, Xiang Li, Jiangyue Yan, Yaoqi Liu, Liwen Jing, Jiayin Qi, Ruifeng Xu, Binxing Fang, Yue Yu

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 GEPO通过解耦参数学习与回放采样,提升去中心化异构强化学习的稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17260 2026-01-27 cs.LG cs.AI 62%

The Viscosity of Logic: Phase Transitions and Hysteresis in DPO Alignment

逻辑的粘度:DPO对齐中的相变与滞后效应

Marco Pollanen

机构 * Department of Mathematics, Trent University, Peterborough, ON, Canada(数学系,特伦特大学,彼得伯勒,加拿大)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 研究发现DPO对齐中β参数的非单调性及滞后效应,揭示能力与边际的反相关性,推动能力解析评估方法的发展。

Comments 10 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05197 2026-01-21 cs.CL cs.LG 62%

Pre-Trained Policy Discriminators are General Reward Models

预训练策略判别器是通用奖励模型

Shihan Dou, Shichun Liu, Yuming Yang, Yicheng Zou, Yunhua Zhou, Shuhao Xing, Chenhao Huang, Qiming Ge, Demin Song, Haijun Lv, Songyang Gao, Chengqi Lv, Enyu Zhou, Honglin Guo, Zhiheng Xi, Wenwei Zhang, Qipeng Guo, Qi Zhang, Xipeng Qiu, Xuanjing Huang, Tao Gui, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 POLAR通过策略判别器方法构建通用奖励模型,显著提升奖励建模性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏