arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4556 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4556 篇

2605.13768 2026-06-09 cs.LG cs.AI cs.IT math.IT 版本更新 85%

High-Rate Quantized Matrix Multiplication II

高速率量化矩阵乘法II

Or Ordentlich, Yury Polyanskiy

机构 * Hebrew University of Jerusalem(希伯来大学杰里科分校) MIT(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文研究在已知第二因子列协方差矩阵情况下高速率量化矩阵乘法,通过水填充算法改进LLM量化方法,展示WaterSIC方案在信息论极限下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05296 2026-06-05 cs.LG cs.AI 85%

Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents

智能体蒙特卡洛:黑盒智能体的强化学习模拟

Dae Yon Hwang, Raunaq Suri, Valentin Villecroze, Anthony L. Caterini, Jesse C. Cresswell, Noël Vouitsis, Brendan Leigh Ross

机构 * University of Cambridge(剑桥大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 提出Agentic Monte Carlo (AMC)方法,利用序贯蒙特卡洛从最优策略后验中采样,无需参数级优化即可对黑盒LLM智能体进行强化学习式优化,在AgentGym基准上超越提示基线并随测试时计算扩展优于GRPO。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21917 2026-06-04 cs.LG cs.AI econ.EM stat.ML 85%

Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model

半参数偏好优化:你的语言模型秘密地是一个单索引模型

Nathan Kallus

机构 * Netflix & Cornell University(Netflix与康奈尔大学)

专题命中 后训练与偏好优化 :language model(title);preference optimization(title);分类 cs.AI、cs.LG

AI总结 本文提出半参数偏好优化方法,通过放宽偏好与潜在奖励之间的链接函数假设,在未知且无限制的链接函数下进行策略对齐,并证明策略类的可实现性诱导出半参数单索引二元选择模型,直接学习策略并给出链接无关的收敛保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31228 2026-06-01 cs.LG cs.AI 85%

EchoRL: Reinforcement Learning via Rollout Echoing

EchoRL:通过回滚回响进行强化学习

Jinhe Bi, Aniri, Minglai Yang, Xingcheng Zhou, Wenke Huang, Sikuan Yan, Yujun Wang, Zixuan Cao, Michael Färber, Xun Xiao, Volker Tresp, Yunpu Ma

机构 * Munich Center for Machine Learning(慕尼黑机器学习中心) Huawei Heisenberg Research Center(华为海森堡研究所以) University of Arizona(亚利桑那大学) College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore(数据科学,南洋理工大学,新加坡) MemAgents Lab(MemAgents实验室)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对RLVR训练中优势退化问题,提出EchoRL模块,通过从成功回滚中提取EchoClip作为辅助监督信号,持续提升训练性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26442 2026-05-27 cs.CL cs.AI 85%

Alignment Tuning for Large Language Models: A Data-Centric Lens on Alignment Data Pipelines

大型语言模型的对齐调优:以数据为中心的对齐数据管道视角

Hwanjun Song

机构 * KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文以数据为中心,将对齐调优重构为管道设计问题,分解为响应合成、偏好评估和偏好实例化三个阶段,并基于此框架统一分类现有对齐方法,总结设计权衡与失败模式,提炼高层原则,最后指出开放挑战。

Comments Accepted at the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23868 2026-05-15 cs.LG cs.CL 85%

GIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNA

GIFT: 组相对隐式微调整合GRPO与DPO和UNA

Zhichao Wang

机构 * Inflection AI

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 GIFT结合GRPO组采样、DPO隐式奖励和UNA的隐式与显式优势MSE,通过z-score标准化消除DPO隐式奖励中的不可行分区函数Z(x)和RLHF/RLVR目标中的KL系数β,以组相对隐式微调解决相同参数策略族,用提示适应的β(x)替代外部调优的β。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21877 2026-05-08 cs.LG cs.AI 85%

P^2O: Joint Policy and Prompt Optimization

P²O:联合策略和提示优化

Xinyu Lu, Kaiqi Zhang, Jinglin Yang, Boxi Cao, Yaojie Lu, Hongyu Lin, Min He, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) National Computer Network Emergency Response Technical Team/Coordination Center of China(中国国家计算机网络应急技术协调中心)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出P²O方法,通过交替更新连续策略与离散提示,解决RLVR在难样本上的优势崩溃问题,提升模型泛化能力并提升性能9.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01511 2026-02-13 cs.CL cs.LG 85%

Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training

交替强化学习用于非可验证大语言模型后训练的评分标准建模

Ran Xu, Tianci Liu, Zihan Dong, Tony Yu, Ilgee Hong, Carl Yang, Linjun Zhang, Tao Zhao, Haoyu Wang

机构 * Emory University(埃默里大学) Purdue University(普渡大学) Rutgers University(罗格斯大学) Georgia Institute of Technology(佐治亚理工学院) University at Albany(阿尔巴尼大学)

专题命中 后训练与偏好优化 :LLM(title);post-training(title);分类 cs.CL、cs.LG

AI总结 Rubric-ARM通过交替强化学习优化评分标准生成与评判,提升非可验证领域大语言模型后训练的响应质量评估与策略对齐性能。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14711 2026-01-22 cs.AI cs.LG 85%

DARA: Few-shot Budget Allocation in Online Advertising via In-Context Decision Making with RL-Finetuned LLMs

DARA: 通过基于上下文的决策制定实现在线广告中的少样本预算分配

Mingxuan Song, Yusen Huo, Bohan Zhou, Shenglin Yin, Zhen Xiao, Jieyi Long, Zhilin Zhang, Chuan Yu

机构 * Peking University(北京大学) School of Computer Science(计算机科学学院) Alibaba Group(阿里巴巴集团) Theta Labs, Inc.(Theta Labs公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 DARA通过结合LLMs的上下文学习与细粒度优化,实现在线广告中的少样本预算分配,提升广告商价值。

Comments Accepted at The ACM Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17169 2025-06-05 cs.CL cs.AI 85%

REAL: Response Embedding-based Alignment for LLMs

Honggen Zhang, Xufeng Zhao, Igor Molybog, June Zhang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17931 2024-05-29 cs.CL cs.LG 85%

Online Merging Optimizers for Boosting Rewards and Mitigating Tax in Alignment

Keming Lu, Bowen Yu, Fei Huang, Yang Fan, Runji Lin, Chang Zhou

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00486 2024-04-02 cs.CL cs.AI 85%

Dialectical Alignment: Resolving the Tension of 3H and Security Threats of LLMs

Shu Yang, Jiayuan Su, Han Jiang, Mengdi Li, Keyuan Cheng, Muhammad Asif Ali, Lijie Hu, Di Wang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17492 2024-02-28 cs.CL cs.AI 85%

Preference Ranking Optimization for Human Alignment

Feifan Song, Bowen Yu, Minghao Li, Haiyang Yu, Fei Huang, Yongbin Li, Houfeng Wang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02206 2023-12-06 cs.AI cs.CL 85%

Axiomatic Preference Modeling for Longform Question Answering

Corby Rosset, Guoqing Zheng, Victor Dibia, Ahmed Awadallah, Paul Bennett

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Accepted to EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06377 2026-08-07 cs.CL cs.AI cs.LG 新提交 85%

Learning When to Trust via Selective Context Preference Optimization

通过选择性上下文偏好优化学习何时信任

Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong

机构 * Duke University(杜克大学) National University of Singapore(新加坡国立大学) UC Berkeley(加州大学伯克利分校) UC Irvine(加州大学欧文分校) Northeastern University(东北大学) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对语言模型易受误导性外部信号影响的问题,提出SCOPE方法,在含四种条件的MIST基准上优化DPO目标,降低SC2W的同时保持正常上下文下的准确率,主张以选择性信任评判模型。

Comments Project Page at https://worldbench.github.io/scope GitHub Repo at https://github.com/worldbench/SCOPE HF Dataset at https://huggingface.co/datasets/worldbench/MIST-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24720 2026-07-28 cs.CL cs.AI cs.LG 新提交 85%

The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

多轮长期规划的物理学:通过单教师和多教师策略蒸馏从预训练到训练后

Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多轮长期规划问题,通过引入统一可控环境,利用预训练、GRPO、OPD及MOPD等方法,研究规划能力在不同阶段的获取、塑造与整合,展示了多教师策略蒸馏对跨环境能力整合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21227 2026-07-24 cs.RO 新提交 85%

FORGE-plus: Force-Budgeted Recovery for Contact-Rich Assembly with a Frozen LLM Supervisor

FORGE-plus:使用冻结的语言模型监督器进行力预算的富接触装配恢复

Kyupaeck Jeff Rah, Midum Oh

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究在规定力上限下实现紧间隙装配及从插入失败中恢复的问题,提出含冻结大语言模型的两层框架,该模型分配力上限并选恢复策略,通过实验评估,此框架表现良好,解决了部分夹具故障问题,也有负面结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18476 2026-07-22 cs.CL cs.AI cs.LG 新提交 85%

Structured Output Collapses Answer Diversity Across 44 Language Models

结构化输出会削弱44种语言模型的答案多样性

Tapan Parikh

机构 * Cornell Tech(康奈尔理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型在特定格式要求下答案多样性变化,通过对44个模型进行31个类别提示实验,发现结构化输出使答案收敛、多样性降低,存在寄存器梯度,揭示了模型对不同格式的响应差异及对答案多样性的影响。

Comments 12 pages, 1 figure. Companion to the One-Word Census (arXiv:2607.12796). Code, data, and interactive explorer: https://github.com/tap2k/modelun/tree/main/studies/structured

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07976 2026-07-10 cs.CL cs.AI cs.LG 新提交 85%

When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning

当不合理的令牌得到强化时:大语言模型强化学习的尾部感知信用校准

Xiuyi Lou, Zicheng Xu, Yu-Neng Chuang, Hoang Anh Duy Le, Zhaozhuo Xu, Guanchu Wang, Vladimir Braverman

机构 * Johns Hopkins University(约翰霍普金斯大学) Rice University(里士满大学) Workato(Workato公司) University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型强化学习中统一信用分配的问题,提出尾部感知信用校准方法TACO,通过计算尾部风险分数校准信用,抑制不良正更新,实验证明该方法优于基线,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22851 2026-07-07 cs.LG cs.AI cs.CL 版本更新 85%

Adaptive Margin RLHF via Preference over Preferences

通过偏好之上的偏好进行自适应边际基于人类反馈的强化学习

Yaswanth Chittepu, Prasann Singhal, Greg Durrett, Scott Niekum

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :RLHF(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究在基于人类反馈的强化学习中奖励模型学习的边际优化问题,提出利用偏好之上的偏好推断自适应边际,介绍具体实例DPO-PoP,提升判别和生成性能,并给出采样策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29805 2026-07-01 cs.CV 版本更新 85%

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO AI中心)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15165 2026-06-09 cs.CL cs.AI cs.LG 版本更新 85%

The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models

灵活性陷阱:重新思考扩散语言模型中任意顺序的价值

Zanlin Ni, Shenzhi Wang, Yang Yue, Tianyu Yu, Weilin Zhao, Yeguo Hua, Tianyi Chen, Jun Song, Cheng Yu, Bo Zheng, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学Leap实验室) NLPLab, Tsinghua University(清华大学自然语言处理实验室) Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) BNRist, Tsinghua University(清华大学北京研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现,尽管扩散语言模型(dLLMs)允许任意生成顺序,但这种灵活性可能限制其推理能力,通过采用标准的Group Relative Policy Optimization(GRPO)方法,即JustGRPO,在保持并行解码能力的同时提升了推理性能。

Comments Code and pre-trained models: https://github.com/LeapLabTHU/JustGRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03376 2026-06-04 cs.CV cs.AI cs.CL cs.LG 85%

P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization

P²-DPO:通过校准直接偏好优化在感知处理中锚定幻觉

Ruipeng Zhang, Zhihao Li, Haozhang Yuan, C. L. Philip Chen, Tong Zhang

机构 * Guangdong Provincial Key Laboratory of Computational AI Models and Cognitive Intelligence, School of Computer Science & Engineering, South China University of Technology(广东省计算人工智能模型与认知智能重点实验室,计算机科学与工程学院,华南理工大学) Pazhou Lab, Guangzhou, China(琶洲实验室,广州,中国) Engineering Research Center of the Ministry of Education on Health Intelligent Perception and Paralleled Digital-Human, Guangzhou, China(教育部健康智能感知与并行数字人工程研究中心,广州,中国)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大型视觉语言模型中的幻觉问题,提出P²-DPO训练范式,通过模型自生成偏好对和校准损失,直接优化感知瓶颈和视觉鲁棒性,无需昂贵人工反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27791 2026-05-28 cs.DB 85%

Are Diffusion Language Models Good Database Analysts?

扩散语言模型是好的数据库分析师吗?

Peixian Ma, Xialie Zhuang, Jiantao Tan, Changlun Li, Ruirui Chen, Chengwei Qin

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 本文提出统一评估框架和SQL-D1智能体框架,通过实验证明扩散语言模型在NL2SQL任务中具有结构鲁棒性和效率-精度灵活权衡的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23398 2026-05-25 cs.IR 85%

TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization

TPMM-DPO:轨迹感知偏好引导的模型合并用于迭代直接偏好优化

Lingling Fu, Yongfu Xu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对迭代DPO中噪声累积导致的过优化和性能退化问题,提出TPMM-DPO方法,通过将迭代策略模型序列视为优化轨迹并自适应融合,构建更平滑鲁棒的参考模型,从而提升训练稳定性和生成质量。

Comments 11 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16342 2026-05-19 cs.LG cs.AI cs.CL 85%

DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models

DACA-GRPO:去噪感知的信用分配用于扩散语言模型中的强化学习

Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Lokesh Boominathan, Manuel R. Ciosici, Yizhe Zhang, Irina Belousova

机构 * The Ohio State University(俄亥俄州立大学) Apple(苹果公司)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DACA-GRPO,通过引入去噪进度评分和分层掩码似然,改进扩散语言模型中强化学习的信用分配,提升数学推理、代码生成等任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05000 2026-05-14 cs.LG cs.AI cs.CL 85%

Entropy Aware Reward Guidance for Diffusion Language Model Alignment

基于熵的奖励引导用于扩散语言模型对齐

Atula Tejaswi, Litu Rout, Constantine Caramanis, Sanjay Shakkottai, Sujay Sanghavi

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EntRGi机制,解决离散扩散语言模型中无法通过自然输出区分的问题,通过动态插值连续token放松与采样硬token,提升奖励模型可靠性与优化精度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07579 2026-05-12 cs.LG cs.AI cs.CL 85%

Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

你的语言模型就是其自身的批评者:具有从演员内部状态估计价值的强化学习

Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo

机构 * Graduate School of Data Science(数据科学研究生院) Seoul National University(首尔国立大学) Computer Science and Engineering(计算机科学与工程)

专题命中 后训练与偏好优化 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出POISE方法,通过利用策略模型内部信号在强化学习中实现高效的基线估计,减少方差并提高训练稳定性,适用于数学推理任务。

Comments Under Review; Project Page: https://elijah0430.github.io/poise/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06070 2026-05-08 cs.CV 85%

Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models

竞技场作为离线奖励:用于扩散模型的高效细粒度偏好优化

Zhikai Li, Yue Zhao, Edward Zhongwei Zhang, Xuewen Liu, Jing Zhang, Qingyi Gu, Zhen Dong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Berkeley(加州大学伯克利分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract,abstract_cn)

AI总结 本文提出ArenaPO,利用竞技场评分作为离线奖励,实现高效细粒度优化,无需奖励模型。通过构建能力分布模型,基于截断正态分布估计质量差距,提升扩散模型的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23964 2026-04-29 cs.IR 85%

RAD-DPO: Robust Adaptive Denoising Direct Preference Optimization for Generative Retrieval in E-commerce

RAD-DPO:面向电商生成检索的鲁棒自适应去噪直接偏好优化

Zhiguo Chen, Guohao Sun, Yiming Qiu, Xingzhi Yao, Mingming Li, Huimu Wang, Yangqi Zhang, Songlin Wang, Sulong Xu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn)

AI总结 针对生成检索中直接偏好优化的局限性,提出RAD-DPO方法,通过梯度分离保护前缀结构、动态奖励加权缓解标签噪声、全局对比学习扩展正样本覆盖,提升检索精度和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏