arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4556 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4556 篇

2606.17678 2026-06-17 cs.CV cs.AI 新提交 81%

See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

先看后答:基于充分性驱动的强化学习实现视觉证据预对齐

Yilian Liu, Sicong Leng, Guoshun Nan, Junyi Zhu, Jiayu Huang, Minghao Sun, Xuancheng Zhu, Yisong Chen, Zexian Wei, Xiaofeng Tao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) China Telecom(中国电信)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 提出视觉证据预对齐(VEPA)方法,在预训练与后训练之间引入充分性驱动的GRPO优化,以增强多模态大模型对细粒度视觉证据的利用,显著提升视觉密集型任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08561 2026-06-10 cs.AI 81%

RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback

RetroAgent: 从解决到进化 via 逆向双重内在反馈

Xiaoying Zhang, Zichen Liu, Yipeng Zhang, Xia Hu, Wenqi Shao

机构 * Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RetroAgent通过逆向双重内在反馈机制,使大语言模型代理在交互环境中通过持续进化而非单纯完成任务来提升性能,实现更强的适应与泛化能力。

Comments updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08875 2026-06-09 cs.AI 新提交 81%

Can the Environment Speak for Itself? $T^{2}$-GRPO: A Turn-Trajectory Group Relative Policy Optimization for Caregiver Agents

环境能否为自己发声?$T^{2}$-GRPO:一种面向护理智能体的转向-轨迹组相对策略优化

Yutong Song, Jiang Wu, Pengfei Zhang, Wenjun Huang, Honghui Xu, Nikil Dutt, Amir M. Rahmani

机构 * University of California, Irvine(加州大学尔湾分校) Independent Researcher(独立研究员) Kennesaw State University(肯尼索州立大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出T²-GRPO框架,通过解耦护理强化学习为两个归一化奖励视界,并利用二元硬否决确保安全,从环境状态转换中提取密集转向级奖励,结合轨迹级评估,有效处理即时患者反馈、长期护理结果和安全约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07988 2026-06-09 cs.AI 新提交 81%

PAFO: Pareto Fairness Optimization for Personalized Reward Modeling

PAFO: 个性化奖励建模的帕累托公平优化

Xiaoyan Zhao, Haoting Ni, Yang Zhang, Chunyuan Zheng, Haoxuan Li, Fuli Feng

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对个性化奖励模型因训练数据偏好不平衡导致对少数用户群体存在偏见的问题,提出PAFO框架,通过帕累托公平优化提升弱势群体性能而不损害其他群体,实验表明能同时提高少数和多数群体准确率并降低不公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05336 2026-06-05 cs.CL 81%

Self-supervised User Profile Generation for Personalization

面向个性化的自监督用户画像生成

Clark Mingxuan Ju, Yuwei Qiu, Tong Zhao, Neil Shah

机构 * Snap Inc.(Snap公司) bellevue, WA USA(华盛顿州西雅图市)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出BUMP框架,利用自监督双向排序目标训练大语言模型生成用户文本画像,无需下游标注即可实现个性化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02615 2026-06-03 eess.AS cs.AI cs.SD 81%

FSA-GRPO: Teaching Auditory LLMs to Use Few-shot Demonstrations

FSA-GRPO:训练听觉大语言模型使用少样本示例

Haolong Zheng, Siyin Wang, Xulin Fan, Zengrui Jin, Mark Hasegawa-Johnson

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);prompting(abstract)

AI总结 提出基于强化学习的后训练方法FSA-GRPO,通过专门设计的奖励机制鼓励模型利用少样本示例,增强其少样本适应能力,在儿童语音识别、语音翻译和音频理解等任务上取得提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03239 2026-06-03 cs.CL 81%

ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents

ARBOR: 通过可复用评分标准缓冲区的在线过程奖励用于搜索智能体

Zheng Liu, Longxiang Zhang, Xintong Wang, Zhiang Xu, Shaoxiong Zhan, Xin Shan, Wen Huang, Tao Dai, Shu-Tao Xia, Chengfu Huo, Liang Ding

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Peking University(北京大学) Shenzhen University(深圳大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对基于LLM的搜索智能体训练中结果奖励缺乏过程监督的问题,提出ARBOR框架,通过维护跨查询共享的评分标准记忆库,利用对比轨迹生成局部草案并整合为通用评分标准,以稀疏成对判断提供过程级梯度,在四个多跳QA基准上优于GRPO和DAPO基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03131 2026-06-03 cs.LG 81%

HARVE: Hacking-Aware Reward-Head Vector Editing for Robust Reward Models

HARVE:面向鲁棒奖励模型的感知黑客奖励头向量编辑

Shuang Liu, Yuxuan Bo, Qiuyang Zhao, Caiyue Huang, Xiaorong Chen, Yanguang Liu, Mengnan Du

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Virginia(弗吉尼亚大学) Harvard University(哈佛大学) Stanford University(斯坦福大学) University of Michigan(密歇根大学) New Jersey Institute of Technology(新泽西理工学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对奖励模型易受奖励黑客攻击的问题,提出无需训练的奖励头编辑方法HARVE,通过移除与黑客相关子空间对齐的奖励头向量分量,提升鲁棒性并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16014 2026-06-03 cs.CL 81%

Ranking Free RAG: Replacing Re-ranking with Selection in RAG for Sensitive Domains

无排序RAG:用选择替代重排序以应用于敏感领域

Yash Saxena, Ankur Padia, Mandar S Chaudhary, Kalpa Gunaratna, Srinivasan Parthasarathy, Manas Gaur

机构 * University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出METEORA框架,通过DPO微调LLM生成检索理由、统计肘部检测自适应截断和验证器过滤,在敏感领域实现可解释、高效且鲁棒的证据选择,无需重排序。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03619 2026-06-02 cs.CL 81%

Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation

从人类偏好中学习查询特定评分标准用于DeepResearch报告生成

Changze Lv, Jie Zhou, Wentao Zhao, Jingwen Xu, Shihan Dou, Zisu Huang, Muzhao Tian, Xiaohua Wang, Yang Liu, Pluto Zhou, Tao Gui, Le Tian, Xiao Zhou, Xiaoqing Zheng, Xuanjing Huang, Jie Zhou

机构 * Tencent(腾讯) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 提出一种通过强化学习训练查询特定评分标准生成器的流水线,以解决DeepResearch长报告生成中缺乏可验证奖励信号的问题,并在人类偏好测试和下游任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27772 2026-05-28 cs.SD cs.LG 81%

Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox

音频大语言模型是听还是读?使用VoxParadox分析和缓解副语言失败

Jiacheng Pang, Ashutosh Chaubey, Mohammad Soleymani

机构 * Institute for Creative Technologies, University of Southern California, Los Angeles, USA(创意技术研究所,南加州大学,洛杉矶,美国)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对音频大语言模型在副语言理解上的不足,提出对抗性基准VoxParadox和Prompt-Conditioned Layer Mixer方法,显著提升模型对副语言线索的利用能力。

Comments Accepted as a conference paper at ICML 2026. Project page: https://voxparadox.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18530 2026-05-28 cs.AI 81%

OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning

OGER:一种用于混合强化学习的鲁棒离线引导探索奖励

Xinyu Ma, Mingzhou Xu, Xuebo Liu, Chang Jin, Qiang Wang, Derek F. Wong, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Hithink RoyalFlush Information Network, Hangzhou, China(杭州Hithink RoyalFlush信息网络) Computer and Information Science, University of Macau, Macau, China(澳门大学计算机与信息科学学院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出OGER框架,通过多教师协作训练和基于熵的辅助探索奖励,统一离线教师引导与在线强化学习,提升大语言模型在数学推理和泛化任务中的探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24812 2026-05-26 cs.AI 81%

CoRe-Code: Collaborative Reinforcement Learning for Code Generation

CoRe-Code:面向代码生成的协作式强化学习

Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Xiaoyu Xia, Sumon Biswas

机构 * The Ohio State University(俄亥俄州立大学) Royal Melbourne Institute of Technology(皇家墨尔本理工学院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CoRe-Code框架,通过规划器-编码器范式和基于GRPO的协作感知强化学习,增强多智能体间的协调与专业化,提升代码生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23652 2026-05-25 cs.AI 81%

One Policy, Infinite NPCs: Persona-Traceable Shared RL Policies for Scalable Game Agents

一个策略,无限NPC:用于可扩展游戏智能体的可追溯共享RL策略

Yoosung Hong

机构 * Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一种基于冻结LLM嵌入的条件共享强化学习策略pcsp,实现大规模NPC的个性化控制,在300人生活模拟基准上零样本身份识别提升17倍,推理速度比LLM策略快22倍。

Comments 18 pages, 15 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21822 2026-05-22 cs.AI 81%

Implicit Safety Alignment from Crowd Preferences

从大众偏好中隐式安全对齐

Qian Lin, Daniel S. Brown

机构 * Kahlert School of Computing, University of Utah(犹他大学计算学校)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究如何从大众偏好数据中提取共享的安全标准,并将其转移到下游强化学习任务中以规范智能体行为并确保安全。提出了一种基于大众偏好的安全强化学习框架,通过高级策略将安全对齐的技能组合起来,以安全地解决下游任务。

Comments Accepted to ICML 2026. Conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20061 2026-05-20 cs.CL 81%

Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents

奖励信念,而非行动:一致性引导的长期智能体信用分配

Wenjie Tang, Minne Li, Sijie Huang, Liquan Xiao, Yuan Zhou

机构 * College of Computer, National University of Defense Technology(国防科技大学计算机学院) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ReBel算法,通过建模结构化信念状态来指导策略学习,解决长期任务中由于部分可观测性导致的信用分配问题,实验表明其在ALFWorld和WebShop等基准测试中提升了任务成功率并提高了样本效率。

Comments 10 pages, 4 figures, 3 tables, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17558 2026-05-19 cs.SE cs.CL 81%

Firefly: Illuminating Large-Scale Verified Tool-Call Data Generation from Real APIs

Firefly:从真实API生成大规模验证工具调用数据

Yuxuan Lu, Ziyi Wang, Yingzhou Lu, Yisi Sang, Jiri Gesi, Xianfeng Tang, Yimeng Zhang, Zhenwei Dai, Hui Liu, Hanqing Lu, Chen Luo, Qi He, Benoit Dumoulin, Jing Huang, Dakuo Wang

机构 * Northeastern University(东北大学) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出FireFly框架,通过反向合成方法生成具有验证标签的工具调用数据,利用强LLM探索真实API并构建工具图,以提高大规模工具空间下的训练效率和结果准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00920 2026-05-18 cs.CL 81%

Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios

奖励审计员:在现实扰动场景中对奖励建模适用性的推断

Jianxiang Zang, Yongda Wei, Ruxue Bai, Shiyu Jiang, Nijia Mo, Binhong Li, Qiang Sun, Hui Liu

机构 * School of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Statistics and Data Science, Shanghai University of International Business and Economics(上海国际商务经济学院统计与数据科学学院) Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)数据科学与分析方向)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出奖励审计员框架,用于评估奖励模型在现实扰动场景中的适用性,通过统计显著性和效应量分析模型的可靠性与漏洞严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14483 2026-05-15 cs.AI 81%

LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning

LEMON:通过反事实强化学习学习可执行多智能体编排

Xudong Chen, Yixin Liu, Hua Wei, Kaize Ding

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LEMON通过反事实强化学习生成可执行的多智能体编排规范,整合任务特定角色、定制职责、容量级别和依赖结构,提升多智能体系统解决方案质量和执行效率。

Comments Submitted to Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12995 2026-05-14 cs.LG 81%

F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking

F-GRPO:基于统一候选生成与排序的因子化组相对策略优化

Rohan Surana, Gagan Mundada, Junda Wu, Xintong Li, Yizhu Jiao, Bowen Jin, Sizhe Zhou, Tong Yu, Ritwik Sinha, Jiawei Han, Jingbo Shang, Julian McAuley

机构 * UC San Diego(南加州大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出F-GRPO,通过因子化组相对策略优化统一完成候选生成与排序,解决传统方法中因反馈滞后导致的优化不稳定问题,提升推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11865 2026-05-13 stat.ML cs.LG 81%

Variance-aware Reward Modeling with Anchor Guidance

具有锚点指导的方差感知奖励建模

Shuxing Fang, Ruijian Han, Liangyu Zhang, Fan Zhou

机构 * Department of Data Science and Artificial Intelligence, Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系) School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.LG

AI总结 本文提出一种通过添加粗粒度响应级锚点标签来解决标准Bradley-Terry奖励模型非识别性问题的框架,改进了奖励建模和下游RLHF性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10663 2026-05-12 cs.AI 81%

Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents

Evolving-RL: 端到端优化经验驱动的自我进化能力

Zhiyuan Fan, Wenwei Jin, Feng Zhang, Bin Li, Yihong Dong, Yao Hu, Jiawei Li

机构 * Xiaohongshu Inc.(小红书公司) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出Evolving-RL框架,通过联合优化经验提取与利用能力,提升大模型在新型任务中的适应能力,实验显示在ALFWorld和Mind2Web任务中取得显著性能提升。

Comments 17pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26272 2026-05-11 cs.CV cs.LG 81%

PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection

PRPO:用于视觉-语言深度伪造检测的段级策略优化

Tuan Nguyen, Naseem Khan, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Qatar Computing Research Institute, Hamad Bin Khalifa University, Doha, Qatar(卡塔尔计算研究所,哈马德·本·哈利法大学,多哈) New Jersey Institute of Technology, NJ, USA(新泽西理工学院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PRPO算法,通过段级相对策略优化提升深度伪造检测的准确性与推理能力,实验显示其在检测准确率和推理评分上均显著优于现有方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00425 2026-05-11 cs.AI 81%

AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning

AEM:多轮代理强化学习中的自适应熵调节

Haotian Zhao, Songlin Zhou, Yuxin Zhang, Stephen S. -T. Yau, Wenyu Zhang, Lun Tian, Tianshu Zhu, Yifeng Huang, Yucheng Zeng, Jingnan Gu, Daxiang Dong, Jianmin Wu

机构 * Baidu(百度) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AEM通过自适应调节熵动态,改进多轮代理强化学习中的探索与利用平衡,无需监督即可提升性能。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06650 2026-05-08 cs.CL 81%

Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients

超越负回滚:仅正回滚的策略优化

Mingwei Xu, Hao Fang

机构 * University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出POPO框架,通过仅使用在线正回滚进行学习,避免负回滚,并通过siamese网络和相似性惩罚提升稳定性,实验证明其在数学基准测试中性能优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27453 2026-05-01 cs.CL 81%

From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks

从粗到细:面向写作中心生成任务的基准测试与奖励建模

Qingyu Ren, Tianjun Pan, Xingzhou Chen, Xuhong Wang

机构 * Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(数据科学上海重点实验室,计算机科学与人工智能学院,复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出WEval评估框架和WRL训练框架,通过细粒度评估和强化学习提升写作生成任务的奖励模型性能,实验显示模型在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19342 2026-05-01 stat.ML cs.LG stat.ME 81%

Contextual Online Uncertainty-Aware Preference Learning for Human Feedback

基于上下文的在线不确定性感知偏好学习用于人类反馈

Nan Lu, Ethan Lee, Ethan X. Fang, Junwei Lu

机构 * Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学T.H.陈公共卫生学院生物统计学系) Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种新的统计框架,利用动态上下文信息在线决策和统计推断最优模型,通过人类偏好数据实现最优 regret 绑定和估计量渐近分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22981 2026-04-28 cs.LG 81%

Reward Models Are Secretly Value Functions: Temporally Coherent Reward Modeling

奖励模型实际上是隐含的价值函数:时间一致的奖励建模

Alex Nikulkov

机构 * AI at Meta(Meta人工智能)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出时间一致的奖励建模方法,通过正则化项使奖励模型在任意token位置输出代表条件期望,提升token级奖励可解释性,并在ProcessBench上取得SOTA性能,同时优化PPO的资源利用。

Comments 27 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19544 2026-04-22 cs.AI 81%

DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling

DT2IT-MRM:去偏偏好构建与迭代训练用于多模态奖励建模

Zhihong Zhang, Jie Zhao, Xiaojian Huang, Jin Xu, Zhuodong Luo, Xin Liu, Jiansheng Wei, Xuejin Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DT2IT-MRM方法,通过去偏偏好构建、文本到图像偏好数据重构和迭代训练框架,解决多模态奖励建模中偏好数据的偏差、噪声和不一致问题,并在三个基准测试中取得新突破。

Comments code will be uploaded to https://github.com/zhang123434/DT2IT-MRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14646 2026-04-20 cs.AI 81%

Targeted Exploration via Unified Entropy Control for Reinforcement Learning

通过统一熵控制实现定向探索的强化学习

Chen Wang, Lai Wei, Yanzhi Zhang, Chenyang Shao, Zedong Dan, Weiran Huang, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Sun Yat-sen Univeristy(中山大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出UEC-RL框架,通过定向探索机制和稳定器解决强化学习中的熵崩溃问题,提升大模型推理性能。

Comments Accepted for publication in Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏