CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents
CodeGrep:用于LLM编码智能体的基于强化学习训练的检索智能体
专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI
AI总结 该研究针对LLM编码智能体查找文件效率低的问题,提出基于GRPO训练的14B检索智能体CodeGrep,在SWE-Bench Verified上保持解决率的同时,减少了交互轮数和token使用量。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
CodeGrep:用于LLM编码智能体的基于强化学习训练的检索智能体
专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI
AI总结 该研究针对LLM编码智能体查找文件效率低的问题,提出基于GRPO训练的14B检索智能体CodeGrep,在SWE-Bench Verified上保持解决率的同时,减少了交互轮数和token使用量。
从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励
机构 * Duke University(杜克大学) ; Adobe Inc.(奥多比公司) ; Oregon State University(俄勒冈州立大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; National University of Singapore(新加坡国立大学) ; Amazon(亚马逊)
专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对开放式LLM自我改进中奖励验证问题,提出基于任务转换的RLSVR方法,通过SpyRL实例化,在文本摘要等任务实验中,该方法在不可验证任务上优于现有方法,在可验证推理任务上有提升,扩展了基于RLVR的自我改进。
Comments COLM 2026
强化学习从人类反馈(RLHF)中的评分者状态偏差:一个审计框架
机构 * Oles Honchar Dnipro National University(第聂伯罗国立奥列斯·冈察尔大学) ; Kyiv Institute of Modern Psychology and Psychotherapy(基辅现代心理与心理治疗研究所)
专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.AI
AI总结 研究RLHF中评分者状态偏差这一结构化混淆,提出评分者状态变化是偏差来源,开发审计框架,定义相关概念,得出可证伪预测和效应大小阈值,提出审计协议和试点研究计划以分离偏差来源。
Comments v2: added sycophancy related work; Section 4 positioned against concurrent Bradley-Terry amplification results (Shapira et al. 2026); minor revisions
S2T-RLHF:基于稳定偏好的强化学习从人类反馈中的分层信用分配
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)
专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.AI
AI总结 研究基于偏好奖励模型的RLHF训练不稳定问题,提出分层信用分配的粒度感知原则,引入S2T-RLHF框架,先在句子间分配奖励,再在句内细化,无需重新训练模型,实验证明该方法提高了训练稳定性和鲁棒性。
在Linux提权中使用可验证奖励进行训练后的本地LLM代理
专题命中 后训练与偏好优化 :LLM(title_cn,abstract);post-training(title,abstract);language model(abstract);分类 cs.AI
AI总结 本文提出一种两阶段训练流程,通过监督微调和强化学习提升Linux提权任务的性能,实现高成功率和低推理成本。
LLM赋能的智能MAC协议:一种动态Stackelberg博弈方法
机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院) ; Huawei Technologies Company Ltd.(华为技术有限公司) ; Zhejiang Lab(之江实验室) ; Zhejiang University(浙江大学) ; Macau University of Science and Technology(澳门科技大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI
AI总结 提出一种博弈论LLM赋能的多智能体深度强化学习框架,将上行传输建模为动态多追随者Stackelberg博弈,通过PPO协调LLM驱动代理合成自适应语义MAC协议,实现无需重训的泛化,吞吐量提升77.6%,公平性提升65.2%。
Comments This work has been submitted to IEEE for possible publication
具有广义双线性偏好的可证明高效正则化在线RLHF
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; KAIST EE(韩国科学技术院电子工程系) ; POSTECH CSE/AI(POSTECH 计算科学与人工智能系)
专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.LG
AI总结 研究在线RLHF中正则化最佳响应最大遗憾最小化问题,通过广义双线性偏好模型证明强凸性可导出多对数遗憾,表明快速遗憾不限于KL散度。
Comments 48 pages, 3 figures (ver3: major revisions; ver2: more colorful boxes, fixed some typos)
基于强化学习的LLM事件预测
机构 * Advanced Computer Science(高级计算机科学) ; DeepSeek R1
专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.LG
AI总结 使用GRPO微调LLM,结合Wikipedia修订工具获取实时信息,预测未来事件,使1.5B参数模型性能超越Claude Sonnet 3.5。
Comments Submitted internally at the University of Oxford in Oct 2025, migrated to arXiv on Jun 2026
GIFT: 基于LLM引导的状态-奖励接口用于金融强化学习
机构 * East China University of Science and Technology(华东理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Southwestern University of Finance and Economics(西南财经大学) ; University of Sydney(悉尼大学) ; City University of Hong Kong(香港城市大学) ; Northeastern University(东北大学) ; The Ohio State University(俄亥俄州立大学) ; National University of Singapore(新加坡国立大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出GIFT框架,利用大语言模型引导PPO强化学习中的状态增强和奖励塑造,提升金融交易策略的样本外风险调整收益。
Comments 25 pages, 7 figures. Code and data are available at https://github.com/KAG778/GIFT . Equal contribution: Yanyan Wu and Boyi Zhang. Corresponding author: Youhua Li
当更密集的信用不足时:面向长周期LLM智能体训练的基于证据校准的策略优化
机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室,计算机科学学院,上海交通大学,上海,中国) ; Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(电子与信息工程学院,西安交通大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.LG
AI总结 针对长周期LLM智能体在稀疏延迟奖励下的信用分配问题,提出一种无评论家的策略优化算法ECPO,通过证据校准的动作优势和方差门控信用加权来修正密集信用的统计不可靠性,在ALFWorld和WebShop上显著提升性能。
Evo-Attacker: 用于LLM-MAS长时程工具攻击的记忆增强强化学习
机构 * Beihang University(北航) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; China Academy of Information and Communications Technology(信息通信技术研究院)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出Evo-Attacker,通过记忆增强强化学习框架将工具攻击建模为自进化过程,并引入Attack-Flow GRPO优化长时程信用分配,实验表明其优于基线方法。
Comments ACL 2026 main
StepGap:一种用于多跳问答中步骤级证据缺口检测的混合NLI-LLM检查器
机构 * School of Computing and Information, University of Pittsburgh(计算信息学院,匹兹堡大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL
AI总结 提出混合NLI-LLM决策树StepGap,用于检测多跳问答中的步骤级证据缺口并输出三类标签,在82个问题上达到sF1=72.0,且作为GRPO过程奖励可提升模型精确匹配率。
DynaTrain: 快速在线并行切换用于弹性大语言模型训练
机构 * Institute of Computing Technology, CAS(中国科学院计算技术研究所) ; Peking University(北京大学) ; Infinigence AI ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出DynaTrain,一种能够快速在线重新配置任意多维并行性的分布式训练系统,通过虚拟参数空间抽象统一所有分布式训练状态,实现并行配置的确定性映射,并在密集和MoE模型上展示了显著的性能提升。
Comments GitHub Repo: https://github.com/infinigence/ElasticMegatron
因式分解因果表示学习用于RLHF中的鲁棒奖励建模
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Group(阿里巴巴集团) ; University of California San Diego(加州大学圣地亚哥分校) ; Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)
专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出因式分解表示学习框架,通过分离因果因素与非因果因素提升奖励模型鲁棒性,有效缓解奖励黑客问题。
SkillMaster:迈向LLM代理自主技能掌握
机构 * Shandong University(山东大学) ; Zhongguancun Academy(中关村学院) ; Tsinghua University(清华大学) ; Southeast University(东南大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI
AI总结 SkillMaster通过轨迹引导技能复习、反事实效用评估和DualAdv-GRPO算法,使LLM代理能自主创建、优化和选择技能,提升任务成功率8.8%和9.3%。
潜在代理:一种事后训练过程用于内部化多代理辩论
机构 * Boston University(波士顿大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(title);large language model(abstract);language model(abstract)
AI总结 本文提出一种两阶段微调流程,将多代理辩论转化为单个LLM,通过动态奖励调度和长度截断实现内部化,减少93%的token使用,同时通过激活引导发现代理特定子空间,并展示通过内部化辩论抑制恶意代理的应用。
Comments ACL 2026 Main
See2Refine:视觉语言反馈提升基于LLM的eHMI动作设计
机构 * The University of Tokyo(东京大学) ; University College London(伦敦大学学院) ; Google(谷歌)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 See2Refine通过视觉语言模型的反馈机制,提升基于大语言模型的eHMI动作设计能力,实现无需人工干预的闭环改进,优于传统提示和人工指定基线。
Comments Accepted to ACL2026
高效联邦RLHF via零阶策略优化
机构 * University of Michigan(密歇根大学)
专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.LG
AI总结 本文提出一种高效联邦RLHF算法Par-S$^2$ZPO,通过零阶优化和二进制扰动降低通信、计算和内存复杂度,理论分析证明其在样本复杂度上与集中式方法相当,但策略更新迭代更快,在MuJoCo任务中表现更优。
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);post-training(abstract)
Comments Post-hoc attribution
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(title);language model(title);分类 cs.CL
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments Accepted in ICLR 2024
CreativeInstruct:规模化教导大型语言模型(LLM)平衡质量、创造性与多样性
机构 * Columbia(哥伦比亚大学) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 该研究提出CreativeInstruct指令调优方法,通过注入[StartCreativity]跨度平衡LLM的质量、创造性与多样性,其在叙事生成中表现更优,还能提升强化学习任务性能。
Comments Code: https://github.com/ananya-sahu/CreativeInstruct
时间序列基础模型的训练后处理:一个统一框架
专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究时间序列基础模型预训练不足以可靠部署下游任务的问题,基于预测管道干预位置分析训练后处理方法,分为五类并研究其代表性方法与局限,确定未来方向,提供统一框架助于相关研究。
具有噪声偏好的大语言模型的无偏对齐
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型与人类偏好对齐问题,针对真实偏好数据集中噪声大的问题,提出无偏对齐理论框架,引入新损失函数,能直接从噪声数据集无偏训练模型,实验表明优于现有基线。
Comments Accepted by ICML2026
TimeSRL: 通过语义RL调优的LLM实现通用的时间序列行为建模 -- 一项心理健康应用的案例研究
机构 * Columbia University(哥伦比亚大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Yale University(耶鲁大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Google(谷歌) ; University of Virginia(弗吉尼亚大学)
专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出TimeSRL,一种两阶段LLM框架,通过显式的语义瓶颈路由预测,将原始信号抽象为高级自然语言,从而预测行为结果,该方法在心理健康预测中实现了最先进的跨群体泛化性能。
传递性与循环性:动态大语言模型对齐的显式偏好分解
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区)
专题命中 后训练与偏好优化 :large language model(title);language model(title);RLHF(abstract,abstract_cn);preference optimization(abstract)
AI总结 本文提出Hybrid Reward-Cyclic模型,通过博弈论分解显式分离传递性和循环性偏好,结合动态自我博弈优化方法提升大语言模型对齐效果,实验证明其在混合传递-循环设置中具有结构优势和更高的准确率。
Comments Accepted by ICML 2026
DVPO:基于分布价值建模的策略优化用于大语言模型后训练
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Honor Device Co., Ltd(荣誉设备有限公司)
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG
AI总结 DVPO通过结合条件风险理论与分布价值建模,在噪声监督下提升大语言模型后训练的鲁棒性和泛化能力,优于PPO、GRPO等方法。
英语并非一切所需:系统探索多语言在大语言模型后训练中的作用
机构 * UC Santa Barbara(加州大学圣巴巴拉分校) ; Amazon(亚马逊)
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);large language model(abstract);language model(abstract)
AI总结 研究通过220次监督微调实验,探讨训练语言覆盖、模型规模和任务领域间的相互作用,发现增加后训练语言覆盖对各任务和模型规模均有益,低资源语言受益最大,高资源语言趋于稳定。单语种多语言性可提升英语表现和跨语言泛化,英语独占后训练效果不佳。
卡牌对战大语言模型:大型语言模型幽默对齐的基准测试
机构 * Ghent University(根特大学) ; University of Helsinki(赫尔辛基大学)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过让五种前沿语言模型与人类玩家玩卡牌对战游戏,评估大语言模型在幽默对齐方面的表现,发现模型在幽默判断上与人类偏好不一致,可能受系统性偏差影响。
将大型语言模型对齐于搜索者偏好
机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) ; Xiaohongshu Inc.(小红书公司) ; Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能研究所) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 SearchLLM通过分层多维奖励系统提升开放式生成搜索的鲁棒性和用户需求对齐能力,实测有效消费率提升1.03%。