SPA: A SQL-Plan-Aware Reinforcement Learning Framework for Query Rewriting with LLMs
SPA:一种面向LLM查询重写的SQL计划感知强化学习框架
专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn)
AI总结 提出SPA框架,利用物理执行反馈训练LLM重写SQL查询,通过概率门控自适应奖励塑形和策略自改进,显著提升端到端运行时性能并减少有害重写。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
SPA:一种面向LLM查询重写的SQL计划感知强化学习框架
专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn)
AI总结 提出SPA框架,利用物理执行反馈训练LLM重写SQL查询,通过概率门控自适应奖励塑形和策略自改进,显著提升端到端运行时性能并减少有害重写。
从扫描到缝合:交错跨块后训练量化
机构 * Fujitsu Limited(富士通公司) ; RIKEN Center for AIP(理化学研究所先进智能项目中心) ; Tokai University(东海大学)
专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对大语言模型的分块后训练量化,提出交错跨块量化方法,通过重新处理块边界降低量化困惑度,提升了三比特及GPTQ等量化方案的性能。
Comments 34 pages, 1 figure
控制多样化强化微调:解耦RL后训练的共享控制瓶颈
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract_cn);分类 cs.LG
AI总结 本研究提出CD-RFT方法,定义后训练控制系数揭示RL后训练的共享控制瓶颈,通过正则化减少控制坍缩,在Qwen2.5-7B等模型上实现控制解耦与多任务能力提升,效果可迁移至Llama-3.2-3B。
GraphThink:用于长视距具身任务规划的图增强大语言模型思维
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Tsinghua University(清华大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 后训练与偏好优化 :LLM(title,abstract);prompting(abstract);分类 cs.AI
AI总结 GraphThink框架结合任务图与场景图,通过上下文提示、迭代优化、GRPO奖励设计及事件驱动重规划,在ALFRED基准上实现最优性能,具强泛化能力。
ReQuant:用于训练后量化的固定网格离散细化
机构 * School of Computer Science, Peking University(北京大学计算机学院) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; School of Physics, Peking University(北京大学物理学院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Central Research Institute, ZTE Corporation(中兴公司中央研究院)
专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 ReQuant是用于训练后量化(PTQ)的无反向传播固定网格细化方法,可作为即插即用后处理阶段,提升各类PTQ初始化器生成的量化模型性能,在低位宽下增益显著。
Comments 10 pages, 3 figures, 16 tables
用于功能性抗体设计的抗原特异性抗体多模态基础模型
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 后训练与偏好优化 :foundation model(title,abstract);language model(abstract);preference optimization(abstract);分类 cs.LG
AI总结 该研究针对抗原特异性抗体设计难题,引入AAMFM多模态基础模型,通过跨模态适配器整合抗原信息,用校准直接偏好优化微调,实现抗体 - 抗原相互作用联合建模,实验证明其在功能性抗体设计中性能最优,有抗原特异性抗体工程潜力。
TD-DPO:用于减轻临床自闭症干预对话中谄媚行为的差异感知偏好优化
机构 * Nanhu Brain-Computer Interface Institute(南湖脑机接口研究所) ; MOE Frontiers Science Center for Brain and Brain-Machine Integration, Zhejiang University(浙江大学脑与脑机融合教育部前沿科学中心) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Children’s Hospital Zhejiang University School of Medicine(浙江大学医学院附属儿童医院) ; State Key Laboratory of Brain-Machine Intelligence(脑机智能技术国家重点实验室) ; Department of Neurobiology, Affiliated Mental Health Center and Hangzhou Seventh People’s Hospital, Zhejiang University School of Medicine(浙江大学医学院附属精神卫生中心和杭州市第七人民医院神经生物学系)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究针对大语言模型在自闭症干预对话中的谄媚问题,提出最小编辑数据增强策略及令牌级差异直接偏好优化方法,通过加权差异令牌、降权共享令牌抑制背景漂移,经实验验证该方法能在减轻谄媚与保留干预能力间达较好平衡。
Comments commited to EMNLP2026
通过多模态基于人类反馈的强化学习偏好对齐实现汉喃手稿到现代越南语的直接图像翻译
专题命中 后训练与偏好优化 :RLHF(title,abstract);SFT(abstract);preference optimization(abstract);分类 cs.CL
AI总结 针对汉喃手稿到现代越南语翻译的挑战,提出多模态基于人类反馈的强化学习偏好对齐框架,结合四个流生成越南语,比较PPO、DPO和KTO,结果显示各有优劣,且多模态偏好优化能补充监督学习提升翻译质量。
Comments Accepted Paper at 2026 International Conference on Multimedia Analysis and Pattern Recognition (MAPR)
用于大语言模型强化学习的预测性散度掩码
机构 * Tencent Hunyuan(腾讯混元) ; UIUC(伊利诺伊大学厄巴纳 - 香槟分校) ; NUS(新加坡国立大学)
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究大语言模型强化学习中PPO方向标准不足,提出预测性散度掩码,通过判断策略梯度步骤对散度的影响改进训练,针对离散softmax策略推导预测并开发轻量级估计器,提升不同模型规模和精度设置下的强化学习训练效果。
基于互信息的多目标探索与偏好优化
机构 * School of Computer, Beihang University(北京航空航天大学计算机学院) ; Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰AGI实验室,中国电信人工智能技术(北京)有限公司)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出MI-EPO框架,通过最大化生成响应、偏好反馈和偏好向量的联合条件互信息,统一多目标探索与对齐,实现可控且稳定的多目标权衡。
Comments Accepted at ECML/PKDD 2026
价值轴:语言模型编码它们是否在正确的轨道上
机构 * Stanford University(斯坦福大学) ; Anthropic
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);preference optimization(abstract);分类 cs.CL
AI总结 通过构建Qwen3-8B的“价值轴”,发现语言模型内部追踪当前轨迹的成功概率,并影响自信、自我纠正和探索行为。
Comments Code repository: https://github.com/nickjiang2378/value-axis
分析与改进医学LVLMs中的细粒度偏好优化
机构 * York University(约克大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Queen’s University(女王大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI
AI总结 针对医学大视觉语言模型在事实一致性、视觉定位和临床对齐方面的不足,提出一种结合双向令牌级KL正则化和视觉对比定位目标的细粒度在线偏好优化框架,通过最小编辑模型输出构建偏好对,仅修正临床错误片段,显著提升诊断准确性。
训练LLM通过重力加权直接偏好优化强制执行多级指令层次结构
机构 * Department of Computational Linguistics, University of Zurich, Switzerland(计算语言学系,苏黎世大学,瑞士)
专题命中 后训练与偏好优化 :LLM(title_cn,abstract_cn);preference optimization(title);分类 cs.CL
AI总结 提出重力加权DPO(GW-DPO)方法,通过线性或双边调度加权冲突级别间的结构距离,结合层次分隔符和指令段嵌入,在Llama-3.1-8B-Instruct上提升多级指令优先级遵守率并降低过度拒绝率。
OR 否则:用于策略优化的可微信赖域
机构 * Quantiphi Inc(昆蒂菲公司) ; Self Machines Inc(自机器公司) ; The University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 研究 PPO 和 GRPO 中裁剪代理目标导数突变问题,提出用输出重置(OR)规则优化。通过对比实验,在广义优势估计下 PPO-OR 有更高奖励模型得分,组相对优势下 GRPO-OR 虽平均得分未升但差异更小,OR 改变了优化行为但奖励效果有别。
Comments 22 pages, 5 figures
LatentGym: 具有可控潜在结构的跨任务经验学习测试平台
机构 * Columbia University(哥伦比亚大学) ; Oumi Blog | Code | Models(Oumi博客 | 代码 | 模型)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 提出LatentGym测试平台,通过可控潜在变量分离探索与利用,研究LLM代理在跨任务序列中的适应性学习机制。
Comments 61 pages
通过选择性上下文偏好优化学习何时信任
机构 * Duke University(杜克大学) ; National University of Singapore(新加坡国立大学) ; UC Berkeley(加州大学伯克利分校) ; UC Irvine(加州大学欧文分校) ; Northeastern University(东北大学) ; Nanyang Technological University(南洋理工大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究针对语言模型易受误导性外部信号影响的问题,提出SCOPE方法,在含四种条件的MIST基准上优化DPO目标,降低SC2W的同时保持正常上下文下的准确率,主张以选择性信任评判模型。
Comments Project Page at https://worldbench.github.io/scope GitHub Repo at https://github.com/worldbench/SCOPE HF Dataset at https://huggingface.co/datasets/worldbench/MIST-Bench
多轮长期规划的物理学:通过单教师和多教师策略蒸馏从预训练到训练后
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究多轮长期规划问题,通过引入统一可控环境,利用预训练、GRPO、OPD及MOPD等方法,研究规划能力在不同阶段的获取、塑造与整合,展示了多教师策略蒸馏对跨环境能力整合的作用。
FORGE-plus:使用冻结的语言模型监督器进行力预算的富接触装配恢复
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究在规定力上限下实现紧间隙装配及从插入失败中恢复的问题,提出含冻结大语言模型的两层框架,该模型分配力上限并选恢复策略,通过实验评估,此框架表现良好,解决了部分夹具故障问题,也有负面结果。
结构化输出会削弱44种语言模型的答案多样性
机构 * Cornell Tech(康奈尔理工学院)
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究语言模型在特定格式要求下答案多样性变化,通过对44个模型进行31个类别提示实验,发现结构化输出使答案收敛、多样性降低,存在寄存器梯度,揭示了模型对不同格式的响应差异及对答案多样性的影响。
Comments 12 pages, 1 figure. Companion to the One-Word Census (arXiv:2607.12796). Code, data, and interactive explorer: https://github.com/tap2k/modelun/tree/main/studies/structured
当不合理的令牌得到强化时:大语言模型强化学习的尾部感知信用校准
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Rice University(里士满大学) ; Workato(Workato公司) ; University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究大语言模型强化学习中统一信用分配的问题,提出尾部感知信用校准方法TACO,通过计算尾部风险分数校准信用,抑制不良正更新,实验证明该方法优于基线,提升训练稳定性。
Polaris:基于检索反馈学习生成表格描述
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.CL
AI总结 Polaris是基于检索反馈训练LLM生成表格描述的系统,通过BM25排序和DPO微调优化检索效果,性能优于AutoDDG,证明检索基准可用于训练LLM生成面向检索的元数据。
Comments 22 pages, 6 figures
为何摘要变得中立:人类反馈强化学习中情感漂移的策略归因
机构 * Instituto Politécnico Nacional (IPN)(墨西哥国立理工学院) ; Centro de Investigación en Computación (CIC)(计算机研究中心)
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract_cn);分类 cs.CL
AI总结 本文针对RLHF引发摘要情感漂移的问题,提出Policy Attribution框架溯源漂移来源,验证了跨语言漂移特性,并提出感知情感的正则化技术以降低漂移,且相关代码将公开。
CEDAR-GRPO:面向大语言模型通用溯因推理的过程感知强化学习
机构 * Sharif University of Technology(谢里夫理工大学) ; University of Tehran(德黑兰大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI
AI总结 本文提出过程感知强化学习框架CEDAR-GRPO,通过后训练提升LLM的通用溯因推理能力,在11个未见任务上实现显著性能提升,验证了其迁移有效性。
Comments Code and data are available at https://github.com/cedar-grpo/cedar-grpo
JustLLMGRPO:面向胸部X射线生成的放射学控制
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI
AI总结 JustLLMGRPO仅对LLM提示词策略应用GRPO,在冻结Sana生成器的前提下,提升了胸部X射线生成的质量,同时维持了提示词对齐度,实现了最优性能。
训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。
替代更新何时能改进决策?轨迹式迁移的局部理论
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.LG
AI总结 该研究提出轨迹式迁移的局部理论,探究替代更新改进决策的条件,推导相关梯度、校准等理论结果,通过网格世界和LLM后训练实验验证结论。
Comments 22 pages in total, including references and appendices; 3 composite figures (9 panels) and 4 tables. Code is available at https://github.com/Ethan-Shen-Individual-Lab/surrogate-to-decision-transfer
Agentic-DPO:从专家轨迹上的模仿到智能体策略优化
机构 * Johns Hopkins University(约翰·霍普金斯大学)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 研究针对大语言模型智能体基于专家轨迹训练只学动作序列、难应对错误的问题,提出Agentic-DPO方法,通过转化专家轨迹为状态条件偏好监督,结合策略保持增强,实现低成本智能体策略优化,实验验证其有效性。
超越有监督澄清:基于LLM的输入重写用于对话篇章解析
专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL
AI总结 研究在无监督条件下利用LLM零样本或基于解析器反馈重写输入以提升对话篇章解析性能,发现重写常引入回归,提出选择性干预问题并识别可重写性预测为关键缺失能力。
Comments Accepted to SIGDIAL 2026. 17 pages, 2 figures
事后合并是不够的:基于损失差距平衡的多轮模型合并
机构 * Soongsil University, Republic of Korea(韩国顺斯大学) ; Department of Electrical and Computer Engineering, Sungkyunkwan University, Republic of Korea(成均馆大学电子与计算机工程系)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出METIS方法,通过迭代多轮合并和任务损失差距加权,解决多任务模型合并中的信息擦除问题,显著提升最差任务性能。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)
全双工语音模型中的多面交互对齐
机构 * Kyutai ; Gradium
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL
AI总结 针对全双工对话模型交互性问题,提出基于强化学习的后训练对齐方法,从暂停处理、话轮转换、回馈和用户打断四个维度优化,并加入LLM奖励防止语义退化,在Moshi和PersonaPlex上取得一致改进。