Multimodal Query Suggestion with Multi-Agent Reinforcement Learning from Human Feedback
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)
Comments This paper has been accepted by WWW 2024
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)
Comments This paper has been accepted by WWW 2024
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)
Journal ref RO-MAN 2023 Conference
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 8 pages main paper, 17 pages total
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2020
专题命中 后训练与偏好优化 :post-training(abstract,comments);分类 cs.AI、cs.LG
Comments Different from the prior work "Latent Diffusion Model for DNA Sequence Generation" (arXiv:2310.06150), we updated the evaluation framework and compared the DiscDiff with other methods comprehensively. In addition, a post-training framework is proposed to increase the quality of generated sequences
野外测试时缩放:为何利用而非探索是瓶颈
机构 * Thomson Reuters(汤姆森路透)
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究通过首个计算归一化对比发现,测试时缩放(TTS)中从候选池选择的利用环节是瓶颈,跨候选合成(Fusion)仅恢复约40%可用质量,探索缩放有效但利用失效。
面向可执行终端与MCP智能体的任务条件最小权限学习
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出任务条件最小权限学习框架,通过后训练优化4B参数模型的权限选择,使智能体超额权限错误率大幅降低,安全成功率显著提升,可作为工具使用智能体的额外控制层。
Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
超越英语的GRPO:非英语与多语言场景下GRPO的大规模研究
机构 * Apple(苹果公司) ; Hasso Plattner Institute(哈索·普拉特纳研究所) ; ELLIS Unit Potsdam(波茨坦ELLIS单元)
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对非英语及多语言场景开展GRPO大规模实证,发现母语训练推理与英语训练差距小、存在跨语言迁移但趋势依赖模型语言,指出非英语RLVR有跨语言增益但需全面评估退化问题。
如何使用你的专家预算:蛋白质结构预测模型的实用指南
机构 * InstaDeep Ltd(InstaDeep公司) ; University of Oxford(牛津大学) ; Lancaster University(兰卡斯特大学)
专题命中 后训练与偏好优化 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本研究针对蛋白质结构预测模型的专家预算约束,通过基准测试FK-steering、DPO、Best K-of-N采样及O3方法,明确不同预算下的最优方法并给出实用选择建议。
Comments Proceedings of the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM)
μ子何时有助于智能体强化学习?
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 研究μ子在稀疏奖励智能体强化学习中的作用,通过与AdamW对比,发现在组内组策略优化下,μ子应用于隐藏权重矩阵能提升成功率,效果与优势估计器、学习率有关,表明其可使智能体RL受益,还需多种子和跨任务验证。
小型模型是GRPO中策略级多样性的自然探索者
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 后训练与偏好优化 :LLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 提出S2L-PO框架,利用小型模型作为自然探索者生成策略级多样性的rollout,通过渐进退火策略过渡到大型模型自身采样,提升数学推理性能并减少计算开销。
TOPReward: 令牌概率作为机器人学中的隐式零样本奖励
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究所) ; Amazon(亚马逊) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG
AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。
循环循环者!
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI
AI总结 研究提出最强大的循环Transformer——Loopie,由两个专家混合模型组成。它应对了循环Transformer面临的挑战,经消融研究表明在相同计算预算下优于普通基线,其训练后管道赋予强大推理能力,在竞赛中无需工具获金牌。
强化多模态掩码扩散模型的生成顺序
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; AGI Foundations for AWS(AWS强化人工智能基础)
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG
AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。
D2PO:通过动态偏好优化扩散采样器
机构 * Seoul National University(首尔国立大学) ; Ulsan National Institute of Science and Technology(蔚山国立科学技术院)
专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG
AI总结 研究针对现有框架局限,提出D2PO框架优化扩散采样策略。核心方法是将其转化为基于偏好的对齐问题,利用DPO框架并建模为能量模型,引入新能量公式和动态偏好。主要贡献是使采样器与感知质量更忠实对齐,性能优于传统调度器。
Comments Accepted to ECCV 2026
最佳中的更优N:通过上下文学习生成预对齐响应
机构 * JPMorganChase Global Technology Applied Research(摩根大通全球技术应用研究)
专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 提出Best-of-Better-$N$框架应对响应质量限制问题,利用检索高奖励示例及重写步骤,通过上下文学习使预训练模型输出分布向高奖励区域转移,在安全对齐和数学推理基准测试中有更好表现。
定点运算下硬件安全神经网络的李雅普诺夫引导训练
机构 * The School of Engineering & Physical Sciences(工程与物理科学学院) ; SDAIA-KFUPM Joint Research Centre for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心) ; Heriot-Watt University(赫瑞-沃森大学) ; King Fahd University of Petroleum and Minerals(国王法赫德石油大学)
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 针对定点运算中低精度神经网络的问题,提出李雅普诺夫稳定量化框架,通过层状李雅普诺夫函数监测隐藏状态能量,应用单调投影确保状态稳定,实验表明该方法可抑制激活溢出并恢复稳定学习。
基于噪声声明验证的覆盖控制偏好挖掘用于基于证据的生成
机构 * Vanderbilt University(范德比大学) ; Vanderbilt University Medical Center(范德比大学医学中心) ; Lirio ; Virginia Tech(弗吉尼亚理工大学)
专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.LG
AI总结 研究临床简要医院病程总结中基于证据生成的问题,引入VERI-DPO框架,将噪声声明验证转化为覆盖控制的摘要级偏好,经实验验证该框架能降低不支持率,提升模型表现。
Comments 15 pages, 1 figure, 8 tables. Major revision with locked MIMIC-IV transfer evaluation, blinded pairwise human assessment, matched multi-seed ablations, revised title, and revised author list
GIPO:高斯重要性采样策略优化
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出了一种基于截断重要性采样的策略优化目标GIPO,通过使用基于对数比率的高斯信任权重替代硬裁剪,以软化极端重要性比率同时保持非零梯度,从而提高数据效率,实验表明GIPO在多种回放缓冲区大小下均取得最佳性能,表现出优越的偏差-方差权衡、高训练稳定性及改进的样本效率。
ICR-RL:通过上下文回归实现深度强化学习
机构 * Bar-Ilan University(巴伊兰大学) ; Tel Aviv University(特拉维夫大学)
专题命中 后训练与偏好优化 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 研究探索基于从强化学习到回归的经典简化的新方法,用预训练的回归基础模型作为上下文回归模型直接用于强化学习问题,引入无梯度方法ICR-RL,实验表明其能与常用方法竞争。
Comments Accepted to ICML 2026 Main Track
先排序后行动:基于帧序进展的无奖励控制
机构 * T-Tech
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出Rank-Then-Act框架,利用视觉语言模型从专家视频中学习进度排序器,通过斯皮尔曼等级相关奖励函数实现无环境奖励的策略学习,在离散和连续控制任务中达到或超越现有方法。
Comments 20 pages, 15 figures
Flow-Map GRPO:基于锚定随机组合的少步流映射生成器的强化学习
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 提出Flow-Map GRPO框架,通过锚定随机流映射组合(ASFMC)对确定性少步流映射生成器进行随机化,使其适用于强化学习后训练,并在FLUX文本到图像生成器上提升奖励和感知指标。
Comments 31 pages, 29 figures
QuasiMoTTo: 准蒙特卡洛测试时扩展
机构 * Stanford University(斯坦福大学)
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.LG
AI总结 提出QuasiMoTTo方法,利用准蒙特卡洛相关采样替代独立同分布采样,在推理和强化学习中减少冗余,以更少样本达到相同性能。
并非所有时间和频率都需要在扩散遗忘中被遗忘
机构 * Korea Institute for Advanced Study(韩国高等研究院) ; University of British Columbia(不列颠哥伦比亚大学)
专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG
AI总结 提出选择性遗忘扩散模型中的时间和频率,通过理论分析分布失真与遗忘-效用权衡,在多种设置下实现更高遗忘成功率和生成质量。
Comments ICML 2026 Workshop FoGen
智能体安全是认知属性,而非行为属性
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 本文提出AI安全应视为认知属性,强调系统需保持可教性(teachability),即在学习、适应和自修改过程中仍能被纠正。
Comments To appear in proceedings of ICML 2026
考虑不确定性的奖励折扣以缓解奖励黑客
专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种双源不确定性-aware奖励框架,通过建模价值估计和人类偏好中的不确定性,减少奖励黑客行为,在多个离散和连续控制环境中验证了其有效性。
Comments 46 pages, 16 figures, 6 tables
重建对齐改进统一多模态模型
机构 * UC Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; Duke University(杜克大学)
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 提出重建对齐(RECA),一种资源高效的后训练方法,利用视觉理解编码器嵌入作为密集文本提示,通过自监督重建损失对齐理解与生成,显著提升多种统一多模态模型的生成和编辑性能。
Comments 43 pages, 36 figures and 14 tables; accepted by ICLR 2026
通过蒙特卡洛 Pass@k 评判器进行单次 rollout 学习
机构 * University of Alberta(阿尔伯塔大学) ; BIGAI(北京通用人工智能研究院) ; University of Toronto(多伦多大学) ; McGill University, Mila(麦吉尔大学,米拉) ; Nvidia Research(英伟达研究院) ; Amii(阿尔伯塔机器智能研究所) ; CIFAR AI Chair(CIFAR人工智能教席)
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出单次 rollout 近端策略优化(SR-PPO),利用每个提示的一次 rollout 训练 token 级信用评判器,通过 Pass@k 成功概率提供更选择性学习信号,避免重复采样并改善信用分配。
DRA-GRPO:你的GRPO需要了解多样化的推理路径以进行数学推理
机构 * Morgan Stanley(摩根士丹利) ; Clemson University(克莱姆森大学) ; Arizona State University(亚利桑那州立大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; University of Notre Dame(圣母大学) ; University of Arizona(亚利桑那大学)
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.LG
AI总结 针对GRPO在数学推理中因奖励信号非单射导致策略坍塌的问题,提出基于子模互信息的多样性感知奖励调整框架DRA,通过逆倾向评分去偏梯度估计,在五个数学基准上以少量数据和成本取得平均58.2%的准确率。
Comments ACL2026