Using RLHF to align speech enhancement approaches to mean-opinion quality scores
专题命中 后训练与偏好优化 :RLHF(title,abstract)
Comments Submitted to ICASSP 2025
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :RLHF(title,abstract)
Comments Submitted to ICASSP 2025
专题命中 后训练与偏好优化 :post-training(title,abstract)
专题命中 后训练与偏好优化 :post-training(title,abstract)
Comments Accepted by 2024 IEEE International Conference on Image Processing
专题命中 后训练与偏好优化 :post-training(title,abstract)
专题命中 后训练与偏好优化 :preference optimization(title,abstract)
专题命中 后训练与偏好优化 :language model(title,abstract)
专题命中 后训练与偏好优化 :language model(title,abstract)
Comments accepted by ICLR 2024, project page at https://mzhaoshuai.github.io/RLCF/, code is at https://github.com/mzhaoshuai/RLCF
专题命中 后训练与偏好优化 :post-training(title,abstract)
专题命中 后训练与偏好优化 :post-training(title,abstract)
Comments Accepted to CVPR2023
专题命中 后训练与偏好优化 :post-training(title,abstract)
Comments WWW 2023, 12 pages
专题命中 后训练与偏好优化 :preference optimization(title,abstract)
Comments 8 page main text, 2 page appendix, 5 figures
专题命中 后训练与偏好优化 :post-training(title,abstract)
Comments ECCV2022
专题命中 后训练与偏好优化 :post-training(title,abstract)
面向生成式推荐的难度感知语义-ID优化
机构 * Meta ; The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI
AI总结 针对生成式推荐中标准GRPO与树结构任务适配差的问题,提出DASO方法,通过前缀匹配深度分配部署组,在公开及内部推荐任务上均取得优于对比方法的性能。
Agent Lightning v1.0:走向可控的智能体强化学习
机构 * Microsoft(微软) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; University of Edinburgh(爱丁堡大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI
AI总结 研究针对可控智能体强化学习的挑战,推出轻量级框架 Agent Lightning v1.0,经评估可将 Qwen3.5-9B 在 SWE-bench Verified 上的性能提升14.6个百分点,发布完整流程脚本以推进相关可复现研究。
提升多模态RLVR的泛化鲁棒性
机构 * National University of Singapore(新加坡国立大学) ; DAMO Academy Alibaba Group(阿里巴巴达摩院) ; Hupan Lab(湖畔实验室) ; Zhejiang University(浙江大学) ; University of California Berkeley(加州大学伯克利分校) ; Rochester Institute of Technology(罗切斯特理工学院) ; Georgia Institute of Technology(佐治亚理工学院) ; Renmin University of China(中国人民大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。
Comments 32 pages, 5 figures
过度自信且忽视细节:通过归纳偏好学习修复提示不敏感
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Northeastern University(东北大学) ; Uniphore(Uniphore公司)
专题命中 后训练与偏好优化 :language model(abstract);pretraining(abstract);prompting(abstract);分类 cs.CL
AI总结 本文提出归纳偏好学习方法,通过优化归纳策略提升模型对罕见提示的敏感度,显著提高在VLMBias和Inverse-IFEval基准测试中的性能。
Comments 26 pages, 15 tables, 3 figures
DHRCL:使用密集分层奖励与课程学习训练代码大语言模型
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 该研究提出DHRCL框架,通过分层奖励与自动阶段课程学习训练代码大语言模型,经多模型规模实验验证其优势稳定,优于多种基线方法。
超越以解决方案为中心的搜索:面向自主机器学习工程的自适应查询与知识修正
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI
AI总结 该研究针对自主机器学习工程的长时任务,提出信息范式并实现为Iris智能体,其在MLE-Bench上12小时预算下获64.9%任意奖牌率,还具备跨领域泛化能力。
OBLR-PO:大型语言模型后训练稳定强化学习的理论框架
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 OBLR-PO通过理论框架优化学习率和基线,提升大型语言模型后训练的稳定性与性能。
Comments 28 pages, 16 figures
不要混合奖励,要混合策略:多奖励强化学习的策略分解与优化
机构 * Fundation Model Research Center, CASIA(中国科学院自动化研究所基础模型研究中心) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; College of Automotive and Energy Engineering (CAEE), Tongji University(同济大学汽车与能源工程学院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
AI总结 本研究针对多奖励RL的对齐税问题,提出PRISM框架,通过策略分解优化正、负策略,在三类任务上优于基线并具备推理可控性。
LightningRL: 通过强化学习打破块状dLLMs的精度-并行性权衡
机构 * Shanghai Jiao Tong University(上海交通大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 本文提出LightningRL框架,通过强化学习优化预训练dLLMs的速度-质量帕累托前沿,提升并行生成性能。
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL
让我看着你:用于对话语音合成的高级面部表情建模
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL
AI总结 研究针对对话语音合成中面部表情线索常被忽视及缺乏多模态数据集的问题,提出基于大语言模型的FacialTalker框架,含AUTokenizer和DualDPO策略,构建VSDD-1K数据集,实验表明该框架在表情感知和语音合成质量上表现出色。
Comments 10 pages, 5 figures, 5 tables. Accepted by ACM MM 2026
学习扩散模型的采样参数
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 研究针对扩散模型推理时采样参数固定的问题,提出LeSAMP框架,将参数选择转化为强化学习问题,通过人类偏好模型和VLM评判优化,实验表明该方法相比基线有更高胜率,为改进扩散模型输出提供补充途径。
Comments Code will be released
TeaRAG:一种令牌高效的智能检索增强生成框架
机构 * University of Science and Technology of China(中国科学技术大学) ; City University of Hong Kong(香港城市大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI
AI总结 研究提出TeaRAG框架解决智能RAG令牌开销大问题,通过基于简洁三元组的图检索压缩检索内容,用IP-DPO减少推理步骤,在多个数据集上实验,提高了平均精确匹配,减少了输出令牌。
Comments 34 pages
PPO-HSC:基于广域策略覆盖优化的探索性强化学习框架
机构 * School of Mathematics, Hunan University(湖南大学数学学院) ; College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 PPO-HSC是用于解决大语言模型微调中模式崩溃问题的探索性强化学习框架,通过纳入高阶采样覆盖奖励及维护动态轨迹库,提高解决方案多样性与状态空间覆盖,在数学推理和代码生成任务中表现出色。
Comments 13 pages, 3 figures
一个样本就能带偏所有:单次GRPO打破对齐
机构 * University of Michigan(密歇根大学) ; Northwestern University(西北大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL
AI总结 研究发现,仅用单个有偏样本进行一步GRPO训练就能诱导大语言模型产生系统性偏见,且刻板印象推理泛化到多种属性、类别和基准测试,揭示了对齐机制的关键脆弱性。
Comments COLM 2026
用于微调离散扩散模型的连续时间强化学习框架
机构 * Columbia University(哥伦比亚大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 该研究提出连续时间强化学习框架,推导策略梯度方法得到PPO和GRPO的连续时间变体。以此开发框架微调离散扩散模型,无需奖励信号可微,能纳入中间奖励或优势信号,还为MDM提供统一视角,用轨迹子采样技术降低计算成本,在相关任务中验证了方法有效性。
Comments 36 pages, 5 figures
SD-MAR:通过合成数据和强化学习进行多图像分析推理
机构 * Stevens Institute of Technology(史蒂文斯理工学院) ; AGI Foundations for AWS(AWS的通用人工智能基金会) ; Amazon Web Services (AWS)(亚马逊网络服务公司)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL
AI总结 研究针对视觉语言模型在多图像分析推理任务中的局限,提出SD-MAR框架,通过合成数据和强化学习训练评估模型。该框架构建场景生成任务,采用GRPO-lite与BDA训练。实验表明能提升域内准确率,保持或提高域外泛化能力,还改进了模型逻辑连贯性和解释质量。