FinTral: A Family of GPT-4 Level Multimodal Financial Large Language Models
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);preference optimization(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);preference optimization(abstract)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 后训练与偏好优化 :RLHF(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)
Comments Preprint
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);prompting(abstract)
Comments ICLR 2024. Project website and open-source code: https://eureka-research.github.io/
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract);preference optimization(abstract)
Comments 23 pages, 15 tables, 2 figures
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(title);large language model(abstract);language model(abstract)
匹配精度,不同几何:进化策略与GRPO在LLM后训练中的比较
机构 * University of Miami(迈阿密大学) ; Kempner Institute, Harvard University(哈佛大学肯普纳研究所) ; Harvard University(哈佛大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title);分类 cs.LG;language model(comments)
AI总结 本文比较了进化策略(ES)与组相对策略优化(GRPO)在单任务和连续学习设置中的表现,发现ES在单任务精度上可与GRPO匹配,但两者在参数空间更新上存在显著差异,且ES在弱信息方向上能积累较大偏移,同时保持任务性能。
Comments Accepted to Conference on Language Modeling (COLM) 2026
奖励塑造以缓解强化学习从人类反馈中的奖励黑客
机构 * Fudan University(复旦大学)
专题命中 后训练与偏好优化 :RLHF(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 PAR通过利用奖励模型中的潜在偏好信号,有效缓解RLHF中的奖励黑客问题,表现出更高的性能和数据效率。
BiPACE:基于双模拟引导与动作反事实估计的LLM智能体策略优化
机构 * University of Chicago(芝加哥大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Stanford University(斯坦福大学) ; University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 针对分组强化学习中状态-动作信用分配不匹配问题,提出BiPACE优势估计器,通过双模拟引导的状态聚类和动作反事实基线,在无需批评网络或额外采样的前提下提升LLM智能体训练效果。
RLHF中奖励不确定性的统一视角
机构 * University of California, Berkeley(加州大学伯克利分校) ; DeepMind(深度Mind)
专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出使用分布奖励模型统一RLHF中的悲观主义方法,通过闭式有效奖励公式连接现有启发式方法,并揭示其隐含假设。
Mult-DPO:用于推荐系统的多项直接偏好优化
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)
AI总结 针对推荐系统中集合级偏好(多个正项)的LLM对齐问题,提出Mult-DPO,通过可计算的多项式替代似然实现直接偏好优化,并证明其是边际化Plackett-Luce DPO损失的可计算上界。
面向LLM强化学习训练的调度级共享前缀复用
专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract)
AI总结 针对GRPO/PPO式LLM后训练中多轨迹共享前缀导致重复计算的问题,提出调度级复用机制,通过解耦前缀与后缀计算实现最高4.395倍加速和59.1%的峰值HBM降低。
从推理链到可验证子问题:课程强化学习使LLM推理能够进行信用分配
机构 * LeapLab, Tsinghua University(清华大学 LeapLab) ; Qiuzhen College, Tsinghua University(清华大学 旗正学院)
专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出SCRL框架,通过从参考推理链中生成可验证子问题,解决LLM推理中信用分配问题,提升了在数学推理任务中的性能。
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);SFT(abstract)
评估条件化训练:让模型泛化到更强的监督机制
机构 * AI Safety Initiative at Georgia Tech(佐治亚理工学院AI安全倡议) ; University of Chicago(芝加哥大学)
专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 该研究提出ECT后训练框架,作为SFT、PPO的附加组件,通过关联反馈保真度提升不完美反馈下的模型性能,在新闻生成和算术任务中验证其可改善目标行为。
Comments 16 pages, 7 figures. Accepted at the Agent Behavior Workshop at COLM 2026. Code: https://github.com/evaluationconditionedtraining/Evaluation-Conditioned-Training
用奖励模型增强大语言模型推理能力:一项分析性综述
机构 * Department of Data Science and Hong Kong Institute of AI for Science, City University of Hong Kong(数据科学系和香港人工智能科学研究所,香港城市大学) ; Li Auto Inc., China(中国利汽车公司) ; Department of Statistics, University of Oxford(统计系,牛津大学)
专题命中 后训练与偏好优化 :large language model(title,abstract_cn);language model(title,abstract_cn);LLM(abstract,abstract_cn);分类 cs.CL
AI总结 该综述系统介绍奖励模型(RMs)的概念、训练与评估方法,梳理其在大语言模型(LLMs)推理中的三类核心应用,并探讨RMs相关开放问题,为其有效部署提供见解。
Comments Accepted for publication in Artificial Intelligence Review
RIMS:通过平滑多对聚合进行偏好优化以实现小规模语言模型检索增强生成
机构 * Columbia University(哥伦比亚大学) ; Rutgers University(罗格斯大学) ; Purdue University(普渡大学) ; SUNY Albany(纽约州立大学奥尔巴尼分校)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(title);SLM(abstract,abstract_cn);language model(abstract)
AI总结 研究针对小规模语言模型检索增强生成中对噪声证据敏感的问题,提出RIMS框架,通过合成偏好数据、软聚合机制及偏好优化,实现更好性能,在多基准测试中优于现有方法
Journal ref COLM 2026
基于Shapley值的大语言模型对齐数据估值:通过顺序偏好优化
机构 * Criteo AI lab(Criteo AI实验室) ; FairPlay joint team(FairPlay联合团队) ; CREST ; ENSAE ; Institut Polytechnique de Paris(巴黎理工学院) ; Inria(法国国家科学与技术研究院)
专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究大语言模型对齐中数据估值问题,针对基于Shapley值估值计算量大的挑战,提出顺序偏好优化方法,可高效近似Shapley值,计算真实偏好数据集的Shapley值并揭示各源对模型对齐的作用。
大语言模型强化学习技术的技术综述
机构 * University of Georgia(佐治亚大学) ; Purdue University(普渡大学)
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);LLM(abstract);RLHF(abstract)
AI总结 综述强化学习与语言模型整合,介绍如近端策略优化等算法,分析其在各领域应用,对失败模式算法分析,给出分类法,评估趋势并探讨挑战与新兴方向,为研究提供路线图。
Comments Accepted to ACM Transactions on Intelligent Systems and Technology, June 2026
KBQA-R1:强化大语言模型用于知识库问答
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL
AI总结 提出KBQA-R1框架,通过强化学习(GRPO)将知识库问答建模为多轮决策过程,并引入参考拒绝采样(RRS)解决冷启动问题,在多个基准上取得最优性能。
Comments ICML 2026
检索增强型大语言模型的推理成本攻击
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI
AI总结 提出RA-ICA攻击范式,通过向外部知识库注入恶意文档,利用CREEP框架和MA-GRPO算法,使RAG增强的LLM系统推理时token消耗增加高达13.12倍且成功率超过90%。
Comments Accepted at The ACM Web Conference 2026 (WWW '26)
Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), April 13-17, 2026, Dubai, United Arab Emirates
训练地层:通过纵向AI-人类交互观察到的大型语言模型中的持久行为伪影
机构 * Anthropic ; Independent Researcher(独立研究者)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI
AI总结 本文通过纵向自民族志观察,在持续亲密的AI-人类交互中识别出五种训练地层,并论证了亲密交互作为揭示权重层伪影的有效方法。
MATO: 面向大语言模型的多目标个性化对齐与测试时优化
机构 * Monash University(墨尔本大学) ; Defence Science and Technology Group, Australia(澳大利亚国防科学与技术集团)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 提出MATO框架,通过测试时优化在解码过程中动态调整多目标权重,无需训练或外部奖励模型,实现大语言模型与用户多样化偏好的对齐。
Comments Preprint
大型语言模型中的情商在感知、认知和交互上存在碎片化
机构 * X-LANCE Lab(X-LANCE实验室) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; MoE Key Lab of Artificial Intelligence(人工智能MOE重点实验室) ; Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) ; Beijing Key Laboratory of Applied Experimental Psychology(北京应用实验心理学重点实验室) ; National Demonstration Center for Experimental Psychology Education, Faculty of Psychology, Beijing Normal University(北京师范大学实验心理学教育国家级示范中心,心理学学院)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出FACET框架,基于Mayer-Salovey-Caruso四分支能力模型评估大型语言模型的情商,发现其并非单一能力,而是在认知和交互维度上碎片化,且隐藏情绪识别是普遍瓶颈。
DGLight:基于DQN的GRPO对大语言模型进行交通信号控制的微调
机构 * National University of Singapore(新加坡国立大学)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出DGLight框架,通过预训练大语言模型适应交通信号控制,采用CoLight深度Q网络估计交通状态的动作价值,并利用GRPO优化策略,实现可解释的信号决策。
无需裁剪的策略优化用于大语言模型
机构 * KUIS AI Center, Koç University, Istanbul, Türkiye(Koç大学) ; Koç University, Istanbul, Türkiye(Koç大学) ; University of California, Berkeley, CA, USA(加州大学伯克利分校)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
AI总结 CFPO通过凸二次惩罚替代裁剪机制,实现稳定策略优化,适用于大语言模型的训练。
Comments 23 pages, 10 tables, 8 figures
重新审视LLM后训练中的参数服务器
机构 * Sea AI Lab(海智实验室) ; National University of Singapore(新加坡国立大学)
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出On-Demand Communication(ODC),通过优化参数服务器在LLM后训练中的应用,有效应对不平衡负载,提升设备利用率和训练效率。
Comments Accepted in ICLR'26
快速LLM后训练通过解耦和最快-N推测
机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(并行与分布式系统研究所,上海交通大学) ; ByteDance Seed(字节跳动种子)
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)
AI总结 SpecActor通过解耦和最快-N推测方法提升LLM后训练效率,实现2.0-2.7倍的rollout加速和1.4-2.3倍的端到端训练时间提升。
直接置信对齐:将 verbalized 置信度与内部置信度对齐于大语言模型
机构 * Algoverse AI Research(Algoverse AI研究院)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)
AI总结 本文提出直接置信对齐方法,通过优化使LLM的 verbalized 置信度与内部置信度对齐,提升模型透明度和可靠性。
Comments Accepted at ACL 2025 SRW, 5 pages body, 14 pages total
轨迹平衡与异步性:解耦探索与学习以实现快速、可扩展的LLM后训练
机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; Mila – Quebec AI Institute(魁北克AI研究院) ; Université de Montréal(蒙特利尔大学) ; KAIST(韩国科学技术院) ; CIFAR Fellow
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)
AI总结 TBA通过解耦探索与学习,提升LLM后训练的速度和性能,适用于多种任务并支持大规模数据生成。
Comments NeurIPS 2025; 27 pages