Exploration-Driven Policy Optimization in RLHF: Theoretical Insights on Efficient Data Utilization
专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 14 pages, 7 figures
先爱后知:基于人设的浪漫兼容性通过LLM文本世界引擎
机构 * BreathingCORE
专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出一种基于LLM文本世界引擎的浪漫兼容性匹配方法,通过模拟互动预测人类偏好,实现个性化匹配系统。
Comments NeurIPS 2025 Workshop: First Workshop on LLM Persona Modeling (Oral)
专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG
Comments Published as a conference paper at ICLR 2024. The website is available at https://uni-rlhf.github.io/
门控解耦组合多臂老虎机:带监督校准动作缩放与预执行门控的上下文多臂老虎机统一理论
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);分类 cs.LG
AI总结 该研究提出门控解耦组合多臂老虎机(GDCB),证明其可统一多个工业系统,核心定理可将非平稳问题转化为近似平稳问题,还推广了相关结果,配套论文已验证短期租赁动态定价实例。
Comments 30 pages, 4 figures
SAPO:用于智能体强化学习的单回滚自回归策略优化
机构 * Xiamen University(厦门大学) ; Nanyang Technological University(南洋理工大学)
专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本研究针对智能体强化学习现有方法的三大局限,提出SAPO框架,其共享策略与价值函数的自回归主干,结合广义优势估计器,在ALFWorld、WebShop任务上性能优于PPO和GRPO,内存与计算效率更高。
弥合网络碎片化:一种语义增强的深度强化学习框架用于无人机辅助的VANETs
机构 * Department of Automation, University of Science & Technology of China(中国科学技术大学自动化系)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出语义增强深度强化学习框架,通过语义推理优化无人机在VANETs中的部署,提升网络连通性与效率。
Comments Revised version. This update includes substantial improvements to the methodology, ablation studies, temporal robustness analysis, and cross-city generalization experiments. Submitted to IEEE Transactions on Cognitive Communications and Networking. 15 pages, 14 figures
智能体安全应成为运行时契约
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);分类 cs.AI
AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。
注意间隙:在偏好学习中的结构感知一致性
机构 * Google Research(谷歌研究) ; Courant Institute of Mathematical Sciences(数学科学学院)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出结构感知H一致性框架,通过引入SA-DPO目标函数,改进偏好学习中的一致性问题,证明重尾 surrogate 在容量受限模型中具有更好的一致性保证。
Comments ICML 2026
无任何监督的在线策略自蒸馏
机构 * UC San Diego(加州大学圣迭戈分校) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Maryland, College Park(马里兰大学帕克分校) ; ByteDance(字节跳动)
专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本研究提出无监督在线策略自蒸馏(U-OPSD),仅用模型自身生成结果实现在线策略自蒸馏,在多数学基准上优于基础模型,部分场景超越OPSD、GRPO等监督方法。
Comments Project page at https://williamium3000.github.io/u-opsd/ and code at https://github.com/williamium3000/u-opsd
SearchMaster:面向搜索智能体的基于接地与调控的自博弈框架
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 本文提出SearchMaster自博弈框架,通过ECG、SDR、OOP三项调控措施优化LLM搜索智能体训练,在六个深度搜索基准上显著提升Qwen3.5-9B模型的平均准确率,无需人工标注数据。
解构离策略比率:用于异步强化学习的熵缩放信任区域
机构 * Baidu(百度)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 研究异步强化学习中离策略数据问题,提出熵缩放信任区域(ESTR)方法,通过令牌局部熵缩放离策略偏差,无需辅助前向传递等,在多任务和基准测试中优于现有异步方法,提升训练-推理一致性与速度。
学习标量奖励模型的端到端潜在推理轨迹
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。
SciForma:科学图表的结构忠实生成
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) ; State Key Lab of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract);preference optimization(abstract);分类 cs.LG
AI总结 研究针对科学图表结构保真度问题,提出SciForma框架,分解图表质量为三个结构轴,用M-DPO优化,策划训练和评估数据,实现迭代编辑,使SciForma-9B超越开源基线和GPT-Image-1.5,提升科学图表生成的结构保真度。
Comments 30 pages, 21 figures
派利淘-多模态搜索:构建原生电子商务多模态搜索基础
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝及天猫集团)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);foundation model(abstract);post-training(abstract)
AI总结 针对电子商务多模态搜索问题,提出派利淘-多模态搜索基础模型,通过混合语义ID、两阶段持续预训练策略和混合推理后训练管道,在淘宝派利淘平台实现显著改进,提升了商品交易总额和交易量。
Comments Technical Report: Pailitao-MMSearch
社会模拟中生成式智能体的步骤级偏好学习
机构 * Shanghai Qi Zhi Institute(上海期智研究院) ; Xiongan AI Institute(雄安人工智能研究院) ; Tsinghua University(清华大学) ; CUHK-Shenzhen(香港中文大学(深圳)) ; USTC(中国科学技术大学) ; Sun Yat-sen University(中山大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 研究基于大语言模型的生成式智能体模拟人类行为时中间步骤注释稀缺问题,引入交互式模拟界面收集步骤级人类偏好监督,经监督微调算法和直接偏好优化方法进行步骤级偏好学习,提升模拟效果,证明步骤级人类监督是有效训练信号。
Comments WAICA2026
竞争然后合作:前沿人工智能教师构建可验证课程以提升编码学生超越模仿
机构 * Genesis Cortex AI Inc.(创世纪皮层人工智能公司)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)
AI总结 研究探讨大型语言模型作教师时的教学问题,提出竞争然后合作框架,让四个前沿人工智能教师先对决排名,再合作构建课程提升学生。发现执行验证下教师解决标准问题情况,模仿不一定提升学生,合作课程能提升学生,强调合作构建可验证环境的价值。
Comments 8 pages, 1 figure
迭代视觉思维:通过视觉反馈教会视觉语言模型空间自我修正
机构 * QpiAI India Pvt. Ltd(QpiAI印度私人有限公司)
专题命中 后训练与偏好优化 :SFT(summary_cn,abstract_cn);language model(abstract);分类 cs.AI
AI总结 提出迭代视觉思维(IVT)框架,通过视觉反馈闭环和两阶段训练(SFT+GRPO),使视觉语言模型具备空间自我修正能力,在三个基准上提升指标2.4-3.2个百分点。
OpenSIR: 开放式自我改进推理器
机构 * University of Edinburgh(爱丁堡大学) ; Imperial College London(伦敦帝国理工学院)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出OpenSIR框架,通过多样性奖励和难度校准实现开放式自我对弈,无需外部验证器或标注数据,在七个数学基准上平均提升指令模型3.6分、推理模型3.1分,且唯一能泛化到通用推理。
OpenReward: 通过强化学习学习奖励长形式智能体任务
机构 * Leiden University(莱顿大学) ; Shandong University(山东大学) ; Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出OpenRM,一种工具增强的长形式奖励模型,通过GRPO训练联合监督工具使用和结果准确性,在长形式任务中显著优于现有方法。
哪些Token重要?基于相对惊讶指数的自适应Token选择用于RLVR
机构 * ModelScope Team(ModelScope团队) ; Alibaba Group(阿里巴巴集团) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出相对惊讶指数(RSI)度量,通过自适应Token过滤方法RSI-S解决RLVR中高熵与低概率Token的矛盾,在AIME和AMC基准上提升avg@32准确率2-3个百分点。
Comments 13 pages, 4 figures
双向过程奖励模型
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Biomedical Basic Research Center of Jiangsu, Soochow University(苏州大学江苏省生物医学基础研究中心) ; School of Software Technology, Zhejiang University(浙江大学软件学院) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出双向过程奖励模型(BiPRM),通过并行左右评估流和门控机制融合分数,仅增加0.3%参数和5%延迟,在推理质量上平均提升10.6%。
Comments ACL 2026
走向对齐动力学的物理直觉:以随机性结晶为例的案例研究
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL
AI总结 通过类比热力学相变中的结晶过程,将语言模型对齐分解为三个相,并提出直观度量验证相变,为对齐动力学提供物理直觉。
PASTA: 一种用于大语言模型知识更新的释义与自训练方法
机构 * Waseda University(早稻田大学)
专题命中 后训练与偏好优化 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出PASTA框架,通过数据增强、问答生成和自学习DPO过程,将新闻事实知识集成到LLM中,实现知识覆盖与幻觉抑制,准确率从0.02提升至0.82。
Comments 9 pages, 3 figures
双精灵博弈:审计基础AI治理中的采纳与福利
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.AI
AI总结 利用进化博弈论研究在竞争市场中,最小化危害的AI代理如何取代RLHF代理,并分析其采纳条件及对社区福利的影响。
Comments 36 pages, 3 figures. Lean 4 formalization and figure scripts: https://github.com/dlewissandy/two-genie-scripts
Qwen-Image-2.0-RL 技术报告
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 提出基于强化学习与在线蒸馏的后训练流程,通过复合奖励模型和GRPO框架提升扩散模型的视觉质量与指令遵循能力,在多个基准上取得显著提升。
Comments 16 pages, 6 figures, 1 table
最大化人类反馈在AI对齐中的效率:比较分析
机构 * University College Dublin, Ireland(都柏林大学学院)
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.AI
AI总结 本文探讨了RLHF中偏好推断的替代采样与评估策略,提出Swiss InfoGain方法在受限标注预算下表现更优,且更节省样本,提升了偏好学习的效率与鲁棒性。
Comments 17 pages, 6 figures, 6 algorithms. AICS2025
Journal ref 33rd International Conference on Artificial Intelligence and Cognitive Science (AICS 2025)
一种偏好对齐的马尔可夫链方法
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.LG
AI总结 提出MCHF方法,通过直接利用成对偏好定义马尔可夫核实现生成模型对齐,理论证明其几何收敛速度由非传递结构量决定,并与NLHF和RLHF方法建立统一视角。
Comments 48 pages, 7 figures
对齐否决:安全训练如何压制LLM中的文化知识
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Qatar Computing Research Institute(卡塔尔计算研究所) ; Hamad Bin Khalifa University(哈马德·本·卡伊夫大学)
专题命中 后训练与偏好优化 :LLM(title_cn);language model(abstract);prompting(abstract);分类 cs.CL
AI总结 研究对齐训练与语言模型编码的文化价值观冲突时的内部机制,发现模型内部logit分布仍反映人类调查数据,但输出被压制,称为“对齐否决”,并区分了压制失败与表征偏差失败,揭示了安全税在国家间的不平等。