arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 510 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 510 篇

2608.16068 2026-08-18 cs.CL cs.AI 新提交 89%

CAPO: Constraint-Aware Prompt Optimization for LLM Agents

CAPO:面向大语言模型智能体的感知约束提示优化

Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao

机构 * Microsoft(微软)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出CAPO与DCAPO两种方法,通过原始对偶框架优化LLM智能体的系统提示,在智能体及助手式任务中均提升了可行性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20448 2026-07-24 cs.CL cs.LG 新提交 89%

Domyn-Small: A European 10B Reasoning Language Model

Domyn-Small:一个欧洲的100亿参数推理语言模型

Simone Angarano, Francesco Bertolotti, Federico D'Ambrosio, Michele Resta, Alessandro Rognoni, Nicolò Ruggeri, Dario Salvati, Andrea Valenti, Alberto Veneri, Martin Cimmino

机构 * CINECA(意大利国家计算应用研究所)

专题命中 后训练与偏好优化 :language model(title,abstract);SFT(abstract,abstract_cn);LLM(abstract);post-training(abstract)

AI总结 介绍了基于9万亿令牌多语言数据预训练的100亿参数推理语言模型Domyn-Small,经持续预训练、监督微调、强化学习等训练后管道,实现双模式推理,在与对等模型对比中平衡了准确性与效率,还发布了相关权重及开源框架。

Comments 27 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21090 2026-06-23 cs.AI cs.LG 新提交 89%

Self-Improvement Can Self-Regress: The Rise-and-Collapse Failure Mode of LLM Self-Training

自我改进可能导致自我退化:LLM自我训练的兴起与崩溃失败模式

Jianzhe Lin

机构 * MetaAI

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM自我训练中pass@1先升后降的崩溃模式,发现非跨任务遗忘而是策略过度优化,提出CARE、ES和GRPO三种控制方法,在Qwen-2.5模型上验证效果。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09961 2026-06-10 cs.LG cs.AI 新提交 89%

3SPO: State-Score-Supervised Policy Optimization for LLM Agents

3SPO: 面向LLM智能体的状态分数监督策略优化

Yu Han, Kailing Li, Yang Jiao, Yulin Dai, Yuqian Fu, Linhai Zhuo, Tianwen Qian

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Fudan University(复旦大学) KAUST(卡塔尔人工智能研究学院) Fuzhou University(福州大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出3SPO算法,通过动态状态分数监督实现逐步骤策略优化,解决多轮智能体任务中奖励稀疏和信用分配问题,在ALFWorld和WebShop上分别比GRPO提升22.6%和15.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16739 2026-08-18 cs.LG 新提交 89%

Le Critique: Privileged Value Functions for LLM Reinforcement Learning

Le Critique:用于大语言模型强化学习的特权值函数

Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison

机构 * Mistral AI(米斯特拉尔人工智能公司) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对 LLM 强化学习的值函数应用难题,提出特权值函数(PVF)与自适应插值基线 TETHER,在多推理任务中提升了值函数基线性能,表现优于或媲美 GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15041 2026-08-18 cs.AI 新提交 89%

LLM-Based Hierarchical Coordinated Control with Continuation-Aware Policy Learning

基于大语言模型的分层协调控制与感知延续性的策略学习

Changhong He, Jinda Gao, Xinkuan Liu, Le Zhang, Xizi Luo, Yu Mei

专题命中 后训练与偏好优化 :LLM(title,summary_cn);prompting(abstract);分类 cs.AI

AI总结 针对复杂工程系统多单元协调难题,提出基于LLM的分层框架,结合感知延续性的GRPO,在多匝道交通控制和VPP能源管理中,性能优于多种对比方法。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06526 2026-08-10 cs.CL 新提交 89%

GRASP: Reinforcing Language Model Anonymizers with Group Relative Policy Optimization

GRASP:用组相对策略优化增强语言模型匿名化器

Sajjad Ghiasvand, Nader Sehatbakhsh

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) UC Los Angeles(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);preference optimization(abstract)

AI总结 该研究提出GRASP方法,用组相对策略优化增强设备端小型语言模型匿名化器,在隐私-效用权衡、对抗匿名化防御及运行成本上均优于DPO蒸馏基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03952 2026-08-05 cs.AI 新提交 89%

TACT: Taxonomy-Aligned Post-Training for Pedagogically Adaptive English Tutoring

TACT:面向教学自适应英语辅导的分类对齐后训练

Dongjie Yang, Siyan Lin, Leixian Shen, Rui Sheng, Huamin Qu, Zixin Chen

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出基于人类研究的TACT框架,构建含双分类体系的数据集后,通过特定训练得到TACTutor,在自研基准及盲法研究中表现优于基线,为自适应ESL辅导器开发提供开放基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08010 2026-08-11 cs.LG cs.AI 新提交 88%

Ground-Truth Neighborhood Regularization for Reinforcement Learning Post-Training of Time Series Foundation Models

面向时间序列基础模型强化学习后训练的真实值邻域正则化方法

Jianqi Zhang, Xingyu Zhang, Zeen Song, Changwen Zheng, Fanjiang Xu, Wenwen Qiang

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 针对时间序列基础模型强化学习后训练的次优崩溃问题,提出真实值邻域正则化方法,可缓解该问题并提升模型性能,且能灵活集成到各类强化学习方法中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16242 2026-07-21 cs.LG cs.AI cs.CR 新提交 88%

TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment

TRACE:基于轨迹的安全补丁学习用于大语言模型训练后调整

Changyue Li, Jiaming He, Youliang Yuan, Jialin Wu, Boxi Yu, Zhicong Huang, Pinjia He

机构 * LERo

专题命中 后训练与偏好优化 :LLM(title);post-training(title);large language model(abstract);language model(abstract)

AI总结 研究针对FTaaS平台削弱模型安全对齐的问题,提出TRACE框架,通过模拟有害轨迹生成损坏状态,优化插件补丁,在保持效用的同时恢复模型安全,在多基准测试和模型上占据安全 - 效用前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31876 2026-07-07 cs.AI cs.CV cs.LG 新提交 88%

Harnessing Textual Refusal Directions for Multimodal Safety

利用文本拒绝方向实现多模态安全

Moreno D'Incà, Nicu Sebe, Massimiliano Mancini

机构 * University of Trento(特伦托大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出MARS方法,通过从LLM骨干提取的文本拒绝方向泛化到多模态,无需多模态安全数据即可提升安全性,在五个先进MLLM上验证了有效性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24004 2026-06-24 cs.CL cs.AI 新提交 88%

Towards Spec Learning: Inference-Time Alignment from Preference Pairs

面向规范学习:从偏好对进行推理时对齐

Dhriti Krishnan, Tejas Goyal, Jaromir Savelka

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出规范学习框架,利用少量用户指令和偏好判断生成自然语言规范,在推理时引导LLM行为,无需参数更新,在密集偏好信号领域优于DPO,且规范可解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21943 2026-06-23 cs.LG cs.AI 新提交 88%

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

LLM上的模块化强化学习:从MDP创建到探索与学习

Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievski, Shujian Yu, Aske Plaat, Zhaochun Ren, Mark Hoogendoorn, Vincent François-Lavet

机构 * VU Amsterdam(阿姆斯特丹自由大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Leiden University(莱顿大学) University of Warsaw(华沙大学) Simon Fraser University(西蒙菲莎大学) The University of Hong Kong(香港大学)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文系统梳理LLM后训练中的强化学习方法,从MDP构建、探索策略到学习范式,揭示当前方法分布不均,指出价值函数、离策略AC及自举法等领域存在研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08088 2026-06-09 cs.LG cs.CL 新提交 88%

ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning

ConSteer-RL:通过置信度感知强化学习引导大型语言模型的推理能力

Qing Miao, Yiming Zhao, Jing Yang, Chenxi Liu, Yuehai Chen, Yuewen Liu, Shaoyi Du, Badong Chen

机构 * Xi'an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出ConSteer-RL框架,将模型log概率的token级置信度信号融入GRPO,通过置信度感知奖励塑造机制惩罚过度自信错误并强化正确自信推理,在多个模型规模上平均提升2.3%-4.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28862 2026-08-03 cs.CL cs.AI cs.CR cs.LG 新提交 88%

TextCloak: Thwarting Unauthorized LLM Exploitation via RL-Driven Unlearnable Text

TextCloak:基于强化学习的不可学习文本防御未经授权的大语言模型利用

Chengshuai Zhao, Pingchuan Ma, Dawei Li, Bohan Jiang, Zhiyuan Yu, Zhen Tan, Huan Liu

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出TextCloak框架,采用强化学习与GRPO-UE技术生成不可学习文本,可削弱大语言模型的未经授权微调,兼具实用性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11867 2026-06-11 cs.DC 新提交 88%

Harnessing Routing Foresight for Micro-step-level MoE load balancing in RL Post-training

利用路由预见性实现RL后训练中微步级MoE负载均衡

Yuming Zhou, Haoyang Li, Sheng Lin, Yanfeng Zhao, Tong Zhao, Xupeng Miao, Jie Jiang, Fangcheng Fu, Bin Cui

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对MoE模型在RL后训练中微步级负载波动问题,提出ForeMoE系统,利用rollout阶段的可预见路由信息主动引导负载均衡,并采用分层规划器与传输引擎实现微步级重配置,在64 GPU上取得高达1.45倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15504 2026-08-18 cs.LG stat.ML 新提交 88%

PERO: Efficient Robust Post-Training Foundation Models for Encrypted Traffic Classification

PERO:面向加密流量分类的高效鲁棒预训练后 foundation 模型

Wumei Du, Jiarong Wen, Kaiyu Zhang, Zi Yang, Yiqin Lv, Longfei Zhang, Dong Liang, Zheng Xie

机构 * National University of Defense Technology(国防科技大学)

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 针对加密流量分类中鲁棒优化成本高的问题,提出PERO框架,通过轻量代理估计风险并选择高风险样本更新模型,在保持性能的同时降低了计算与内存成本。

Comments 16 pages, 6 figures, 6 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25328 2026-06-25 cs.SD cs.AI 新提交 88%

Supervised Post-training of Speech Foundation Models for Robust Adaptation in Speech Deepfake Detection

语音深度伪造检测中鲁棒适应的语音基础模型监督后训练

Zihan Pan, Sailor Hardik, Jinyang Wu

机构 * Institute for Infocomm Research (I2R), Agency for Science, Technology and Research (A*STAR)(资讯通信研究院(I2R),新加坡科技研究局(A*STAR))

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);分类 cs.AI

AI总结 提出混合帧后训练策略,通过帧级监督学习局部不一致性,在ASVspoof5上实现单模型EER 4.50%,在ASVspoof2021上LA与DF的EER差距仅0.16%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17967 2026-06-25 cs.CL 新提交 88%

Learning task-specific subspaces via interventional post-training of speech foundation models

通过语音基础模型的干预后训练学习任务特定子空间

Jack Cox, Jon Barker

机构 * University of Sheffield(谢菲尔德大学)

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);分类 cs.CL

AI总结 提出一种干预对比学习后训练方法,将语音基础模型的纠缠表示分解为内容和说话人子空间,提升说话人验证和关键词识别性能。

Comments Accepted to Interspeech 2026; 6 pages (4 main body), 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21458 2026-06-23 cs.LG 新提交 88%

Post-Training Speech Enhancement Language Models with Perceptual Rewards

基于感知奖励的语音增强语言模型后训练

Frédéric Berdoz, Luca A. Lanzendörfer, Antonis Asonitis, Roger Wattenhofer

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 提出使用组序列策略优化(GSPO)结合多指标感知奖励对自回归语音增强语言模型进行后训练,直接优化非可微质量指标,在DNS2020基准上达到最优,且多奖励优化优于单指标变体。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06310 2026-08-07 cs.LG cs.CL 新提交 88%

RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

RRC:基于排序的奖励构造解锁LLM强化学习中的生成式奖励模型

Chenglong Wang, Ziming Zhu, Yifu Huo, Bei Li, Qiaozhi He, Yan Ding, Xiaoyang Hao, Yuxin Gao, Tianhua Zhou, Xiaojia Chang, Tongran Liu, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) NiuTrans Research(NiuTrans研究院) Institute of Psychology, CAS(中国科学院心理研究所) Kunming University of Science and Technology(昆明理工大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本研究针对生成式奖励模型在LLM强化学习中潜力未充分发挥的问题,提出RRC方法,通过两种互补策略提升RL训练效果,在多基准上取得一致增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05446 2026-08-07 cs.LG cs.CL 新提交 88%

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents

EvoHarness-RL:为长视野大语言模型智能体学习自进化运行时管控器

Xuying Ning, Dongqi Fu, Tianxin Wei, Hanqing Zeng, Yuanchen Bei, Bingxuan Li, Zihao Li, Qifan Wang, Xiang Shen, Yifan Wu, Jiayi Liu, Hong Li, Yinglong Xia, Xiangjun Fan, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta AI

专题命中 后训练与偏好优化 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 本研究提出 EvoHarness-RL 方法,通过学习管控器策略解决长视野 LLM 智能体的外部状态管理问题,在 ALFWorld 上达到 96.9% 的任务成功率,验证了可训练管控器策略的有效性。

Comments Accepted to LLA@COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01879 2026-08-04 cs.LG cs.AI 新提交 88%

LAB-Tab: LLM-Augmented Bayesian Network Adaptation for Few-Shot Tabular Generation

LAB-Tab:面向小样本表格生成的大语言模型增强型贝叶斯网络适配方法

Zijian Shen, Taijie Chen, Bin Zhou, Ziyang Jiang, Jintao Ke

专题命中 后训练与偏好优化 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 针对小样本表格生成的分布偏移问题,提出LLM增强的贝叶斯网络适配框架LAB-Tab,在六个ACS分布偏移场景中表现优于基准方法,性能提升显著。

Comments 21 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14171 2026-07-17 cs.LG cs.CL 新提交 88%

Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning

分支策略优化:沙盒原生语言智能体强化学习

Bowei He, Yankai Chen, Xiaokun Zhang, Xue Liu

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) McGill Univeristy(麦吉尔大学) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究基于可执行沙盒的大语言模型智能体强化学习,提出分支策略优化(BPO)算法,利用沙盒特性构建新展开拓扑,通过自适应快照、分叉动作等方式计算优势,实验验证该算法能提升成功率、降低方差并减少策略更新。

Comments Accepted by WAIC Academic 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01083 2026-07-03 cs.LG cs.AI 新提交 88%

Staleness-Learning Rate Scaling Laws for Asynchronous RLHF

异步RLHF的陈旧度-学习率缩放定律

Jingwei Song, Haofeng Xu, Jie Xiao, Chengke Bao, Jingwei Shi, Pengbin Feng, Weixun Wang, Yuhang Han, Chuan Wu, Linfeng Zhang, Bill Shi

机构 * The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Gradient University of Southern California(南加州大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究异步GRPO中陈旧rollout的影响,推导出陈旧度与学习率之间的缩放定律,揭示稳定性受累积漂移和陈旧度约束的双重条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18606 2026-06-18 cs.CL cs.AI 新提交 88%

Steerable Cultural Preference Optimization of Reward Models

可引导的文化偏好优化奖励模型

Minsik Oh, Advit Deepak, Sophie Wu, Douwe Kiela, Ekaterina Shutova

机构 * Stanford University(斯坦福大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 后训练与偏好优化 :preference optimization(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出SCPO算法,通过平衡多种文化偏好训练奖励模型,在PRISM和GlobalOpinionQA数据集上提升少数群体偏好预测准确率最多7点,训练效率提高280%。

Comments Accepted to Pluralistic Alignment @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08768 2026-08-11 cs.IR 新提交 88%

BOUND: Brief-Guided Corrective Preference Distillation at Search-Control Boundaries

BOUND:在搜索-控制边界处的摘要引导式校正偏好蒸馏

Qingying Niu, Ruiyang Ren, Wayne Xin Zhao, Yaliang Li

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对大语言模型深度搜索智能体的持续漂移问题,提出BOUND框架,通过摘要引导构建偏好对,用DPO蒸馏偏好,在7个基准上多数数据集和指标优于基线。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20438 2026-07-24 cs.CL cs.AI cs.LG 新提交 88%

Preference Tuning as Spectral Update Reorganization

作为频谱更新重组的偏好调整

Peiyan Zhang, Haibo Jin, Liying Kang, Haohan Wang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);post-training(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过频谱结构研究RLHF及偏好优化,将偏好诱导更新转化为可干预对象,发现更新呈现头-尾组织,头部主导端点偏移,揭示了偏好训练后是结构化更新重组,以及对齐增益和覆盖损失与更新组织方式的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14212 2026-08-17 cs.AI 新提交 87%

APTER: Adaptive Post-Training with Expert-Grounded Rubrics

APTER:基于专家准则的自适应后训练

Xukai Wang, Liangqi Li, Zhiyue Xu, Jingang Zhou, Xiaoyu Shi, Jiansheng Cai, Bo Zhang, Zhe Li, Xu-Yao Zhang

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字科技)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 APTER是将结构化领域知识融入专业复杂推理评估、优化与诊断的框架,通过专家准则生成查询级准则并用于自适应后训练,在数学、医学领域三代模型上均实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19712 2026-07-23 cs.LG 新提交 87%

How Fast Can Reward Models Score? A Systems Study of C++ and PyTorch Inference Runtimes for RLHF

奖励模型评分能有多快?对用于基于人类反馈的强化学习的C++和PyTorch推理运行时的系统研究

Venkata Naga Sai Vishnu Rohit Pulipaka, Anish Katta, Deva Rohit Reddy Peddireddy

专题命中 后训练与偏好优化 :RLHF(title,summary_cn);分类 cs.LG

AI总结 研究RLHF中奖励模型评分速度,构建基于ONNX Runtime的C++推理引擎,经测试,在CPU上击败所有基线,GPU上部分领先,发现加速源于ONNX Runtime,且批处理策略对速度影响更大,结果经多次独立运行得出。

详情

展开后加载摘要…

URL PDF HTML 收藏