arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-26 至 2026-08-26 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 22 篇

2604.01597 2026-08-26 cs.LG 版本更新 91%

Learning from the Right Rollouts: Data Attribution for PPO-based LLM Post-Training

从正确的回放中学习:基于PPO的LLM后训练的数据归因

Dong Shu, Denghui Zhang, Jessica Hullman

机构 * Northwestern University(西北大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);SFT(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出Influence-Guided PPO框架,通过计算影响分数筛选反向齐梯度的回放片段,提升PPO后训练效率并减少不忠实的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24658 2026-08-26 cs.AI 新提交 90%

Parason: Revealing Subtask and Trial Parallelism in LLM Reasoning

Parason:揭示大语言模型推理中的子任务并行与试错并行

Zhengyang Zhang, Zijian Zhang, Jiaxuan Gao, Shusheng Xu, Yi Wu, Song Han, Ligeng Zhu

机构 * Tsinghua University(清华大学) NVIDIA(英伟达) Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Parason揭示LLM推理的子任务与试错并行,用上下文无关文法转换轨迹,经PA-GRPO训练,在数学基准上实现约1.7倍加速且保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24192 2026-08-26 cs.AI cs.CL 新提交 90%

Preference Data Selection for Mitigating the Alignment Tax in Large Language Models

缓解大语言模型对齐税的偏好数据选择

Minsu Kim, Jianxun Lian, Xing Xie, Steven Euijong Whang

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BALIGN策略,通过筛选偏好数据的三个关键特征,缓解大语言模型对齐税,在保留通用能力的同时提升对齐效果,达到最优帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21883 2026-08-26 cs.CL 版本更新 89%

Token-weighted Direct Preference Optimization with Attention

基于注意力的令牌加权直接偏好优化

Chengyu Huang, Zhuohang Li, Sheng-Yen Chou, Claire Cardie

机构 * Cornell University(康奈尔大学) Vanderbilt University(范德比大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出Token-weighted DPO (TwDPO)方法,利用注意力机制估计令牌权重,在不增加额外训练成本的情况下提升大语言模型与人类偏好对齐的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24163 2026-08-26 eess.AS cs.AI cs.LG 新提交 88%

Preference Optimization for Non-Verbal Vocalization Synthesis

非言语发声合成的偏好优化

Haoyang Li, Chenglin Xu, Junchuan Zhao, Yuang Cao, Liumeng Xue, Yiwen Guo, Eng Siong Chng

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文针对支持非言语发声的文本转语音系统,研究偏好优化相关设计,提出NV-CER指标,在Emilia-NV等数据集上验证标准DPO设置的有效性,为相关后训练提供实用见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24730 2026-08-26 cs.MM cs.HC 新提交 87%

Learning to Prefer Reliably: Error-Augmented Emotion Preference Optimization with Calibrated Fusion

学习可靠偏好:带校准融合的错误增强情感偏好优化

Zilong Huang, Junyi Peng, Junjie Li, Kai Li, Wenze Ren, Kong Aik Lee, Man-Wai Mak, Tatsuya Kawahara

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对情感偏好学习的稀疏监督与单一MLLM评判者的偏差问题,提出EAPO框架,构建错误增强数据集并通过边际校准软融合聚合多MLLM评判结果,提升情感偏好预测与鲁棒性。

Comments Accepted at ACM MM 2026 Workshop (MRAC '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06621 2026-08-26 cs.GL cs.LG stat.ML 版本更新 86%

The Theorems of Dr. David Blackwell and Their Contributions to Artificial Intelligence

大卫·布莱克韦尔定理及其对人工智能的贡献

Napoleon Paxton

机构 * School of Information, University of California, Berkeley(加州大学伯克利分校信息学院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文综述了布莱克韦尔的三个重要定理及其对现代人工智能和机器学习的影响,包括马尔可夫链蒙特卡罗推断、自主机器人导航、生成模型训练等领域的应用。

Comments Survey article, 20 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23632 2026-08-26 cs.AI cs.SE 新提交 85%

Function-Level Execution Feedback for Code Preference Optimization

用于代码偏好优化的函数级执行反馈

Idris Nechnech, Sehwan Kim, Jimin Seo, Yeongoon Kim, Minhae Oh, Sangwoo Hong, Jungwoo Lee

机构 * Seoul National University(首尔大学) Konkuk University(建国大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出STEP-KTODER框架,将代码步骤定义为多函数程序的模块级函数,结合函数级过程监督与程序结果级反馈,在多个代码基准测试中优于KTO、DPO等方法,且验证了执行标签的重要性。

Comments 20 pages, 8 figures, 14 tables. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23311 2026-08-26 cs.CL 版本更新 85%

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法

Xianlei Zhou, Xiangdi Meng, Yu He, Tianyu Qi, Shuyan Guan, Xianli Zhang, Jian Zhang, Xin Li, Qika Lin, Jun Liu

机构 * Alibaba Group(阿里巴巴集团) Beijing Normal University(北京师范大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23811 2026-08-26 cs.AI 新提交 84%

Generating Biomedical Fact-Checking Reports with RL-Enhanced Agentic Search

用强化学习增强的智能体搜索生成生物医学事实核查报告

Jiongxiao Wang, Dingli Ma, Chaoqun Ni

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究提出BioCheck Agent智能体结合EG-GRPO强化学习方法,生成生物医学事实核查报告,在SciFact数据集上提升了标签预测准确率、证据质量并降低了幻觉率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07557 2026-08-26 cs.RO cs.AI cs.CV 版本更新 83%

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization

AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力

Peng Xu, Chengcheng Wang, Shaohua Wan

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。

Comments 7 pages, 3 figures, 4 tables, Code is available at: [ this https URL (https://github.com/XuPeng23/AeroDPO) ]

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04946 2026-08-26 cs.CL 版本更新 83%

LocalSUG: City-Preference-Enhanced LLM for Query Suggestion in Local-Life Services

LocalSUG:面向本地生活服务的城市偏好增强大语言模型查询建议

Jinwen Chen, Shiwen Zhang, Shuai Gong, Zheng Zhang, Yachao Zhao, Lingxiang Wang, Haibo Zhou, Wei Lin, Hainan Zhang

机构 * Meituan(美团)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 提出LocalSUG框架,通过挖掘城市偏好候选词注入提示、束搜索GRPO算法和加速解码,解决大语言模型在本地生活服务查询建议中城市偏好不足、偏好暴露偏差和延迟约束问题。

Comments EMNLP2026 Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26958 2026-08-26 cs.CL cs.AI 版本更新 82%

Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation

Tournament-GRPO:面向开放式长文本生成强化学习的群组锦标赛奖励

Zixuan Yang, Yiqun Chen, Wei Yang, Erhan Zhang, Zihan Shen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) University of Southern California(南加州大学) Zhejiang University(浙江大学) Xiaohongshu Inc.(小红书公司)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对开放式长文本生成中缺乏可靠参考答案和自动评估指标的问题,提出Tournament-GRPO框架,通过同一查询生成结果间的多轮锦标赛比较将基于规则的LLM评判转化为相对奖励,在Deep Research Bench上取得4.52分提升。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24777 2026-08-26 cs.AI cs.CR 新提交 81%

StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing

StepGuard:利用可扩展监督与安全-效用平衡学习步骤级护栏

Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) Fudan University(复旦大学) Renmin University of China(中国人民大学) KAUST(阿卜杜拉国王科技大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究针对LLM智能体交互的安全风险,提出步骤级护栏模型StepGuard,通过自动数据引擎StepGen与动态平衡学习方法Balance-GRPO训练,在降低攻击成功率的同时仅小幅影响效用。

Comments Accepted by EMNLP 2026. Project page: this https URL (https://zheng977.github.io/StepGuard/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19342 2026-08-26 stat.ML cs.LG stat.ME 版本更新 81%

Contextual Online Uncertainty-Aware Preference Learning for Human Feedback

基于上下文的在线不确定性感知偏好学习用于人类反馈

Nan Lu, Ethan Lee, Ethan X. Fang, Junwei Lu

机构 * Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学T.H.陈公共卫生学院生物统计学系) Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种新的统计框架,利用动态上下文信息在线决策和统计推断最优模型,通过人类偏好数据实现最优 regret 绑定和估计量渐近分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24525 2026-08-26 cs.RO 新提交 78%

RoG-DAgger: Rollout-Guided Post-Training for End-to-End Driving

RoG-DAgger:面向端到端驾驶的基于回滚的后训练方法

Liangyu Zhong, Joachim Sicking, Fabian Hueger, Hanno Gottschalk

机构 * CARIAD SE, Volkswagen Group(大众集团旗下CARIAD SE) Institute of Mathematics, Technical University of Berlin(柏林工业大学数学研究所)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 本研究针对端到端驾驶系统训练与推理不匹配的问题,提出 RoG-DAgger 后训练框架,通过回滚优化专家演示与监督,在多个驾驶基准上显著提升了模型的驾驶性能与成功率。

Comments preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23566 2026-08-26 cs.LG cs.AI cs.CL 版本更新 75%

Best Practice Critic Optimization

如何稳定且高效地训练评价模型

Penghui Qi, Xiangxin Zhou, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学) Tencent Hunyuan(腾讯混元)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24275 2026-08-26 cs.AI cs.CL 新提交 73%

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

RePolicy:用于智能体安全保障中安全策略调用的强化学习方法

Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24114 2026-08-26 cs.AI 新提交 70%

AHEAD: Adaptive Hindsight with Environment-Augmented Distillation for Agentic RL

AHEAD:用于智能体强化学习的环境增强蒸馏自适应回溯

Xiaolong Jin, Dingmin Wang, Vijay Lingam, Varun Kumar

机构 * AWS AI Labs(亚马逊云科技人工智能实验室) Purdue University(普渡大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 AHEAD是一种步骤感知的智能体强化学习框架,通过匹配不同监督源适配步骤类型,在多任务及多模型规模下提升了GRPO算法的任务成功率,减少了训练步骤并适配更严格的交互预算。

Comments 22 pages, 15 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24046 2026-08-26 cs.AI 新提交 70%

Algorithmic Impact Reveals the Hidden Social Choice Structure of Alignment

算法影响揭示对齐的隐藏社会选择结构

Zachary Wojtowicz, Michelle Si, Finale Doshi-Velez, Ariel Procaccia

机构 * MIT(麻省理工学院) Harvard University(哈佛大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究将AI对齐问题转化为凸影响空间上的线性优化,结合福利经济学与机制设计,推导了防策略的社会选择机制及最大化功利主义社会福利的对齐协议,并通过多领域人类偏好实证验证其福利影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23999 2026-08-26 cs.CY 新提交 67%

The urban right to AI: Pluralistic co-design and governance of public space

城市的AI权利:公共空间的多元协同设计与治理

Rashid Mushkani

专题命中 后训练与偏好优化 :preference optimization(abstract,abstract_cn)

AI总结 本论文提出公民AI权利与多元对齐方法,以蒙特利尔为实证基础,结合Street Review与LIVS研究,构建市政AI治理框架,解决公共空间AI决策中的多元价值争议问题。

Comments Ph.D. dissertation, Université de Montréal, 231 pages, 59 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24794 2026-08-26 cs.AI 新提交 57%

CAFE: Self-Improving Search Agents Need Co-Evolving Feedback

CAFE:自改进搜索智能体需要协同演化的反馈

Boyang Liu, Senjie Jin, Peixin Wang, Zhangyue Yin, Yibo Wang, Yuhao Zhou, Xinbing Liang, Shizheng Zhu, Yuhui Wang, Jingqi Tong, Zhiheng Xi, Jiazheng Zhang, Clive Bai, Clarenceai, Blaze Chen, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 该研究提出 CAFE 框架,通过共享参数模型耦合搜索智能体与评判者的协同演化反馈,在七个及六个域外搜索基准上均优于现有 RL 智能体,减少答案幻觉且性能持续提升。

详情

展开后加载摘要…

URL PDF HTML 收藏