arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-26 至 2026-01-26 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2601.16403 2026-01-26 cs.LG 85%

Towards a Theoretical Understanding to the Generalization of RLHF

迈向RLHF泛化性的理论理解

Zhaochun Li, Mingyang Yi, Yue Wang, Shisheng Cui, Yong Liu

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Renmin University of China(中国人民大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过算法稳定性框架,在线性奖励模型下构建了RLHF下LLM的泛化理论,证明在特征覆盖条件下策略模型的泛化界为O(n^{-1/2}),并推广到梯度方法参数。

Comments 31 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16356 2026-01-26 cs.HC 85%

The Behavioral Fabric of LLM-Powered GUI Agents: Human Values and Interaction Outcomes

LLM驱动的GUI代理的行为织体:人类价值观与交互结果

Simret Araya Gebreegziabher, Yukun Yang, Charles Chiang, Hojun Yoo, Chaoran Chen, Hyo Jin Do, Zahra Ashktorab, Werner Geyer, Diego Gómez-Zará, Toby Jia-Jun Li

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了LLM驱动的GUI代理中人类价值观如何影响其行为和交互结果,提出了一种开源测试平台和实证分析方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16483 2026-01-26 eess.AS 80%

FlowSE-GRPO: Training Flow Matching Speech Enhancement via Online Reinforcement Learning

FlowSE-GRPO:通过在线强化学习训练流匹配语音增强

Haoxu Wang, Biao Tian, Yiheng Jiang, Zexu Pan, Shengkui Zhao, Bin Ma, Daren Chen, Xiangang Li

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

AI总结 本文提出FlowSE-GRPO,通过在线强化学习优化语音增强,平衡多指标以提升音频质量与任务性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16276 2026-01-26 cs.CL cs.AI cs.GT cs.LG cs.MA 75%

GameTalk: Training LLMs for Strategic Conversation

GameTalk: 训练 LLMs 进行战略性对话

Victor Conchello Vendrell, Max Ruiz Luyten, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GameTalk 通过多轮互动训练 LLMs 实现战略性决策,优于传统方法,尤其在奖励塑造下表现突出。

Comments 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16480 2026-01-26 cs.CL 70%

TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization

TL-GRPO:基于回合的强化学习用于推理引导的迭代优化

Peiji Li, Linyang Li, Handa Sun, Wenjin Mai, Yongkang Chen, Xiaozhe Li, Yue Shen, Yichuan Ma, Yiliu Sun, Jiaxi Cao, Zhishu He, Bo Wang, Xiaoqing Zheng, Zhaori Bi, Xipeng Qiu, Qipeng Guo, Kai Chen, Dahua Lin

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TL-GRPO通过回合级分组采样优化解决迭代优化任务中的轨迹级强化学习问题,实现更精细的优化效果。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20304 2026-01-26 cs.CL 70%

Exploring Generative Process Reward Modeling for Semi-Structured Data: A Case Study of Table Question Answering

探索生成过程奖励建模在半结构化数据中的应用:表格问答的案例研究

Lei Tang, Wei Zhou, Mohsen Mesgar

机构 * University of Augsburg(奥格斯堡大学) Institut für Maschinelle Sprachverarbeitung, University of Stuttgart(斯图加特大学机械语言处理研究所) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了生成过程奖励模型在表格问答任务中的应用,发现结合文本和代码验证的PRMs能辅助解决方案选择,但泛化能力有限。

Comments Accepted at EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16400 2026-01-26 cs.CL 57%

Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification

澄清或回答:基于上下文不充分的代理视觉问答强化学习

Zongwan Cao, Bingbing Wen, Lucy Lu Wang

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 后训练与偏好优化 :prompting(abstract);分类 cs.CL

AI总结 CoA通过强化学习解决上下文不充分的视觉问答问题,通过生成聚焦问题澄清歧义,提升问答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13018 2026-01-26 cs.LG q-bio.QM 57%

Escaping Local Optima in the Waddington Landscape: A Two-Stage TRPO-PPO Approach for Single-Cell Perturbation Analysis

摆脱Waddington景观的局部极值:一种用于单细胞扰动分析的两阶段TRPO-PPO方法

Francis Boabang, Samuel Asante Gyamerah

机构 * Department of Mathematics, Toronto Metropolitan University(数学系,多伦多 Metropolitan 大学)

专题命中 后训练与偏好优化 :pretraining(abstract);分类 cs.LG

AI总结 本文提出一种两阶段TRPO-PPO方法,用于单细胞扰动分析,通过改进初始化策略提升模型在数字双胞胎系统中的泛化能力。

Comments 17 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏