arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-09 至 2025-12-09 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 11 篇

2512.06874 2025-12-09 cs.CL 91%

An Analysis of Large Language Models for Simulating User Responses in Surveys

大型语言模型在模拟调查用户响应中的分析

Ziyun Yu, Yiru Zhou, Chen Zhao, Hongyi Wen

机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心) New York University(纽约大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

AI总结 本文分析了大型语言模型在模拟调查用户响应中的表现,提出CLAIMSIM方法以提高响应多样性,但发现模型在处理不同人口特征时存在固有偏见和推理限制。

Comments Accepted to IJCNLP-AACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06097 2025-12-09 cs.CL cs.AI 90%

Empathy by Design: Aligning Large Language Models for Healthcare Dialogue

设计中的共情:为医疗对话对齐大语言模型

Emre Umucu, Guillermina Solis, Leon Garza, Emilia Rivas, Beatrice Lee, Anantaa Kotal, Aritran Piplai

机构 * Department of Public Health Sciences, The University of Texas at El Paso, USA(公共卫生科学系,德克萨斯理工大学埃尔帕索分校) Department of Nursing, The University of Texas at El Paso, USA(护理系,德克萨斯理工大学埃尔帕索分校) Department of Rehabilitation Sciences, The University of Texas at El Paso, USA(康复科学系,德克萨斯理工大学埃尔帕索分校)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于DPO的对齐框架,通过优化医疗对话中事实准确性、语义连贯性和共情能力,提升AI助手在医疗场景中的可信度和人文关怀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07611 2025-12-09 cs.AI cs.LG 86%

Comparative Analysis and Parametric Tuning of PPO, GRPO, and DAPO for LLM Reasoning Enhancement

PPO、GRPO和DAPO在LLM推理增强中的比较分析与参数调优

Yongsheng Lian

机构 * Mechanical Engineering Department University of Louisville(路易斯维尔大学机械工程系)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过比较PPO、GRPO和DAPO在LLM推理增强中的表现,发现GRPO和DAPO在参数调优下具有更稳定的训练动态和更高的准确性,而DAPO禁用动态采样时表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05031 2025-12-09 cs.IR 86%

LSRP: A Leader-Subordinate Retrieval Framework for Privacy-Preserving Cloud-Device Collaboration

LSRP: 一种用于隐私保护云-设备协作的领导者-下属检索框架

Yingyi Zhang, Pengyue Jia, Xianneng Li, Derong Xu, Maolin Wang, Yichao Wang, Zhaocheng Du, Huifeng Guo, Yong Liu, Ruiming Tang, Xiangyu Zhao

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 LSRP通过领导者-下属检索框架提升云-设备协作的隐私保护性能,增强云模型与设备模型的协同能力。

Comments Accepted at KDD'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06920 2025-12-09 cs.LG 83%

Parent-Guided Semantic Reward Model (PGSRM): Embedding-Based Reward Functions for Reinforcement Learning of Transformer Language Models

基于嵌入的语义奖励模型(PGSRM):用于变换器语言模型强化学习的奖励函数

Alexandr Plashchinsky

机构 * VECTOR Labs(VECTOR实验室)

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.LG

AI总结 PGSRM通过嵌入相似度生成语义奖励,为变换器语言模型强化学习提供无需人工标注的替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19296 2025-12-09 cs.LG cs.AR cs.PL 77%

QiMeng-SALV: Signal-Aware Learning for Verilog Code Generation

QiMeng-SALV:面向Verilog代码生成的信号感知学习

Yang Zhang, Rui Zhang, Jiaming Guo, Lei Huang, Di Huang, Yunpu Zhao, Shuyao Cheng, Pengwei Jin, Chongxiao Li, Zidong Du, Xing Hu, Qi Guo, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 QiMeng-SALV通过信号感知学习提升Verilog代码生成的准确性与性能,采用信号级优化解决功能奖励不足问题。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07544 2025-12-09 cs.CL cs.AI 73%

MoCoRP: Modeling Consistent Relations between Persona and Response for Persona-based Dialogue

MoCoRP: 模型对话中人设与回应之间的一致性关系

Kyungro Lee, Dongha Choi, Hyunju Lee

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MoCoRP通过显式建模人设与回应之间的一致性关系,提升基于人设的对话生成质量与一致性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11227 2025-12-09 cs.AI cs.LG 73%

Is PRM Necessary? Problem-Solving RL Implicitly Induces PRM Capability in LLMs

PRM是否必要?问题解决RL隐式地在LLMs中诱导PRM能力

Zhangying Feng, Qianglong Chen, Ning Lu, Yongqian Li, Siqi Cheng, Shuangmu Peng, Duyu Tang, Shengcai Liu, Zhirui Zhang

机构 * Huawei Technologies Ltd.(华为技术有限公司) Guangdong Provincial Key Laboratory of Brain-Inspired Intelligent Computation, Department of CSE, SUSTech(广东省脑启发智能计算重点实验室、信息科学部、南方科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现纯RL训练可提升LLMs的推理能力并隐式诱导PRM能力,挑战了PRM的必要性。

Comments Accepted by NeurIPS 2025, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06533 2025-12-09 cs.LG cs.AI 73%

Beyond Token-level Supervision: Unlocking the Potential of Decoding-based Regression via Reinforcement Learning

超越标记级监督:通过强化学习解锁解码回归的潜力

Ming Chen, Sheng Tang, Rong-Xi Tan, Ziniu Li, Jiacheng Chen, Ke Xue, Chao Qian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过强化学习提升基于解码的回归性能,引入序列级信号以提高预测精度和采样效率,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06060 2025-12-09 cs.SE cs.AI 70%

Reinforcement Learning Integrated Agentic RAG for Software Test Cases Authoring

强化学习集成的代理RAG用于软件测试用例编写

Mohanakrishnan Hariharan

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合强化学习与自主代理的RAG框架,用于提升软件测试用例生成的准确性和缺陷检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14354 2025-12-09 cs.LG cs.CL 62%

Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment

迈向帕累托最优的自我改进:缓解多目标对齐中的偏好冲突

Moxin Li, Yuantao Zhang, Wenjie Wang, Wentao Shi, Zhuo Liu, Fuli Feng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种自我改进的DPO框架,通过生成帕累托最优响应缓解多目标对齐中的偏好冲突,提升模型在帕累托前沿的优化效果。

Comments ACL findings (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏