arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-19 至 2026-01-19 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 5 篇

2601.10532 2026-01-19 cs.CL 88%

PERM: Psychology-grounded Empathetic Reward Modeling for Large Language Models

PERM:基于心理学的共情奖励建模用于大语言模型

Chengbing Wang, Wuqiang Zheng, Yang Zhang, Fengbin Zhu, Junyi Cheng, Yi Xie, Wenjie Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Huawei Technologies(华为技术)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PERM通过双向分解和旁观者视角提升大语言模型的共情能力,实验显示其在同理心基准和对话数据集上表现优异,用户偏好率达70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16995 2026-01-19 cs.CL 87%

DecoupledESC: Enhancing Emotional Support Generation via Strategy-Response Decoupled Preference Optimization

解耦ESC:通过策略-回应解耦的偏好优化增强情感支持生成

Chao Zhang, Xin Shi, Xueqiao Zhang, Yifan Zhu, Yi Yang, Yawei Luo

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出了解耦ESC框架,通过策略-回应解耦的偏好优化方法,提升情感支持生成的质量与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11379 2026-01-19 cs.CL cs.AI cs.CY cs.SI 86%

Evaluating LLM Behavior in Hiring: Implicit Weights, Fairness Across Groups, and Alignment with Human Preferences

评估LLM在招聘中的行为:隐含权重、群体公平性及与人类偏好的一致性

Morgane Hoffmann, Emma Jouffroy, Warren Jouanneau, Marc Palyart, Charles Pebereau

机构 * Malt

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出评估LLM招聘决策的框架,发现模型重视核心生产力信号,但对某些特征的解释超出显性匹配价值,且不同群体间权重存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11147 2026-01-19 cs.AI 70%

Do We Always Need Query-Level Workflows? Rethinking Agentic Workflow Generation for Multi-Agent Systems

我们是否总是需要查询级工作流?重新思考多智能体系统中的代理工作流生成

Zixu Wang, Bingbing Xu, Yige Yuan, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SCALE框架,通过低成本任务级生成替代查询级生成,减少令牌消耗并保持性能。

Comments 17 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10131 2026-01-19 cs.AI cs.MA 70%

M^4olGen: Multi-Agent, Multi-Stage Molecular Generation under Precise Multi-Property Constraints

M^4olGen: 多智能体、多阶段分子生成在精确多属性约束下

Yizhan Li, Florence Cloutier, Sifan Wu, Ali Parviz, Boris Knyazev, Yan Zhang, Glen Berseth, Bang Liu

机构 * DIRO & Université de Montréal(DIRO与蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) Institut Courtois(Courtois研究所) Samsung AI Lab, Montreal(三星AI实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 M^4olGen通过多智能体和强化学习框架,在多属性约束下实现精确分子生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏