arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-27 至 2026-01-27 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 15 篇

2601.18129 2026-01-27 cs.CL cs.AI 92%

Typhoon-S: Minimal Open Post-Training for Sovereign Large Language Models

Typhoon-S: 最小化开放的训练后处理以实现主权大语言模型

Kunat Pipatanakul, Pittawat Taveekitworachai

机构 * Typhoon, SCB 10X(Typhoon,SCB 10X)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI

AI总结 Typhoon-S通过最小化开放的训练后处理方法,实现主权大语言模型的可采用性和主权能力,无需大规模数据或复杂调优流程。

Comments 19 pages. Code is publicly available at https://github.com/scb-10x/typhoon-s . Datasets and model weights are available at https://huggingface.co/collections/typhoon-ai/typhoon-s

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17096 2026-01-27 cs.CY cs.AI cs.CL 90%

Beyond Instrumental and Substitutive Paradigms: Introducing Machine Culture as an Emergent Phenomenon in Large Language Models

超越工具性和替代性范式:引入机器文化作为大型语言模型中的涌现现象

Yueqing Hu, Xinyang Peng, Yukun Zhao, Lin Qiu, Ka-lai Hung, Kaiping Peng

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出机器文化作为大型语言模型中的一种新兴现象,挑战传统工具性和替代性范式,揭示模型在文化表现上的独特特性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17918 2026-01-27 cs.CV cs.CL 88%

Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models

医疗大视觉-语言模型的直接偏好优化基准测试

Dain Kim, Jiwoo Lee, Jaehoon Yun, Yong Hoe Koo, Qingyu Chen, Hyunjae Kim, Jaewoo Kang

机构 * Korea University(韩国大学) AIGEN Sciences(AIGEN公司) Hanyang University College of Medicine(翰林大学医学院) Asan Medical Center, University of Ulsan College of Medicine(釜山大学医学院阿桑医院) Yale University(耶鲁大学)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract);分类 cs.CL

AI总结 本文评估了医疗领域中多种DPO变体,发现其在视觉问答任务中存在性能不一致和视觉误解问题,并提出针对性策略提升3.6%。

Comments EACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22881 2026-01-27 cs.LG cs.CL 88%

Offline Preference Optimization via Maximum Marginal Likelihood Estimation

通过最大边际似然估计实现离线偏好优化

Saeed Najafi, Alona Fyshe

机构 * Department of Computing Science, University of Alberta, Canada(计算科学系,阿尔伯塔大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出基于最大边际似然估计的MMPO方法,通过隐式偏好优化提升模型稳定性与对齐性能。

Comments EACL 2026, camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18009 2026-01-27 cs.IR 87%

Post-Training Denoising of User Profiles with LLMs in Collaborative Filtering Recommendation

利用LLM进行协同过滤推荐的用户资料后训练去噪

Ervin Dervishaj, Maria Maistro, Tuukka Ruotsalo, Christina Lioma

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 利用LLM对用户资料进行后训练去噪以提升协同过滤推荐效果

Comments Accepted at the 48th European Conference on Information Retrieval (ECIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18306 2026-01-27 cs.CL cs.AI 86%

Calibrating Beyond English: Language Diversity for Better Quantized Multilingual LLM

超越英语的校准:为更好的量化多语言大语言模型的语言多样性

Everlyn Asiko Chimoto, Mostafa Elhoushi, Bruce A. Bassett

机构 * Lelapa AI Cerebras Systems, Inc University of the Witwatersrand(乌得勒支大学) University of Cape Town(开普敦大学) South African Astronomical Observatory(南非天文台)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过多语言校准集提升多语言大语言模型的量化性能,发现非英语和多语言混合校准显著降低困惑度,强调语言对齐的重要性。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17329 2026-01-27 cs.LG cs.AI 81%

Conformal Feedback Alignment: Quantifying Answer-Level Reliability for Robust LLM Alignment

符合反馈对齐:量化答案级可靠性以实现鲁棒的大语言模型对齐

Tiejin Chen, Xiaoou Liu, Vishnu Nandam, Kuan-Ru Liou, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 后训练与偏好优化 :LLM(title);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 Conformal Feedback Alignment通过量化答案级可靠性提升大语言模型对齐的鲁棒性和数据效率。

Comments Accetped to Findings of EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17567 2026-01-27 cs.IR cs.AI 79%

Real-Time Trend Prediction via Continually-Aligned LLM Query Generation

通过持续对齐的LLM查询生成进行实时趋势预测

Zijing Hui, Wenhan Lyu, Shusen Wang, Li Chen, Chu Wang

机构 * Meta Platforms(Meta平台)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.AI

AI总结 RTTP通过持续对齐的LLM查询生成,在低流量搜索环境中实现实时趋势预测,显著提升尾部趋势检测精度和查询生成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22323 2026-01-27 cs.CL 77%

Advancing Expert Specialization for Better MoE

推动专家专业化以提升MoE

Hongcan Guo, Haolang Lu, Guoshun Nan, Bolun Chu, Jialin Zhuang, Yuan Yang, Wenhao Che, Xinye Cao, Sicong Leng, Qimei Cui, Xudong Jiang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出正交性损失和方差损失,提升MoE模型专家专业化,显著提高性能并保持负载平衡。

Comments 33pages, 6figures(Accepted by Neurips 2025 Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18760 2026-01-27 cs.LG cs.CL 73%

Beyond Preferences: Learning Alignment Principles Grounded in Human Reasons and Values

超越偏好:基于人类理由和价值观的学习对齐原则

Henry Bell, Lara Neubauer da Costa Schertel, Bochu Ding, Brandon Fain

机构 * Duke University(杜克大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出GCAI框架,通过结合人类理由和价值观生成AI对齐原则,提升AI治理的道德基础和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16944 2026-01-27 cs.LG cs.AI 73%

Pretrain Value, Not Reward: Decoupled Value Policy Optimization

预训练价值,而非奖励:解耦的价值策略优化

Chenghua Huang, Lu Wang, Fangkai Yang, Pu Zhao, Zhixu Li, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan, Qi Zhang

机构 * School of Computer Science, Fudan University(复旦大学计算机学院) Microsoft(微软公司)

专题命中 后训练与偏好优化 :pretraining(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了解耦的价值策略优化方法,通过预训练价值模型替代传统奖励模型,实现了更稳定高效的强化学习。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14175 2026-01-27 cs.CL cs.AI 73%

GRAM: A Generative Foundation Reward Model for Reward Generalization

GRAM:一种用于奖励泛化的大规模生成式奖励模型

Chenglong Wang, Yang Gan, Yifu Huo, Yongyu Mu, Qiaozhi He, Murun Yang, Bei Li, Tong Xiao, Chunliang Zhang, Tongran Liu, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) NiuTrans Research, Shenyang, China(NiuTrans研究) CAS Key Laboratory of Behavioral Science, Institute of Psychology, CAS, Beijing, China(中国科学院行为科学重点实验室) Meituan Inc.(美团公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GRAM提出了一种生成式奖励模型,通过结合无监督和监督学习,提升奖励模型在多种任务上的泛化能力,有效改进了基线模型的性能。

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16987 2026-01-27 cs.CL cs.AI 73%

Evaluating Reward Model Generalization via Pairwise Maximum Discrepancy Competitions

通过成对最大分歧竞赛评估奖励模型泛化能力

Shunyang Luo, Peibei Cao, Zhihui Zhu, Kehua Feng, Zhihua Wang, Keyan Ding

机构 * ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC研究院) School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学Hangzhou全球科技创新中心) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PMDC方法,通过动态选择高争议测试案例评估奖励模型的泛化能力,并揭示了现有模型的系统性泛化失败问题。

Comments 17 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17260 2026-01-27 cs.LG cs.AI 62%

The Viscosity of Logic: Phase Transitions and Hysteresis in DPO Alignment

逻辑的粘度:DPO对齐中的相变与滞后效应

Marco Pollanen

机构 * Department of Mathematics, Trent University, Peterborough, ON, Canada(数学系,特伦特大学,彼得伯勒,加拿大)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 研究发现DPO对齐中β参数的非单调性及滞后效应,揭示能力与边际的反相关性,推动能力解析评估方法的发展。

Comments 10 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17008 2026-01-27 cs.LG 57%

Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs

Turn-PPO:基于PPO的回合级优势估计以提升代理语言模型中的多回合强化学习

Junbo Li, Peng Zhou, Rui Meng, Meet P. Vadera, Lihong Li, Yang Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.LG

AI总结 本研究提出turn-PPO,通过回合级MDP公式化提升多回合强化学习在代理语言模型中的表现,验证其在WebShop和Sokoban数据集上的有效性。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏