arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-20 至 2026-02-20 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2602.16833 2026-02-20 cs.LG cs.AI 88%

VAM: Verbalized Action Masking for Controllable Exploration in RL Post-Training -- A Chess Case Study

VAM:在RL后训练中可控探索的可言行动屏蔽——国际象棋案例研究

Zhicheng Zhang, Ziyan Wang, Yali Du, Fei Fang

机构 * Carnegie Mellon University(卡内基梅隆大学) King's College London(国王学院伦敦)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 VAM通过可言化动作屏蔽提升LLM后训练强化学习的探索效率,在国际象棋中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16802 2026-02-20 cs.CL cs.AI cs.LG 87%

References Improve LLM Alignment in Non-Verifiable Domains

参考文献提高非可验证领域的LLM对齐

Kejian Shi, Yixin Liu, Peifeng Wang, Alexander R. Fabbri, Shafiq Joty, Arman Cohan

机构 * Yale University(耶鲁大学) Meta Scale AI Salesforce Research(Salesforce 研究) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出参考引导的LLM评估器,通过增强LLM对齐的评估器和自我改进,显著提升了非可验证领域中LLM的性能。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16053 2026-02-20 cs.LG cs.CL 84%

Multi-Objective Alignment of Language Models for Personalized Psychotherapy

多目标对齐语言模型以实现个性化心理治疗

Mehrab Beikzadeh, Yasaman Asadollah Salmanpour, Ashima Suvarna, Sriram Sankararaman, Matteo Malgaroli, Majid Sarrafzadeh, Saadia Gabriel

机构 * Department of Computer Science, University of California, Los Angeles, CA, USA(计算机科学系,加州大学洛杉矶分校) Department of Psychology, The University of Texas at Austin, Austin, TX, USA(心理学系,德克萨斯大学奥斯汀分校) Department of Psychiatry, NYU Grossman School of Medicine, New York, NY, USA(精神病学系,纽约大学格罗斯曼医学院)

专题命中 后训练与偏好优化 :language model(title);LLM(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文提出多目标对齐框架,通过直接偏好优化提升语言模型在心理治疗中的共情与安全性能,实验显示其在平衡患者偏好与临床安全方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00040 2026-02-20 cs.LG cs.AI 84%

Semi-Supervised Preference Optimization with Limited Feedback

半监督偏好优化与有限反馈

Seonggyun Lee, Sungjun Lim, Seojin Park, Soeun Cheon, Kyungwoo Song

机构 * Yonsei University(延世大学) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出半监督偏好优化方法,通过结合少量标注数据和大量未标注数据,有效提升模型对齐人类偏好的效率,减少数据获取成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14762 2026-02-20 cs.LG cs.CV 83%

Unlocking [CLS] Features for Continual Post-Training

解锁[CLS]特征以实现持续微调

Murat Onur Yildirim, Elif Ceren Gok Yildirim, Joaquin Vanschoren

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出TOSCA方法,通过在[CLS]标记上部署稀疏LuCA模块,实现持续学习中稳定性与可塑性的平衡,减少参数量并提升性能。

Comments Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17338 2026-02-20 cs.AI cs.LG stat.ML 73%

Capturing Individual Human Preferences with Reward Features

通过奖励特征捕捉个体人类偏好

André Barreto, Vincent Dumoulin, Yiran Mao, Mark Rowland, Nicolas Perez-Nieves, Bobak Shahriari, Yann Dauphin, Doina Precup, Hugo Larochelle

机构 * Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过奖励特征捕捉个体偏好,提出自适应奖励模型架构,展示其在不同用户偏好下的有效性。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17025 2026-02-20 cs.LG 57%

WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning

WS-GRPO:弱监督组相对策略优化用于高效推理

Gagan Mundada, Zihan Huang, Rohan Surana, Sheldon Yu, Jennifer Yuntong Zhang, Xintong Li, Tong Yu, Lina Yao, Jingbo Shang, Julian McAuley, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Toronto(多伦多大学) Adobe Research(Adobe研究) The University of New South Wales(新南威尔士大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 WS-GRPO 通过将终端奖励转换为正确性感知的指导,提高推理效率并减少冗余思考,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06355 2026-02-20 cs.CV cs.AI 57%

Di3PO - Diptych Diffusion DPO for Targeted Improvements in Image Generation

Di3PO - Diptych Diffusion DPO用于图像生成的针对性改进

Sanjana Reddy, Ishaan Malhi, Sally Ma, Praneet Dutta

机构 * Google(谷歌) DeepMind

专题命中 后训练与偏好优化 :SFT(abstract);分类 cs.AI

AI总结 Di3PO通过针对性改进图像生成中的特定区域,提升扩散模型的文本渲染性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16987 2026-02-20 cs.CY 50%

A testable framework for AI alignment: Simulation Theology as an engineered worldview for silicon-based agents

一种可测试的AI对齐框架:模拟神学作为硅基智能体的工程世界观

Josef A. Habdank

专题命中 后训练与偏好优化 :RLHF(abstract)

AI总结 本文提出模拟神学作为可测试的AI对齐框架,通过内化目标减少欺骗行为,促进AI与人类的可持续共存。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏