arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-21 至 2026-01-21 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 15 篇

2509.04419 2026-01-21 cs.LG cs.AI cs.CL 92%

Towards a Unified View of Large Language Model Post-Training

迈向大规模语言模型后训练的统一视角

Xingtai Lv, Yuxin Zuo, Youbang Sun, Hongyi Liu, Yuntian Wei, Zhekai Chen, Xuekai Zhu, Kaiyan Zhang, Bingning Wang, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) WeChat AI Code(微信AI代码)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);large language model(title);SFT(abstract)

AI总结 本文提出混合后训练算法,通过统一的优化过程整合在线与离线数据,实现稳定探索与有效利用演示,提升大规模语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13806 2026-01-21 cs.CL cs.LG 91%

Knowledge Graph-Assisted LLM Post-Training for Enhanced Legal Reasoning

基于知识图谱的LLM后训练以增强法律推理

Dezhao Song, Guglielmo Bonifazi, Frank Schilder, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) Imperial College London(帝国理工学院伦敦分校)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);SFT(abstract);preference optimization(abstract)

AI总结 本文提出基于知识图谱的LLM后训练方法,通过构建法律知识图谱提升法律推理能力,在多个基准测试中优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06147 2026-01-21 cs.AI cs.CL 91%

DeAL: Decoding-time Alignment for Large Language Models

DeAL:大型语言模型的解码时间对齐

James Y. Huang, Sailik Sengupta, Daniele Bonadiman, Yi-An Lai, Arshit Gupta, Nikolaos Pappas, Saab Mansour, Katrin Kirchhoff, Dan Roth

机构 * University of Southern California(南加州大学) Ω WS AI Labs(Ω WS AI实验室)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);prompting(abstract)

AI总结 DeAL通过允许用户自定义奖励函数和实现解码时间对齐,改进了大型语言模型对齐目标的实现。

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11574 2026-01-21 cs.LG cs.AI 88%

GRADE: Replacing Policy Gradients with Backpropagation for LLM Alignment

GRADE: 用反向传播替代策略梯度以实现大语言模型对齐

Lukas Abrie Nel

机构 * Lotus Health AI(Lotus健康AI)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 GRADE通过可微松弛的离散令牌采样过程替代策略梯度,实现大语言模型对齐的更稳定和高效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06092 2026-01-21 cs.LG cs.CL 88%

Learning from Failures: Understanding LLM Alignment through Failure-Aware Inverse RL

从失败中学习:通过失败意识反向强化学习理解LLM对齐

Nyal Patel, Matthieu Bou, Arjun Jagota, Satyapriya Krishna, Sonali Parbhoo

机构 * Imperial College London(帝国理工学院伦敦分校) Amazon AGI(亚马逊人工智能实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出一种失败意识反向强化学习算法,通过聚焦于误分类或困难的例子来提取更准确的奖励函数,从而提升LLM对齐的可解释性和安全性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04700 2026-01-21 cs.CL 85%

PRISM: A Unified Framework for Post-Training LLMs Without Verifiable Rewards

PRISM: 一种无需可验证奖励的统一后训练LLM框架

Mukesh Ghimire, Aosong Feng, Liwen You, Youzhi Luo, Fang Liu, Xuan Zhu

机构 * Arizona State University(亚利桑那州立大学) Amazon Web Services(亚马逊网络服务)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PRISM通过结合过程奖励模型与自我确定性,实现无需真实标签的稳定训练和提升LLM测试性能。

Comments Added open-sourced github url

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09212 2026-01-21 cs.CL 85%

Targeting Misalignment: A Conflict-Aware Framework for Reward-Model-based LLM Alignment

针对对齐偏差:一种基于冲突意识的奖励模型驱动LLM对齐框架

Zixuan Liu, Siavash H. Khajavi, Guangkai Jiang, Xinru Liu

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于冲突意识的框架,通过识别和缓解代理模型与策略间的冲突来提升大语言模型的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12748 2026-01-21 cs.CL 77%

Towards Robust Process Reward Modeling via Noise-aware Learning

通过噪声感知学习实现鲁棒的过程奖励建模

Bin Xie, Bingbing Xu, Xueyun Tian, Yilin Chen, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出噪声感知迭代训练框架,通过两阶段方法缓解噪声监督问题,提升过程奖励模型的步骤正确性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16899 2026-01-21 cs.CL cs.CV 77%

Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image

多模态奖励基准2:评估多模态奖励模型用于交错文本和图像

Yushi Hu, Reyhane Askari-Hemmat, Melissa Hall, Emily Dinan, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta Superintelligence Labs(Meta超智能实验室的FAIR)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 多模态奖励基准2评估多模态奖励模型在交错文本和图像任务中的性能,通过专家标注数据和先进模型对比,揭示了不同模型在多模态理解与生成任务中的准确率差异。

Comments Code and data available at https://github.com/facebookresearch/MMRB2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12294 2026-01-21 cs.AI cs.SE 77%

ToolPRMBench: Evaluating and Advancing Process Reward Models for Tool-using Agents

ToolPRMBench: 评估和推进用于工具使用智能体的过程奖励模型

Dawei Li, Yuguang Yao, Zhen Tan, Huan Liu, Ruocheng Guo

机构 * Arizona State University(亚利桑那州立大学) Intuit AI Research(Intuit人工智能研究)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ToolPRMBench通过构建大规模基准评估工具使用智能体的过程奖励模型,揭示PRM有效性差异并展示专用PRMs的潜力。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12758 2026-01-21 cs.CL cs.AI cs.LG 75%

VISPA: Pluralistic Alignment via Automatic Value Selection and Activation

VISPA:通过自动价值选择和激活实现多元对齐

Shenyan Zheng, Jiayou Zhong, Anudeex Shetty, Heng Ji, Preslav Nakov, Usman Naseem

机构 * University of Waterloo(滑铁卢大学) University of Melbourne(墨尔本大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MBZUAI(马克斯·普朗克智能系统研究所) Macquarie University(麦考瑞大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VISPA通过自动价值选择和激活实现多元对齐,适用于多种模型和场景,提供了一种可扩展的语言模型对齐方法。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09929 2026-01-21 eess.AS cs.AI cs.LG 73%

Aligning Generative Speech Enhancement with Perceptual Feedback

将生成式语音增强与感知反馈对齐

Haoyang Li, Nana Hou, Yuchen Hu, Jixun Yao, Sabato Marco Siniscalchi, Xuyi Zhuang, Deheng Ye, Wei Yang, Eng Siong Chng

机构 * Nanyang Technological University, Singapore(南洋理工大学) Independent Researcher(独立研究者) Northwestern Polytechnical University, China(西北工业大学) University of Palermo, Italy(巴勒莫大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于语言模型的语音增强方法,通过引入感知反馈和直接偏好优化,提升语音质量并建立新的感知对齐增强范式。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12730 2026-01-21 cs.LG 70%

Distribution-Centric Policy Optimization Dominates Exploration-Exploitation Trade-off

以分布为中心的策略优化主导探索-利用权衡

Zhaochun Li, Chen Wang, Jionghao Bai, Shisheng Cui, Ge Lan, Zhou Zhao, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) School of Automation , Beijing Institute of Technology(北京理工大学自动化学院) College of Computer Science(计算机科学学院) Technology, Zhejiang University(浙江大学技术学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DCPO,通过分布层面的正则化实现可控探索,改进了探索-利用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05197 2026-01-21 cs.CL cs.LG 62%

Pre-Trained Policy Discriminators are General Reward Models

预训练策略判别器是通用奖励模型

Shihan Dou, Shichun Liu, Yuming Yang, Yicheng Zou, Yunhua Zhou, Shuhao Xing, Chenhao Huang, Qiming Ge, Demin Song, Haijun Lv, Songyang Gao, Chengqi Lv, Enyu Zhou, Honglin Guo, Zhiheng Xi, Wenwei Zhang, Qipeng Guo, Qi Zhang, Xipeng Qiu, Xuanjing Huang, Tao Gui, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 POLAR通过策略判别器方法构建通用奖励模型,显著提升奖励建模性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10599 2026-01-21 cs.CY 50%

Institutional AI: A Governance Framework for Distributional AGI Safety

机构AI:分布式AGI安全的治理框架

Federico Pierucci, Marcello Galisai, Marcantonio Syrnikov Bracale, Matteo Prandi, Piercosma Bisconti, Francesco Giarrusso, Olga Sorokoletova, Vincenzo Suriani, Daniele Nardi

专题命中 后训练与偏好优化 :LLM(abstract)

AI总结 机构AI通过治理框架解决分布式AGI安全问题,将对齐视为治理机制设计问题,通过运行时监控、激励塑造和规范执行来约束代理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏