arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-09 至 2026-01-09 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 15 篇

2601.05075 2026-01-09 cs.CL 89%

SemPA: Improving Sentence Embeddings of Large Language Models through Semantic Preference Alignment

SemPA:通过语义偏好对齐提升大语言模型的句子嵌入

Ziyang Chen, Zhenxuan Huang, Yile Wang, Weiqin Wang, Lu Yin, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computer Science and Electronic Engineering, University of Surrey(Surrey大学计算机科学与电子工程学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 SemPA通过语义偏好对齐提升大语言模型的句子嵌入能力,同时保持其生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04670 2026-01-09 cs.LG 88%

Learning Dynamics in RL Post-Training for Language Models

在语言模型中学习动态的强化学习后训练

Akiyoshi Tomihari

机构 * Department of Computer Science, The University of Tokyo(东京大学计算机科学系)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 本文提出分类器优先强化学习(CF-RL),通过优先更新分类器来提升语言模型的对齐性和推理能力,揭示了RL后训练中学习动态的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02393 2026-01-09 cs.SE 88%

AP2O-Coder: Adaptively Progressive Preference Optimization for Reducing Compilation and Runtime Errors in LLM-Generated Code

AP2O-Coder: 适应性渐进偏好优化用于减少LLM生成代码的编译和运行时错误

Jianqing Zhang, Wei Xia, Hande Dong, Qiang Lin, Jian Cao

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract)

AI总结 AP2O-Coder通过适应性渐进偏好优化方法,减少LLM生成代码的编译和运行时错误,提升代码生成性能。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04694 2026-01-09 cs.AI 85%

ResMAS: Resilience Optimization in LLM-based Multi-agent Systems

ResMAS: LLM-based多智能体系统中的韧性优化

Zhilun Zhou, Zihan Liu, Jiahe Liu, Qingyu Shao, Yihan Wang, Kun Shao, Depeng Jin, Fengli Xu

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ResMAS通过两阶段框架提升LLM-based MAS的韧性,结合奖励模型与拓扑生成器优化拓扑和提示设计,增强系统在扰动下的稳定性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06568 2026-01-09 cs.LG cs.AI stat.ML 84%

Meta-Learning Objectives for Preference Optimization

元学习目标用于偏好优化

Carlo Alfano, Silvia Sapora, Jakob Nicolaus Foerster, Patrick Rebeschini, Yee Whye Teh

机构 * Department of Statistics University of Oxford(统计系牛津大学) Department of Engineering University of Oxford(工程系牛津大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于镜像下降的新型偏好优化算法MPO,通过进化策略发现针对特定偏好数据集属性的算法,并在MuJoCo和大语言模型对齐任务中取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21830 2026-01-09 cs.LG cs.AI 79%

GAPO: Robust Advantage Estimation for Real-World Code LLMs

GAPO:面向现实世界代码LLM的鲁棒优势估计

Jianqing Zhang, Zhezheng Hao, Wei Xia, Hande Dong, Hong Wang, Chenxing Wei, Yuyan Zhou, Yubin Qi, Qiang Lin, Jian Cao

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) Zhejiang University(浙江大学) Shenzhen University(深圳大学) Peking University(北京大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 GAPO通过自适应Q机制提升代码编辑LLM的鲁棒性,实现领域内和领域外精确匹配的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04736 2026-01-09 cs.CL 77%

AM$^3$Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs

AM$^3$Safety: 向多模态多轮安全对齐的数据高效方法

Han Zhu, Jiale Chen, Chengkun Cai, Shengjie Sun, Haoran Li, Yujin Zhou, Chi-Min Chan, Pengcheng Wen, Lei Li, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Zhongshan School of Medicine, SUN YAT-SEN UNIVERSITY(中山医学院,孙中山大学) University of Edinburgh(爱丁堡大学) University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

AI总结 AM$^3$Safety通过结合冷启动拒绝阶段和组相对策略优化,有效提升多模态多轮对话的安全性,降低攻击成功率并增强模型的无害与帮助维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04277 2026-01-09 cs.LG 77%

Unlocking the Pre-Trained Model as a Dual-Alignment Calibrator for Post-Trained LLMs

解封预训练模型作为后训练LLMs的双对齐校准器

Beier Luo, Cheng Wang, Hongxin Wei, Sharon Li, Xuefeng Du

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) School of Computing, National University of Singapore(计算学院,新加坡国立大学) Department of Computer Sciences, University of Wisconsin-Madison(计算机科学系,威斯康星大学麦迪逊分校) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出Dual-Align方法,通过双对齐策略校正后训练LLMs的置信度漂移和过程漂移,提升校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05002 2026-01-09 cs.LG cs.AI cs.CL 75%

On the Hidden Objective Biases of Group-based Reinforcement Learning

基于群体的强化学习中的隐藏目标偏差

Aleksandar Fontana, Marco Simoni, Giulio Rossolini, Andrea Saracino, Paolo Mori

机构 * Department of Excellence in Robotics and AI, TeCIP, Scuola Superiore Sant’Anna(机器人与人工智能卓越部门、TeCIP、圣安娜高等学院) Institute of Informatics and Telematics, National Research Council of Italy(信息与电信研究所、意大利国家研究委员会) National Doctorate on Artificial Intelligence, Sapienza Università di Roma(人工智能国家博士项目、萨皮恩扎罗马大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文分析了基于群体的强化学习方法中的隐藏目标偏差,揭示了非均匀群体加权、AdamW优化器影响及动量对策略更新的影响,为未来方法设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04656 2026-01-09 cs.SD 75%

FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions

FlexiVoice: 通过自然语言指令实现零样本语音合成的灵活风格控制

Dekun Chen, Xueyao Zhang, Yuancheng Wang, Kenan Dai, Li Ma, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);preference optimization(abstract)

AI总结 FlexiVoice通过自然语言指令实现零样本语音合成的灵活风格控制,结合LLM核心和PPT方案,实现风格与音色的精准解耦与可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04767 2026-01-09 cs.AI cs.CL 73%

AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search

AT$^2$PO: 通过树搜索实现基于回合的代理策略优化

Zefang Zong, Dingwei Chen, Yang Li, Qi Yi, Bo Zhou, Chengming Li, Bo Qian, Peng Chen, Jie Jiang

机构 * Tencent Inc(腾讯公司) Sun Yat-Sen University(中山大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 AT$^2$PO 通过树搜索实现多轮代理强化学习,解决探索多样性、奖励分配和策略优化不一致问题,提升性能达1.84个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05242 2026-01-09 cs.CL cs.AI cs.LG 67%

GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

GDPO:多奖励强化学习优化中的组奖励解耦归一化策略优化

Shih-Yang Liu, Xin Dong, Ximing Lu, Shizhe Diao, Peter Belcak, Mingjie Liu, Min-Hung Chen, Hongxu Yin, Yu-Chiang Frank Wang, Kwang-Ting Cheng, Yejin Choi, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GDPO通过解耦奖励归一化提升多奖励强化学习优化的稳定性和准确性,优于GRPO。

Comments NVIDIA-Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04411 2026-01-09 cs.LG cs.AI cs.CL 67%

Rate or Fate? RLV$^\varepsilon$R: Reinforcement Learning with Verifiable Noisy Rewards

速率还是命运?RLV$^\varepsilon$R:具有可验证噪声奖励的强化学习

Ali Rad, Khashayar Filom, Darioush Keivan, Peyman Mohajerin Esfahani, Ehsan Kamalinejad

机构 * Cognichip AI University of Toronto(多伦多大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLV$^\varepsilon$R框架,通过分析验证噪声对强化学习的影响,揭示了噪声如何影响学习速率与命运,并通过实验验证了在不同Youden指数下动态变化的相变特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04300 2026-01-09 cs.CV 67%

Beyond Binary Preference: Aligning Diffusion Models to Fine-grained Criteria by Decoupling Attributes

超越二元偏好:通过解耦属性对齐扩散模型以实现细粒度标准

Chenye Meng, Zejian Li, Zhongni Liu, Yize Li, Changle Xie, Kaixin Jia, Ling Yang, Huanghuang Deng, Shiying Ding, Shengyuan Zhang, Jiayi Li, Lingyun Sun

机构 * Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学) University of Nottingham Ningbo China(诺丁汉大学宁波分校)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract)

AI总结 本文提出CPO方法,通过解耦属性实现扩散模型对细粒度标准的对齐,提升生成质量与专业对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00675 2026-01-09 cs.RO 50%

RoboReward: General-Purpose Vision-Language Reward Models for Robotics

RoboReward: 通用视觉-语言奖励模型用于机器人学

Tony Lee, Andrew Wagenmaker, Karl Pertsch, Percy Liang, Sergey Levine, Chelsea Finn

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 RoboReward通过构建机器人奖励数据集和基准,训练视觉-语言奖励模型,验证了其在机器人学习中的有效性,并展示了改进策略学习和缩小与人工奖励差距的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏