arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-12 至 2026-02-12 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 7 篇

2602.09621 2026-02-12 cs.CL cs.LG 93%

AlignTune: Modular Toolkit for Post-Training Alignment of Large Language Models

AlignTune: 大型语言模型后训练对齐的模块化工具包

R E Zera Marveen Lyngkhoi, Chirag Chawla, Pratinav Seth, Utsav Avaiya, Soham Bhattacharjee, Mykola Khandoga, Rui Yuan, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);SFT(abstract)

AI总结 AlignTune通过模块化工具包提供统一接口,支持监督微调和RLHF优化,解决后端干扰和不可复现问题,提升对齐研究的可控性和复现性。

Comments Library opensource and available at https://github.com/Lexsi-Labs/aligntune

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10986 2026-02-12 cs.LG 88%

TVCACHE: A Stateful Tool-Value Cache for Post-Training LLM Agents

TVCACHE: 一种具有状态的工具-价值缓存用于训练后LLM代理

Abhishek Vijaya Kumar, Bhaskar Kataria, Byungsoo Oh, Emaad Manzoor, Rachee Singh

机构 * cornell(康奈尔大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 TVCACHE通过维护工具调用序列树和最长前缀匹配,实现LLM代理训练后的高效缓存,提高缓存命中率并减少工具调用时间。

Comments Abhishek Vijaya Kumar and Bhaskar Kataria have equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10583 2026-02-12 cs.AI 79%

Flow of Spans: Generalizing Language Models to Dynamic Span-Vocabulary via GFlowNets

动态跨度的流动:通过GFlowNets泛化语言模型到动态跨度词典

Bo Xue, Yunchong Song, Fanghao Shao, Xuekai Zhu, Lin Chen, Luoyi Fu, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI

AI总结 本文提出FOSS,一种基于GFlowNets的跨度生成框架,通过动态跨度词典和DAG结构状态空间提升语言模型的生成能力与泛化性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05188 2026-02-12 cs.CL cs.AI 79%

Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling

修复破碎的指南针:诊断并改进推理时间奖励建模

Jiachun Li, Pengfei Cao, Zhuoran Jin, Yubo Chen, Jiexin Xu, Huaijun Li, Xiaojian Jiang, Kang Liu, Jun Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) China Merchants Bank(中国 Merchants 银行)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CRISP算法,通过聚类和逐步前缀优化,提升LLM在推理任务中的性能,实现5%的准确率提升。

Comments 38 pages, 30 figures, Accpeted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11128 2026-02-12 cs.LG 77%

Asymmetric Prompt Weighting for Reinforcement Learning with Verifiable Rewards

可验证奖励下的强化学习中不对称提示加权

Reinhard Heckel, Mahdi Soltanolkotabi, Christos Thramboulidis

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);SFT(abstract);分类 cs.LG

AI总结 本文提出不对称提示加权方法,用于提升可验证奖励强化学习中低成功率提示的训练效率,尤其在从头开始的强化学习中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10418 2026-02-12 cs.CR cs.SE 75%

SecCodePRM: A Process Reward Model for Code Security

SecCodePRM: 一种用于代码安全的过程奖励模型

Weichen Yu, Ravi Mangal, Yinyi Luo, Kai Hu, Jingxuan He, Corina S. Pasareanu, Matt Fredrikson

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SecCodePRM通过一种面向安全的过程奖励模型,提升代码安全性和检测效率,适用于完整代码漏洞检测、部分代码漏洞检测和安全代码生成。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17247 2026-02-12 cs.CL cs.CV 57%

From Preferences to Prejudice: The Role of Alignment Tuning in Shaping Social Bias in Video Diffusion Models

从偏好到偏见:对齐调谐在视频扩散模型中塑造社会偏见的作用

Zefan Cai, Haoyi Qiu, Haozhe Zhao, Ke Wan, Jiachen Li, Jiuxiang Gu, Wen Xiao, Nanyun Peng, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) Microsoft(微软公司)

专题命中 后训练与偏好优化 :prompting(abstract);分类 cs.CL

AI总结 本文研究了对齐调谐在视频扩散模型中如何塑造社会偏见,提出VideoBiasEval框架以评估和缓解偏见,揭示了对齐调谐使偏见更稳定且刻板化的现象。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏