arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-19 至 2025-12-19 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2505.11711 2025-12-19 cs.LG 88%

Reinforcement Learning Finetunes Small Subnetworks in Large Language Models

强化学习在大型语言模型中微调小型子网络

Sagnik Mukherjee, Lifan Yuan, Dilek Hakkani-Tur, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 强化学习在大型语言模型中通过微调小型子网络显著提升性能,且该子网络更新稀疏性源于数据分布和正则化技术的影响。

Comments NeuRIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16626 2025-12-19 cs.LG cs.AI cs.GT cs.MA stat.ML 88%

Stackelberg Learning from Human Feedback: Preference Optimization as a Sequential Game

基于人类反馈的Stackelberg学习:偏好优化作为连续博弈

Barna Pásztor, Thomas Kleine Buening, Andreas Krause

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 SLHF通过连续博弈框架实现偏好优化,优于RLHF和NLHF,在一致性、数据敏感性和鲁棒性方面具有优势,并在大规模语言模型中展示出强对齐能力。

Comments 10 pages, 5 tables, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04070 2025-12-19 cs.CL cs.MM 87%

LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward

LaF-GRPO:通过GRPO与LLM-as-Follower生成视障人士的现场导航指令

Yi Zhao, Siqi Wang, Jing Li

专题命中 后训练与偏好优化 :LLM(title,abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 LaF-GRPO通过GRPO与LLM-as-Follower生成更直观安全的视障人士现场导航指令,提升指令准确性和实用性。

Comments Accepted at AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16565 2025-12-19 math.OC cs.LG 77%

Non-Asymptotic Global Convergence of PPO-Clip

PPO-Clip算法的非渐近全局收敛性

Yin Liu, Qiming Dai, Junyu Zhang, Zaiwen Wen

机构 * Beijing International Center for Mathematical Research, Peking University(北京国际数学研究中心,北京大学) School of Mathematical Sciences, Peking University(北京大学数学学院) Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Beijing International Center for Mathematical Research and Center for Machine Learning Research, Peking University(北京国际数学研究中心和机器学习研究中心,北京大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文研究了PPO-Clip算法的非渐近全局收敛性,通过理论分析建立了前向KL正则化器的线性收敛率及反向KL正则化器的静止收敛与局部线性收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09670 2025-12-19 cs.AI 70%

MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement

MEML-GRPO:异构多专家互学习用于强化学习可验证奖励的进步

Weitao Jia, Jinghui Lu, Haiyang Yu, Siqi Wang, Guozhi Tang, An-Lan Wang, Weijie Yin, Dingkang Yang, Yuxiang Nie, Bin Shan, Hao Feng, Irene Li, Kun Yang, Han Wang, Jingqun Tang, Teng Fu, Changhong Jin, Chao Feng, Xiaohui Lv, Can Huang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MEML-GRPO通过异构多专家互学习机制,提升RLVR在复杂任务中的推理能力,实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08697 2025-12-19 cs.SE cs.AI cs.CL 62%

BigCodeArena: Unveiling More Reliable Human Preferences in Code Generation via Execution

BigCodeArena: 通过执行揭示更多可靠的代码生成人类偏好

Terry Yue Zhuo, Xiaolong Jin, Hange Liu, Juyong Jiang, Tianyang Liu, Chen Gong, Bhupesh Bishnoi, Vaisakhi Mishra, Marek Suppa, Noah Ziems, Saiteja Utpala, Ming Xu, Guangyu Song, Kaixin Li, Yuhan Cao, Bo Liu, Zheng Liu, Sabina Abdurakhmanova, Wenhao Yu, Mengzhao Jia, Jihan Yao, Kenneth Hamilton, Kumar Shridhar, Minh Chien Vu, Dingmin Wang, Jiawei Liu, Zijian Wang, Qian Liu, Binyuan Hui, Meg Risdal, Ahsen Khaliq, Atin Sood, Zhenchang Xing, Wasi Uddin Ahmad, John Grundy, David Lo, Banghua Zhu, Xiaoning Du, Torsten Scholak, Leandro von Werra

机构 * Monash University(墨尔本大学) CSIRO’s Data61(CSIRO的数据61) Purdue University(普渡大学) Independent(独立) HKUST (Guangzhou)(香港科技大学(广州)) UCSD(加州大学圣地亚哥分校) UVA(弗吉尼亚大学) CNRS, France(法国国家科学研究中心) IBM Cisco(思科) Comenius University in Bratislava(布拉提斯拉瓦康门纽斯大学) University of Notre Dame(Notre Dame大学) Uber Tano Labs(Tano实验室) NUS(国立大学新加坡) Institute of Automation, CAS(中国科学院自动化研究所) Tencent AI Lab(腾讯AI实验室) University of Washington(华盛顿大学) Nevsky Collective(Nevsky集体) ETH Zurich(苏黎世联邦理工学院) Detomo Inc(Detomo公司) University of Oxford(牛津大学) UIUC(伊利诺伊大学香槟分校) Google(谷歌) NVIDIA Singapore Management University(新加坡管理学院) ServiceNow Research(ServiceNow研究) Hugging Face

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 BigCodeArena通过执行揭示更多可靠的代码生成人类偏好,提出自动评分基准评估LLM编码质量。

Comments Built with love by the BigCode community :)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12767 2025-12-19 q-bio.NC cond-mat.dis-nn cs.LG hep-th math.PR 57%

Random matrix theory of sparse neuronal networks with heterogeneous timescales

稀疏神经网络的随机矩阵理论:具有异质时间尺度的神经网络

Thiparat Chotibut, Oleg Evnin, Weerawit Horinouchi

机构 * Complex Systems, Department of Physics, Faculty of Science, Chulalongkorn University, Bangkok, Thailand High Energy Physics Research Unit, Faculty of Science, Chulalongkorn University, Bangkok, Thailand International Solvay Institutes, Brussels, Belgium Mark Kac Center for Complex Systems Research, Jagiellonian University, Krak\'ow, Poland Department of Mathematics, King's College London, London, UK

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 研究通过随机矩阵理论分析稀疏神经网络的动态特性,揭示了异质时间尺度对工作记忆计算稳定性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16906 2025-12-19 cs.CV 50%

VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization

VIVA: 基于VLM的指令式视频编辑与奖励优化

Xiaoyan Cong, Haotian Yang, Angtian Wang, Yizhi Wang, Yiding Yang, Canyu Zhang, Chongyang Ma

机构 * Brown University(布朗大学) Intelligent Creation, ByteDance(字节跳动智能创作)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 VIVA通过VLM引导编码和奖励优化,实现更高效、高质量的指令式视频编辑,提升对复杂指令的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16741 2025-12-19 cs.SE 50%

An Empirical Study of the Realism of Mutants in Deep Learning

深度学习中突变体真实性的实证研究

Zaheed Ahmed, Philip Makedonski, Jens Grabowski

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本研究通过实证分析比较深度学习中预训练与后训练突变方法的真实性,发现预训练突变体在耦合强度和行为相似性上更优,但其高计算成本促使需开发更高效的后训练操作符。

详情

展开后加载摘要…

URL PDF HTML 收藏