arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-19 至 2026-02-19 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 2 篇

2602.16093 2026-02-19 cs.CL cs.AI 81%

Updating Parametric Knowledge with Context Distillation Retains Post-Training Capabilities

通过上下文蒸馏更新参数化知识可保留训练后能力

Shankar Padmanabhan, Mustafa Omer Gul, Tanya Goyal

机构 * Department of Computer Science, Cornell University(康奈尔大学计算机科学系)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DiSC方法,通过上下文蒸馏实现持续知识适应,有效平衡新知识学习与原有能力保持。

Comments 15 pages. Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03710 2026-02-19 cs.LG 57%

Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards

缩减方差:用于具有可验证奖励的强化学习的收缩基线

Guanning Zeng, Zhaoyi Zhou, Daman Arora, Andrea Zanette

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出了一种基于收缩估计的基线方法,用于改进具有可验证奖励的强化学习中策略梯度估计器的方差,通过结合每个提示和跨提示的均值来提高估计准确性。

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏