arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-07 至 2026-01-07 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 7 篇

2601.02764 2026-01-07 cs.IR cs.AI 89%

Netflix Artwork Personalization via LLM Post-training

通过LLM后训练实现Netflix作品个性化

Hyunji Nam, Sejoon Oh, Emma Kong, Yesu Feng, Moumita Bhattacharya

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 通过LLM后训练实现Netflix作品个性化推荐,提升用户满意度和参与度。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22234 2026-01-07 cs.LG cs.AI 88%

DiRL: An Efficient Post-Training Framework for Diffusion Language Models

DiRL:一种高效的扩散语言模型后训练框架

Ying Zhu, Jiaxin Wan, Xiaoran Liu, Siyang He, Qiqi Wang, Xu Guo, Tianyi Liang, Zengfeng Huang, Ziwei He, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) OpenMoss Team(OpenMoss团队)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 DiRL是一种高效的扩散语言模型后训练框架,通过整合FlexAttention加速的分块训练与LMDeploy优化的推理,实现了高效的两阶段后训练,提升了在复杂推理任务如数学中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02648 2026-01-07 cs.LG cs.AI cs.CL 87%

Prioritized Replay for RL Post-training

训练后强化学习的优先级回放

Mehdi Fatemi

机构 * IEEE

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于经验成功统计的优先级回放方法,用于大型语言模型训练后强化学习,无需预定义难度层级或外部标签,通过动态调整优先级提升学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07723 2026-01-07 cs.AI cs.CL cs.LG 85%

Stable Preference Optimization: A Bilevel Approach to Catastrophic Preference Shift

稳定偏好优化:一种针对灾难性偏好转移的双层方法

Chengtao Jian, Kai Yang, Tianhao Gao, Wuguang Ni, Keying Yang, Bowen Xiao, Jiajun Liu, Ye Ouyang

机构 * Tongji University(同济大学) AsiaInfo Technologies(亚洲信息科技)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出稳定偏好优化框架,通过约束偏好学习在安全对齐区域,解决灾难性偏好转移问题,提升偏好学习方法的稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03044 2026-01-07 cs.RO 78%

SOP: A Scalable Online Post-Training System for Vision-Language-Action Models

SOP:一种可扩展的在线后训练系统用于视觉-语言-动作模型

Mingjie Pan, Siyuan Feng, Qinglin Zhang, Xinchen Li, Jianheng Song, Chendi Qu, Yi Wang, Chuankang Li, Ziyu Xiong, Zhi Chen, Yi Liu, Jianlan Luo

机构 * Agibot Research(Agibot研究机构) Shanghai Innovation Institute(上海创新研究院)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 SOP系统通过在线分布式后训练提升视觉-语言-动作模型在现实世界中的性能,实现高效可靠的多任务适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02900 2026-01-07 cs.SD eess.AS 78%

SPO-CLAPScore: Enhancing CLAP-based alignment prediction system with Standardize Preference Optimization, for the first XACLE Challenge

SPO-CLAPScore: 通过标准化偏好优化提升基于CLAP的对齐预测系统,用于首次XACLE挑战

Taisei Takano, Ryoya Yoshida

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 本文提出SPO-CLAPScore方法,通过标准化偏好优化和听众筛选提升基于CLAP的音频-文本对齐预测性能,在XACLE挑战中取得第六名。

Comments https://github.com/ttakano398/SPO-CLAPScore

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10071 2026-01-07 cs.RO 67%

Openpi Comet: Competition Solution For 2025 BEHAVIOR Challenge

Openpi Comet: 2025 BEHAVIOR挑战的竞赛解决方案

Junjie Bai, Yu-Wei Chao, Qizhi Chen, Jinwei Gu, Moo Jin Kim, Zhaoshuo Li, Xuan Li, Tsung-Yi Lin, Ming-Yu Liu, Nic Ma, Kaichun Mo, Delin Qu, Shangkun Sun, Hongchi Xia, Fangyin Wei, Xiaohui Zeng

机构 * Openpi Comet

专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract)

AI总结 Openpi Comet通过系统构建方法,在2025 BEHAVIOR挑战中取得优异成绩,展示了在长期移动操作任务中的高效解决方案

Comments Post-challenge bug fix

详情

展开后加载摘要…

URL PDF HTML 收藏