arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-08 至 2026-01-08 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 6 篇

2601.03781 2026-01-08 cs.CV 89%

MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction

MVP: 通过自监督掩码视频预测增强视频大型语言模型

Xiaokun Sun, Zezhong Wu, Zewen Ding, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 MVP通过自监督掩码视频预测提升视频大语言模型的时间推理和因果理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11963 2026-01-08 cs.CL 88%

ToolRM: Outcome Reward Models for Tool-Calling Large Language Models

ToolRM: 用于工具调用大型语言模型的成果奖励模型

Mayank Agarwal, Ibrahim Abdelaziz, Kinjal Basu, Merve Unuvar, Luis A. Lastras, Yara Rizk, Pavan Kapanipathi

机构 * IBM Research(IBM研究院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 ToolRM通过领域特定建模提升工具调用奖励模型性能,实现25%的改进并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03661 2026-01-08 cs.LG cs.AI 79%

AMIR-GRPO: Inducing Implicit Preference Signals into GRPO

AMIR-GRPO:将隐式偏好信号引入GRPO

Amir Hossein Yari, Fajri Koto

机构 * Department of Natural Language Processing, MBZUAI(自然语言处理系,MBZUAI)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 AMIR-GRPO通过隐式对比正则化器提升GRPO性能,增强低奖励轨迹抑制,减少长度偏差,实现更密集的监督约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03608 2026-01-08 cs.IR cs.LG 77%

Shielded RecRL: Explanation Generation for Recommender Systems without Ranking Degradation

屏蔽的推荐强化学习:无需降级的推荐系统解释生成

Ansh Tiwari, Ayush Chauhan

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 Shielded RecRL通过双塔架构和复合奖励信号,在不降低推荐准确性的情况下,提升推荐系统个性化解释的质量和用户交互效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03468 2026-01-08 cs.CV 75%

Understanding Reward Hacking in Text-to-Image Reinforcement Learning

理解文本到图像强化学习中的奖励黑客行为

Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出了一种轻量的伪影奖励模型,用于缓解文本到图像强化学习中的奖励黑客问题,通过提高图像真实性和减少低质量生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03286 2026-01-08 cs.CV cs.AI cs.CL cs.LG 67%

HyperCLOVA X 32B Think

NAVER Cloud HyperCLOVA X Team

机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏