arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-22 至 2026-01-22 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 7 篇

2601.14686 2026-01-22 cs.AI cs.LG 86%

IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization

IB-GRPO: 通过基于指标的群体相对策略优化对基于大语言模型的学习路径推荐进行对齐

Shuai Wang, Yaoming Yang, Bingdong Li, Hao Hao, Aimin Zhou

机构 * East China Normal University(东华大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 IB-GRPO通过基于指标的群体相对策略优化,解决大语言模型在学习路径推荐中的多目标对齐问题,提升学习效果与教学目标的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14711 2026-01-22 cs.AI cs.LG 85%

DARA: Few-shot Budget Allocation in Online Advertising via In-Context Decision Making with RL-Finetuned LLMs

DARA: 通过基于上下文的决策制定实现在线广告中的少样本预算分配

Mingxuan Song, Yusen Huo, Bohan Zhou, Shenglin Yin, Zhen Xiao, Jieyi Long, Zhilin Zhang, Chuan Yu

机构 * Peking University(北京大学) School of Computer Science(计算机科学学院) Alibaba Group(阿里巴巴集团) Theta Labs, Inc.(Theta Labs公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 DARA通过结合LLMs的上下文学习与细粒度优化,实现在线广告中的少样本预算分配,提升广告商价值。

Comments Accepted at The ACM Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19780 2026-01-22 cs.LG 83%

Listwise Direct Preference Optimization with Multi-Dimensional Preference Mixing

基于多维偏好混合的列表式直接偏好优化

Yuhui Sun, Xiyao Wang, Zixi Li, YiTian Ding, Tianyang Ling, Jialuo Chen, Tianyi Yu, Zhenlong Yuan, Jinman Zhao

机构 * University of Alberta(阿尔伯塔大学) University of Toronto(多伦多大学) Zhejiang University(浙江大学) School of Computer Science McGill University(麦吉尔大学计算机学院) Alibaba Group (Ant Group)(阿里巴巴集团(蚂蚁集团)) Chinese Academy of Sciences(中国科学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出λ-DPO,通过多维偏好混合和自适应调度器提升模型对多维度偏好权衡的建模能力。

Comments 13 pages, 1 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05553 2026-01-22 cs.CL cs.CY 81%

Do Political Opinions Transfer Between Western Languages? An Analysis of Unaligned and Aligned Multilingual LLMs

政治观点在西方语言之间是否转移?对未对齐和对齐的多语言大语言模型的分析

Franziska Weeber, Tanise Ceron, Sebastian Padó

机构 * University of Stuttgart(斯图加特大学) Bocconi University(博科尼大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);prompting(abstract)

AI总结 研究探讨多语言大语言模型在五种西方语言中政治观点的转移情况,发现对齐前模型观点差异小,对齐后观点在各语言间均匀转移。

Comments EACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04339 2026-01-22 cs.CV cs.AI 79%

Unified Text-Image Generation with Weakness-Targeted Post-Training

通过弱项针对性后训练实现统一的文本图像生成

Jiahui Chen, Philippe Hansen-Estruch, Xiaochuang Han, Yushi Hu, Emily Dinan, Amita Kamath, Michal Drozdzal, Reyhane Askari-Hemmat, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta(Meta旗下的FAIR) University of Texas, Austin(德克萨斯大学奥斯汀分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 本文提出通过针对性后训练实现统一文本图像生成,提升多模态生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14525 2026-01-22 cs.CL cs.AI cs.LG 75%

Towards Execution-Grounded Automated AI Research

面向执行导向的自动化AI研究

Chenglei Si, Zitong Yang, Yejin Choi, Emmanuel Candès, Diyi Yang, Tatsunori Hashimoto

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出自动化执行器,通过执行反馈学习改进LLM预训练和后训练方法,验证了进化搜索在样本效率上的优势,但强化学习存在模式崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14037 2026-01-22 cs.CV 50%

Human detectors are surprisingly powerful reward models

人类检测器出人意料地强大

Kumar Ashutosh, XuDong Wang, Xi Yin, Kristen Grauman, Adam Polyak, Ishan Misra, Rohit Girdhar

机构 * Meta University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出 HuDA 模型,通过简单奖励函数提升视频生成中的人体运动质量,胜率高达 73%。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏