arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-25 至 2025-12-25 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 7 篇

2512.15745 2025-12-25 cs.LG cs.AI cs.CL 88%

LLaDA2.0: Scaling Up Diffusion Language Models to 100B

LLaDA2.0:将扩散语言模型扩展到100B参数

Tiwei Bie, Maosong Cao, Kun Chen, Lun Du, Mingliang Gong, Zhuochen Gong, Yanmei Gu, Jiaqi Hu, Zenan Huang, Zhenzhong Lan, Chengxi Li, Chongxuan Li, Jianguo Li, Zehuan Li, Huabin Liu, Lin Liu, Guoshan Lu, Xiaocheng Lu, Yuxin Ma, Jianfeng Tan, Lanning Wei, Ji-Rong Wen, Yipeng Xing, Xiaolu Zhang, Junbo Zhao, Da Zheng, Jun Zhou, Junlin Zhou, Zhanchao Zhou, Liwang Zhu, Yihong Zhuang

机构 * Ant Group(蚂蚁集团) Renmin University of China(中国人民大学) Zhejiang University(浙江大学) Westlake University(西湖大学) HongKong University of Science and Technology(香港科学与技术大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);post-training(abstract);SFT(abstract)

AI总结 LLaDA2.0通过三阶段块级训练方案将扩散语言模型扩展至100B参数,实现高效前沿规模部署。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00162 2025-12-25 cs.CL cs.AI 86%

Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback

序列到序列奖励建模:通过语言反馈改进RLHF

Jiayi Zhou, Jiaming Ji, Juntao Dai, Dong Li, Yaodong Yang

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过序列到序列奖励建模方法改进RLHF,提升LLMs对齐人类意图的性能。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18736 2025-12-25 cs.CV 85%

Rethinking Direct Preference Optimization in Diffusion Models

重新思考扩散模型中的直接偏好优化

Junyong Kang, Seohyun Lim, Kyungjune Baek, Hyunjung Shim

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种改进扩散模型偏好优化的方法,通过稳定参考模型更新和时间步感知训练策略,提升模型在人类偏好评估中的性能。

Comments Accepted by SPIGM@NeurIPS 2025 and AAAI-26 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12867 2025-12-25 cs.AI cs.LG 79%

Bootstrapping LLMs via Preference-Based Policy Optimization

通过基于偏好的策略优化提升大语言模型

Chen Jia

机构 * Chen Jia(陈佳)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于偏好的策略优化框架,通过主动收集偏好数据实现大语言模型的持续改进,并在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20082 2025-12-25 cs.AI 70%

Adaptive Financial Sentiment Analysis for NIFTY 50 via Instruction-Tuned LLMs , RAG and Reinforcement Learning Approaches

通过指令调优LLMs、RAG和强化学习方法实现NIFTY 50的自适应金融情绪分析

Chaithra, Kamesh Kadimisetty, Biju R Mohan

机构 * National Institute of Technology Karnataka(印度卡纳塔克国家理工学院) Gayatri Vidya Parishad College of Engineering(迦雅利维达帕希拉工程学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出结合指令调优LLMs、RAG和强化学习的方法,提升NIFTY 50金融情绪分析的准确性和市场适应性。

Comments Accepted in CODS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20675 2025-12-25 cs.LG cs.AI 62%

Revisiting the Learning Objectives of Vision-Language Reward Models

重新审视视觉-语言奖励模型的学习目标

Simon Roy, Samuel Barbeau, Giovanni Beltrame, Christian Desrosiers, Nicolas Thome

机构 * Polytechnique Montréal(蒙特利尔理工学院) École de Technologie Supérieure(高级技术学院) Sorbonne Université(索邦大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过统一框架评估了基于VLM的奖励模型,发现简单三元组损失在性能上优于现有方法,表明改进可能源于数据和架构差异。

Comments Published as an extended abstract at World Modeling Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04332 2025-12-25 cs.LG 57%

Data-regularized Reinforcement Learning for Diffusion Models at Scale

大规模扩散模型中的数据正则化强化学习

Haotian Ye, Kaiwen Zheng, Jiashu Xu, Puheng Li, Huayu Chen, Jiaqi Han, Sheng Liu, Qinsheng Zhang, Hanzi Mao, Zekun Hao, Prithvijit Chattopadhyay, Dinghao Yang, Liang Feng, Maosheng Liao, Junjie Bai, Ming-Yu Liu, James Zou, Stefano Ermon

机构 * Stanford University(斯坦福大学) NVIDIA Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 DDRL通过数据正则化方法提升扩散模型的奖励表现,有效缓解奖励黑客问题,实现高分辨率视频生成中的高人偏好和可扩展训练。

详情

展开后加载摘要…

URL PDF HTML 收藏