arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-16 至 2025-12-16 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 12 篇

2512.11998 2025-12-16 cs.CL 90%

Direct Confidence Alignment: Aligning Verbalized Confidence with Internal Confidence In Large Language Models

直接置信对齐:将 verbalized 置信度与内部置信度对齐于大语言模型

Glenn Zhang, Treasure Mayowa, Jason Fan, Yicheng Fu, Aaron Sandoval, Sean O'Brien, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

AI总结 本文提出直接置信对齐方法,通过优化使LLM的 verbalized 置信度与内部置信度对齐,提升模型透明度和可靠性。

Comments Accepted at ACL 2025 SRW, 5 pages body, 14 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13070 2025-12-16 cs.AI cs.CL 88%

M-GRPO: Stabilizing Self-Supervised Reinforcement Learning for Large Language Models with Momentum-Anchored Policy Optimization

M-GRPO:通过动量锚定策略优化稳定大语言模型的自监督强化学习

Bizhe Bai, Hongming Wu, Peng Ye, Tao Chen

机构 * Shanghai Innovation Institute(上海创新研究院) College of Future Information Technology, Fudan(复旦大学未来信息技术学院) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 M-GRPO通过动量锚定策略优化和IQR过滤方法,稳定大语言模型的自监督强化学习训练,提升训练稳定性和性能。

Comments 7 pages, 5 figures,Accepted NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13240 2025-12-16 cs.AI cs.LG 86%

Reflective Preference Optimization (RPO): Enhancing On-Policy Alignment via Hint-Guided Reflection

反射偏好优化(RPO):通过提示引导的反思增强策略对齐

Zihui Zhao, Zechang Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 RPO通过提示引导的反思增强策略对齐,减少幻觉并提升多模态基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10264 2025-12-16 cs.SD 82%

MR-FlowDPO: Multi-Reward Direct Preference Optimization for Flow-Matching Text-to-Music Generation

MR-FlowDPO:多奖励直接偏好优化用于流匹配文本到音乐生成

Alon Ziv, Sanyuan Chen, Andros Tjandra, Yossi Adi, Wei-Ning Hsu, Bowen Shi

机构 * FAIR Team, Meta MSL(Meta MSL FAIR团队) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);prompting(abstract)

AI总结 MR-FlowDPO通过多奖励直接偏好优化提升文本到音乐生成的质量,增强音频质量、文本对齐和音乐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21983 2025-12-16 cs.LG 81%

Improving Generative Ad Text on Facebook using Reinforcement Learning

通过强化学习改进Facebook上的生成广告文本

Daniel R. Jiang, Alex Nikulkov, Yu-Chia Chen, Yang Bai, Zheqing Zhu

机构 * Meta Platforms(Meta平台)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 通过强化学习改进Facebook广告文本生成,提升点击率和广告效果

Comments D.J. and A.N. contributed equally, 41 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14029 2025-12-16 cs.CL 81%

Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR

超越Pass@1:基于变分问题合成的自我博弈维持RLVR

Xiao Liang, Zhongzhi Li, Yeyun Gong, Yelong Shen, Ying Nian Wu, Zhijiang Guo, Weizhu Chen

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出基于变分问题合成的自我博弈策略,有效维持RLVR训练中的策略熵,显著提升Pass@k性能,在多个基准测试中取得绝对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13262 2025-12-16 cs.RO cs.CV 78%

Post-Training and Test-Time Scaling of Generative Agent Behavior Models for Interactive Autonomous Driving

生成代理行为模型在交互式自动驾驶中的训练和测试时间缩放

Hyunki Seong, Jeong-Kyun Lee, Heesoo Myeong, Yongho Shin, Hyun-Mook Cho, Duck Hoon Kim, Pranav Desai, Monu Surana

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 本文提出GRBO和Warm-K两种方法,用于提升交互式自动驾驶中生成代理行为模型的训练和测试时间性能,提高安全性和鲁棒性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11306 2025-12-16 cs.DC 78%

RollMux: Phase-Level Multiplexing for Disaggregated RL Post-Training

RollMux:基于分拆强化学习后训练的阶段级多路复用

Tianyuan Wu, Lunxi Cao, Yining Wei, Wei Gao, Yuheng Zhao, Dakai An, Shaopan Xiong, Zhiqiang Lv, Ju Huang, Siran Yang, Yinghao Yu, Jiamang Wang, Lin Qu, Wei Wang

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 RollMux通过跨集群编排优化强化学习后训练的资源利用,提升效率1.84倍,实现100%服务等级目标。

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16763 2025-12-16 cs.CV 78%

Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation

自奖励的大型视觉-语言模型用于优化文本到图像生成中的提示

Hongji Yang, Yucheng Zhou, Wencheng Han, Jianbing Shen

机构 * University of Macau(澳门大学)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 本文提出了一种自奖励的大型视觉-语言模型框架,用于优化文本到图像生成中的提示,通过统一求解器和奖励模型实现自我改进,实验表明其优于其他方法。

Comments Accepted by ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11838 2025-12-16 cs.LG 77%

D-STEER - Preference Alignment Techniques Learn to Behave, not to Believe -- Beneath the Surface, DPO as Steering Vector Perturbation in Activation Space

D-STEER - 通过偏好对齐技术学习行为而非信念 -- 在表象之下,DPO作为激活空间中的低秩引导机制

Samarth Raina, Saksham Aggarwal, Aman Chadha, Vinija Jain, Amitava Das

机构 * IIIT Delhi(印度理工学院德里分校) Microsoft(微软) Apple (USA)(苹果(美国)) Google (USA)(谷歌(美国)) Pragya Lab, BITS Pilani, K. K. Birla Goa Campus(普拉吉亚实验室,比斯科大学,K.K. 布尔拉果阿校区)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 D-STEER研究揭示DPO通过引导激活空间中的低秩机制实现行为对齐,而非改变模型内部信念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12387 2025-12-16 cs.LG 70%

Anchoring Values in Temporal and Group Dimensions for Flow Matching Model Alignment

在时间和群体维度上锚定值以实现流匹配模型对齐

Yawen Shao, Jie Xiao, Kai Zhu, Yu Liu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab(通义实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 VGPO通过在时间和群体维度上锚定值,改进流匹配模型对齐,提升图像生成质量与任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13678 2025-12-16 cs.CV cs.AI 57%

Feedforward 3D Editing via Text-Steerable Image-to-3D

通过文本可控的图像到3D进行前馈编辑

Ziqi Ma, Hongqiao Chen, Yisong Yue, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 Steer3D通过文本可控的图像到3D生成方法,实现高效且准确的3D资产编辑,速度提升显著。

Comments https://glab-caltech.github.io/steer3d/

详情

展开后加载摘要…

URL PDF HTML 收藏