arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-01 至 2026-01-01 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2504.15843 2026-01-01 cs.CL 87%

Pre-DPO: Improving Data Utilization in Direct Preference Optimization Using a Guiding Reference Model

Pre-DPO:通过引导参考模型提升直接偏好优化的数据利用

Junshu Pan, Wei Shen, Shulin Huang, Qiji Zhou, Yue Zhang

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 Pre-DPO通过引入引导参考模型提升直接偏好优化的数据利用效率,有效提高大语言模型的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24609 2026-01-01 cs.AI 85%

Reinforcement Learning-Augmented LLM Agents for Collaborative Decision Making and Performance Optimization

强化学习增强的LLM代理用于协作决策与性能优化

Dong Qiu, Duo Xu, Limengxi Yue

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出强化学习增强的LLM代理框架,通过GRPO和联合奖励优化,提升多智能体协作任务的效率与一致性。

Comments Accepted by IEEE ICFTIC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06970 2026-01-01 cs.CV 80%

Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment

通过偏好对齐引导跨模态表示

Pengfei Zhao, Rongbo Luan, Wei Zhang, Peng Wu, Sifeng He

机构 * Apple(苹果公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);pretraining(abstract);preference optimization(abstract)

AI总结 MAPLE通过利用多模态大语言模型的细粒度对齐先验,引导跨模态表示学习,提升细粒度检索性能。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15159 2026-01-01 cs.CV 78%

OnlineVPO: Align Video Diffusion Model with Online Video-Centric Preference Optimization

OnlineVPO: 对齐视频扩散模型与在线视频中心偏好优化

Jiacheng Zhang, Jie Wu, Weifeng Chen, Yatai Ji, Xuefeng Xiao, Weilin Huang, Kai Han

机构 * The University of Hong Kong(香港大学) ByteDance Project Page(字节跳动项目)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 OnlineVPO通过改进反馈源和调节方法,提出一种针对视频扩散模型的高效偏好学习框架,提升视频生成质量与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24693 2026-01-01 cs.CL 77%

MUSIC: MUlti-Step Instruction Contrast for Multi-Turn Reward Models

MUSIC: 多步指令对比用于多轮奖励模型

Wenzhe Li, Shujian Zhang, Wenxuan Zhou, John Lambert, Chi Jin, Andrew Hard, Rajiv Mathews, Lun Wang

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MUSIC通过多步指令对比提升多轮奖励模型的性能,有效增强多轮对话的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03142 2026-01-01 cs.LG 77%

Not All Tokens Are Meant to Be Forgotten

并非所有标记都旨在被遗忘

Xiangyu Zhou, Yao Qiang, Saleh Zare Zade, Douglas Zytko, Prashant Khanduri, Dongxiao Zhu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 本文提出TIF框架,通过目标信息标识符和偏好优化方法,解决LLM过度遗忘问题,提升去学习效果并保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25023 2026-01-01 cs.LG 70%

ResponseRank: Data-Efficient Reward Modeling through Preference Strength Learning

ResponseRank: 通过偏好强度学习实现数据高效的奖励建模

Timo Kaufmann, Yannick Metz, Daniel Keim, Eyke Hüllermeier

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 ResponseRank通过本地有效相对强度信号稳健学习偏好强度,提升样本效率和鲁棒性,引入Pearson距离相关性度量。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22681 2026-01-01 cs.CV 67%

CritiFusion: Semantic Critique and Spectral Alignment for Faithful Text-to-Image Generation

CritiFusion: 语义批评与频谱对齐用于忠实的文本到图像生成

ZhenQi Chen, TsaiChing Ni, YuanFu Yang

机构 * National Yang Ming Chiao Tung University

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 CritiFusion通过语义批评和频谱对齐提升文本到图像生成的忠实度和细节质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23971 2026-01-01 cs.CL 57%

CEC-Zero: Zero-Supervision Character Error Correction with Self-Generated Rewards

CEC-Zero: 无监督字符错误纠正与自生成奖励

Zhiming Lin, Kai Zhao, Sophie Zhang, Peilai Yu, Canran Xiao

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL

AI总结 CEC-Zero通过无监督强化学习框架,利用自动生成的奖励在无需标注的情况下提升大语言模型的字符错误纠正能力,实现了在多个基准测试中的性能提升。

Comments AAAI'26 poster

详情

展开后加载摘要…

URL PDF HTML 收藏