arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-05 至 2025-12-05 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 6 篇

2409.18541 2025-12-05 cs.AI 89%

Align$^2$LLaVA: Cascaded Human and Large Language Model Preference Alignment for Multi-modal Instruction Curation

Align$^2$LLaVA: 多模态指令编纂的级联人类与大语言模型偏好对齐

Hongzhe Huang, Jiang Liu, Zhewen Yu, Li Cai, Dian Jiao, Wenqiao Zhang, Siliang Tang, Juncheng Li, Hao Jiang, Haoyuan Li, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba(阿里巴巴)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Align$^2$LLaVA通过级联人类与LLM偏好对齐方法,有效压缩多模态指令数据,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04419 2025-12-05 cs.AI 85%

Solving LLM Repetition Problem in Production: A Comprehensive Study of Multiple Solutions

在生产环境中解决大语言模型重复问题:对多种解决方案的综合研究

Weiwei Wang, Weijie Zou, Jiyong Min

机构 * Shenzhen Sunline Tech Co., Ltd(深圳Sunline科技有限公司)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文针对大语言模型在生产环境中重复问题,提出多种解决方案并验证其有效性,通过理论分析和实验评估,识别关键参数并提供实用的生产级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12723 2025-12-05 cs.CL 81%

On-Policy Optimization with Group Equivalent Preference for Multi-Programming Language Understanding

基于组等价偏好的多编程语言理解的在线优化

Haoyuan Wu, Rui Ming, Jilong Gao, Hangyu Zhao, Xueyi Chen, Yikai Yang, Haisheng Zheng, Zhuolun He, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) ChatEDA Tech(ChatEDA科技)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出OORL框架和GEPO方法,通过代码翻译任务提升LLMs对多编程语言代码功能的理解和跨语言关系的认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16139 2025-12-05 cs.AI 77%

Multidimensional Rubric-oriented Reward Model Learning via Geometric Projection Reference Constraints

通过几何投影参考约束的多维评分导向奖励模型学习

Yongnan Jin, Xurui Li, Feng Cao, Liucun Gao, Juanjuan Yao

机构 * Shanghai Mingpin Medical Data Technology Co., Ltd.(上海明品医疗数据技术有限公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过几何投影参考约束的多维评分导向奖励模型学习,提升医疗领域大型语言模型的性能和对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08123 2025-12-05 cs.CL 77%

QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA

QA-LIGN:通过宪法分解的问答对对齐大语言模型

Jacob Dineen, Aswin RRV, Qin Liu, Zhikun Xu, Xiao Ye, Ming Shen, Zhaonan Li, Shijie Lu, Chitta Baral, Muhao Chen, Ben Zhou

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 QA-LIGN通过分解奖励信号提升LLM对齐效果,降低攻击成功率并保持低拒绝率,实现安全与帮助性的帕累托最优。

Comments Findings of the Association for Computational Linguistics: EMNLP 2025, pages 20619-20642, Suzhou, China

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 20619-20642, Suzhou, China, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06783 2025-12-05 cs.CV 71%

TTRV: Test-Time Reinforcement Learning for Vision Language Models

TTRV:用于视觉语言模型的测试时间强化学习

Akshit Singh, Shyam Marjit, Wei Lin, Paul Gavrikov, Serena Yeung-Levy, Hilde Kuehne, Rogerio Feris, Sivan Doveh, James Glass, M. Jehanzeb Mirza

机构 * IISc Bangalore(班加罗尔印度理工学院) JKU Linz(林茨约翰·凯撒大学) Stanford(斯坦福大学) Tübingen AI Center(图宾根人工智能中心) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) MIT CSAIL Project(麻省理工CSAIL项目)

专题命中 后训练与偏好优化 :language model(title)

AI总结 TTRV通过测试时间强化学习提升视觉语言模型的识别和问答性能,无需标记数据,在多个任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏