arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2603.23951 2026-03-26 cs.CL 79%

From AI Assistant to AI Scientist: Autonomous Discovery of LLM-RL Algorithms with LLM Agents

从AI助手到AI科学家:利用LLM代理自主发现LLM-RL算法

Sirui Xia, Yikai Zhang, Aili Chen, Siye Wu, Siyu Yuan, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学) School of Data Science, Fudan University(数据科学学院,复旦大学)

专题命中 后训练与偏好优化 :LLM(title);language model(abstract);分类 cs.CL

AI总结 本文提出POISE框架,通过自动化发现语言模型的策略优化算法,改进了政策优化算法,提高了性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12565 2026-03-16 cs.SD cs.CL 79%

Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization

通过直接偏好优化实现日语SpeechLLMs的Speech-Worthy对齐

Mengjie Zhao, Lianbo Liu, Yusuke Fujita, Hao Shi, Yuan Gao, Roman Koshkin, Yui Sudo

机构 * SB Intuitions

专题命中 后训练与偏好优化 :preference optimization(title);LLM(abstract);分类 cs.CL

AI总结 本文提出通过直接偏好优化方法,改进日语SpeechLLMs以生成适合语音合成的简洁、口语化文本,引入SpokenElyza基准测试,并在保持原有性能的同时显著提升语音质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09121 2026-03-11 cs.RO cs.AI 79%

DexHiL: A Human-in-the-Loop Framework for Vision-Language-Action Model Post-Training in Dexterous Manipulation

DexHiL: 一种用于灵巧操作中视觉-语言-动作模型后训练的人机协同框架

Yifan Han, Zhongxi Chen, Yuxuan Zhao, Congsheng Xu, Yanming Shao, Yichuan Peng, Yao Mu, Wenzhao Lian

机构 * CASIA(中国科学院自动化研究所) SJTU(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 DexHiL是一种用于灵巧操作中视觉-语言-动作模型后训练的人机协同框架,通过干预意识的数据采样策略和轻量级远程操作界面,显著提升了模型在不同任务中的成功率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00485 2026-03-06 cs.AI 79%

Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models

用偏好替代参数:异构视觉-语言模型的联邦对齐

Shule Lu, Yujing Wang, Hainan Zhang, Xiaoshan Yang, Hongwei Zheng, Yongxin Tong, Changsheng Xu, Zhiming Zheng

专题命中 后训练与偏好优化 :language model(title);foundation model(abstract);分类 cs.AI

AI总结 本文提出MoR框架,通过用偏好替代参数实现异构视觉-语言模型的联邦对齐,提升泛化、鲁棒性和跨客户端适应性。

Comments Due to the need for substantial revisions, the authors believe that the paper should be retracted first.A revised version may be resubmitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02088 2026-02-27 cs.CV cs.AI 79%

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Dual-IPO: 双迭代偏好优化用于文本到视频生成

Xiaomeng Yang, Mengping Yang, Jia Gong, Luozheng Qin, Zhiyu Tan, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 后训练与偏好优化 :preference optimization(title);foundation model(abstract);分类 cs.AI

AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。

Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11523 2026-02-13 cs.LG 79%

Unifying Stable Optimization and Reference Regularization in RLHF

统一稳定优化与参考正则化在RLHF中

Li He, Qiang Qu, He Zhao, Stephen Wan, Dadong Wang, Lina Yao, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心、悉尼大学) CSIRO, Data61(澳大利亚联邦科学与工业研究组织、Data61) University of New South Wales(新南威尔士大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

AI总结 本文提出了一种统一正则化方法,通过平衡防止奖励黑客和稳定策略更新,提升RLHF的对齐性能和稳定性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10583 2026-02-12 cs.AI 79%

Flow of Spans: Generalizing Language Models to Dynamic Span-Vocabulary via GFlowNets

动态跨度的流动:通过GFlowNets泛化语言模型到动态跨度词典

Bo Xue, Yunchong Song, Fanghao Shao, Xuekai Zhu, Lin Chen, Luoyi Fu, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI

AI总结 本文提出FOSS,一种基于GFlowNets的跨度生成框架,通过动态跨度词典和DAG结构状态空间提升语言模型的生成能力与泛化性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13981 2026-02-11 q-bio.BM cs.LG 79%

Decomposed Direct Preference Optimization for Structure-Based Drug Design

基于结构的分解直接偏好优化用于基于结构的药物设计

Xiwei Cheng, Xiangxin Zhou, Yuwei Yang, Yu Bao, Quanquan Gu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 DecompDPO通过分解优化目标和引入物理信息能量项,提升基于结构的药物设计中分子生成与优化的性能。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04651 2026-02-10 cs.LG 79%

SAFE: Stable Alignment Finetuning with Entropy-Aware Predictive Control for Reinforcement Learning from Human Feedback (RLHF)

SAFE:基于熵感知预测控制的稳定对齐微调用于人类反馈的强化学习(RLHF)

Dipan Maity

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

AI总结 SAFE通过熵感知预测控制提升RLHF稳定性,实现更高的训练奖励和更稳定的优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07743 2026-02-04 cs.CL 79%

OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment

OpenRubrics: 向奖励建模和大语言模型对齐的可扩展合成 rubric 生成迈进

Tianci Liu, Ran Xu, Tony Yu, Ilgee Hong, Carl Yang, Tuo Zhao, Haoyu Wang

机构 * Purdue University(普渡大学) Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院) University at Albany(阿尔巴尼大学)

专题命中 后训练与偏好优化 :LLM(title);RLHF(abstract);分类 cs.CL

AI总结 OpenRubrics 提出了一种基于对比的 rubric 生成方法,通过大规模(提示,rubric)对提升奖励建模和大语言模型对齐的性能。

Comments The first two authors contributed equally. Updated OpenRubrics dataset, RMs, and results

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10077 2026-01-29 cs.CL 79%

A-IPO: Adaptive Intent-driven Preference Optimization

A-IPO:自适应意图驱动偏好优化

Wenqing Wang, Muhammad Asif Ali, Ali Shoker, Ruohan Yang, Junyang Chen, Ying Sha, Huan Wang

机构 * Huazhong Agricultural University(华中农业大学) King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学) Shenzhen University(深圳大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL

AI总结 A-IPO通过引入意图模块,提升偏好对齐的鲁棒性和多样性,实验证明其在多个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17567 2026-01-27 cs.IR cs.AI 79%

Real-Time Trend Prediction via Continually-Aligned LLM Query Generation

通过持续对齐的LLM查询生成进行实时趋势预测

Zijing Hui, Wenhan Lyu, Shusen Wang, Li Chen, Chu Wang

机构 * Meta Platforms(Meta平台)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.AI

AI总结 RTTP通过持续对齐的LLM查询生成,在低流量搜索环境中实现实时趋势预测,显著提升尾部趋势检测精度和查询生成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04339 2026-01-22 cs.CV cs.AI 79%

Unified Text-Image Generation with Weakness-Targeted Post-Training

通过弱项针对性后训练实现统一的文本图像生成

Jiahui Chen, Philippe Hansen-Estruch, Xiaochuang Han, Yushi Hu, Emily Dinan, Amita Kamath, Michal Drozdzal, Reyhane Askari-Hemmat, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta(Meta旗下的FAIR) University of Texas, Austin(德克萨斯大学奥斯汀分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 本文提出通过针对性后训练实现统一文本图像生成,提升多模态生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02036 2026-01-06 cs.LG cs.CV 79%

GDRO: Group-level Reward Post-training Suitable for Diffusion Models

GDRO:适用于扩散模型的组级奖励后训练

Yiyang Wang, Xi Chen, Xiaogang Xu, Yu Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 GDRO通过组级奖励后训练优化,提升扩散模型奖励分数并增强抗奖励黑客能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00885 2026-01-06 cs.AI 79%

Counterfactual Self-Questioning for Stable Policy Optimization in Language Models

反事实自问法用于语言模型中的稳定策略优化

Mandar Parab

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI

AI总结 反事实自问法通过内部生成的监督提升语言模型的推理准确性和训练稳定性,实现自我改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17213 2025-12-22 cs.CV cs.LG 79%

CheXPO-v2: Preference Optimization for Chest X-ray VLMs with Knowledge Graph Consistency

CheXPO-v2:基于知识图谱一致性的胸片视觉-语言模型偏好优化

Xiao Liang, Yuxuan An, Di Wang, Jiawei Hu, Zhicheng Jiao, Bin Jing, Quan Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Warren Alpert Medical School of Brown University(布朗大学沃伦·阿尔珀特医学学院) School of Biomedical Engineering, Capital Medical University(首都医科大学生物医学工程学院)

专题命中 后训练与偏好优化 :preference optimization(title);language model(abstract);分类 cs.LG

AI总结 CheXPO-v2通过知识图谱一致性奖励机制,提升胸片VLMs的临床可靠性与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01331 2025-12-02 cs.RO cs.LG 79%

RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models

RobustVLA: 为视觉-语言-动作模型引入鲁棒性感知的强化学习后训练

Hongyin Zhang, Shuo Zhang, Junxi Jin, Qixin Zeng, Runze Li, Donglin Wang

机构 * Westlake University(西湖大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 RobustVLA通过引入鲁棒性感知的强化学习后训练方法,提升视觉-语言-动作模型在环境不确定性下的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18624 2025-12-02 cs.CL 79%

Checklists Are Better Than Reward Models For Aligning Language Models

检查表比奖励模型更能对齐语言模型

Vijay Viswanathan, Yanchao Sun, Shuang Ma, Xiang Kong, Meng Cao, Graham Neubig, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

AI总结 本文提出基于检查表反馈的强化学习方法,通过灵活的指令特定准则提升语言模型的指令遵循能力,在多个基准测试中均取得性能提升。

Comments Presented at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11500 2025-11-25 cs.LG 79%

Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation

诚实胜过准确:通过强化犹豫实现可信语言模型

Mohamad Amin Mohamadi, Tianhao Wang, Zhiyuan Li

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.LG

AI总结 通过强化犹豫方法,将回避作为核心训练目标,使语言模型在风险可控下提升可信度,降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10165 2025-11-14 cs.LG q-bio.QM 79%

EPO: Diverse and Realistic Protein Ensemble Generation via Energy Preference Optimization

Yuancheng Sun, Yuxuan Ren, Zhaoming Chen, Xu Han, Kang Liu, Qiwei Ye

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

Comments Accepted as AAAI 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05616 2025-11-11 cs.CV cs.AI 79%

Personalized Image Editing in Text-to-Image Diffusion Models via Collaborative Direct Preference Optimization

Connor Dunlop, Matthew Zheng, Kavana Venkatesh, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

Comments Published at NeurIPS'25 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15971 2025-11-06 cs.LG 79%

REINFORCE-ING Chemical Language Models for Drug Discovery

Morgan Thomas, Albert Bou, Jose Carlos Gómez-Tamayo, Gary Tresadern, Mazen Ahmad, Gianni De Fabritiis

机构 * Computational Science Laboratory, Universitat Pompeu Fabra, Barcelona Biomedical Research Park (PRBB), C Dr. Aiguader 88, 08003 Barcelona, Spain In Silico Discovery, Janssen Research \& Development, Janssen Pharmaceutica N. V., Turnhoutseweg 30, B-2340 Beerse, Belgium

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17431 2025-11-05 cs.CL 79%

On Extending Direct Preference Optimization to Accommodate Ties

Jinghong Chen, Guangyu Yang, Weizhe Lin, Jingbiao Mei, Bill Byrne

机构 * Department of Engineering University of Cambridge(工程系剑桥大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL

Comments 24 pages, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23167 2025-10-28 cs.AI 79%

Guiding Skill Discovery with Foundation Models

Zhao Yang, Thomas M. Moerland, Mike Preuss, Aske Plaat, Vincent François-Lavet, Edward S. Hu

机构 * Department of Computer Science(计算机科学系) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Leiden University(莱顿大学) The Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) University of Pennsylvania(宾夕法尼亚大学) GRASP Lab(GRASP实验室)

专题命中 后训练与偏好优化 :foundation model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22954 2025-10-28 cs.CL 79%

Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)

Liwei Jiang, Yuanjun Chai, Margaret Li, Mickel Liu, Raymond Fok, Nouha Dziri, Yulia Tsvetkov, Maarten Sap, Alon Albalak, Yejin Choi

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

Comments NeurIPS 2025 D&B Paper (Oral); Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18851 2025-10-22 cs.CV cs.AI 79%

DP$^2$O-SR: Direct Perceptual Preference Optimization for Real-World Image Super-Resolution

Rongyuan Wu, Lingchen Sun, Zhengqiang Zhang, Shihao Wang, Tianhe Wu, Qiaosi Yi, Shuai Li, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

Comments Accept by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15626 2025-10-02 cs.LG stat.ML 79%

Direct Preference Optimization for Adaptive Concept-based Explanations

Jacopo Teneggi, Zhenzhen Wang, Paul H. Yi, Tianmin Shu, Jeremias Sulam

机构 * Johns Hopkins University(约翰霍普金斯大学) St. Jude Children’s Research Hospital(圣犹大儿童研究医院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05677 2025-09-17 cs.CV cs.AI 79%

T2V-Turbo-v2: Enhancing Video Generation Model Post-Training through Data, Reward, and Conditional Guidance Design

Jiachen Li, Qian Long, Jian Zheng, Xiaofeng Gao, Robinson Piramuthu, Wenhu Chen, William Yang Wang

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) UC Los Angeles(加州大学洛杉矶分校) Amazon AGI(亚马逊人工智能实验室) University of Waterloo(滑铁卢大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

Comments Accepted by ICLR 2025. Project Page: https://t2v-turbo-v2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12132 2025-09-16 cs.CV cs.CL 79%

Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models

Pu Jian, Junhong Wu, Wei Sun, Chen Wang, Shuo Ren, Jiajun Zhang

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

Comments EMNLP2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05863 2025-09-09 cs.CL 79%

LatinX: Aligning a Multilingual TTS Model with Direct Preference Optimization

Luis Felipe Chary, Miguel Arjona Ramirez

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏