arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2506.04462 2026-02-25 cs.CL cs.CR cs.LG 81%

Watermarking Degrades Alignment in Language Models: Analysis and Mitigation

水印会损害语言模型的对齐:分析与缓解

Apurv Verma, NhatHai Phan, Shubhendu Trivedi

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究发现水印影响语言模型对齐,提出Alignment Resampling方法恢复对齐性能。

Comments Published in Transactions of Machine Learning Research 02/2026. Extended version of the earlier paper published at the 1st Workshop on GenAI Watermarking (ICLR 2025)

Journal ref Transactions of Machine Learning Research 02/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16093 2026-02-19 cs.CL cs.AI 81%

Updating Parametric Knowledge with Context Distillation Retains Post-Training Capabilities

通过上下文蒸馏更新参数化知识可保留训练后能力

Shankar Padmanabhan, Mustafa Omer Gul, Tanya Goyal

机构 * Department of Computer Science, Cornell University(康奈尔大学计算机科学系)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DiSC方法,通过上下文蒸馏实现持续知识适应,有效平衡新知识学习与原有能力保持。

Comments 15 pages. Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03441 2026-02-13 cs.LG cs.AI cs.CR 81%

PBP: Post-training Backdoor Purification for Malware Classifiers

PBP: 事后训练后门净化用于恶意软件分类器

Dung Thuy Nguyen, Ngoc N. Tran, Taylor T. Johnson, Kevin Leach

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 PBP是一种后训练方法,通过调节批量归一化层统计特性,有效净化恶意软件分类器中的后门,显著降低攻击成功率。

Comments The Network and Distributed System Security (NDSS) Symposium 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05125 2026-02-06 cs.LG cs.AI 81%

Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended Tasks

重新思考评估标准生成以改进LLM评判与开放任务的奖励建模

William F. Shen, Xinchi Qiu, Chenxi Whitehouse, Lisa Alazraki, Shashwat Goel, Francesco Barbieri, Timon Willi, Akhil Mathur, Ilias Leontiadis

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 RRD通过递归分解-过滤循环优化评估标准,提升LLM评判准确性和奖励建模效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20848 2026-01-29 cs.LG cs.AI cs.CY cs.IR 81%

Post-Training Fairness Control: A Single-Train Framework for Dynamic Fairness in Recommendation

训练后公平性控制:一个用于推荐中动态公平性的单一训练框架

Weixin Chen, Li Chen, Yuhan Zhao

机构 * Hong Kong Baptist University(香港 Baptist 大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 Cofair提出一个单一训练框架,通过共享表示层和公平性条件适配器模块,在推荐系统中实现动态公平性控制,无需重新训练即可适应不同公平性需求。

Comments Accepted to WWW 2026 Workshop on HCRS (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17329 2026-01-27 cs.LG cs.AI 81%

Conformal Feedback Alignment: Quantifying Answer-Level Reliability for Robust LLM Alignment

符合反馈对齐:量化答案级可靠性以实现鲁棒的大语言模型对齐

Tiejin Chen, Xiaoou Liu, Vishnu Nandam, Kuan-Ru Liou, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 后训练与偏好优化 :LLM(title);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 Conformal Feedback Alignment通过量化答案级可靠性提升大语言模型对齐的鲁棒性和数据效率。

Comments Accetped to Findings of EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12205 2026-01-23 cs.LG cs.AI cs.IT math.IT math.ST stat.ML stat.TH 81%

On the Exponential Convergence for Offline RLHF with Pairwise Comparisons

关于通过成对比较进行离线RLHF的指数收敛性

Zhirui Chen, Vincent Y. F. Tan

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种在离线RLHF中通过成对比较实现指数收敛的算法RL-LOW,并推导了实例依赖的下界。

Comments Accepted as an oral presentation at AAAI 2026 (AI Alignment Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18913 2026-01-13 cs.LG cs.AI stat.ML 81%

ADPO: Anchored Direct Preference Optimization

ADPO:基于锚定的直接偏好优化

Wang Zixian

机构 * China Mobile Communications Group Shandong Co., Ltd. Tai’an Branch(中国移动通信集团山东有限公司 Tai’an 分部)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 ADPO通过锚定logits优化相对优势,统一了监督微调、强化学习和排序目标,在推理任务中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22953 2025-12-30 cs.LG cs.AI 81%

APO: Alpha-Divergence Preference Optimization

APO:Alpha-散度偏好优化

Wang Zixian

机构 * China Mobile Communications Group Shandong Co., Ltd. Tai’an Branch(中国移动通信集团山东公司泰安分公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 APO通过alpha-散度在锚定几何中插值正反KL散度,实现稳定训练与探索平衡,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10767 2025-12-17 cs.LG cs.AI math.OC 81%

Understanding Sampler Stochasticity in Training Diffusion Models for RLHF

理解训练扩散模型用于RLHF中的采样随机性

Jiayuan Sheng, Hanyang Zhao, Haoxian Chen, David D. Yao, Wenpin Tang

机构 * Columbia University, IEOR Department(哥伦比亚大学,工业工程与运营研究系)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在训练扩散模型用于RLHF时随机采样与确定性采样之间的不匹配问题,通过理论分析和实验验证,提出了非空的界限和更尖锐的收敛速率,并展示了高随机性SDE训练对ODE采样质量的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08153 2025-12-10 cs.LG cs.AI cs.CV 81%

TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models

TreeGRPO:基于树优势的在线强化学习后训练扩散模型

Zheng Ding, Weirui Ye

机构 * UC San Diego(圣迭戈大学) MIT(麻省理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 TreeGRPO通过树结构提升扩散模型后训练效率,实现2.4倍加速并优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23184 2025-12-01 cs.CL cs.AI 81%

Listwise Preference Optimization with Element-wise Confusions for Aspect Sentiment Quad Prediction

基于元素混淆的列表偏好优化用于方面情感四元组预测

Wenna Lai, Haoran Xie, Guandong Xu, Qing Li, S. Joe Qin

机构 * The Hong Kong Polytechnic University(香港理工大学) Lingnan University(岭大) University of Technology Sydney(悉尼大学) The Education University of Hong Kong(香港教育大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于元素混淆的列表偏好优化方法,用于提升方面情感四元组预测的准确性和解释一致性。

Comments 11 pages, 7 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02433 2025-12-01 cs.LG cs.AI 81%

FairPO: Robust Preference Optimization for Fair Multi-Label Learning

FairPO: 为公平多标签学习的鲁棒偏好优化

Soumen Kumar Mondal, Prateek Chanda, Akshit Varmora, Ganesh Ramakrishnan

机构 * IIT Bombay(印度理工学院班加罗尔)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 FairPO通过结合偏好损失和群体鲁棒优化,提升多标签学习中不同标签的公平性,通过针对性改进和平衡目标缓解偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04753 2025-11-10 cs.CV cs.AI cs.LG 81%

CPO: Condition Preference Optimization for Controllable Image Generation

Zonglin Lyu, Ming Li, Xinxin Liu, Chen Chen

机构 * Institute of Artificial Intelligence(人工智能研究院) University of Central Florida(中央佛罗里达大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03069 2025-10-28 cs.CL cs.AI 81%

ARF-RLHF: Adaptive Reward-Following for RLHF through Emotion-Driven Self-Supervision and Trace-Biased Dynamic Optimization

YuXuan Zhang

机构 * South China Normal University(华南师范大学) University of Aberdeen(阿伯丁大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI

Comments This version fixes some minor typographical errors and adds more explanations to ensure clarity in presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18458 2025-10-24 cs.CL cs.AI cs.CV 81%

Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning

Wenyi Xiao, Leilei Gan

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18407 2025-10-17 cs.LG cs.AI 81%

KL-regularization Itself is Differentially Private in Bandits and RLHF

Yizhou Zhang, Kishan Panaganti, Laixi Shi, Juba Ziani, Adam Wierman

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14094 2025-10-15 cs.LG cs.AI 81%

Hard Examples Are All You Need: Maximizing GRPO Post-Training Under Annotation Budgets

Benjamin Pikus, Pratyush Ranjan Tiwari, Burton Ye

机构 * Independent(独立研究者) Eternis Labs(Eternis实验室) Writer, Inc(Writer公司)

专题命中 后训练与偏好优化 :post-training(title);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06552 2025-10-14 cs.CL cs.LG 81%

References Indeed Matter? Reference-Free Preference Optimization for Conversational Query Reformulation

Doyoung Kim, Youngjun Lee, Joeun Kim, Jihwan Bang, Hwanjun Song, Susik Yoon, Jae-Gil Lee

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01774 2025-10-13 cs.LG cs.AI 81%

VAGPO: Vision-augmented Asymmetric Group Preference Optimization for Graph Routing Problems

Shiyan Liu, Bohan Tan, Zhiguang Cao, Yan Jin

机构 * Huazhong University of Science and Technology(华中科技大学) Singapore Management University(新加坡管理学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01555 2025-10-07 cs.LG cs.AI 81%

Rethinking KL Regularization in RLHF: From Value Estimation to Gradient Optimization

Kezhao Liu, Jason Klein Liu, Mingtao Chen, Yiming Liu

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09350 2025-10-03 cs.CV cs.AI cs.LG 81%

Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation

Shanchuan Lin, Ceyuan Yang, Hao He, Jianwen Jiang, Yuxi Ren, Xin Xia, Yang Zhao, Xuefeng Xiao, Lu Jiang

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08316 2025-10-03 cs.CV cs.AI cs.LG 81%

Diffusion Adversarial Post-Training for One-Step Video Generation

Shanchuan Lin, Xin Xia, Yuxi Ren, Ceyuan Yang, Xuefeng Xiao, Lu Jiang

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21718 2025-09-29 cs.AI cs.LG eess.AS 81%

Align2Speak: Improving TTS for Low Resource Languages via ASR-Guided Online Preference Optimization

Shehzeen Hussain, Paarth Neekhara, Xuesong Yang, Edresson Casanova, Subhankar Ghosh, Roy Fejgin, Ryan Langman, Mikyas Desta, Leili Tavabi, Jason Li

机构 * NVIDIA Corporation, USA(NVIDIA公司,美国)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

Comments Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20751 2025-09-26 cs.CV cs.AI cs.CL 81%

Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models

Zoe Wanying He, Sean Trott, Meenakshi Khosla

机构 * Department of Cognitive Science University of California, San Diego(认知科学系,加州大学圣地亚哥分校)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025 (camera-ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18026 2025-09-09 cs.LG cs.AI 81%

Addressing Concept Mislabeling in Concept Bottleneck Models Through Preference Optimization

Emiliano Penaloza, Tianyue H. Zhang, Laurent Charlin, Mateo Espinosa Zarlenga

机构 * Mila - Québec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12833 2025-08-13 cs.CV cs.AI cs.LG 81%

SPIE: Semantic and Structural Post-Training of Image Editing Diffusion Models with AI feedback

Elior Benarous, Yilun Du, Heng Yang

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05838 2025-08-11 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 81%

Integrating Vision Foundation Models with Reinforcement Learning for Enhanced Object Interaction

Ahmad Farooq, Kamran Iqbal

机构 * University of Arkansas at Little Rock(阿拉伯塔大学拉夫洛克分校)

专题命中 后训练与偏好优化 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments Published in the Proceedings of the 2025 3rd International Conference on Robotics, Control and Vision Engineering (RCVE'25). 6 pages, 3 figures, 1 table

Journal ref RCVE'25: Proceedings of the 2025 3rd International Conference on Robotics, Control and Vision Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05273 2025-08-07 cs.RO cs.AI cs.LG 81%

Real-World Offline Reinforcement Learning from Vision Language Model Feedback

Sreyas Venkataraman, Yufei Wang, Ziyu Wang, Navin Sriram Ravie, Zackory Erickson, David Held

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,克哈格浦尔分校) IIIS, Tsinghua University(清华大学人工智能研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI、cs.LG

Comments 7 pages. Accepted at the LangRob Workshop 2024 @ CoRL, 2024. Accepted at 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04883 2025-07-08 cs.LG cs.AI cs.CR 81%

Beyond Training-time Poisoning: Component-level and Post-training Backdoors in Deep Reinforcement Learning

Sanyam Vyas, Alberto Caron, Chris Hicks, Pete Burnap, Vasilios Mavroudis

机构 * Cardiff University(卡迪夫大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏