arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4556 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4556 篇

2605.12288 2026-06-11 cs.CL cs.AI 版本更新 84%

TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching

TokenRatio: 通过比率匹配实现原理化的token级偏好优化

Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van, Duy Minh Ho Nguyen, Khoa Doan, Trung Le

机构 * National University of Singapore(新加坡国立大学) Institute of Cybernetics and Robotics, Czech Technical University in Prague(捷克布拉格技术大学控制论与机器人研究所)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TBPO方法,通过比率匹配恢复token级偏好最优性,改进对齐质量和训练稳定性,并增加输出多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09850 2026-06-10 cs.LG cs.CL 新提交 84%

Mechanistic Analysis of Alignment Algorithms in Language Models

语言模型中对齐算法的机制分析

Aarush Sinha, Ishan Garg, Veeraraju Elluru, Arth Singh, Kushal Garg

机构 * University of Copenhagen(哥本哈根大学) Independent(独立研究者) IIT Jodhpur(印度理工学院焦特布尔分校) NIT Agartala(印度国立理工学院阿加尔塔拉分校) Narris

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文通过层间线性探针、稀疏自编码器和交叉编码器,系统分析了六种偏好优化方法在语言模型中的内部机制,发现不同目标函数导致不同的表示几何变换,并揭示了行为对齐与内部结构变化的不一致性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05924 2026-06-05 cs.CL cs.AI 84%

Better Literary Translation: A Multi-Aspect Data Generation and LLM Training Approach

更好的文学翻译:多维度数据生成与大语言模型训练方法

Zhihao Lin, Ziqi Zhu, Hao Huang, Guanghui Wang, Peiyang He

机构 * Amazon Web Services (AWS)(亚马逊网络服务(AWS)) Peking University(北京大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 提出多维度迭代优化框架,通过专门的大语言模型生成高质量翻译参考和偏好数据,结合监督微调和强化学习(GRPO)提升文学翻译质量,在MetaphorTrans英中文学翻译基准上达到与Claude Sonnet 4.5竞争的性能。

Comments Accepted by ACL 2026 Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17218 2026-05-27 cs.CL cs.AI cs.GT 84%

Alignment Makes Language Models Normative, Not Descriptive

对齐使语言模型变得规范,而非描述性

Eilam Shapira, Moshe Tennenholtz, Roi Reichart

机构 * Technion – Israel Institute of Technology(技术离子-以色列理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 通过对比120个基础-对齐模型对在超过10,000个真实人类决策中的表现,发现对齐诱导了规范性偏差:在单轮教科书式博弈中提升预测,但在多轮战略博弈中因忽略互惠、报复等描述性动态而损害预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05865 2026-05-26 cs.LG cs.AI 84%

Intrinsically Interpretable Attention via Sparse Post-Training

通过稀疏后训练实现内在可解释的注意力机制

Florent Draye, Anson Lei, Hsiao-Ru Pan, Ingmar Posner, Bernhard Schölkopf

机构 * MPI-IS(马克斯·普朗克研究所) University of Oxford(牛津大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出一种后训练方法,通过约束损失下的灵活稀疏正则化,在不牺牲性能的前提下将Transformer注意力连接稀疏至约0.4%,从而简化全局电路并提升可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17684 2026-05-19 cs.LG cs.AI 84%

CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models

CodeScaler: 通过奖励模型扩展代码大语言模型的训练和测试时间推理

Xiao Zhu, Xinyu Zhou, Boyu Zhu, Hanxu Hu, Mingzhe Du, Haotian Zhang, Huiming Wang, Zhijiang Guo

机构 * LARK, HKUST(GZ)(LARK,香港科技大学(广州)) Kuaishou Technology(快手科技) UCL(伦敦大学学院) UZH(苏黎世联邦理工学院) NUS(国立新加坡大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CodeScaler,一种通过奖励模型扩展代码生成模型的训练和测试时间推理的框架,通过精心编纂的偏好数据和语法感知的代码提取,实现了在四个编码基准上比基于执行的RL提升1.55分,在Qwen3-14B-Base上提升4.23分,并在无测试用例的情况下通过合成数据进一步提升14.64分,同时在推理时间减少10倍的延迟,且在代码、通用和推理领域均优于现有奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10981 2026-05-13 cs.LG cs.AI 84%

$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin

$ξ$-DPO:通过比率奖励边际进行直接偏好优化

Zhengyuan Fan, Zhonghua Wu, Yuxuan Du, Qun Chen

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出$ξ$-DPO,通过重新定义奖励形式和优化目标,解决SimPO中超参数联合调优难题,实现更直观的边际解释和稳定训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08327 2026-05-12 cs.LG cs.AI 84%

Interactive Critique-Revision Training for Reliable Structured LLM Generation

交互式批评-修订训练用于可靠的结构化大语言模型生成

Fei Xu Yu, Zuyuan Zhang, Mahdi Imani, Nathaniel D. Bastian, Tian Lan

机构 * The George Washington University(乔治华盛顿大学) Northeastern University(东北大学) United States Military Academy(美国军事学院)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DPA-GRPO方法,通过生成器-验证器游戏中的结构化验证干预,提升结构化决策的准确性与一致性,实验显示其在TaxCalcBench TY24上优于零样本生成和生成器-only RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08037 2026-05-11 cs.LG cs.AI 84%

Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph

超越成对:你的语言模型其实是在优化一个偏好图

Ning Liu, Chuanneng Sun, Kristina Klinkner, Shervin Malmasi

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphDPO,通过构建偏好图结构优化语言模型,解决传统成对优化在处理多轮次数据时的局限性,提升模型在推理和编程任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16453 2026-04-21 cs.LG cs.AI stat.ML 84%

Sampling for Quality: Training-Free Reward-Guided LLM Decoding via Sequential Monte Carlo

采样以保证质量:通过序列蒙特卡洛方法实现无训练奖励引导的大语言模型解码

Jelena Markovic-Voronov, Wenhui Zhu, Bo Long, Zhipeng Wang, Suyash Gupta, Kayhan Behdin, Bee-Chung Chen, Deepak Agarwal

机构 * LinkedIn

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于概率框架的奖励引导解码方法,通过结合模型转移概率和前缀依赖的奖励势能,改进传统解码方法的序列级质量优化。实验表明,该方法在代码生成和数学推理任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09541 2026-04-16 cs.CL cs.AI 84%

SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models

SPG:用于遮蔽扩散语言模型的夹心策略梯度

Chenyu Wang, Paria Rashidinejad, DiJia Su, Song Jiang, Sid Wang, Siyan Zhao, Cai Zhou, Shannon Zejiang Shen, Feiyu Chen, Tommi Jaakkola, Yuandong Tian, Bo Liu

机构 * Meta Superintelligence Labs(Meta超智能实验室) MIT(麻省理工学院) USC(南加州大学) UCLA(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SPG策略梯度方法,通过同时利用真实对数似然的上下界,解决扩散大语言模型在强化学习中对齐人类偏好或任务奖励的难题,实验显示其在多个任务中表现优异。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05117 2026-04-08 cs.CV cs.AI cs.CL 84%

Watch Before You Answer: Learning from Visually Grounded Post-Training

在回答前观看:从视觉引导的后训练中学习

Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang, Penghui Du, Yiming Jia, Dongfu Jiang, Xuan He, Shenhui Zhang, Ping Nie, Peter West, Kelsey R. Allen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Etude AI Kolors Team, Kuaishou Technology(快手科技Kolors团队) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文发现现有视频理解基准中40-60%的问题可通过文本线索回答,提出VidGround方法通过仅使用视觉引导问题提升VLM性能,实验显示其在后训练中效果优于复杂方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04261 2026-04-07 cs.LG cs.AI 84%

APPA: Adaptive Preference Pluralistic Alignment for Fair Federated RLHF of LLMs

APPA:自适应偏好多元对齐用于大语言模型公平联邦强化学习从人类反馈

Mahmoud Srewa, Tianyu Zhao, Salma Elmalaki

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 后训练与偏好优化 :RLHF(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出APPA框架,通过动态调整群体奖励权重,提升联邦强化学习中多群体公平对齐效果,实验显示其在保持整体对齐性的同时,显著提升最差群体对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23184 2026-03-25 cs.CL cs.AI stat.AP 84%

ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment

ImplicitRM: 从隐式偏好数据中无偏奖励建模以实现语言模型对齐

Hao Wang, Haocheng Yang, Licheng Pan, Lei Shen, Xiaoxi Li, Yinuo Wang, Zhichao Chen, Yuan Lu, Haoxuan Li, Zhouchen Lin

机构 * Peking University(北京大学) Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :LLM(title);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ImplicitRM,通过隐式反馈数据学习无偏奖励模型,解决隐式偏好数据中缺乏明确负样本和用户偏好偏差的问题,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19532 2026-03-23 cs.CL cs.IR cs.LG 84%

EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models

EvidenceRL: 为可信语言模型强化证据一致性

J. Ben Tamo, Yuxing Lu, Benoit L. Marteau, Micky C. Nnamdi, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Pekin University(培根大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 EvidenceRL通过强化学习框架在训练中强制证据遵循,提升语言模型在医疗诊断和法律推理中的证据接地和可信度,同时保持任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21240 2026-03-19 cs.LG cs.AI 84%

Tree Search for LLM Agent Reinforcement Learning

基于树搜索的LLM代理强化学习

Yuxiang Ji, Ziyu Ma, Yong Wang, Guanhua Chen, Xiangxiang Chu, Liaoni Wu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里集团AMAP实验室) Southern University of Science and Technology(南方科技大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tree-GRPO方法,通过树结构提升LLM代理在长期任务中的表现,利用树搜索共享前缀以增加rollout数量,并通过理论分析证明其与直接偏好学习等效。

Comments ICLR 2026, Code: https://github.com/AMAP-ML/Tree-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22607 2026-03-11 cs.AI cs.CL 84%

From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents

从自演化合成数据到可验证奖励强化学习:训练后多轮交互工具使用智能体

Jiaxuan Gao, Jiaao Chen, Chuyi He, Shusheng Xu, Di Jin, Yi Wu

专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EigenData框架,结合自演化数据代理与验证器强化学习,通过合成数据提升多轮交互工具使用智能体的训练效率和性能。

Comments Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04918 2026-03-06 cs.LG cs.AI 84%

BandPO: Bridging Trust Regions and Ratio Clipping via Probability-Aware Bounds for LLM Reinforcement Learning

BandPO: 通过概率感知边界弥合信任区域与比率裁剪用于大语言模型强化学习

Yuan Li, Bo Wang, Yufei Gao, Yuqian Yao, Xinyuan Wang, Zhangyue Yin, Xipeng Qiu

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 BandPO通过概率感知边界解决大语言模型强化学习中的探索瓶颈,提升性能并缓解熵崩溃问题。

Comments Code available at https://github.com/OpenMOSS/BandPO.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06084 2026-03-04 cs.CL cs.AI 84%

Spectrum Tuning: Post-Training for Distributional Coverage and In-Context Steerability

频谱调节:面向分布覆盖和上下文可引导性的后训练

Taylor Sorensen, Benjamin Newman, Jared Moore, Chan Park, Jillian Fisher, Niloofar Mireshghallah, Liwei Jiang, Yejin Choi

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Spectrum Tuning方法,通过Spectrum Suite提升模型在多样化分布下的引导能力和输出空间覆盖性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05619 2026-03-03 cs.AI cs.LG 84%

Beyond RLHF and NLHF: Population-Proportional Alignment under an Axiomatic Framework

超越RLHF和NLHF:在公理框架下的人口比例对齐

Kihyun Kim, Jiawei Zhang, Asuman Ozdaglar, Pablo A. Parrilo

机构 * MIT LIDS(麻省理工学院LIDS) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :RLHF(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于公理框架的人口比例对齐方法,通过社会选择理论解决传统偏好学习中的偏差和操纵问题,并在推荐任务和语言模型对齐中验证了其有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16053 2026-02-20 cs.LG cs.CL 84%

Multi-Objective Alignment of Language Models for Personalized Psychotherapy

多目标对齐语言模型以实现个性化心理治疗

Mehrab Beikzadeh, Yasaman Asadollah Salmanpour, Ashima Suvarna, Sriram Sankararaman, Matteo Malgaroli, Majid Sarrafzadeh, Saadia Gabriel

机构 * Department of Computer Science, University of California, Los Angeles, CA, USA(计算机科学系,加州大学洛杉矶分校) Department of Psychology, The University of Texas at Austin, Austin, TX, USA(心理学系,德克萨斯大学奥斯汀分校) Department of Psychiatry, NYU Grossman School of Medicine, New York, NY, USA(精神病学系,纽约大学格罗斯曼医学院)

专题命中 后训练与偏好优化 :language model(title);LLM(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文提出多目标对齐框架,通过直接偏好优化提升语言模型在心理治疗中的共情与安全性能,实验显示其在平衡患者偏好与临床安全方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00040 2026-02-20 cs.LG cs.AI 84%

Semi-Supervised Preference Optimization with Limited Feedback

半监督偏好优化与有限反馈

Seonggyun Lee, Sungjun Lim, Seojin Park, Soeun Cheon, Kyungwoo Song

机构 * Yonsei University(延世大学) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出半监督偏好优化方法,通过结合少量标注数据和大量未标注数据,有效提升模型对齐人类偏好的效率,减少数据获取成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13055 2026-02-16 cs.CV cs.AI cs.LG 84%

Curriculum-DPO++: Direct Preference Optimization via Data and Model Curricula for Text-to-Image Generation

Curriculum-DPO++: 通过数据和模型课程直接优化偏好用于文本到图像生成

Florinel-Alin Croitoru, Vlad Hondru, Radu Tudor Ionescu, Nicu Sebe, Mubarak Shah

机构 * Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系) University of Trento(特伦托大学) Center for Research in Computer Vision (CRCV), University of Central Florida(中央佛罗里达大学计算机视觉研究中心)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 Curriculum-DPO++通过数据和模型课程增强直接偏好优化,提升文本到图像生成的性能。

Comments arXiv admin note: substantial text overlap with arXiv:2405.13637

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12530 2026-02-13 cs.CL cs.LG 84%

Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations

将策略翻译为语言:通过生成连续归一化流生成的奖励用于LLM解释

Xinyi Yang, Liang Zeng, Heng Dong, Chao Yu, Xiaoran Wu, Huazhong Yang, Yu Wang, Milind Tambe, Tonghan Wang

机构 * AIPD, Tencent, Shenzhen, China(腾讯人工智能与大数据研究院,深圳,中国) IIIS, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) EE, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国) CS, Tsinghua University, Beijing, China(清华大学计算机系,北京,中国) SEAS, Harvard University, Cambridge, USA(哈佛大学工程学院,剑桥,美国) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国)

专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过生成连续归一化流生成奖励,训练LLM生成更准确、逻辑严谨且认知负担更低的解释,以提升智能体与人类共存的可靠性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08847 2026-02-10 cs.LG cs.AI 84%

Dr. MAS: Stable Reinforcement Learning for Multi-Agent LLM Systems

Dr. MAS:多智能体大语言模型系统的稳定强化学习

Lang Feng, Longtao Zheng, Shuo He, Fuxiang Zhang, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 Dr. MAS通过智能体级归一化方法稳定多智能体大语言模型的强化学习训练,提升性能并减少梯度不稳定问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05113 2026-02-06 cs.AI cs.LG 84%

Democratic Preference Alignment via Sortition-Weighted RLHF

通过排序加权RLHF实现民主偏好对齐

Suvadip Sana, Jinzhou Wu, Martin T. Wells

机构 * cornell(康奈尔大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 DemPO通过算法排序机制优化偏好对齐,确保民主代表性,提升模型对代表性公众价值观的反映能力。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05049 2026-02-06 cs.CV cs.AI cs.LG cs.RO 84%

VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models

VISTA: 通过视觉跟踪偏好优化增强视觉条件化在视觉-语言-动作模型中

Yiye Chen, Yanan Jian, Xiaoyi Dong, Shuxin Cao, Jing Wu, Patricio Vela, Benjamin E. Lundell, Dongdong Chen

机构 * Nvidia(Nvidia公司) Microsoft(微软公司) University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VISTA通过视觉跟踪偏好优化提升视觉条件化,增强VLA模型在视觉-动作对齐和任务性能上的表现。

Comments In submission. Project website: https://vista-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01587 2026-02-03 cs.CL cs.AI 84%

Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment

通过噪声增强对齐的可证明防御框架对抗LLM劫持

Zehua Cheng, Jianwei Yang, Wei Dai, Jiahao Sun

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过噪声增强对齐的可证明防御框架,有效降低LLM劫持攻击成功率,提升模型鲁棒性与实用性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22083 2026-02-03 cs.LG cs.AI 84%

Latent Adversarial Regularization for Offline Preference Optimization

潜在对抗正则化用于离线偏好优化

Enyi Jiang, Yibo Jacky Zhang, Yinglun Xu, Andreas Haupt, Nancy Amato, Sanmi Koyejo

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Siebel School of Computing(塞贝尔计算学院) Data Science, University of Illinois at Urbana-Champaign(数据科学,伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GANPO,通过潜在空间正则化提升语言模型的离线偏好优化性能,增强鲁棒性并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21282 2026-02-02 cs.LG cs.AI 84%

It's Not You, It's Clipping: A Soft Trust-Region via Probability Smoothing for LLM RL

并非你,而是剪裁:通过概率平滑的软信任区域进行大语言模型强化学习

Madeleine Dwyer, Adam Sobey, Adriane Chapman

机构 * University of Southampton(索姆塞特大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PSPO方法,通过概率平滑改进大语言模型强化学习中的信任区域,提升数学推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏