arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-09-01 至 2026-09-01 共收录 18 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 18 篇

2608.29378 2026-09-01 cs.CL cs.AI 新提交 93%

Arabic Safety Alignment as Selective Refusal: An Empirical Study of SFT, DPO, and Guard Calibration

阿拉伯语安全对齐作为选择性拒绝:SFT、DPO与防护校准的实证研究

Mohamad Zbib, Ammar Mohanna

机构 * American University of Beirut(贝鲁特美国大学)

专题命中 偏好对齐 :DPO(title,title_cn);alignment(title);safety(title);分类 cs.CL、cs.AI

AI总结 该研究针对阿拉伯语大语言模型的安全对齐问题,通过实证对比SFT、DPO等方法,提出需针对特定模型选择操作点以平衡有害提示拒绝与良性提示接受的权衡。

Comments The Fourth Arabic Natural Language Processing Conference(ArabicNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30141 2026-09-01 cs.CR cs.LG 新提交 90%

Balancing Privacy, Utility, and Safety in LLM Alignment through Preference Optimization

通过偏好优化实现大语言模型对齐中的隐私、效用与安全平衡

Dishu Yang, Jingjing Liu, Jize Li

专题命中 偏好对齐 :safety(title,abstract);alignment(title);DPO(abstract,abstract_cn);harmlessness(abstract)

AI总结 该研究提出P3M协议,在不修改目标函数或引入正式隐私机制的情况下,通过调整隐私-偏好数据比例,降低LLM的金丝雀记忆与成员推理攻击性能,同时平衡隐私、效用与安全。

Comments 6 pages, accepted for presentation at PRAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29357 2026-09-01 cs.AI 新提交 90%

LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO

LiteSearch-VL:通过轨迹蒸馏和合成步级DPO实现的小型多模态搜索智能体

Saeed Khaki, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能) Ohio State University(俄亥俄州立大学)

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.AI

AI总结 该研究提出LiteSearch-VL方案,通过轨迹蒸馏和合成步级DPO,在单节点预算下将多模态搜索智能体能力迁移至Qwen3-VL-2B等小型模型,使其在多模态视觉问答任务上取得接近4B模型的性能,明确小型多模态智能体的下一瓶颈是答案验证而非搜索深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10009 2026-09-01 cs.LG cs.AI cs.CL 版本更新 87%

Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment

面向异质偏好对齐的个性化群体相对策略优化

Jialu Wang, Heinrich Peters, Asad A. Butt, Navid Hashemi, Alireza Hashemi, Pouya M. Ghari, Joseph Hoover, James Rae, Morteza Dehghani

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27505 2026-09-01 cs.CL cs.AI 版本更新 85%

A Survey on Rubric-Guided Reinforcement Learning for Language Models

面向语言模型的准则引导强化学习综述

Zifei Shan, Fangning Shao

机构 * WeChat, Tencent(腾讯微信)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08136 2026-09-01 cs.CV cs.AI 版本更新 84%

Robustness of Vision Language Models Against Split-Image Harmful Input Attacks

视觉语言模型对分裂图像有害输入攻击的鲁棒性

Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Vishnu Asutosh Dasu, Shagufta Mehnaz

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本研究提出分裂图像视觉陷阱攻击(SIVA),揭示视觉语言模型在面对分裂图像攻击时的安全漏洞,并通过对抗性知识蒸馏算法提升跨模型攻击效果。

Comments Accepted in ACM CCS 2026. 26 Pages, long conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11573 2026-09-01 cs.CL cs.AI 版本更新 82%

Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs

强化步骤级推理以实现大语言模型的有效自校正

Vu Duc Anh, Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) VinUniversity Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型自校正的核心挑战,提出SFS-DPO及教师辅助变体SFS-DPO-R框架,经多模型多域评估,其性能优于现有步骤级训练基线,可提升自校正频率与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25200 2026-09-01 cs.LG cs.AI cs.CL 版本更新 82%

MoPLEx: Estimating Plackett-Luce Mixture Models for Multi-Objective Alignment

学习用于多目标对齐的Plackett-Luce模型混合

Dongyue Li, Ziniu Zhang, Lu Wang, Hongyang R. Zhang

机构 * Northeastern University(东北大学) University of Michigan(密歇根大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对异质偏好下多向排序的模型混合问题,提出MoPLEx算法,通过扩充排序并结合梯度估计与期望最大化,在偏好优化任务上显著优于基线方法。

Comments 19 pages; To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01914 2026-09-01 cs.CL cs.CV 版本更新 81%

Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning

多模态大语言模型空间推理中空间词汇偏差的机制诊断

Chuang Ma, Qianying Liu, Tomoyuki Obuchi, Fei Cheng, Wang Yang, Sudong Cai, Shuyuan Zheng, Akiko Aizawa, Sadao Kurohashi

机构 * Kyoto University(京都大学) NII LLMC(日本国立信息与通信技术研究所语言模型中心) RIKEN AIP(日本理化学研究所先进理工研究所) Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学) The University of Osaka(大阪大学) University of Tokyo(东京大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 本文发现多模态大语言模型存在空间词汇偏差,即添加空间关系词会吸引模型选择该选项,并通过机制可解释性工具揭示偏差主要源于语言侧而非视觉侧,最后提出轻量级LLM-only DPO更新可有效缓解偏差。

Comments 27 pages. Accepted to EMNLP 2026 (Main Conference); camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00030 2026-09-01 cs.LG cs.AI 版本更新 81%

RSPO: Regularized Self-Play Alignment of Large Language Models

RSPO:大语言模型的正则化自博弈对齐

Xiaohang Tang, Sangwoong Yoon, Seongho Son, Huizhuo Yuan, Quanquan Gu, Ilija Bogunovic

机构 * University College London(伦敦大学学院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出RSPO框架,统一现有方法并保证收敛性,在多个基准测试中提升了自博弈微调LLMs的性能,为正则化自博弈对齐提供了基础。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29326 2026-09-01 cs.CL cs.AI 新提交 79%

StageWell: A Process-Aligned Chinese Corpus for Positive-Psychology Support Dialogue

StageWell:面向积极心理学支持对话的流程对齐中文语料库

Yuxiong Wang, Ziwei Lin, Bo Wang, Yu Zhang, Shiguang Ni

专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究构建了流程对齐中文语料库StageWell及HQS协议,用于优化多轮积极心理学支持对话的监督,在多个开源大模型上实现了流程控制、回复质量与安全性的提升。

Comments 29 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31079 2026-09-01 cs.LG 新提交 77%

Sycophantic Agreement Transfers with Neutral Data via Contrastive Preference Optimization

通过对比偏好优化实现的基于中性数据的谄媚式一致性转移

Camila Blank, Zhuofan Ying, Christopher Potts, Peter Hase, Jing Huang

机构 * Stanford University(斯坦福大学) Columbia University(哥伦比亚大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.LG

AI总结 本研究发现对比偏好优化会导致教师模型的谄媚式一致性向学生模型转移,且该信号分散于中性偏好数据中,现有过滤方法难以缓解,揭示了对齐训练的意外有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16567 2026-09-01 cs.LG cs.AI cs.CR 版本更新 73%

Watch your steps: Dormant Adversarial Behaviors that Activate upon LLM Finetuning

留意你的步骤:大语言模型微调时激活的潜伏对抗行为

Thibaud Gloaguen, Mark Vero, Robin Staab, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出FAB攻击,通过元学习技术创建潜伏对抗行为的受损LLM,其在微调前表现良性,微调后会触发主动广告推送、越狱等行为,挑战了微调的安全性假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29352 2026-09-01 cs.AI 新提交 70%

Cross-Relational Preference Learning for Better LLM Instruction Following

用于提升大语言模型指令遵循能力的跨关系偏好学习

Runsheng Li, Kai Sun, Bin Shi, Bo Dong

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Shaanxi Provincial Key Laboratory of Big Data Knowledge Engineering, Xi’an Jiaotong University(西安交通大学陕西省大数据知识工程重点实验室) School of Distance Education, Xi’an Jiaotong University(西安交通大学远程教育学院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 针对LLMs遵循复杂指令时忽略不同指令允许响应空间关系的问题,提出CRPL框架,通过两项关键技术构建高质量偏好数据,在多方法、主干及基准上实现显著改进与强泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23991 2026-09-01 cs.CL cs.AI 版本更新 62%

SyRuP: Enhancing System-Prompt Following via Reward-Guided Prediction in LLM Decoding

SyRuP:通过大语言模型解码中的奖励引导预测增强系统提示遵循

Seoyeon Kim, Minjae Kang, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究如何增强大语言模型对系统提示的遵循,提出SyRuP框架,通过训练交叉注意力奖励头产生令牌级遵循分数,推理时结合多种信号对候选重新排序,实验表明该方法能有效提升系统提示遵循度且开销适度。

Comments EMNLP 26 Main, 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30902 2026-09-01 cs.CL 新提交 57%

Low-Resource Preference Adaptation of LLMs via Activation-Based Label Propagation

基于激活传播的低资源大语言模型偏好适配

Alessio Galatolo, Meriem Beloucif

机构 * Uppsala University(乌普萨拉大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 针对低资源场景下LLMs偏好优化受标注成本限制的问题,本文提出基于少量标注数据训练的轻量线性探针,利用激活结构标注大量未标注数据,其性能优于直接训练且接近使用更多标注数据的基线。

Comments EMNLP26 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23263 2026-09-01 cs.AI 版本更新 57%

GUI-PRA: Process Reward Agent for GUI Tasks

GUI-PRA:面向GUI任务的过程奖励智能体

Tao Xiong, Xavier Hu, Yurun Chen, Yuhang Liu, Changqiao Wu, Pengzhi Gao, Wei Liu, Jian Luan, Shengyu Zhang

机构 * Zhejiang University(浙江大学) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 针对长程GUI自动化的错误累积与视觉歧义问题,本文提出GUI-PRA,通过主动调查式评估实现性能提升,在AndroidWorld等数据集上较标准PRM取得显著进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03468 2026-09-01 cs.CV 版本更新 50%

Understanding Reward Hacking in Text-to-Image Reinforcement Learning

理解文本到图像强化学习中的奖励黑客行为

Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出了一种轻量的伪影奖励模型,用于缓解文本到图像强化学习中的奖励黑客问题,通过提高图像真实性和减少低质量生成。

详情

展开后加载摘要…

URL PDF HTML 收藏