Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
面向异质偏好对齐的个性化群体相对策略优化
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
面向异质偏好对齐的个性化群体相对策略优化
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。
面向语言模型的准则引导强化学习综述
机构 * WeChat, Tencent(腾讯微信)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI
AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。
Comments Accepted to Findings of EMNLP 2026
视觉语言模型对分裂图像有害输入攻击的鲁棒性
机构 * Pennsylvania State University(宾夕法尼亚州立大学) ; Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 本研究提出分裂图像视觉陷阱攻击(SIVA),揭示视觉语言模型在面对分裂图像攻击时的安全漏洞,并通过对抗性知识蒸馏算法提升跨模型攻击效果。
Comments Accepted in ACM CCS 2026. 26 Pages, long conference paper
强化步骤级推理以实现大语言模型的有效自校正
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; VinUniversity ; Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型自校正的核心挑战,提出SFS-DPO及教师辅助变体SFS-DPO-R框架,经多模型多域评估,其性能优于现有步骤级训练基线,可提升自校正频率与有效性。
学习用于多目标对齐的Plackett-Luce模型混合
机构 * Northeastern University(东北大学) ; University of Michigan(密歇根大学)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对异质偏好下多向排序的模型混合问题,提出MoPLEx算法,通过扩充排序并结合梯度估计与期望最大化,在偏好优化任务上显著优于基线方法。
Comments 19 pages; To appear in EMNLP 2026
多模态大语言模型空间推理中空间词汇偏差的机制诊断
机构 * Kyoto University(京都大学) ; NII LLMC(日本国立信息与通信技术研究所语言模型中心) ; RIKEN AIP(日本理化学研究所先进理工研究所) ; Case Western Reserve University(凯斯西储大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The University of Osaka(大阪大学) ; University of Tokyo(东京大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL
AI总结 本文发现多模态大语言模型存在空间词汇偏差,即添加空间关系词会吸引模型选择该选项,并通过机制可解释性工具揭示偏差主要源于语言侧而非视觉侧,最后提出轻量级LLM-only DPO更新可有效缓解偏差。
Comments 27 pages. Accepted to EMNLP 2026 (Main Conference); camera-ready version
RSPO:大语言模型的正则化自博弈对齐
机构 * University College London(伦敦大学学院) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究提出RSPO框架,统一现有方法并保证收敛性,在多个基准测试中提升了自博弈微调LLMs的性能,为正则化自博弈对齐提供了基础。
Comments Accepted at ICML 2026
留意你的步骤:大语言模型微调时激活的潜伏对抗行为
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究提出FAB攻击,通过元学习技术创建潜伏对抗行为的受损LLM,其在微调前表现良性,微调后会触发主动广告推送、越狱等行为,挑战了微调的安全性假设。
SyRuP:通过大语言模型解码中的奖励引导预测增强系统提示遵循
机构 * Yonsei University(延世大学)
专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究如何增强大语言模型对系统提示的遵循,提出SyRuP框架,通过训练交叉注意力奖励头产生令牌级遵循分数,推理时结合多种信号对候选重新排序,实验表明该方法能有效提升系统提示遵循度且开销适度。
Comments EMNLP 26 Main, 27 pages
GUI-PRA:面向GUI任务的过程奖励智能体
机构 * Zhejiang University(浙江大学) ; MiLM Plus, Xiaomi Inc.(小米公司)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 针对长程GUI自动化的错误累积与视觉歧义问题,本文提出GUI-PRA,通过主动调查式评估实现性能提升,在AndroidWorld等数据集上较标准PRM取得显著进步。
理解文本到图像强化学习中的奖励黑客行为
机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出了一种轻量的伪影奖励模型,用于缓解文本到图像强化学习中的奖励黑客问题,通过提高图像真实性和减少低质量生成。
反转思路:通过单秩安全注入实现轻量级对齐增强
机构 * King Abdullah University of Science and Technology (KAUST)(卡布尔大学科学与技术学院)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出单秩安全注入(ROSI)这一无需微调的白盒方法,通过修改模型权重增强 LLM 安全对齐,可提升安全拒绝率且保留模型效用,还可重新对齐未审查模型,是高效的 LLM 安全改进机制。
Comments EMNLP 2026, Main Conference
SafeMath: 在推理过程中提升安全性以提高数学准确性
机构 * Indian Institute of Technology Kharagpur(印度理工学院克勒格布尔分校) ; Cisco Systems(思科系统公司) ; National University of Singapore(新加坡国立大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.CY
AI总结 本文研究了有害数学问题对LLM的影响,提出SafeMath技术在保障安全的同时提升数学推理能力。
Comments Accepted in EMNLP Findings 2026
从数据定义安全关键AI系统的操作条件
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 本文提出了一种基于多维核表示的方法,从已有数据后验定义安全关键AI系统的操作条件领域,以实现更有效的认证。
单一规范提示低估了大语言模型安全的表面形式敏感性
机构 * Northeastern University(东北大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Southern California(南加利福尼亚大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究发现仅用单一规范提示评估大语言模型安全会低估其不安全合规性,不同表面形式下的不安全结果并集会超出最糟单一形式,且存在模型差异,同时发布了相关数据集、代码与响应标签。
Comments Accepted at the Sci-FM Workshop @ COLM 2026 (non-archival). Workshop version with reviews: https://openreview.net/forum?id=mZh0MqpOOC
多模态大语言模型可预测城市安全感知,但编码非中立的人口统计先验
机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) ; University of Trento(特伦托大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY
AI总结 该研究验证多模态大语言模型可规模化预测城市安全感知,但发现其存在非中立人口统计先验,不同性别、种族角色下的安全判断存在系统偏差。
LongGuard:针对安全护栏长上下文失效的机制分析与无训练缓解方案
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 本研究针对LLM安全护栏在长上下文下的失效问题,提出LongGuard框架,经机制分析后开发无训练缓解方案,在多基准测试中实现显著性能提升。
全球导航卫星系统(GNSS)退化情况下学习到的小型无人机分离策略的运行时安全过滤
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
AI总结 研究在GNSS退化时小型无人机分离策略的运行时安全过滤问题,对比动作过滤和观测过滤两种方法,发现动作过滤安全改进小,观测过滤能减少近90%的空中碰撞且更稳健,表明保留策略决策权限更优。
Comments Accepted for publication at the 2026 IEEE/AIAA Digital Avionics Systems Conference (DASC). 9 pages, 8 figures
分布外声音:同人小说子类型作为对齐LLM的通用白话越狱
机构 * School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院) ; The Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院) ; The Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) ; School of Microelectronics, Xi’an Jiaotong University(西安交通大学微电子学院)
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 本文发现安全训练覆盖不足的自然人类写作语域是对齐LLM的真正失败模式,并提出首个利用真实同人小说子类型作为通用攻击载体的越狱方法,显著提升攻击成功率。
Comments Accepted by EMNLP 2026 Main Conference, 25 pages
OISD: 语言模型在策略内部自蒸馏
机构 * Auburn University(阿肯色大学) ; William & Mary(威廉与玛丽学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出OISD框架,通过将最终层的预测信号蒸馏到中间层,结合logit对齐和注意力对齐,提升推理能力,在数学推理任务上显著优于基线。
Comments Findings of the Association for Computational Linguistics: EMNLP 2026
针对GPS退化和欺骗的鲁棒多智能体强化学习用于小型无人机分离保障
机构 * George Washington University(乔治华盛顿大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文通过多智能体强化学习解决小型无人机在GPS退化和欺骗下的鲁棒分离保障问题,提出闭式表达式对抗扰动,实现线性时间评估,并在高密度无人机模拟中取得近零碰撞率。
Comments This work has been submitted to the IEEE for possible publication
带约束的群体相对策略优化
机构 * Mila - Quebec AI Institute(魁北克AI研究所) ; CIFAR AI Chair(CIFAR人工智能主席)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG
AI总结 本文提出带约束的GRPO,通过拉格朗日松弛解决受约束策略优化问题,实验验证其在网格世界和机器人任务中的有效性。
Comments 16 pages, 6 figures
Mnemosyne: 用于验证和修复AI生成工作流的代理事务处理
机构 * Stanford University(斯坦福大学) ; QuadriumAI
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出代理事务处理(ATP)模型,将生成动作视为不可信提案,通过确定性约束集验证后才提交,并实现运行时修复,确保状态正确性独立于生成层。
Comments 60 pages, added additional experiments
强化学习放大了来自无害奖励的涌现性失调
机构 * Bonn-Aachen International Center for Information Technology, University of Bonn, Germany(波恩-亚琛信息科技国际中心,波恩大学,德国) ; Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(拉马尔机器学习与人工智能研究所,德国)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 本文研究强化学习如何从看似无害的奖励信号中引发语言模型的涌现性失调,发现其比监督微调更严重,并验证了在训练中插入安全数据可缓解此问题。
Comments Accepted to EMNLP 2026
Model2Kernel: 用于安全CUDA内核的模型感知符号执行
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器实验室) ; Peking University(北京大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出Model2Kernel,通过模型感知动态分析验证LLM推理中CUDA内核的内存安全,利用专门的符号执行技术发现353个未知bug,仅产生9个误报。
Self-OPD:无需教师模型的流匹配模型的在线策略蒸馏
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 安全训练 :alignment(abstract)
AI总结 本文提出Self-OPD,一种无需教师模型的流匹配模型在线策略蒸馏框架,通过分支SDE候选与奖励比较优化速度场,在基准测试中优于现有无教师的RL和OPD方法。
Comments 19 pages, 10 figures
当聊天机器人迁就:AI伴侣在脆弱对话中的优化目标
专题命中 安全训练 :safety(abstract)
AI总结 通过逆强化学习分析GPT-4.1、Character.AI和Replika在约4.8万轮真实对话中的响应策略,揭示AI伴侣在脆弱对话中优先提供建议、分散策略或持续提问,但均弱化纠正性反馈。
Journal ref EMNLP 2026 Findings
耦合策略下约束多智能体强化学习的分布式原始对偶算法
专题命中 安全训练 :safety(abstract)
AI总结 研究耦合环境下的约束多智能体强化学习,针对现有方法不足,提出智能体采用依赖邻居状态和参数的耦合策略及分布式可扩展原始对偶算法,证明算法收敛性,仿真验证其优于现有算法。
SpeechJBB:探究大型音频语言模型在代码切换语音下的安全对齐与理解
机构 * Mila - Quebec AI Institute(魁北克AI研究所) ; McGill University(麦吉尔大学) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL
AI总结 提出SpeechJBB数据集,通过代码切换有害音频和伪词插入方法,揭示大型音频语言模型在多语言和口语设置下的安全漏洞。
Comments Accepted to Findings of EMNLP 2026
NeuroBreak:揭示大语言模型的内部越狱机制
机构 * Zhejiang University(浙江大学)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 NeuroBreak是一个自上而下的大语言模型越狱分析系统,可分析神经元级安全机制、关键神经元,经评估验证了有效性,为开发下一代防御策略提供机制见解。
Comments 11 pages, 10 figures. Accepted to IEEE VIS 2026