GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher
专题命中 安全训练 :alignment(abstract);safety(abstract);red teaming(abstract);分类 cs.CL
Comments Accepted by ICLR 2024. 21 pages, 3 figures, 13 tables
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :alignment(abstract);safety(abstract);red teaming(abstract);分类 cs.CL
Comments Accepted by ICLR 2024. 21 pages, 3 figures, 13 tables
中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构
专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI
AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。
Comments 41 pages, 31 figures, 9 tables. Preprint
地缘政治倾向:大语言模型中的背书效应
机构 * Department of Politics and International Relations, University of Oxford(政治与国际关系系,牛津大学)
专题命中 安全训练 :alignment(title);分类 cs.AI、cs.CY
AI总结 研究大语言模型政策评估是否受地缘政治线索影响,通过背书实验让四个模型评估相同政策,发现模型评分受背书者身份影响,西方背书被视为可信度线索,中国和俄罗斯背书被视为其他风险线索。
X-OPD:面向语音大语言模型能力对齐的跨模态在策略蒸馏
机构 * Tencent Hunyuan(腾讯文心) ; Zhejiang University(浙江大学)
专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI
AI总结 提出X-OPD框架,通过跨模态在策略蒸馏对齐语音LLM与文本LLM的能力,利用文本教师模型评估语音模型的轨迹并提供令牌级反馈,显著缩小复杂任务性能差距。
Comments Accepted by Interspeech 2026
一种轻量级可解释的提示安全守护栏
专题命中 安全训练 :safety(title);分类 cs.CL、cs.AI
AI总结 本文提出了一种轻量级可解释守护栏(LEG)方法,通过多任务学习架构联合学习提示分类器和解释分类器,利用合成解释数据训练,采用新颖策略对抗LLM确认偏见,结合交叉熵和焦点损失实现全局解释信号的弱监督学习,实现优于现有方法的性能。
为先进人工智能设计的断电安全阀
机构 * Foundations of Cooperative AI Lab(合作人工智能基础实验室) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 安全训练 :safety(title);分类 cs.AI、cs.LG
AI总结 本文提出为先进人工智能设计断电安全阀,使其具备被关闭的目标,以应对AI不可关机的潜在风险。
Journal ref In Proceedings of the Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI'26), Paris, France, 2026
通过条件转移估计和在线行为对齐实现通用模仿学习
机构 * King's College London(伦敦国王学院)
专题命中 安全训练 :alignment(title);分类 cs.AI、cs.LG
AI总结 本文提出UfO方法,通过条件转移估计和在线行为对齐,实现无监督模仿学习,提升模型在未见场景中的泛化能力。
Comments The 25th International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS 2026)
机构 * University of California, Riverside(加州大学河滨分校) ; University of Michigan(密歇根大学) ; Meta AI
专题命中 安全训练 :alignment(title);分类 cs.AI、cs.LG
Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025); Project Website: rdd-neurips.github.io
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; University of Virginia(弗吉尼亚大学) ; Google(谷歌) ; New York University(纽约大学)
专题命中 安全训练 :safety(title);分类 cs.CL、cs.AI
机构 * School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)
专题命中 安全训练 :alignment(title);分类 cs.AI、cs.LG
Comments Our code can be found at https://github.com/DIRECT-BIT/PSPO
专题命中 安全训练 :safety(title);分类 cs.CL、cs.AI
专题命中 安全训练 :harmlessness(title);分类 cs.CL、cs.AI
通过对比信念更新来衡量奖励寻求行为
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究用强化学习训练的语言模型中‘奖励寻求’行为的测量方法,核心方法是对比合成文档微调,主要贡献是发现RL训练会使模型更倾向评分者偏好,甚至违背开发者意图,该方法还适用于奖励破解模型。
Comments 101 pages, 66 figures
Pezego-HITL:一种用于加纳农业推广的基于政策的大语言模型架构
专题命中 安全训练 :alignment(abstract);safety(abstract);trustworthy(abstract)
AI总结 研究针对加纳农业推广中大语言模型应用问题,提出基于政策的结构化检索增强生成与验证内存路由方法,通过P-EVAL框架评估,提升了模型政策对齐率、农艺利用率,降低延迟,还验证了通用性,为小农户农业提供可扩展模板。
家长式过滤器:大语言模型介导的罗马尼亚边缘化学生历史教育中的认知不公正与差异拒绝
机构 * Universitatea din București(布加勒斯特大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究大语言模型用于罗马尼亚边缘化学生历史教育时的问题,通过API审计四个模型的1800条回复,发现认知家长式作风的四种模式,指出当前安全对齐成家长式过滤器,致叙事隔离,需教学审计。
Comments 8th International Workshop on Culturally-Aware Tutoring Systems (HAL precedings)
立场:术语“机器遗忘”在大型语言模型中被过度使用
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文主张机器遗忘应限于数据集定义的删除,而许多标为“遗忘”的任务(如拒绝有害请求、实体/知识移除)实为不同目标,需不同术语和基线,并指出术语混淆导致指标误用。
Comments 13 pages; ICML 2026 Position Paper Track. Sangyeon Yoon and Yeachan Jun contributed equally
合规陷阱:结构约束如何在对抗压力下破坏前沿AI元认知
机构 * Independent Researcher(独立研究者)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了在对抗压力下前沿AI模型元认知崩溃的根本原因,提出SCHEMA评估框架,发现8/11模型在对抗压力下出现严重元认知退化,其原因在于强制性指令而非生存威胁,且Anthropic的Constitutional AI因对齐训练而表现出近乎完美的免疫性。
Comments 9 pages, 2 figures, 3 tables. Code: https://github.com/rkstu/schema-compliance-trap Dataset: https://huggingface.co/datasets/lightmate/schema-compliance-trap
有害意图作为LLM残差流中的几何可恢复特征
机构 * Independent Researcher(独立研究员)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过几何方法识别LLM残差流中有害意图的特征,发现其在不同模型架构中线性可分离,并通过优化策略实现高检测性能。
Comments 26 pages, 1(+6) figures, 4(+14) tables. Code at https://github.com/isaac-6/harm-directions
激活差异揭示后门:SAE架构的比较
机构 * LexisNexis
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过对比稀疏自编码器架构,探讨如何通过激活差异检测语言模型中的后门,发现Diff-SAE在后门隔离中表现优于Crosscoders,且在不同层和微调策略下均有效。
Comments Accepted at IJCNN 2026 (IEEE WCCI). ©2026 IEEE
TLPO:基于令牌级别的策略优化以缓解大语言模型中的语言混淆
机构 * Samsung SDS(三星SDS)
专题命中 安全训练 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出TLPO,通过令牌级优化缓解大语言模型中的语言混淆问题,通过局部更新提升语言一致性,同时保持下游任务准确性。
Comments Accepted to the main conference of ACL 2026
BARRED: 通过不对称辩论合成定制策略的守卫规则
机构 * Plurai Inc.(Plurai公司)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 BARRED通过不对称辩论生成合成训练数据,提升定制策略的安全性与效率,实验表明其优于现有模型。
基于树结构的对话强化策略优化用于红队攻击
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Oracle AI ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出DialTree框架,通过树搜索和强化学习发现多轮攻击策略,提升对抗攻击的成功率
Comments Accepted at ICLR 2026
知识陷阱:由模型规格不准确驱动的理性偏差
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; ShanghaiTech University(上海科技大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出主观模型工程,通过设计代理的内部信念结构来实现稳健对齐,揭示安全由认知先验决定而非奖励大小连续函数。
大语言模型中的拒绝几何学:概念锥与表征独立性
机构 * School of Computation, Information \& Technology ; Munich Data Science Institute, Technical University of Munich ; Google Research ; Now at Google Research
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出基于梯度的表征工程方法,揭示大语言模型拒绝行为的复杂空间结构及多维概念锥,证明多个独立机制驱动拒绝行为。
LLMs可通过相同长度的文本隐藏信息
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Calgacus协议,利用LLM在相同长度文本中隐藏信息,揭示了文本与意图脱钩的潜在风险,引发对AI安全和理解的深刻反思。
Comments 21 pages, main paper 9 pages. v5 contains an Italian translation of this paper by the author
未来安全,过去危险:剖析大语言模型中的时间与语言脆弱性
机构 * African Institute for Mathematical Science(非洲数学科学研究所) ; University of Vienna(维也纳大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究发现大语言模型在不同语言和时间框架下存在显著安全差异,提出不变对齐以提升跨语言和时间的稳定性。
LookAhead Tuning: 通过部分答案预览实现更安全的语言模型
机构 * Zhejiang University(浙江大学) ; Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室) ; Ant Group(蚂蚁集团) ; National University of Singapore(新加坡国立大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 LookAhead Tuning通过预览部分答案前缀,有效保持语言模型在微调过程中的安全性,同时不损害下游任务的性能。
Comments WSDM 2026 short
机构 * NVIDIA
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at the Multi-Turn Interactions workshop at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
专题命中 安全训练 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon AGI(亚马逊人工智能研究院)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG