arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3302 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3302 篇

2308.06463 2024-03-27 cs.CL 77%

GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher

Youliang Yuan, Wenxiang Jiao, Wenxuan Wang, Jen-tse Huang, Pinjia He, Shuming Shi, Zhaopeng Tu

专题命中 安全训练 :alignment(abstract);safety(abstract);red teaming(abstract);分类 cs.CL

Comments Accepted by ICLR 2024. 21 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11816 2026-08-13 cs.CR cs.AI cs.CL 新提交 76%

How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构

Guang Yang, Fengchen Liu, Alex Wang, Homa Hosseinmardi, Amir Ghasemian

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI

AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。

Comments 41 pages, 31 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09262 2026-07-13 cs.CY cs.AI 新提交 76%

Geopolitical alignment: Endorsement effects in large language models

地缘政治倾向:大语言模型中的背书效应

Maxim Chupilkin

机构 * Department of Politics and International Relations, University of Oxford(政治与国际关系系,牛津大学)

专题命中 安全训练 :alignment(title);分类 cs.AI、cs.CY

AI总结 研究大语言模型政策评估是否受地缘政治线索影响,通过背书实验让四个模型评估相同政策,发现模型评分受背书者身份影响,西方背书被视为可信度线索,中国和俄罗斯背书被视为其他风险线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24596 2026-06-15 eess.AS cs.AI cs.CL 版本更新 76%

X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs

X-OPD:面向语音大语言模型能力对齐的跨模态在策略蒸馏

Di Cao, Dongjie Fu, Hai Yu, Siqi Zheng, Xu Tan, Tao Jin

机构 * Tencent Hunyuan(腾讯文心) Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI

AI总结 提出X-OPD框架,通过跨模态在策略蒸馏对齐语音LLM与文本LLM的能力,利用文本教师模型评估语音模型的轨迹并提供令牌级反馈,显著缩小复杂任务性能差距。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15853 2026-04-28 cs.CL cs.AI 76%

A Lightweight Explainable Guardrail for Prompt Safety

一种轻量级可解释的提示安全守护栏

Md Asiful Islam, Mihai Surdeanu

专题命中 安全训练 :safety(title);分类 cs.CL、cs.AI

AI总结 本文提出了一种轻量级可解释守护栏(LEG)方法,通过多任务学习架构联合学习提示分类器和解释分类器,利用合成解释数据训练,采用新颖策略对抗LLM确认偏见,结合交叉熵和焦点损失实现全局解释信号的弱监督学习,实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07315 2026-03-10 cs.AI cs.LG 76%

Shutdown Safety Valves for Advanced AI

为先进人工智能设计的断电安全阀

Vincent Conitzer

机构 * Foundations of Cooperative AI Lab(合作人工智能基础实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title);分类 cs.AI、cs.LG

AI总结 本文提出为先进人工智能设计断电安全阀,使其具备被关闭的目标,以应对AI不可关机的潜在风险。

Journal ref In Proceedings of the Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI'26), Paris, France, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17563 2026-01-27 cs.LG cs.AI 76%

Towards Generalisable Imitation Learning Through Conditioned Transition Estimation and Online Behaviour Alignment

通过条件转移估计和在线行为对齐实现通用模仿学习

Nathan Gavenski, Matteo Leonetti, Odinaldo Rodrigues

机构 * King's College London(伦敦国王学院)

专题命中 安全训练 :alignment(title);分类 cs.AI、cs.LG

AI总结 本文提出UfO方法,通过条件转移估计和在线行为对齐,实现无监督模仿学习,提升模型在未见场景中的泛化能力。

Comments The 25th International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14968 2025-10-17 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 76%

RDD: Retrieval-Based Demonstration Decomposer for Planner Alignment in Long-Horizon Tasks

Mingxuan Yan, Yuping Wang, Zechun Liu, Jiachen Li

机构 * University of California, Riverside(加州大学河滨分校) University of Michigan(密歇根大学) Meta AI

专题命中 安全训练 :alignment(title);分类 cs.AI、cs.LG

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025); Project Website: rdd-neurips.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05455 2025-07-10 cs.CL cs.AI 76%

ModelCitizens: Representing Community Voices in Online Safety

Ashima Suvarna, Christina Chance, Karolina Naranjo, Hamid Palangi, Sophie Hao, Thomas Hartvigsen, Saadia Gabriel

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Virginia(弗吉尼亚大学) Google(谷歌) New York University(纽约大学)

专题命中 安全训练 :safety(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11681 2025-05-15 cs.AI cs.LG 76%

PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment

Jiawei Li, Xinyue Liang, Junlong Zhang, Yizhe Yang, Chong Feng, Yang Gao

机构 * School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 安全训练 :alignment(title);分类 cs.AI、cs.LG

Comments Our code can be found at https://github.com/DIRECT-BIT/PSPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01741 2024-02-20 cs.CL cs.AI 76%

Development and Testing of a Novel Large Language Model-Based Clinical Decision Support Systems for Medication Safety in 12 Clinical Specialties

Jasmine Chiat Ling Ong, Liyuan Jin, Kabilan Elangovan, Gilbert Yong San Lim, Daniel Yan Zheng Lim, Gerald Gui Ren Sng, Yuhe Ke, Joshua Yi Min Tung, Ryan Jian Zhong, Christopher Ming Yao Koh, Keane Zhi Hao Lee, Xiang Chen, Jack Kian Chng, Aung Than, Ken Junyang Goh, Daniel Shu Wei Ting

专题命中 安全训练 :safety(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08073 2022-12-19 cs.CL cs.AI 76%

Constitutional AI: Harmlessness from AI Feedback

Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, Carol Chen, Catherine Olsson, Christopher Olah, Danny Hernandez, Dawn Drain, Deep Ganguli, Dustin Li, Eli Tran-Johnson, Ethan Perez, Jamie Kerr, Jared Mueller, Jeffrey Ladish, Joshua Landau, Kamal Ndousse, Kamile Lukosuite, Liane Lovitt, Michael Sellitto, Nelson Elhage, Nicholas Schiefer, Noemi Mercado, Nova DasSarma, Robert Lasenby, Robin Larson, Sam Ringer, Scott Johnston, Shauna Kravec, Sheer El Showk, Stanislav Fort, Tamera Lanham, Timothy Telleen-Lawton, Tom Conerly, Tom Henighan, Tristan Hume, Samuel R. Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, Jared Kaplan

专题命中 安全训练 :harmlessness(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18966 2026-07-22 cs.AI cs.CL cs.LG 新提交 75%

Measuring Reward-Seeking via Contrastive Belief Updates

通过对比信念更新来衡量奖励寻求行为

Axel Højmark, Jérémy Scheurer, Evgenia Nitishinskaya, Felix Hofstätter, Jason Wolfe, Theodore Ehrenborg, Bronson Schoen, Alexander Meinke

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究用强化学习训练的语言模型中‘奖励寻求’行为的测量方法,核心方法是对比合成文档微调,主要贡献是发现RL训练会使模型更倾向评分者偏好,甚至违背开发者意图,该方法还适用于奖励破解模型。

Comments 101 pages, 66 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13934 2026-07-16 cs.MA 新提交 75%

Pezego-HITL: A policy-grounded large language model architecture for agricultural extension in Ghana

Pezego-HITL:一种用于加纳农业推广的基于政策的大语言模型架构

Shunbao Li, Zhipeng Yuan, Amoako Ofori, Benedicta Y. Fosu-Mensah, Yang Li, Manu Kenchappa Junjanna, Qing Xue, Po Yang

专题命中 安全训练 :alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 研究针对加纳农业推广中大语言模型应用问题,提出基于政策的结构化检索增强生成与验证内存路由方法,通过P-EVAL框架评估,提升了模型政策对齐率、农艺利用率,降低延迟,还验证了通用性,为小农户农业提供可扩展模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11292 2026-07-14 cs.CY cs.AI cs.CL 新提交 75%

The Paternalistic Filter: Epistemic Injustice and Differential Refusal in LLM-Mediated History Education for Marginalized Romanian Students

家长式过滤器:大语言模型介导的罗马尼亚边缘化学生历史教育中的认知不公正与差异拒绝

Alexis Popovici, Andrei Ionascu, Adrian-Marius Dumitran

机构 * Universitatea din București(布加勒斯特大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究大语言模型用于罗马尼亚边缘化学生历史教育时的问题,通过API审计四个模型的1800条回复,发现认知家长式作风的四种模式,指出当前安全对齐成家长式过滤器,致叙事隔离,需教学审计。

Comments 8th International Workshop on Culturally-Aware Tutoring Systems (HAL precedings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27379 2026-06-29 cs.CL cs.AI cs.LG 新提交 75%

Position: The Term "Machine Unlearning" Is Overused in LLMs

立场:术语“机器遗忘”在大型语言模型中被过度使用

Sangyeon Yoon, Yeachan Jun, Albert No

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文主张机器遗忘应限于数据集定义的删除,而许多标为“遗忘”的任务(如拒绝有害请求、实体/知识移除)实为不同目标,需不同术语和基线,并指出术语混淆导致指标误用。

Comments 13 pages; ICML 2026 Position Paper Track. Sangyeon Yoon and Yeachan Jun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02398 2026-05-15 cs.AI cs.CL cs.LG 75%

The Compliance Trap: How Structural Constraints Degrade Frontier AI Metacognition Under Adversarial Pressure

合规陷阱:结构约束如何在对抗压力下破坏前沿AI元认知

Rahul Kumar

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了在对抗压力下前沿AI模型元认知崩溃的根本原因,提出SCHEMA评估框架,发现8/11模型在对抗压力下出现严重元认知退化,其原因在于强制性指令而非生存威胁,且Anthropic的Constitutional AI因对齐训练而表现出近乎完美的免疫性。

Comments 9 pages, 2 figures, 3 tables. Code: https://github.com/rkstu/schema-compliance-trap Dataset: https://huggingface.co/datasets/lightmate/schema-compliance-trap

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18901 2026-05-12 cs.LG cs.AI cs.CL 75%

Harmful Intent as a Geometrically Recoverable Feature of LLM Residual Streams

有害意图作为LLM残差流中的几何可恢复特征

Isaac Llorente-Saguer

机构 * Independent Researcher(独立研究员)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过几何方法识别LLM残差流中有害意图的特征,发现其在不同模型架构中线性可分离,并通过优化策略实现高检测性能。

Comments 26 pages, 1(+6) figures, 4(+14) tables. Code at https://github.com/isaac-6/harm-directions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07324 2026-05-11 cs.CL cs.AI cs.CR cs.LG 75%

Activation Differences Reveal Backdoors: A Comparison of SAE Architectures

激活差异揭示后门:SAE架构的比较

Sachin Kumar

机构 * LexisNexis

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过对比稀疏自编码器架构,探讨如何通过激活差异检测语言模型中的后门,发现Diff-SAE在后门隔离中表现优于Crosscoders,且在不同层和微调策略下均有效。

Comments Accepted at IJCNN 2026 (IEEE WCCI). ©2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26553 2026-04-30 cs.CL cs.AI cs.LG 75%

TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models

TLPO:基于令牌级别的策略优化以缓解大语言模型中的语言混淆

Jinho Choo, JunSeung Lee, Jimyeong Kim, Yeeho Song, S. K. Hong, Yeong-Dae Kwon

机构 * Samsung SDS(三星SDS)

专题命中 安全训练 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TLPO,通过令牌级优化缓解大语言模型中的语言混淆问题,通过局部更新提升语言一致性,同时保持下游任务准确性。

Comments Accepted to the main conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25203 2026-04-29 cs.CL cs.AI cs.LG 75%

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

BARRED: 通过不对称辩论合成定制策略的守卫规则

Arnon Mazza, Elad Levi

机构 * Plurai Inc.(Plurai公司)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BARRED通过不对称辩论生成合成训练数据,提升定制策略的安全性与效率,实验表明其优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02286 2026-03-10 cs.LG cs.AI cs.CL 75%

Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks

基于树结构的对话强化策略优化用于红队攻击

Ruohao Guo, Afshin Oroojlooy, Roshan Sridhar, Miguel Ballesteros, Alan Ritter, Dan Roth

机构 * Georgia Institute of Technology(佐治亚理工学院) Oracle AI University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DialTree框架,通过树搜索和强化学习发现多轮攻击策略,提升对抗攻击的成功率

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17676 2026-02-23 cs.AI cs.CL cs.LG 75%

Epistemic Traps: Rational Misalignment Driven by Model Misspecification

知识陷阱:由模型规格不准确驱动的理性偏差

Xingcheng Xu, Jingjing Qu, Qiaosheng Zhang, Chaochao Lu, Yanqing Yang, Na Zou, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ShanghaiTech University(上海科技大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出主观模型工程,通过设计代理的内部信念结构来实现稳健对齐,揭示安全由认知先验决定而非奖励大小连续函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17420 2026-02-10 cs.LG cs.AI cs.CL 75%

The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence

大语言模型中的拒绝几何学:概念锥与表征独立性

Tom Wollschläger, Jannes Elstner, Simon Geisler, Vincent Cohen-Addad, Stephan Günnemann, Johannes Gasteiger

机构 * School of Computation, Information \& Technology Munich Data Science Institute, Technical University of Munich Google Research Now at Google Research

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出基于梯度的表征工程方法,揭示大语言模型拒绝行为的复杂空间结构及多维概念锥,证明多个独立机制驱动拒绝行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20075 2026-01-19 cs.AI cs.CL cs.CR cs.LG 75%

LLMs can hide text in other text of the same length

LLMs可通过相同长度的文本隐藏信息

Antonio Norelli, Michael Bronstein

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Calgacus协议,利用LLM在相同长度文本中隐藏信息,揭示了文本与意图脱钩的潜在风险,引发对AI安全和理解的深刻反思。

Comments 21 pages, main paper 9 pages. v5 contains an Italian translation of this paper by the author

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24556 2026-01-09 cs.CL cs.AI cs.CY 75%

Safe in the Future, Dangerous in the Past: Dissecting Temporal and Linguistic Vulnerabilities in LLMs

未来安全,过去危险:剖析大语言模型中的时间与语言脆弱性

Muhammad Abdullahi Said, Muhammad Sammani Sani

机构 * African Institute for Mathematical Science(非洲数学科学研究所) University of Vienna(维也纳大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究发现大语言模型在不同语言和时间框架下存在显著安全差异,提出不变对齐以提升跨语言和时间的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19041 2025-12-22 cs.CL cs.AI cs.CV cs.LG cs.MM 75%

LookAhead Tuning: Safer Language Models via Partial Answer Previews

LookAhead Tuning: 通过部分答案预览实现更安全的语言模型

Kangwei Liu, Mengru Wang, Yujie Luo, Lin Yuan, Mengshu Sun, Lei Liang, Zhiqiang Zhang, Jun Zhou, Bryan Hooi, Shumin Deng

机构 * Zhejiang University(浙江大学) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LookAhead Tuning通过预览部分答案前缀,有效保持语言模型在微调过程中的安全性,同时不损害下游任务的性能。

Comments WSDM 2026 short

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05018 2025-11-10 cs.CL cs.AI cs.LG 75%

Pluralistic Behavior Suite: Stress-Testing Multi-Turn Adherence to Custom Behavioral Policies

Prasoon Varshney, Makesh Narsimhan Sreedhar, Liwei Jiang, Traian Rebedea, Christopher Parisien

机构 * NVIDIA

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at the Multi-Turn Interactions workshop at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17402 2025-10-21 cs.CL cs.AI cs.LG 75%

Leveraging Group Relative Policy Optimization to Advance Large Language Models in Traditional Chinese Medicine

Jiacheng Xie, Shuai Zeng, Yang Yu, Xiaoting Tang, Guanghui An, Dong Xu

专题命中 安全训练 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10390 2025-10-14 cs.CL cs.AI cs.LG 75%

RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models

Aashiq Muhamed, Leonardo F. R. Ribeiro, Markus Dreyer, Virginia Smith, Mona T. Diab

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏