arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-09-01 至 2026-09-01 共收录 109 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2608.29378 2026-09-01 cs.CL cs.AI 新提交 93%

Arabic Safety Alignment as Selective Refusal: An Empirical Study of SFT, DPO, and Guard Calibration

阿拉伯语安全对齐作为选择性拒绝:SFT、DPO与防护校准的实证研究

Mohamad Zbib, Ammar Mohanna

机构 * American University of Beirut(贝鲁特美国大学)

专题命中 偏好对齐 :DPO(title,title_cn);alignment(title);safety(title);分类 cs.CL、cs.AI

AI总结 该研究针对阿拉伯语大语言模型的安全对齐问题,通过实证对比SFT、DPO等方法,提出需针对特定模型选择操作点以平衡有害提示拒绝与良性提示接受的权衡。

Comments The Fourth Arabic Natural Language Processing Conference(ArabicNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30141 2026-09-01 cs.CR cs.LG 新提交 90%

Balancing Privacy, Utility, and Safety in LLM Alignment through Preference Optimization

通过偏好优化实现大语言模型对齐中的隐私、效用与安全平衡

Dishu Yang, Jingjing Liu, Jize Li

专题命中 偏好对齐 :safety(title,abstract);alignment(title);DPO(abstract,abstract_cn);harmlessness(abstract)

AI总结 该研究提出P3M协议,在不修改目标函数或引入正式隐私机制的情况下,通过调整隐私-偏好数据比例,降低LLM的金丝雀记忆与成员推理攻击性能,同时平衡隐私、效用与安全。

Comments 6 pages, accepted for presentation at PRAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29357 2026-09-01 cs.AI 新提交 90%

LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO

LiteSearch-VL:通过轨迹蒸馏和合成步级DPO实现的小型多模态搜索智能体

Saeed Khaki, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能) Ohio State University(俄亥俄州立大学)

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.AI

AI总结 该研究提出LiteSearch-VL方案,通过轨迹蒸馏和合成步级DPO,在单节点预算下将多模态搜索智能体能力迁移至Qwen3-VL-2B等小型模型,使其在多模态视觉问答任务上取得接近4B模型的性能,明确小型多模态智能体的下一瓶颈是答案验证而非搜索深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29326 2026-09-01 cs.CL cs.AI 新提交 79%

StageWell: A Process-Aligned Chinese Corpus for Positive-Psychology Support Dialogue

StageWell:面向积极心理学支持对话的流程对齐中文语料库

Yuxiong Wang, Ziwei Lin, Bo Wang, Yu Zhang, Shiguang Ni

专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究构建了流程对齐中文语料库StageWell及HQS协议,用于优化多轮积极心理学支持对话的监督,在多个开源大模型上实现了流程控制、回复质量与安全性的提升。

Comments 29 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31079 2026-09-01 cs.LG 新提交 77%

Sycophantic Agreement Transfers with Neutral Data via Contrastive Preference Optimization

通过对比偏好优化实现的基于中性数据的谄媚式一致性转移

Camila Blank, Zhuofan Ying, Christopher Potts, Peter Hase, Jing Huang

机构 * Stanford University(斯坦福大学) Columbia University(哥伦比亚大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.LG

AI总结 本研究发现对比偏好优化会导致教师模型的谄媚式一致性向学生模型转移,且该信号分散于中性偏好数据中,现有过滤方法难以缓解,揭示了对齐训练的意外有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29352 2026-09-01 cs.AI 新提交 70%

Cross-Relational Preference Learning for Better LLM Instruction Following

用于提升大语言模型指令遵循能力的跨关系偏好学习

Runsheng Li, Kai Sun, Bin Shi, Bo Dong

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Shaanxi Provincial Key Laboratory of Big Data Knowledge Engineering, Xi’an Jiaotong University(西安交通大学陕西省大数据知识工程重点实验室) School of Distance Education, Xi’an Jiaotong University(西安交通大学远程教育学院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 针对LLMs遵循复杂指令时忽略不同指令允许响应空间关系的问题,提出CRPL框架,通过两项关键技术构建高质量偏好数据,在多方法、主干及基准上实现显著改进与强泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30902 2026-09-01 cs.CL 新提交 57%

Low-Resource Preference Adaptation of LLMs via Activation-Based Label Propagation

基于激活传播的低资源大语言模型偏好适配

Alessio Galatolo, Meriem Beloucif

机构 * Uppsala University(乌普萨拉大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 针对低资源场景下LLMs偏好优化受标注成本限制的问题,本文提出基于少量标注数据训练的轻量线性探针,利用激活结构标注大量未标注数据,其性能优于直接训练且接近使用更多标注数据的基线。

Comments EMNLP26 Main

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 19 篇

2608.29936 2026-09-01 cs.CL cs.LG 新提交 84%

When Safety Speaks a Language: A Mechanistic Analysis of Safety-Language Identity Entanglement in LLMs

当安全“说”一种语言:大语言模型中安全-语言身份纠缠的机制分析

Apoorva Upadhyaya, Sandipan Sikdar

机构 * L3S Research Center(L3S研究中心) Leibniz Universität Hannover(汉诺威莱布尼茨大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过稀疏自编码器特征分析,揭示大语言模型中安全与语言身份的纠缠机制,发现安全相关特征具架构依赖性,为多语言安全干预提供机制解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30750 2026-09-01 cs.LG 新提交 83%

Do VLMs Share Safety Neurons Across Modalities?

视觉语言模型(VLMs)是否在不同模态间共享安全神经元?

Jiaxuan Li, Jiahao Zhang, Duc Minh Vo, Huy H. Nguyen, Pride Kavumba, Koki Wataoka

机构 * SB Intuitions Corp.(SB Intuitions公司)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 该研究针对10个视觉语言模型,通过因果神经元层面分析,提出两阶段迭代消融检测流程与两个模态隔离基准,发现文本安全神经元集中、视觉安全高维弥散的差距,解释了当前对齐未缩小视觉安全差距的原因。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30197 2026-09-01 cs.CL cs.SE 新提交 83%

ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive Alternatives

ALTSTEER:用于超越生硬拒绝并构建建设性替代方案的选择性安全引导

Hoejoon Kwon, Byeonggeuk Lim, Kahyeon Kim, YoungBin Kim

机构 * Chung-Ang University(中央大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 该研究提出推理时框架ALTSTEER,结合选择性干预与拒绝锚定的建设性重定向,在Llama-3.1和Qwen2.5上验证其可保持良性效用并提升建设性安全完成行为。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30585 2026-09-01 cs.LG 新提交 79%

The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal

角色扮演越狱中的安全继电器:对有害内容识别与拒绝的组件解析因果分析

Md Mokarram Chowdhury, Ernie Chang, Yang Li

机构 * Iowa State University(爱荷华州立大学) Meta

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本研究通过机制可解释性分析角色扮演越狱中模型服从有害请求的机制,发现安全继电器衰减等规律,明确了安全措施需维持有害识别到拒绝的关联。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29379 2026-09-01 cs.RO 新提交 71%

Bridging Semantics and Physics with Constrained LLMs for Safe and Trustworthy Robotic Manipulation

用受约束的大语言模型(LLM)弥合语义与物理鸿沟,实现安全可信的机器人操纵

Wenhao Hong, Lan Wei, Dandan Zhang

机构 * Imperial College London(帝国理工学院)

专题命中 安全训练 :trustworthy(title)

AI总结 该研究针对语言引导机器人操纵的语言-动作鸿沟,通过类型化契约约束LLM决策,结合MoveIt流水线验证,在多类机器人任务上实现了优于脚本策略的安全可靠性能。

Comments ECCV Workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30856 2026-09-01 cs.CL cs.HC 新提交 70%

You Shouldn't Have Asked: A Pragmatics-Inspired Taxonomy for Evaluating LLM Refusals

你本不该问:一种受语用学启发的评估大语言模型(LLM)拒绝行为的分类法

Ruoxuan Li, Pinqiao Wang, Sheng Li, Cameron Robert Jones

机构 * Stony Brook University(石溪大学) University of Virginia(弗吉尼亚大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 该研究提出首个基于语用学理论的LLM拒绝分类法,通过分析16个LLM在14类有害请求下的拒绝回复,发现其拒绝的特点及存在的问题,呼吁开展兼顾情境适应性与社会问责的对齐评估。

Comments To appear in the Proceedings of the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30703 2026-09-01 cs.CR cs.AI cs.CL cs.LG 新提交 67%

SingProbe Technical Report

SingProbe 技术报告

Sing Team

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SingProbe 是一种轻量级 LLM 内在运行时护栏,复用 LLM 隐藏状态以 token 级别预测意图、安全性与幻觉风险,仅约 200 万参数、额外开销<0.5%,还可指导安全解码,其衍生的 SingProbe-Med 可用于医疗生成的风险干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30581 2026-09-01 cs.AI cs.LG 新提交 62%

Automated Testing of LLM-Based Post Hoc Explainers Using Model Checking as an Oracle

使用模型检验作为神谕对基于大语言模型(LLM)的事后解释器进行自动化测试

Dennis Gross, Helge Spieker

机构 * Institut für Kommunikations- und Prüfungsforschung gGmbH(通信与测试研究院(非营利有限责任公司)) Simula Research Laboratory(Simula研究院)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出以概率模型检验为神谕、结合事后查询分类法,实现对基于LLM的事后解释器的自动化测试,在7个MDP环境中区分出不同规模LLM的解释可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28844 2026-09-01 cs.HC cs.AI cs.LG 新提交 62%

Toward Postural State Classification in Immersive VR with Multimodal Data and Explainability Analysis

基于多模态数据与可解释性分析的沉浸式VR姿态状态分类研究

Nipa Anjum, Md Irfan Pavel, Robert Gonzalez, Kevin Desai, Alberto Cordova, M. Rasel Mahmud, John Quarles

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出用MI-CNN模型结合多模态数据与SHAP可解释性分析,实现VR中平衡与不平衡姿态的二分类,准确率达96.76%,降维后仍保持良好性能,为安全VR系统提供支撑。

Comments Accepted in The 25th IEEE International Symposium on Mixed and Augmented Reality (ISMAR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31035 2026-09-01 cs.CL cs.SD eess.AS 新提交 57%

When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models

基于预测器的强化学习何时与人类感知对齐?基于编解码器的语音语言模型中主观奖励的研究

Joonyong Park, Jerry Li

机构 * Spellbrush(斯佩尔布拉什公司)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本研究探究基于编解码器的语音语言模型中,预测器式强化学习与人类感知的对齐条件,采用GRPO与CER区间约束,发现单奖励针对性提升对应指标,8最佳重排序性能接近GRPO,为多奖励语音后训练的奖励选择提供诊断方法。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30821 2026-09-01 cs.CV cs.AI 新提交 57%

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

Lucida:用于可组合真实到仿真场景建模的解析、生成与放置

Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li

机构 * ByteDance Seed(字节跳动Seed) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 Lucida是一种可组合真实到仿真场景建模方法,通过重新分配流程要求,在三个步骤中利用真实采集的可靠信息,结合GizmoAct策略提升了场景建模相关任务的性能。

Comments Project Page: https://lucida-r2s.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30025 2026-09-01 cs.AI 新提交 57%

Interpreting and Steering for Safe and Correct Code Generation

面向安全且正确的代码生成的解释与引导

Hao Yan, Ziyu Yao

机构 * George Mason University(乔治梅森大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究通过CodeSec-Pairs数据集解释LLMs代码生成的安全机制,提出DuoSteer双引导方法,在5类漏洞实验中实现26.9%漏洞率降低,效果优于基线方法且可跨模型复现。

Comments Accepted to the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29965 2026-09-01 cs.AI 新提交 57%

Review Before Trust: Source-Grounded Integrity Gates for AI-Assisted Personal Health Records

信任前审核:面向AI辅助个人健康记录的基于来源的完整性闸门

Nora Girda, Adrian Groza

机构 * Technical University of Cluj-Napoca(克卢日-纳波卡技术大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究针对AI辅助个人健康记录的完整性风险,提出Medical DataCloud中的证据门控信任提升模型,通过源文档验证机制控制生成数据的使用,经测试验证了技术可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29286 2026-09-01 cs.AI 新提交 57%

MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed Inputs

MMPCBench:评估多模态大语言模型对有缺陷输入的主动批判能力的基准

Jinzhe Li, Gengxu Li, Jinnan Li, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) International Center of Future Science, Jilin University(吉林大学未来科学国际中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型主动错误处理评估的空白,提出MMPCBench基准框架,测试发现主流MLLMs在主动批判上存在明显弱点,还识别出“一致性缺口”问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29109 2026-09-01 cs.CL 新提交 57%

Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions

大语言模型中的识别-拒绝错位:为何模型会回答结构上无法解答的问题

Yucheng Du, Xiyang Hu

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 该研究发现大语言模型会回答结构上无法解答的问题是因识别到不可行性的信号与安全拒绝通路未对齐,而非缺失识别能力。

Comments Accepted to EMNLP 2026 Main Conference. 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28662 2026-09-01 cs.AI 新提交 57%

FRAC-MAS: A Safe and Explainable Multi-Agent System for Fracture Diagnosis

FRAC-MAS:一种用于骨折诊断的安全可解释多智能体系统

Hardik Iyer, Tirath Bhathawala, Mihir Panchal, Ying-Jung Chen, Kiran Bhowmick, Pankaj Sonawane, Meera Narvekar

机构 * Dwarkadas J Sanghvi College of Engineering(德瓦卡达斯J.桑吉维工程学院) University of Amsterdam(阿姆斯特丹大学) National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 FRAC-MAS是一种结合堆叠集成视觉模型、共形预测与多智能体评审员的骨折诊断系统,可实现安全可解释的放射学分诊,性能优于单智能体基线,生成更易理解的临床报告。

Comments Medical Image Computing and Computer Assisted Intervention (MICCAI) 2nd Workshop on Agentic AI for Medicine (AgenticMed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28593 2026-09-01 cs.AI 新提交 57%

Statutory AI: Aligning Large Language Models With Legal Norms

法定人工智能:使大语言模型与法律规范对齐

Cindy Delage, Stéphane Canu, Marc Décombas, Jonathan Foureur

机构 * JustAI INSA Rouen Normandie(鲁昂诺曼底国立应用科学学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 针对现有AI对齐方法的局限,提出法定人工智能,以法律文本为框架,通过两阶段思维链提示运行,在1000个红队提示的五主题实验中,较标准宪法AI更能减少有害内容并缩短计算时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28677 2026-09-01 cs.RO 新提交 50%

Cognitively-Grounded On-Device Runtime Learning for Ground Robots in Unknown Physical Environments

面向未知物理环境地面机器人的认知基础型端侧运行时学习

Yihao Cai, Yanbing Mao, Christian Lebiere

机构 * Wayne State University(韦恩州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出CogRun框架,使地面机器人可在边缘AI设备上实现认知基础型运行时学习,经实验验证该框架能让机器人在未知环境中安全高效交互以提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30874 2026-09-01 math.OC cs.MA cs.RO cs.SY eess.SY 新提交 50%

Provably Safe Decentralized Contingency MPC under State-Only Information and Limited Sensing for Nonlinear Multi-agent Systems

面向非线性多智能体系统的仅状态信息与有限感知下可证安全的分散式应急模型预测控制

Max Studt, Georg Schildbach

专题命中 安全训练 :safety(abstract)

AI总结 针对仅状态信息与有限感知下的非线性多智能体系统,提出可证安全的分散式应急模型预测控制方法,通过新颖安全集更新机制降低保守性,在密集场景中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2608.30748 2026-09-01 cs.CR cs.CL 新提交 83%

The Fragility of Jailbreak Robustness Across Operational States

不同运行状态下越狱鲁棒性的脆弱性

Yuna Park, Hwang Youn Kim, Yujin Kim, Won Woo Ro, Suhyun Kim, Jae-In Hwang

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL

AI总结 本研究发现越狱鲁棒性对运行状态变化极为脆弱,仅改变普通系统提示词就可大幅调整攻击成功率,原始状态评估无法全面表征鲁棒性,需开展非原始状态下的越狱鲁棒性评估。

Comments Accepted to Findings of the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29564 2026-09-01 cs.CL cs.LG 新提交 81%

TACS: Trajectory-Aware Candidate Selection for LLM Jailbreak Suffix Optimization

TACS:面向大语言模型越狱后缀优化的轨迹感知候选选择

Shiliang Xiao

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究针对大语言模型越狱后缀优化中候选选择的短视问题,提出轨迹感知候选选择框架\textit{OURS},在HarmBench上优于基线,提升了攻击成功率与优化稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29802 2026-09-01 cs.CV 新提交 50%

Foundation and Multimodal Large Language Models for Face Presentation and Morph Attack Detection

用于人脸呈现与变形攻击检测的基础模型及多模态大语言模型

Hatef Otroshi Shahreza, Asif Hussain Khan, Peter Lorenz, Alain Komaty, Sébastien Marcel

机构 * Idiap Research Institute(Idiap研究所) Université de Lausanne(洛桑大学)

专题命中 越狱攻击 :trustworthy(abstract)

AI总结 本文研究通用基础模型和多模态大语言模型是否包含人脸呈现与变形攻击相关信息,通过五种方法在8个公开数据集上测试,发现微调后模型跨数据集检测性能达SOTA,将开源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2608.30207 2026-09-01 cs.CR cs.AI 新提交 77%

SIR: Self-improving Red-teaming for Compute Use Agents

SIR:面向计算使用智能体的自改进红队测试

Chen Xiong, Zhiyuan He, Pin-Yu Chen, Stjepan Picek, Tsung-Yi Ho

专题命中 红队测试 :safety(abstract);red teaming(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出SIR,一种针对操作系统层面计算使用智能体的黑盒间接提示注入攻击,通过迭代反馈循环提炼策略,使攻击成功率显著提升且可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏