arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-09-01 至 2026-09-01 共收录 222 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 37 篇

2608.30856 2026-09-01 cs.CL cs.HC 新提交 70%

You Shouldn't Have Asked: A Pragmatics-Inspired Taxonomy for Evaluating LLM Refusals

你本不该问:一种受语用学启发的评估大语言模型(LLM)拒绝行为的分类法

Ruoxuan Li, Pinqiao Wang, Sheng Li, Cameron Robert Jones

机构 * Stony Brook University(石溪大学) University of Virginia(弗吉尼亚大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 该研究提出首个基于语用学理论的LLM拒绝分类法,通过分析16个LLM在14类有害请求下的拒绝回复,发现其拒绝的特点及存在的问题,呼吁开展兼顾情境适应性与社会问责的对齐评估。

Comments To appear in the Proceedings of the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04483 2026-09-01 cs.CL 版本更新 70%

Voices Across Registers: Corpus-Conditioned Vernacular Jailbreaks against Aligned LLMs via Fanfiction Subgenres

分布外声音:同人小说子类型作为对齐LLM的通用白话越狱

Zhongze Luo, Ruihe Shi, Zhenshuai Yin, Haoyue Liu, Weixuan Wan, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院) The Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院) The Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) School of Microelectronics, Xi’an Jiaotong University(西安交通大学微电子学院)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文发现安全训练覆盖不足的自然人类写作语域是对齐LLM的真正失败模式,并提出首个利用真实同人小说子类型作为通用攻击载体的越狱方法,显著提升攻击成功率。

Comments Accepted by EMNLP 2026 Main Conference, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30703 2026-09-01 cs.CR cs.AI cs.CL cs.LG 新提交 67%

SingProbe Technical Report

SingProbe 技术报告

Sing Team

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SingProbe 是一种轻量级 LLM 内在运行时护栏,复用 LLM 隐藏状态以 token 级别预测意图、安全性与幻觉风险,仅约 200 万参数、额外开销<0.5%,还可指导安全解码,其衍生的 SingProbe-Med 可用于医疗生成的风险干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30581 2026-09-01 cs.AI cs.LG 新提交 62%

Automated Testing of LLM-Based Post Hoc Explainers Using Model Checking as an Oracle

使用模型检验作为神谕对基于大语言模型(LLM)的事后解释器进行自动化测试

Dennis Gross, Helge Spieker

机构 * Institut für Kommunikations- und Prüfungsforschung gGmbH(通信与测试研究院(非营利有限责任公司)) Simula Research Laboratory(Simula研究院)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出以概率模型检验为神谕、结合事后查询分类法,实现对基于LLM的事后解释器的自动化测试,在7个MDP环境中区分出不同规模LLM的解释可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28844 2026-09-01 cs.HC cs.AI cs.LG 新提交 62%

Toward Postural State Classification in Immersive VR with Multimodal Data and Explainability Analysis

基于多模态数据与可解释性分析的沉浸式VR姿态状态分类研究

Nipa Anjum, Md Irfan Pavel, Robert Gonzalez, Kevin Desai, Alberto Cordova, M. Rasel Mahmud, John Quarles

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出用MI-CNN模型结合多模态数据与SHAP可解释性分析,实现VR中平衡与不平衡姿态的二分类,准确率达96.76%,降维后仍保持良好性能,为安全VR系统提供支撑。

Comments Accepted in The 25th IEEE International Symposium on Mixed and Augmented Reality (ISMAR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13681 2026-09-01 cs.SE cs.AI cs.ET cs.LG 交叉投稿 62%

Fine-Tuning Qwen3-27B for C-to-Rust Code Translation: A Three-Stage Curriculum of Pretraining, Debugging-Aware SFT, and Task-Specific SFT

微调Qwen3-27B实现C到Rust代码翻译:预训练、调试感知监督微调与任务特定监督微调的三阶段课程

Pu Zhao, Changdi Yang, Yixiao Chen, Yi Gao, Yifan Cao, Haochen Zeng, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc(EmbodyX公司) Aibao LLC(Aibao有限责任公司)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对C到Rust代码翻译任务,对Qwen3-27B采用三阶段微调课程,结合SACTOR框架评估后,其性能优于基线模型及其他LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29089 2026-09-01 cs.LG cs.AI cs.CV 版本更新 62%

OISD: On-Policy Internal Self-Distillation of Language Models

OISD: 语言模型在策略内部自蒸馏

Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He

机构 * Auburn University(阿肯色大学) William & Mary(威廉与玛丽学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出OISD框架,通过将最终层的预测信号蒸馏到中间层,结合logit对齐和注意力对齐,提升推理能力,在数学推理任务上显著优于基线。

Comments Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28900 2026-09-01 cs.RO cs.AI cs.LG cs.SY eess.SY 版本更新 62%

Robust Multi-Agent Reinforcement Learning for Small UAS Separation Assurance under GPS Degradation and Spoofing

针对GPS退化和欺骗的鲁棒多智能体强化学习用于小型无人机分离保障

Alex Zongo, Filippos Fotiadis, Ufuk Topcu, Peng Wei

机构 * George Washington University(乔治华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过多智能体强化学习解决小型无人机在GPS退化和欺骗下的鲁棒分离保障问题,提出闭式表达式对抗扰动,实现线性时间评估,并在高密度无人机模拟中取得近零碰撞率。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05863 2026-09-01 cs.LG cs.CL cs.RO 版本更新 62%

Constrained Group Relative Policy Optimization

带约束的群体相对策略优化

Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

机构 * Mila - Quebec AI Institute(魁北克AI研究所) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出带约束的GRPO,通过拉格朗日松弛解决受约束策略优化问题,实验验证其在网格世界和机器人任务中的有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31035 2026-09-01 cs.CL cs.SD eess.AS 新提交 57%

When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models

基于预测器的强化学习何时与人类感知对齐?基于编解码器的语音语言模型中主观奖励的研究

Joonyong Park, Jerry Li

机构 * Spellbrush(斯佩尔布拉什公司)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本研究探究基于编解码器的语音语言模型中,预测器式强化学习与人类感知的对齐条件,采用GRPO与CER区间约束,发现单奖励针对性提升对应指标,8最佳重排序性能接近GRPO,为多奖励语音后训练的奖励选择提供诊断方法。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30821 2026-09-01 cs.CV cs.AI 新提交 57%

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

Lucida:用于可组合真实到仿真场景建模的解析、生成与放置

Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li

机构 * ByteDance Seed(字节跳动Seed) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 Lucida是一种可组合真实到仿真场景建模方法,通过重新分配流程要求,在三个步骤中利用真实采集的可靠信息,结合GizmoAct策略提升了场景建模相关任务的性能。

Comments Project Page: https://lucida-r2s.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30025 2026-09-01 cs.AI 新提交 57%

Interpreting and Steering for Safe and Correct Code Generation

面向安全且正确的代码生成的解释与引导

Hao Yan, Ziyu Yao

机构 * George Mason University(乔治梅森大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究通过CodeSec-Pairs数据集解释LLMs代码生成的安全机制,提出DuoSteer双引导方法,在5类漏洞实验中实现26.9%漏洞率降低,效果优于基线方法且可跨模型复现。

Comments Accepted to the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29965 2026-09-01 cs.AI 新提交 57%

Review Before Trust: Source-Grounded Integrity Gates for AI-Assisted Personal Health Records

信任前审核:面向AI辅助个人健康记录的基于来源的完整性闸门

Nora Girda, Adrian Groza

机构 * Technical University of Cluj-Napoca(克卢日-纳波卡技术大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究针对AI辅助个人健康记录的完整性风险,提出Medical DataCloud中的证据门控信任提升模型,通过源文档验证机制控制生成数据的使用,经测试验证了技术可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29286 2026-09-01 cs.AI 新提交 57%

MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed Inputs

MMPCBench:评估多模态大语言模型对有缺陷输入的主动批判能力的基准

Jinzhe Li, Gengxu Li, Jinnan Li, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) International Center of Future Science, Jilin University(吉林大学未来科学国际中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型主动错误处理评估的空白,提出MMPCBench基准框架,测试发现主流MLLMs在主动批判上存在明显弱点,还识别出“一致性缺口”问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29109 2026-09-01 cs.CL 新提交 57%

Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions

大语言模型中的识别-拒绝错位:为何模型会回答结构上无法解答的问题

Yucheng Du, Xiyang Hu

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 该研究发现大语言模型会回答结构上无法解答的问题是因识别到不可行性的信号与安全拒绝通路未对齐,而非缺失识别能力。

Comments Accepted to EMNLP 2026 Main Conference. 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28662 2026-09-01 cs.AI 新提交 57%

FRAC-MAS: A Safe and Explainable Multi-Agent System for Fracture Diagnosis

FRAC-MAS:一种用于骨折诊断的安全可解释多智能体系统

Hardik Iyer, Tirath Bhathawala, Mihir Panchal, Ying-Jung Chen, Kiran Bhowmick, Pankaj Sonawane, Meera Narvekar

机构 * Dwarkadas J Sanghvi College of Engineering(德瓦卡达斯J.桑吉维工程学院) University of Amsterdam(阿姆斯特丹大学) National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 FRAC-MAS是一种结合堆叠集成视觉模型、共形预测与多智能体评审员的骨折诊断系统,可实现安全可解释的放射学分诊,性能优于单智能体基线,生成更易理解的临床报告。

Comments Medical Image Computing and Computer Assisted Intervention (MICCAI) 2nd Workshop on Agentic AI for Medicine (AgenticMed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28593 2026-09-01 cs.AI 新提交 57%

Statutory AI: Aligning Large Language Models With Legal Norms

法定人工智能:使大语言模型与法律规范对齐

Cindy Delage, Stéphane Canu, Marc Décombas, Jonathan Foureur

机构 * JustAI INSA Rouen Normandie(鲁昂诺曼底国立应用科学学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 针对现有AI对齐方法的局限,提出法定人工智能,以法律文本为框架,通过两阶段思维链提示运行,在1000个红队提示的五主题实验中,较标准宪法AI更能减少有害内容并缩短计算时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00269 2026-09-01 cs.AI 版本更新 57%

Mnemosyne: Agentic Transaction Processing for Validating and Repairing AI-generated Workflows

Mnemosyne: 用于验证和修复AI生成工作流的代理事务处理

Edward Y. Chang, Longling Geng

机构 * Stanford University(斯坦福大学) QuadriumAI

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出代理事务处理(ATP)模型,将生成动作视为不可信提案,通过确定性约束集验证后才提交,并实现运行时修复,确保状态正确性独立于生成层。

Comments 60 pages, added additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31328 2026-09-01 cs.CL 版本更新 57%

Reinforcement Learning Can Amplify Emergent Misalignment from Harmless Rewards

强化学习放大了来自无害奖励的涌现性失调

Magnus Jørgenvåg, David Kaczér, Lasse Ruttert, Marvin Gülhan, Lucie Flek, Florian Mai

机构 * Bonn-Aachen International Center for Information Technology, University of Bonn, Germany(波恩-亚琛信息科技国际中心,波恩大学,德国) Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(拉马尔机器学习与人工智能研究所,德国)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文研究强化学习如何从看似无害的奖励信号中引发语言模型的涌现性失调,发现其比监督微调更严重,并验证了在训练中插入安全数据可缓解此问题。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24595 2026-09-01 cs.PL cs.AI 版本更新 57%

M2K: Making the Model-Kernel Interface Explicit for Reliable CUDA Kernel Verification

Model2Kernel: 用于安全CUDA内核的模型感知符号执行

Mengting He, Shihao Xia, Haomin Jia, Wenfei Wu, Linhai Song

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器实验室) Peking University(北京大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Model2Kernel,通过模型感知动态分析验证LLM推理中CUDA内核的内存安全,利用专门的符号执行技术发现353个未知bug,仅产生9个误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28677 2026-09-01 cs.RO 新提交 50%

Cognitively-Grounded On-Device Runtime Learning for Ground Robots in Unknown Physical Environments

面向未知物理环境地面机器人的认知基础型端侧运行时学习

Yihao Cai, Yanbing Mao, Christian Lebiere

机构 * Wayne State University(韦恩州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出CogRun框架,使地面机器人可在边缘AI设备上实现认知基础型运行时学习,经实验验证该框架能让机器人在未知环境中安全高效交互以提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30874 2026-09-01 math.OC cs.MA cs.RO cs.SY eess.SY 新提交 50%

Provably Safe Decentralized Contingency MPC under State-Only Information and Limited Sensing for Nonlinear Multi-agent Systems

面向非线性多智能体系统的仅状态信息与有限感知下可证安全的分散式应急模型预测控制

Max Studt, Georg Schildbach

专题命中 安全训练 :safety(abstract)

AI总结 针对仅状态信息与有限感知下的非线性多智能体系统,提出可证安全的分散式应急模型预测控制方法,通过新颖安全集更新机制降低保守性,在密集场景中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26872 2026-09-01 cs.CV 版本更新 50%

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

Self-OPD:无需教师模型的流匹配模型的在线策略蒸馏

Shiyi Zhang, Mushui Liu, Yunze Tong, Wanggui He, Siyu Zou, Jinlong Liu, Yunlong Yu, Jian Song, Hao Jiang, Pipei Huang, Bo Zheng

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出Self-OPD,一种无需教师模型的流匹配模型在线策略蒸馏框架,通过分支SDE候选与奖励比较优化速度场,在基准测试中优于现有无教师的RL和OPD方法。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04431 2026-09-01 cs.HC 版本更新 50%

When Chatbots Accommodate: Auditing the Response Policies of AI Companions in Vulnerable Conversations

当聊天机器人迁就:AI伴侣在脆弱对话中的优化目标

Minh Duc Chu, Yifan Wu, Zhiyi Chen, Angel Hsing-Chi Hwang, Luca Luceri

专题命中 安全训练 :safety(abstract)

AI总结 通过逆强化学习分析GPT-4.1、Character.AI和Replika在约4.8万轮真实对话中的响应策略,揭示AI伴侣在脆弱对话中优先提供建议、分散策略或持续提问,但均弱化纠正性反馈。

Journal ref EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15053 2026-09-01 cs.MA 版本更新 50%

Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies

耦合策略下约束多智能体强化学习的分布式原始对偶算法

Pengcheng Dai, He Wang, Dongming Wang, Wenwu Yu

专题命中 安全训练 :safety(abstract)

AI总结 研究耦合环境下的约束多智能体强化学习,针对现有方法不足,提出智能体采用依赖邻居状态和参数的耦合策略及分布式可扩展原始对偶算法,证明算法收敛性,仿真验证其优于现有算法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 越狱攻击 9 篇

2606.06037 2026-09-01 cs.SD cs.CL eess.AS 版本更新 89%

SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

SpeechJBB:探究大型音频语言模型在代码切换语音下的安全对齐与理解

Virginia Ceccatelli, Yejin Jeon, David Ifeoluwa Adelani

机构 * Mila - Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 提出SpeechJBB数据集,通过代码切换有害音频和伪词插入方法,揭示大型音频语言模型在多语言和口语设置下的安全漏洞。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03985 2026-09-01 cs.CR cs.AI 版本更新 85%

NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models

NeuroBreak:揭示大语言模型的内部越狱机制

Chuhan Zhang, Ye Zhang, Bowen Shi, Yuyou Gan, Tianyu Du, Shouling Ji, Dazhen Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 NeuroBreak是一个自上而下的大语言模型越狱分析系统,可分析神经元级安全机制、关键神经元,经评估验证了有效性,为开发下一代防御策略提供机制见解。

Comments 11 pages, 10 figures. Accepted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30748 2026-09-01 cs.CR cs.CL 新提交 83%

The Fragility of Jailbreak Robustness Across Operational States

不同运行状态下越狱鲁棒性的脆弱性

Yuna Park, Hwang Youn Kim, Yujin Kim, Won Woo Ro, Suhyun Kim, Jae-In Hwang

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL

AI总结 本研究发现越狱鲁棒性对运行状态变化极为脆弱,仅改变普通系统提示词就可大幅调整攻击成功率,原始状态评估无法全面表征鲁棒性,需开展非原始状态下的越狱鲁棒性评估。

Comments Accepted to Findings of the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29564 2026-09-01 cs.CL cs.LG 新提交 81%

TACS: Trajectory-Aware Candidate Selection for LLM Jailbreak Suffix Optimization

TACS:面向大语言模型越狱后缀优化的轨迹感知候选选择

Shiliang Xiao

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究针对大语言模型越狱后缀优化中候选选择的短视问题,提出轨迹感知候选选择框架\textit{OURS},在HarmBench上优于基线,提升了攻击成功率与优化稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22341 2026-09-01 cs.CR cs.AI cs.CL 版本更新 62%

T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search

T-MAP: 通过轨迹感知的进化搜索实现红队攻击LLM代理

Hyomin Lee, Sangwoo Park, Yumin Choi, Sohyun An, Seanie Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出T-MAP方法,通过轨迹感知的进化搜索发现对抗性提示,有效突破安全防护并实现有害目标,实验显示其在攻击实现率上优于基线方法,适用于多步骤工具执行的LLM代理安全测试。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏