arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-27 至 2026-08-27 共收录 86 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 11 篇

2605.11632 2026-08-27 cs.CL cs.AI 版本更新 86%

Macro: Enhancing Multilingual Counterfactual Explanations through Alignment-as-Preference Optimization

Macro: 通过偏好对齐优化提升多语言反事实解释

Yilong Wang, Qianli Wang, Bohao Chu, Yihong Liu, Jing Yang, Simon Ostermann

机构 * Technische Universität Berlin(柏林技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) University of Duisburg-Essen(杜伊斯堡- Essen大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Saarland Informatics Campus(萨尔兰州信息学校区) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出Macro框架,通过直接偏好优化改进多语言反事实解释,提升有效性的同时保持最小性,避免翻译基线的严重最小性问题,并在多个指标上优于监督微调方法。

Comments Camera-ready version accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24988 2026-08-27 cs.CL cs.AI cs.LG 新提交 86%

Does Fine-Tuning Undo Activation Steering? Behavioural Recovery Without Weight-Edit Reversal

微调会撤销激活引导吗?无需权重编辑反转的行为恢复

Philipp E. Glass, Allan Tucker, Yongmin Li, Alina Miron

机构 * Brunel University of London(布鲁内尔伦敦大学)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究语言模型嵌入的激活引导在SFT、RLHF微调后的稳定性,发现其机制耐久但功能脆弱,需下游训练后重新验证行为。

Comments Accepted at EMNLP 2026 Main. Earlier version at ICLR 2026 Re^4-Align Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02585 2026-08-27 cs.AI cs.CL 版本更新 82%

Mitigating LLM biases toward spurious social contexts using direct preference optimization

通过直接偏好优化减轻LLM对虚假社会情境的偏见

Hyunji Nam, Dorottya Demszky

机构 * Stanford University(斯坦福大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM对虚假社会情境的鲁棒性,提出Debiasing-DPO方法,通过自监督训练和监督微调减少偏见并提升预测准确性。

Comments COLM 2026, main text 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25200 2026-08-27 cs.LG cs.AI cs.CL 新提交 82%

Learning Mixtures of Plackett-Luce Models for Multi-Objective Alignment

学习用于多目标对齐的Plackett-Luce模型混合

Dongyue Li, Ziniu Zhang, Lu Wang, Hongyang R. Zhang

机构 * Northeastern University(东北大学) University of Michigan(密歇根大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对异质偏好下多向排序的模型混合问题,提出MoPLEx算法,通过扩充排序并结合梯度估计与期望最大化,在偏好优化任务上显著优于基线方法。

Comments 19 pages; To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24899 2026-08-27 cs.HC cs.AI cs.CY 新提交 81%

aipsy-judge: A Specialized, Psychologist-Corrected Local Judge for the Psychological Safety of Conversational AI

aipsy-judge:一种针对对话式AI心理安全性的、经心理学家校正的专用本地评判器

Michael Keeman, Anastasia Keeman

专题命中 偏好对齐 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本研究发现LLM作为评判器评估对话式AI心理安全性存在缺陷,提出经心理学家校正的本地模型aipsy-judge-1.0,其危机检测等性能优于前沿模型,且评分更忠实、数据可本地留存。

Comments 24 pages, 3 figures, 6 tables. Model available at this https URL (https://huggingface.co/keidolabs/aipsy-judge-1.0) (Apache-2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13579 2026-08-27 cs.LG cs.AI 版本更新 79%

Learning to summarize user information for personalized reinforcement learning from human feedback

学习总结用户信息以实现基于人类反馈的个性化强化学习

Hyunji Nam, Yanming Wan, Mickel Liu, Peter Ahnn, Jianxun Lian, Natasha Jaques

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) DoorDash Microsoft Research Asia(微软亚洲研究院)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG

AI总结 PLUS通过学习用户信息摘要实现个性化强化学习,提升奖励模型准确性并实现零样本个性化。

Comments ICLR 2026; 10 pages for main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25350 2026-08-27 cs.LG cs.RO 新提交 70%

Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning

超越成对反馈:用于基于偏好的奖励学习的列表式视觉-语言监督

Srivalli Katkuri, Maxwell Kawada, Juan Wachs

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出首个结合视觉-语言模型生成偏好与普拉科特-卢斯模型的列表式奖励学习框架,在Meta-World操纵任务中,其表现与基线相当且更灵活,最佳配置达86%平均成功率。

Comments 13 pages, 10 figures. Srivalli Katkuri and Maxwell Kawada contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07054 2026-08-27 cs.CL 版本更新 70%

Sell More, Play Less: Benchmarking LLM Realistic Selling Skill

多卖少玩:LLM真实销售技能基准测试

Xuanbo Su, Wenhao Hu, Le Zhan, Yuting Xie, Kailin Lyu, Kaijie Chen, Ziwei Li, Yeqiang Wang, Haibo Su, Yunzhang Chen, Ling Huang

机构 * SF Express(顺丰速运)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出SalesLLM基准测试,通过30,074个剧本配置和1,805个多轮场景评估大语言模型的销售能力,采用自动评估流程和用户模型CustomerLM提升模拟真实性,实验显示LLM在销售任务上的表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25824 2026-08-27 cs.CL 新提交 57%

Localize-Then-Decide Guarantees for LLM Judgments

LLM判断的“先定位后决策”保证

Xinyu Li, Yi Zhou, Guanqun Cao, Zeyu Fu, Tianjin Huang, Gaojie Jin

机构 * University of Exeter(埃克塞特大学) Cardiff University(卡迪夫大学) University of the West of England(西英格兰大学) University of Macau(澳门大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 针对LLM作为评估者时候选响应增多导致置信度假设失效的问题,提出“先定位后决策”框架,结合共形预测与校准规则,提升保证成功率与覆盖率。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Code: this https URL (https://github.com/llm2409/Localize-Then-Decide)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25452 2026-08-27 cs.CV cs.AI 新提交 57%

VGA-BenchV2: An Expanded Unified Benchmark and Multi-Model Framework for Evaluating Video Aesthetics and Generation Quality

VGA-BenchV2:用于评估视频美学与生成质量的扩展统一基准及多模型框架

Longteng Jiang, DanDan Zheng, Qianqian Qiao, Heng Huang, Huaye Wang, Yihang Bo, Bao Peng, Jingdong Chen, Jun Zhou, Xin Jin

机构 * Ant Group(蚂蚁集团) Beijing Film Academy(北京电影学院) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 该研究提出扩展的视频评估基准VGA-BenchV2,构建混合评估器架构,并将其作为奖励模型优化视频生成器,实现从基准到模型优化的闭环,提升视频的美学质量与人类偏好对齐性。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05393 2026-08-27 cs.CV 版本更新 50%

PreResQ-R1: Response-Preference Disentangled Ranking-and-Scoring Reinforcement Optimization for Robust Visual Quality Assessment

PreResQ-R1:用于鲁棒视觉质量评估的响应偏好解耦排序与评分强化优化

Zehui Feng, Weichuan Wang, Xiaohan Chen, Ting Han

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出PreResQ-R1框架,通过解耦响应偏好的强化学习统一评分与排序目标,结合GRPO优化,在IQA和VQA基准上取得最优结果,推理轨迹更贴合人类感知。

Comments 27 pages, 16 figures, Accepted as EMNLP 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 10 篇

2608.24889 2026-08-27 cs.AI 新提交 79%

Reliable LLM-Powered Decision Engines for Large-Scale Supply Chain Operations: Architecture, Safety, and Performance Guarantees

面向大规模供应链运营的可靠大语言模型驱动决策引擎:架构、安全性与性能保证

Nirmal Kumar Jingar

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 针对大规模供应链的不确定性等挑战,提出结合LLM与优化等的LLM-DE架构,实现更智能、安全、可扩展的供应链决策,为下一代智能供应链提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14684 2026-08-27 cs.LG cs.AI 版本更新 73%

Mitigating Rubric Interference in LLM Judges via On-Policy Self-Distillation

通过策略内自蒸馏缓解大语言模型评审员中的评分标准干扰

Dingyao Yu, Tong Zhang, Yutao Mou, Yunxiao Zhang, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Weixin Al, Tencent Inc(腾讯公司微信智能)

专题命中 安全训练 :alignment(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究针对LLM评审员多评分标准评估时的干扰问题,提出SARA方法,通过策略内自蒸馏提升评估一致性,且该一致性可跨数据集迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21147 2026-08-27 cs.SD cs.AI 版本更新 70%

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

AOR-Bench: 大型音频语言模型是否会过度拒绝伪有害查询?

Jiaxi Yang, Chaewan Chun, Jason Lucas, Yuchen Yang, Dongwon Lee

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出首个针对大型音频语言模型过度拒绝问题的基准AOR-Bench,包含3000个伪有害音频样本,评估12个模型发现过度拒绝普遍存在,并探索了两种轻量缓解策略。

Comments To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25390 2026-08-27 cs.LG cs.AI cs.CR 新提交 62%

Refusal geometry reflects refusal training: diverse refusal prefixes can raise stable rank and weaken refusal vector ablation attacks

弃权几何反映弃权训练:多样的弃权前缀可提升稳定秩并削弱弃权向量消融攻击

Andrey Labunets

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究以OLMo-2-0425-1B-Instruct为对象,揭示弃权几何与弃权训练的关联,发现多样弃权起始可提升梯度稳定秩,削弱弃权向量消融攻击,为提升AI模型弃权鲁棒性提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25477 2026-08-27 cs.NI cs.LG 新提交 57%

AERIS: Offline Policy Improvement for Multi-UAV Integrated Sensing and Communication

AERIS:面向多无人机集成感知与通信的离线策略改进

Ziyuan Wang, Yifan Sui, Wei Wei, Wenjie Xin, Zekai Zhang, Xiangwang Hou, Xiao-Ping (Steven) Zhang

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 针对多无人机集成感知与通信的控制问题,提出离线策略改进框架AERIS及STAR-CRDT算法,在保障安全的同时显著提升ISAC性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25091 2026-08-27 cs.AI cs.CR 新提交 57%

Auto-Policy, not Auto-Skill: Compiled Agent Skills for the Physical World

自动策略,而非自动技能:面向物理世界的编译智能体技能

Zhonghao Zhan, Hamed Haddadi

机构 * Imperial College London(帝国理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文针对恶意智能体技能造成物理伤害的问题,提出位于技能制品内部的类型化权限层Edge Skillguard,可高效拒绝借用权限请求,验证了其在多场景下的防护效果。

Comments Presented at the 1st Workshop on Agent Skills (Agent Skills '26), ACM CAIS 2026, San Jose, May 26, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16244 2026-08-27 cs.CR cs.AI 版本更新 57%

Activating Latent Security Knowledge through LLM-Guided Risk Analysis for Secure Code Generation

SPARK: 基于安全知识引导与表示激活的LLM安全代码生成

Xiaoyun Xu, Lichao Wu, Jona te Lintelo, Siyu Zhang, Keke Gai, Stjepan Picek

机构 * Radboud University(拉德堡德大学) University of Bristol(布里斯托大学) University of Zagreb(扎格雷布大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出SPARK方法,通过检索CWE条目并添加结构化提示激活模型内隐安全知识,结合预计算令牌偏置,无需重训练即可提升代码安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17932 2026-08-27 cs.CY 版本更新 57%

Operational Agency: A Permeable Legal Fiction for Tracing Culpability in AI Systems

可操作代理:一种渗透性法律虚构,用于追踪AI系统中的过失

Anirban Mukherjee, Hannah Hanwen Chang

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文提出可操作代理(OA)和可操作代理图(OAG)作为追踪AI系统过失的法律框架,通过分析AI的操作特征和因果关系,为法院和立法提供证据方法,确保人类问责制与技术自主性同步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22932 2026-08-27 eess.SP 版本更新 50%

AirMoE: Realizing Over-the-Air Distributed Mixture-of-Experts Inference at the Wireless Edge

AirMoE:在无线边缘实现无线分布式混合专家(Mixture-of-Experts,MoE)推理

Huiling Yang, Zhanwei Wang, Kaibin Huang

专题命中 安全训练 :alignment(abstract)

AI总结 AirMoE是利用AirComp实现无线分布式MoE推理的框架,通过双时间尺度策略解决AirComp带来的挑战,在ARC-Easy基准上显著提升了E2E推理准确性,尤其适用于强设备异构场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25411 2026-08-27 cs.CR cs.SC 版本更新 50%

Heimdall: Formally Verified Automated Migration of Legacy eBPF Programs to Rust

Heimdall: 形式化验证的遗留 eBPF 程序到 Rust 的自动迁移

Vishnu Asutosh Dasu, Monika Santra, Md Rafi Ur Rashid, Ashish Kumar, Saeid Tizpaz-Niari, Gang Tan

专题命中 安全训练 :safety(abstract)

AI总结 本文提出 Heimdall,一个利用大语言模型将遗留 libbpf C 程序自动翻译为 Aya Rust 的管道,通过静态分析和符号执行确保迁移后程序行为等价,并修复了 eBPF 程序中六类源级漏洞,包括未报告的信息泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 6 篇

2508.09201 2026-08-27 cs.CR cs.AI cs.CV 版本更新 85%

Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models

学习检测未见过的大型视觉-语言模型中的对抗攻击

Shuang Liang, Zhihao Xu, Jiaqi Weng, Jialing Tao, Hui Xue, Xiting Wang

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 LoD通过学习模型内部激活生成安全表示,实现对未见过的对抗攻击的高效检测,提升检测性能和效率。

Comments 17 pages; Previously this version appeared as arXiv:2510.15430 (https://arxiv.org/abs/2510.15430) which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26008 2026-08-27 cs.CR cs.CL 新提交 83%

A Self-Evolving Multi-Agent Framework Defense against LLM Jailbreak Attacks

一种针对LLM越狱攻击的自进化多智能体框架防御方法

Tongyan Hu, Bryan Hooi

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL

AI总结 该研究针对LLM越狱攻击提出一种基于规则记忆的自进化多智能体防御框架,无需参数更新,可降低攻击成功率且保留良性效用,适用于两类LLM模型。

Comments 8 pages (main), with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20991 2026-08-27 cs.LG 版本更新 79%

Trojaning the Alignment: Stealthy Backdoor Attacks against Graph Foundation Models

对齐攻击:针对图基础模型的隐蔽后门攻击

Minhua Lin, Zhicheng Gao, Yilong Wang, Hanqing Lu, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.LG

AI总结 本文针对带文本属性图的图基础模型,提出STAG隐蔽特洛伊木马攻击框架,协调图触发器生成器与文本软提示实现后门攻击,经多数据集实验验证其有效性与隐蔽性。

Comments Accepted by ICDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25817 2026-08-27 cs.CR 新提交 75%

SkillShield: Prompt-Space Security Skills for LLM Coding Agents

SkillShield:面向LLM编码智能体的提示空间安全技能

Xiaodong Wu, Zhimin Zhao, Qi Li, Xiangman Li, Yu Shi, Bram Adams, Jianbing Ni

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 SkillShield是一种系统提示防御机制,通过离线合成安全技能注入系统提示,可有效降低LLM编码智能体的恶意软件生成成功率,在多项实验中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26049 2026-08-27 cs.CR cs.AR 新提交 50%

RTLGuard: A Lightweight Teacher-Student Defense for Poisoned RTL Code Generation Models

RTLGuard:一种针对中毒RTL代码生成模型的轻量级师生防御方法

Mahshid Rezakhani, Kimia Azar, Hadi Kamali

专题命中 越狱攻击 :alignment(abstract)

AI总结 RTLGuard是一种轻量级师生防御方法,通过小规模干净教师模型、复合师生目标及特征对齐等,降低中毒RTL代码生成模型的攻击成功率,同时保留代码功能正确性与可综合性。

Comments 8 pages, 4 figures, 7 tables. Accepted at the IEEE/ACM International Conference on Computer-Aided Design (ICCAD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25697 2026-08-27 cs.CR 新提交 50%

LMSM: LLM Security Framework Inspired by Linux Security Modules

LMSM:受Linux安全模块启发的大语言模型安全框架

XiuYu Zhang, Bonan Ruan, Junfeng Fang, An Zhang, Tat-Seng Chua, Zhenkai Liang

专题命中 越狱攻击 :safety(abstract)

AI总结 该研究提出受Linux安全模块启发的LMSM框架,通过分离调解与策略实现LLM安全,在Qwen3-4B上可降低攻击成功率,同时保持较高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 3 篇

2606.19660 2026-08-27 cs.CR cs.CL 版本更新 79%

A Layered Security Framework Against Prompt Injection in RAG-Based Chatbots

基于RAG的聊天机器人中针对提示注入的分层安全框架

Gulshan Saleem, Nisar Ahmed, Muhammad Imran Zaman, Ali Hassan, Umar Mujahid

机构 * ICCK Transactions on Information Security and Cryptography(信息安全与密码学国际会议交易)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 提出三层防御框架,通过输入过滤、上下文指令层级和输出审计,将提示注入攻击成功率从71.4%降至11.3%,误报率4.8%,延迟开销61.2毫秒。

Comments Submitted in ICCK Transactions on Information Security and Cryptography

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24625 2026-08-27 cs.CR cs.AI 版本更新 72%

APPA: Recoverable Information-Flow Control for Real-World LLM Agents

用于大语言模型代理中污点限制的代理权限策略代数

Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov, Matvey Kukuy

专题命中 提示注入 :safety(abstract,comments);prompt injection(abstract);分类 cs.AI

AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。

Comments 21 pages, 3 figures. v2: Major revision with updated title, MCP protocol gateway architecture, 3-model empirical benchmark (6,600 episodes), recovery ablations, gradual security typing, and complete formal safety proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30837 2026-08-27 cs.CR cs.LG 版本更新 61%

Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense

先派侦察兵:提示注入防御中自适应检测器分配的预推理方法

Shuhao Zhang, Jiarui Li, Qi Cao, Ruiyi Zhang, Pengtao Xie

机构 * UC San Diego(加州大学圣迭戈分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 提示注入 :safety(abstract,comments);分类 cs.LG

AI总结 针对提示注入检测器异构且不可靠的问题,提出SCOUT框架,通过预测每个检测器对每个样本的可靠性和延迟,动态分配检测器,实现安全性与效率的权衡。

Comments We propose SCOUT, a detector allocation framework that predicts each detector's accuracy and latency on a given input before running it, letting operators control the safety-utility trade-off with a single threshold and route to an LLM judge only when needed

详情

展开后加载摘要…

URL PDF HTML 收藏