arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Cisco(思科)

2026-02-10 至 2026-02-10 共收录 2
2505.20162 2026-02-10 cs.AI cs.CL cs.CR cs.LG

Capability-Based Scaling Trends for LLM-Based Red-Teaming

基于能力的LLM红队测试规模趋势

Alexander Panfilov, Paul Kassianik, Maksym Andriushchenko, Jonas Geiping

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) Foundation AI – Cisco Systems Inc.(AI基础研究机构——思科系统公司) EPFL(苏黎世联邦理工学院)

AI总结 研究通过分析攻击者与目标模型能力差距,揭示了红队测试中攻击成功率随模型能力变化的趋势,提出jailbreaking scaling曲线以预测攻击效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20125 2026-02-10 cs.LG cs.AI

Membership Inference Attacks Against Fine-tuned Diffusion Language Models

针对微调扩散语言模型的成员推断攻击

Yuetian Chen, Kaiyuan Zhang, Yuntao Du, Edoardo Stoppa, Charles Fleming, Ashish Kundu, Bruno Ribeiro, Ninghui Li

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) Cisco Research(思科研究)

AI总结 本文提出SAMA方法,通过稳健聚合解决稀疏信号挑战,显著提升对微调扩散语言模型的成员推断攻击效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏