arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-09-01 至 2026-09-01 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 3 篇

2603.10807 2026-09-01 q-fin.CP cs.AI cs.CY 版本更新 84%

Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services

针对金融服务业LLM自动红队测试的风险调整危害评分

Fabrizio Dimino, Bhaskarjit Sarmah, Stefano Pasquali

专题命中 红队测试 :red teaming(title);safety(abstract);jailbreak(abstract_cn);分类 cs.AI、cs.CY

AI总结 本文提出了一种针对金融服务业LLM安全风险的评估框架,通过风险敏感的RAHS度量标准,评估LLM在长期对抗压力下的安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18540 2026-09-01 cs.CL cs.CR cs.LG 版本更新 81%

Learning diverse attacks on large language models for robust red-teaming and safety tuning

针对大语言模型学习多样化攻击以用于鲁棒红队测试与安全调优

Seanie Lee, Minsu Kim, Lynn Cherif, David Dobre, Juho Lee, Sung Ju Hwang, Kenji Kawaguchi, Gauthier Gidel, Yoshua Bengio, Esmeralda S. Whitammer, Moksh Jain

机构 * KAIST(韩国科学技术院) Mila – Québec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) National University of Singapore(新加坡国立大学) University of Edinburgh(爱丁堡大学) CIFAR(加拿大高级研究所)

专题命中 红队测试 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究针对现有红队测试方法存在的模式崩塌或攻击有效性不足问题,提出GFlowNet微调加二次平滑的方法生成多样化攻击提示,其攻击对各类LLM有效且可迁移,用该攻击提示调优的模型对其他攻击方法具有鲁棒性。

Comments ICLR 2025; code: this https URL (https://github.com/GFNOrg/red-teaming)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30207 2026-09-01 cs.CR cs.AI 新提交 77%

SIR: Self-improving Red-teaming for Compute Use Agents

SIR:面向计算使用智能体的自改进红队测试

Chen Xiong, Zhiyuan He, Pin-Yu Chen, Stjepan Picek, Tsung-Yi Ho

专题命中 红队测试 :safety(abstract);red teaming(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出SIR,一种针对操作系统层面计算使用智能体的黑盒间接提示注入攻击,通过迭代反馈循环提炼策略,使攻击成功率显著提升且可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏