arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-25 至 2026-08-25 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 1 篇

2608.21985 2026-08-25 cs.AI 新提交 70%

Redteaming Leading Arabic LLMs with ASAS

基于ASAS对领先阿拉伯大型语言模型开展红队测试

Fidaa Abed, Haidar Khan, M Saiful Bari, Babar Khan, Abdalghani Abujabal

专题命中 红队测试 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本研究推出首个人工策划的阿拉伯语红队测试基准ASAS,评估7款领先阿拉伯LLM的安全性,发现多数模型对50%不安全提示防御失效,自动安全评判器表现逊于人工,为阿拉伯LLM安全提供文化适配的测试方案。

Comments 13 pages, 5 figues, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏