arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-16 至 2026-01-16 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 2 篇

2601.10589 2026-01-16 cs.CR cs.CL 90%

Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay

做自己的红队:通过自play和反思经验回放实现安全对齐

Hao Wang, Yanting Wang, Hao Li, Rui Li, Lei Sha

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) Zhongguancun Laboratory(中关村实验室)

专题命中 红队测试 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);red teaming(abstract)

AI总结 通过自play和反思经验回放机制,使模型自主进化防御能力,提升安全对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10004 2026-01-16 cs.CR cs.LG 57%

SoK: Privacy-aware LLM in Healthcare: Threat Model, Privacy Techniques, Challenges and Recommendations

SoK:面向医疗的隐私保护大语言模型:威胁模型、隐私技术、挑战与建议

Mohoshin Ara Tahera, Karamveer Singh Sidhu, Shuvalaxmi Dass, Sajal Saha

机构 * University of Louisiana at Lafayette, Lafayette, LA, USA(路易斯安那州立大学拉斐特分校) University of Northern British Columbia, Canada(北部BC大学)

专题命中 红队测试 :trustworthy(abstract);分类 cs.LG

AI总结 本文系统分析了医疗领域大语言模型的隐私保护问题,探讨了威胁模型、隐私技术及挑战,并提出针对不同阶段的防护建议和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏