arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-25 至 2025-11-25 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2501.18416 2025-11-25 cs.LG 79%

Exploring Potential Prompt Injection Attacks in Federated Military LLMs and Their Mitigation

探索联邦军事大语言模型中的潜在提示注入攻击及其缓解方法

Youngjoon Lee, Taehyun Park, Yunho Lee, Jinu Gong, Joonhyuk Kang

机构 * Institute of Information & Communications Technology Planning & Evaluation (IITP)-ITRC (Information Technology Research Center)(信息与通信技术规划与评估机构(IITP)-ITRC(信息技术研究中心))

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 本文探讨了联邦军事大语言模型中潜在的提示注入攻击问题,提出人机协作框架结合技术和政策措施来缓解相关风险。

Comments Accepted to the 3rd International Workshop on Dataspaces and Digital Twins for Critical Entities and Smart Urban Communities - IEEE BigData 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00230 2025-11-25 cs.HC cs.AI 57%

Neural Transparency: Mechanistic Interpretability Interfaces for Anticipating Model Behaviors for Personalized AI

神经透明:用于预测模型行为的机制可解释性接口以实现个性化AI

Sheer Karny, Anthony Baez, Pat Pataranutaporn

机构 * MIT Media Lab(麻省理工学院媒体实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 提示注入 :safety(abstract);分类 cs.AI

AI总结 本研究提出神经透明接口,通过可视化语言模型内部结构帮助用户预测AI行为,提升信任并促进更安全的人机交互。

Comments SK and AB are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏