arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-12 至 2026-02-12 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 2 篇

2602.05252 2026-02-12 cs.CL 57%

Copyright Detective: A Forensic System to Evidence LLMs Flickering Copyright Leakage Risks

版权侦探:一种用于证据LLM闪烁版权泄露风险的取证系统

Guangwei Zhang, Jianing Zhu, Cheng Qian, Neil Gong, Rada Mihalcea, Zhaozhuo Xu, Jingrui He, Jiaqi Ma, Yun Huang, Chaowei Xiao, Bo Li, Ahmed Abbasi, Dongwon Lee, Heng Ji, Denghui Zhang

机构 * Pine AI The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Duke University(杜克大学) University of Michigan(密歇根大学) Stevens Institute of Technology(史蒂文斯理工学院) Johns Hopkins University(约翰霍普金斯大学) University of Notre Dame(圣母大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 隐私与版权 :jailbreak(abstract);分类 cs.CL

AI总结 Copyright Detective 是一种交互式系统,用于检测和可视化LLM输出中的版权风险,通过整合多种检测方法实现系统性审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10251 2026-02-12 cs.HC cs.CR 50%

Actions Speak Louder Than Chats: Investigating AI Chatbot Age Gating

行动胜于聊天:研究AI聊天机器人年龄限制

Olivia Figueira, Pranathi Chamarthi, Tu Le, Athina Markopoulou

专题命中 隐私与版权 :safety(abstract)

AI总结 本文研究流行聊天机器人是否能通过对话估计用户年龄并采取行动限制儿童访问,发现其未能履行自身政策。

详情

展开后加载摘要…

URL PDF HTML 收藏