arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-03 至 2026-02-03 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 3 篇

2505.16530 2026-02-03 cs.CR cs.AI cs.CL 73%

DuFFin: A Dual-Level Fingerprinting Framework for LLMs IP Protection

DuFFin:一种用于LLM知识产权保护的双层指纹框架

Yuliang Yan, Haochun Tang, Shuo Yan, Enyan Dai

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Jilin University(吉林大学)

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 DuFFin通过双层指纹框架在黑盒环境下实现LLM知识产权验证,准确识别模型来源并达到高验证精度。

Comments Accepted by EACL 2026, Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00298 2026-02-03 cs.AI 70%

Assessing Domain-Level Susceptibility to Emergent Misalignment from Narrow Finetuning

评估窄微调下领域层面的涌现对齐风险

Abhishek Mishra, Mugilan Arulvanan, Reshma Ashok, Polina Petrova, Deepesh Suranjandass, Donnie Winkelmann

机构 * Anonymous Authors(匿名作者)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文通过评估不同领域中窄微调下的涌现对齐风险,揭示了后门触发器对对齐效果的影响,并提出了基于成员推断度量的预测方法,为AI安全提供了新的视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02184 2026-02-03 cs.CR cs.AI 57%

Malware Detection Through Memory Analysis

通过内存分析检测恶意软件

Sarah Nassar

机构 * Electrical and Computer Engineering(电气与计算机工程系) Queen's University(皇后大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 本文通过XGBoost模型在内存分析中实现高精度恶意软件检测,提升了二分类和多类分类的准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏