arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-27 至 2026-01-27 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 4 篇

2510.13390 2026-01-27 cs.CV 78%

Generalizing WiFi Gesture Recognition via Large-Model-Aware Semantic Distillation and Alignment

通过大模型感知的语义蒸馏与对齐实现WiFi手势识别的泛化

Feng-Qi Cui, Yu-Tong Guo, Tianyue Zheng, Jinyang Huang

机构 * Institute of Advanced Technology, University of Science and Technology of China(科学技术大学先进技术研究院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) School of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程学院)

专题命中 隐私与版权 :alignment(title,abstract)

AI总结 GLSDA通过大模型感知的语义蒸馏与对齐提升WiFi手势识别的泛化能力,实现领域内和跨领域任务的高性能识别。

Comments Accepted by IEEE ICPADS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17480 2026-01-27 cs.LG cs.AI cs.CL 75%

Unintended Memorization of Sensitive Information in Fine-Tuned Language Models

在微调语言模型中意外记忆敏感信息

Marton Szep, Jorge Marin Ruiz, Georgios Kaissis, Paulina Seidl, Rüdiger von Eisenhart-Rothe, Florian Hinterwimmer, Daniel Rueckert

机构 * TUM University Hospital(慕尼黑工业大学医院) Technical University of Munich (TUM)(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Computing, Imperial College London(伦敦帝国学院计算系)

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示微调语言模型时意外记忆敏感信息的风险,分析影响因素并评估隐私保护方法的权衡。

Comments Accepted to EACL 2026. 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14275 2026-01-27 cs.CR cs.AI cs.CL cs.LG 67%

FedMentor: Domain-Aware Differential Privacy for Heterogeneous Federated LLMs in Mental Health

FedMentor: 域感知差分隐私用于心理健康领域异构联邦大语言模型

Nobin Sarwar, Shubhashis Roy Dipta

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FedMentor通过整合LoRA和域感知差分隐私,实现对心理健康领域异构联邦大语言模型的隐私保护微调,提升安全性并保持模型效用。

Comments NeurIPS 2025 GenAI4Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17050 2026-01-27 cs.CV cs.AI 57%

Single-Pixel Vision-Language Model for Intrinsic Privacy-Preserving Behavioral Intelligence

单像素视觉-语言模型用于内在隐私保护的行为智能

Hongjun An, Yiliang Song, Jiawei Shao, Zhe Sun, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 单像素视觉-语言模型通过内在隐私保护机制,在隐私敏感环境中实现安全监控与行为智能的平衡。

Comments Initial Version, Pending Updates. We welcome any feedback and suggestions for improvement. Please feel free to contact us at an.hongjun@foxmail.com

详情

展开后加载摘要…

URL PDF HTML 收藏