arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 691 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 691 篇

2607.16280 2026-07-21 cs.CV 新提交 50%

3D FaceShell: Attribute Transfer in 3D Face Avatars as a VLM Defense Mechanism

3D FaceShell:作为视觉语言模型防御机制的3D人脸头像属性转移

Weston Bondurant, Srijan Das, Hieu Le, Stephanie Schuckers

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 隐私与版权 :alignment(abstract)

AI总结 针对VLM可从3D人脸渲染图像提取敏感属性的隐私挑战,提出3D FaceShell框架,通过可学习高斯壳产生扰动,在保持面部外观的同时引导VLM语义解释,实验证明其能有效提高属性注入和不匹配率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13386 2026-07-16 cs.CV 新提交 50%

FM$^2$: Unified Federated Foundation Models for Heterogeneous Multimodal Medical Imaging

FM$^2$:用于异构多模态医学成像的统一联邦基础模型

Shengchao Chen, Ting Shu

机构 * School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Australian AI Institute, University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所)

专题命中 隐私与版权 :alignment(abstract)

AI总结 针对医学成像基础模型构建中隐私与任务统一问题,提出FM$^2$框架,通过从头训练核心主干、结合预训练编码器、配备双混合专家模块及正则化器,并引入字幕增强学习,实现跨模态泛化,优于现有联邦基线。

Comments Accepted by ACM MM 2026 (Main Track): the 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06687 2026-07-09 cs.HC 新提交 50%

Exploring the Interaction of Explanation Styles, Context, and Trust of AI Privacy Redaction in AI-mediated Interactions

探索人工智能隐私编辑的解释风格、上下文和信任在人工智能介导交互中的相互作用

Roshni Kaushik, Maarten Sap, Koichi Onoue

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 研究人工智能介导通信中隐私编辑解释对用户信任的影响,设计场景并开展用户研究,发现提供解释能提升信任,上下文因素有影响,解释偏好因个体差异而异,强调平衡透明度与隐私及适应性解释对设计可信AI系统的重要性。

Comments Originally submitted to UIST, will be resubmitting

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03688 2026-07-07 cs.CR 新提交 50%

PathMark: Protecting Intellectual Property of Mixture-of-Expert LLMs via Path Watermarks

PathMark:通过路径水印保护混合专家语言模型的知识产权

Yudong Gao, Qingyue Wang, Yuanyuan Yuan, Ruixuan Huang, Linghan Chen, Zimo Ji, Shuai Wang

专题命中 隐私与版权 :alignment(abstract)

AI总结 针对混合专家(MoE)架构中传统水印方案失效的问题,提出PathMark框架,通过主动控制路由作为隐蔽水印通道,利用多种机制解决脆弱决策边界和路由纠缠问题,实现高验证准确率和强鲁棒性。

Comments 20 pages, accepted by CCS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01019 2026-07-02 cs.CR 新提交 50%

Toward a Unified Security and Privacy Framework for AI-Native 6G Networks

面向AI原生6G网络的统一安全与隐私框架

Bidushi Barua, Ahsan Khan, Kangfeng Ye, Panagiotis Papanastasiou, Yifan Liu, Mohit Bidikar, Anthony Moulds, Julie McCann, Poonam Yadav

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 针对AI原生6G网络中安全与隐私的碎片化问题,提出跨层威胁分类与统一框架,分析关键技术威胁并映射对策,为可信6G系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00379 2026-07-02 cs.IR cs.CV 新提交 50%

Attribute-Prompted Kernel Hashing for Unsupervised Data-Efficient Cross-Modal Retrieval

属性提示核哈希用于无监督数据高效跨模态检索

Runhao Li, Xiaoxu Ma, Zhenyu Weng, Yue Zhang, Guibo Luo, Huiping Zhuang, Zhiping Lin, Yap-Peng Tan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) VinUniversity

专题命中 隐私与版权 :alignment(abstract)

AI总结 提出属性提示核哈希(APKH),利用视觉-语言基础模型的广义属性先验,通过上下文优化属性核映射和核平滑对比对齐,在数据受限场景下实现从可见到不可见类别的跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31935 2026-07-01 econ.EM 新提交 50%

Delegation Rights: Property, Agency, and Investment Incentives in the Age of AI Agents

委托权:AI代理时代中的财产、代理与投资激励

Yukun Zhang, Kemu Xu

专题命中 隐私与版权 :safety(abstract)

AI总结 本文定义委托权为账户持有人授权代理执行的可撤销、身份保留、范围受限且模式特定的权限,通过三方不完全契约模型分析平台控制、用户控制与认证委托三种机制对投资激励和风险分配的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24424 2026-06-24 eess.SP 新提交 50%

Explainable AI for Next-Generation Wireless Physical Layer: Basics, State-of-the-Art, and Open Challenges

下一代无线物理层的可解释人工智能:基础、最新进展与开放挑战

Bingnan Xiao, Shuyan Hu, Xiaojing Chen, Zhiyuan Zhai, Bingcong Li, Wei Ni, Xin Wang, Ekram Hossain

专题命中 隐私与版权 :safety(abstract)

AI总结 本文综述了无线物理层中可解释人工智能(XAI)的应用,提出了面向责任的目标,建立了系统分类法,并讨论了可解释性-性能权衡等开放挑战。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23179 2026-06-19 eess.IV cs.CV 版本更新 50%

OncoReg: Medical Image Registration for Oncological Challenges

OncoReg:面向肿瘤学挑战的医学图像配准

Wiebke Heyer, Yannic Elser, Lennart Berkel, Xinrui Song, Xuanang Xu, Pingkun Yan, Xi Jia, Jinming Duan, Zi Li, Tony C. W. Mok, BoWen LI, Tim Hable, Christian Staackmann, Christoph Großbröhmer, Lasse Hansen, Alessa Hering, Malte M. Sieren, Mattias P. Heinrich

机构 * Institute of Medical Informatics, University of Lübeck(吕贝克大学医学信息学研究所) Institute of Radiology and Nuclear Medicine, University Hospital Schleswig-Holstein(石勒斯维希-霍尔斯坦大学医院放射科和核医学研究所) Department of Biomedical Engineering and Center for Biotechnology and Interdisciplinary Studies, Rensselaer Polytechnic Institute(伦塞拉塞尔理工学院生物医学工程系和生物技术与跨学科研究中心) School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院) Division of Informatics, Imaging and Data Sciences, University of Manchester(曼彻斯特大学信息学、成像和数据科学系) DAMO Academy, Alibaba Group(阿里集团DAMO学院) Hangzhou Shengshi Technology Co., Ltd(杭州盛世科技有限公司) Department of Radiation Oncology, University Hospital Schleswig-Holstein(石勒斯维希-霍尔斯坦大学医院放射肿瘤科) EchoScout GmbH Radboud University Medical Center, Nijmegen(奈密根大学医学中心) Institute of Interventional Radiology, University Hospital Schleswig-Holstein(石勒斯维希-霍尔斯坦大学医院介入放射科)

专题命中 隐私与版权 :alignment(abstract)

AI总结 提出OncoReg挑战,通过两阶段框架在保护患者隐私的同时开发可泛化的图像配准方法,用于放射治疗中锥束CT与扇束CT的配准,发现特征提取是关键,深度学习和经典方法结合最有效。

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12341 2026-06-11 cs.CR 新提交 50%

OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents

OCELOT:面向隐私保护LLM代理的推理泄露预算

Jin Xie, Songze Li

专题命中 隐私与版权 :jailbreak(abstract)

AI总结 提出OCELOT运行时中介,通过后验风险控制和证人验证降级机制,在代理轨迹中预算对手信念更新,平衡任务效用与隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04799 2026-06-09 cs.CR 版本更新 50%

Maris: A Formally Verifiable Privacy Policy Enforcement Paradigm for Multi-Agent Collaboration Systems

Maris:一种用于多智能体协作系统的形式化可验证隐私策略执行范式

Jian Cui, Zichuan Li, Chi Wang, Luyi Xing, Xiaojing Liao

专题命中 隐私与版权 :prompt injection(abstract)

AI总结 针对多智能体协作系统(MACS)中敏感数据泄露风险,提出一种基于引用监视器的隐私增强开发范式Maris,通过嵌入消息流控制机制实现细粒度数据保护,并在AutoGen和LangChain框架中实现,实验表明其能有效缓解数据泄露威胁且保持高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03190 2026-06-03 cs.HC 50%

Focused on the User, Overlooking the Risks: Security and Privacy Understandings, Practices and Challenges of Independent Chinese AI Agent Developers

聚焦用户,忽视风险:中国独立AI代理开发者的安全与隐私理解、实践与挑战

Shuning Zhang, Mingyao Xu, Zhixin Huang, Yutong Jiang, Rongjun Ma, Yuting Yang, Xin Yi, Kanye Ye Wang, Hewu Li

专题命中 隐私与版权 :safety(abstract)

AI总结 通过访谈28名中国独立AI代理开发者,发现他们以用户为中心,关注面向用户的安全风险(如有害内容),但对安全漏洞意识薄弱,依赖临时手动防护和非正式沟通,缺乏正式工具和流程,主要受限于缺乏安全培训、工具和平台指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01225 2026-06-02 cs.CR 50%

Privacy-Preserving Smart Surveillance with Cross-Dataset Violence Detection and Decentralized Evidence Governance

隐私保护的智能监控:跨数据集暴力检测与去中心化证据治理

Hasan Coşkun, Furkan Çolhak, Andrea Kulakov, Vesna Dimitrova

专题命中 隐私与版权 :safety(abstract)

AI总结 提出一种隐私保护智能监控框架,使用轻量级MobileNetV2视频分类器检测暴力片段,并通过Shamir秘密共享和公钥加密实现去中心化证据访问控制,在多个数据集上评估了不同时序模型的表现。

Comments 7 pages. Submitted to the CyberMACS Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09781 2026-05-28 cs.CR 50%

CLIOPATRA: Extracting Private Information from LLM Insights

CLIOPATRA: 从LLM洞察中提取隐私信息

Meenatchi Sundaram Muthu Selva Annamalai, Emiliano De Cristofaro, Peter Kairouz

专题命中 隐私与版权 :prompt injection(abstract)

AI总结 提出CLIOPATRA攻击,通过注入恶意聊天突破多层启发式隐私保护,从LLM洞察系统中提取目标用户敏感信息,在合成医疗聊天中高达65%成功率且几乎100%精确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06304 2026-05-28 cs.CR 50%

SRAF: Stealthy and Robust Adversarial Fingerprint for Copyright Verification of Large Language Models

SRAF:用于大语言模型版权验证的隐蔽且鲁棒的对抗指纹

Zhebo Wang, Zhenhua Xu, Maike Li, Wenpeng Xing, Chunqiang Hu, Chen Zhi, Meng Han

专题命中 隐私与版权 :alignment(abstract)

AI总结 提出SRAF框架,通过协同联合优化和困惑度隐藏技术,在多种模型修改下实现鲁棒且隐蔽的对抗指纹,用于大语言模型所有权验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26882 2026-05-27 cs.CR 50%

Privacy-Preserving Screening for Record Linkage

隐私保护的记录链接筛选

Chenyu Huang, Fan Zhang, Huangxun Chen, Yongjun Zhao, Huaming Rao, Peng Chen, Danqing Huang

专题命中 隐私与版权 :alignment(abstract)

AI总结 提出 Screening-then-Linkage 框架,通过轻量级筛选阶段降低隐私保护记录链接的计算开销,并基于电路PSI设计Appraisal系统实现高效安全筛选。

Comments 14 pages; 2025 IEEE 41st International Conference on Data Engineering (ICDE)

Journal ref 2025 IEEE 41st International Conference on Data Engineering (ICDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22139 2026-05-22 cs.CV 50%

EventGait: Towards Robust Gait Recognition with Event Streams

EventGait: 向事件流中实现鲁棒的步态识别

Senyan Xu, Shuai Chen, Chuanfu Shen, Kean Liu, Zhijing Sun, Chengzhi Cao, Xueyang Fu

机构 * University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文提出EventGait,一种端到端的双流框架,通过事件相机捕捉动态和形状信息,提升在复杂光照和运动环境下的步态识别鲁棒性,并通过合成数据集和新基准测试验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00273 2026-05-19 cs.HC 50%

Understanding, Challenging, and Demystifying Perceptions of Gig Worker Vulnerabilities

理解、挑战和祛魅网约车工人脆弱性感知

Sander de Jong, Jane Hsieh, Tzu-Sheng Kuo, Rune Møberg Jacobsen, Niels van Berkel, Haiyi Zhu

专题命中 隐私与版权 :safety(abstract)

AI总结 本文研究了网约车工人对自身脆弱性的认知及误解,通过实验发现工人对常见误解的认知不足,提出通过说服策略提升公众对网约车工人劳动条件的认识,以支持集体谈判权益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15791 2026-05-18 cs.NI cs.SY eess.SY 50%

The Shared Prosperity Internet

共享繁荣互联网

Juan A. Cabrera, Pit Hofmann, Jonas Schulz, Frederic Benken, Hrjehor Mark, Giang T. Nguyen, Holger Boche, Frank H. P. Fitzek

专题命中 隐私与版权 :safety(abstract)

AI总结 本文提出共享繁荣互联网架构,通过映射物理约束到三个原则,构建了三个技术支柱,旨在使自动化和AI的效益广泛普及,并定义了可衡量的成果指标。

Comments 8 pages, conference, 4 figures, 16 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14387 2026-05-15 cs.CR eess.SP 50%

Model Forensics in AI-Native Wireless Networks: Taxonomy, Applications, and Case Study

无线网络中的人工智能原生模型取证:分类、应用与案例研究

Pengyu Chen, Weiyang Li, Jin Xu, Jiacheng Wang, Ning Wang, Dusit Niyato, Tao Xiang

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 本文探讨了人工智能原生无线网络中的模型取证问题,包括模型真实性验证、恶意功能识别和责任追溯,通过RF指纹案例展示取证技术的实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12552 2026-05-14 cs.NI eess.SP 50%

DQN-Driven Adaptive Neighbor Discovery for Directional Aerial Networks

基于DQN的自适应邻居发现方向空中网络

Md Asif Ishrak Sarder, Murat Yuksel, Elizabeth Bentley

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文提出基于DQN的自适应收发机选择协议,解决方向空中网络中邻居发现与隐私保护的平衡问题,通过动态调整探测模式提升连接效率和隐私保护。

Comments Accepted at IEEE ICC 2025. This is the author-accepted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08104 2026-05-12 cs.CR 50%

AgentCrypt: Advancing Privacy and (Secure) Computation in AI Agent Collaboration

AgentCrypt: 推动AI代理协作中的隐私与(安全)计算发展

Harish Karthikeyan, Yue Guo, Leo de Castro, Antigoni Polychroniadou, Udari Madhushani Sehwag, Leo Ardon, Sumitra Ganesh, Manuela Veloso

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 AgentCrypt通过三层框架提升AI代理协作中的隐私和安全计算,解决传统访问控制不足和LLM安全性的不足问题,实现数据安全计算和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06630 2026-05-08 eess.SY cs.SY 50%

Quantifying Trade-Offs Between Stability and Goal-Obfuscation

量化稳定性与目标混淆之间的权衡

Yixuan Wang, Dan Guralnik, Warren Dixon

专题命中 隐私与版权 :safety(abstract)

AI总结 本文研究了在连续状态空间中意图隐私的联合控制问题,通过设计隐私约束与跟踪要求的联合可行性分析,提出了基于PCBF的意图隐私保护方法。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10171 2026-04-23 cs.CV cs.ET 50%

SynSpill: Improved Industrial Spill Detection With Synthetic Data

SynSpill:基于合成数据的改进工业泄漏检测

Aaditya Baranwal, Abdul Mueez, Jason Voelker, Guneet Bhatia, Shruti Vyas

机构 * University of Central Florida(佛罗里达中央大学) Siemens Energy(西门子能源)

专题命中 隐私与版权 :safety(abstract)

AI总结 针对工业泄漏检测中数据稀缺问题,提出基于高质量合成数据生成的框架,通过参数高效微调提升VLMs和检测器性能,实现安全关键领域的有效应用。

Comments Accepted at ICCV (VISION'25 Workshop) 2025

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 1425-1434

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15369 2026-04-20 cs.CR 50%

An Agentic Workflow for Detecting Personally Identifiable Information in Crash Narratives

一种用于检测事故叙述中个人可识别信息的代理工作流

Junyi Ma, Pei Li, Rui Gan, Kai Cheng, Steven T. Parker, Bin Ran

专题命中 隐私与版权 :safety(abstract)

AI总结 本文提出一种本地部署的代理工作流,利用大语言模型检测事故叙述中的个人可识别信息,通过混合提取器和验证器提升检测精度与召回率,实现隐私保护的可扩展数据处理。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12127 2026-04-15 cs.NI 50%

BLAST: Blockchain-based LLM-powered Agentic Spectrum Trading

BLAST:基于区块链的大型语言模型驱动的代理频谱交易

Anas Abognah, Otman Basir

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 本文提出BLAST框架,结合大型语言模型代理与许可区块链,实现自主、隐私和安全的频谱交易生态系统。通过三种拍卖机制评估,证明第二价格拍卖在提升社会福利和分配效率方面最优,同时验证了隐私保护机制。

Comments This work has been submitted to the IEEE Transactions on Cognitive Communications and Networking for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11772 2026-04-14 cs.CR 50%

Towards Automated Pentesting with Large Language Models

向大型语言模型迈进的自动化渗透测试

Ricardo Bessa, Rui Claro, João Trindade, João Lourenço

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文提出RedShell框架,利用微调的LLM生成针对Windows漏洞的恶意PowerShell代码,实现高效隐私保护的渗透测试自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10052 2026-04-14 cs.CR cs.NI 50%

Impact of Intelligent Technologies on IoV Security: Integrating Edge Computing and AI

智能技术对车联网安全的影响:整合边缘计算和人工智能

Awais Bilal, Kashif Sharif, Liehuang Zhu, Chang Xu, Fan Li, Sadaf Bukhari, Sujit Biswas

专题命中 隐私与版权 :safety(abstract)

AI总结 本文探讨智能技术在车联网安全中的作用,分析边缘计算、机器学习和深度学习的协同效应,展示其在威胁检测、响应时间和适应性安全方面的贡献,并指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08352 2026-04-10 cs.SE cs.CR cs.HC 50%

Security Concerns in Generative AI Coding Assistants: Insights from Online Discussions on GitHub Copilot

生成式AI代码助手的安全问题:来自GitHub Copilot在线讨论的洞察

Nicolás E. Díaz Ferreyra, Monika Swetha Gurupathi, Zadia Codabux, Nalin Arachchilage, Riccardo Scandariato

专题命中 隐私与版权 :prompt injection(abstract)

AI总结 研究分析开发者在公共论坛中提出的安全问题,识别出数据泄露、代码授权、对抗攻击和不安全代码建议等四大安全关切,揭示生成式AI在软件工程中的局限性与权衡。

Comments Accepted for publication at EASE '26 Companion

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02711 2026-04-10 eess.SP 50%

Foundation Models Defining A New Era In Sensor-based Human Activity Recognition: A Survey And Outlook

基于传感器的人类活动识别的基石模型:一种综述与展望

Sizhen Bian, Mengxi Liu, Lala Shakti Swarup Ray, Bo Zhou, Bin Guo, Zhiwen Yu, Thomas Ploetz, Paul Lukowicz, Siyu Yuan, Vitor Fortes Rey

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文综述了基于传感器的人类活动识别中的基石模型,分析了九种技术轴上的设计模式与权衡,并探讨了数据整理、多模态对齐、个性化、隐私和负责任部署等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏