arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-07-29 至 2026-07-29 共收录 2
2607.06608 2026-07-29 cs.CR cs.AI cs.HC 版本更新

Security and Privacy in Agentic AI: Grand Challenges and Future Directions

智能体人工智能中的安全与隐私:重大挑战与未来方向

Adam Jenkins, Agnieszka Kitkowska, Caterina Maidhof, Diego Paracuellos, Francesco Sovrano, Gonzalo Gabriel Mendez, Guillermo Suarez-Tangil, Hana Kopecka, Isabel Wagner, Isabel Barbera, Javier Carnerero-Cano, Jide Edu, Jose Luis Martin-Navarro, Jose Such, Josep Domingo-Ferrer, Juan Carlos Carrillo, Kopo Marvin Ramokapane, Mark Cote, Pablo Vellosillo, Ramon Ruiz-Dolz, Rongjun Ma, Ruba Abu-Salma, Sameer Patil, William Seymour, Xiao Zhan

机构 * King’s College London(伦敦国王学院) Jönköping University(琼斯平大学) Universitat Politècnica de València(巴塞罗那理工大学) Inria(法国国家信息与自动化技术研究所) IBM Research(IBM研究院) Aalto University(阿尔托大学) INGENIO (CSIC–Universitat Politècnica de València)(INGENIO(西班牙国家科研委员会-巴塞罗那理工大学)) IMDEA Networks(IMDEA网络研究所) University of Basel(巴塞尔大学) Dutch Data Protection Authority (AP)(荷兰数据保护局) University of Strathclyde(斯特拉斯克莱德大学) Universitat Rovira i Virgili(罗维拉-维古利大学) University of Bristol(布里斯托大学) University of Dundee(邓迪大学)

AI总结 探讨智能体人工智能安全与隐私关键挑战及未来方向,通过汇聚30位国际专家的视野扫描活动,针对人工智能增长带来的新风险展开讨论与协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24539 2026-07-29 cs.CL cs.AI 版本更新

Localizing Persona Representations in LLMs

在大语言模型中定位角色表示

Celia Cintas, Miriam Rateike, Erik Miehling, Elizabeth Daly, Skyler Speakman

机构 * IBM Research Africa(IBM非洲研究院) IBM Research Europe(IBM欧洲研究院)

AI总结 研究大语言模型中角色表示的编码位置与方式,运用降维和模式识别方法,发现角色表示差异在解码器层最后三分之一内,特定伦理观点有重叠激活,政治意识形态区域不同,有助于理解LLM信息表示及改进输出调制。

Comments Corrected small naming inconsistencies for Level 0, 1, and 2 analysis

Journal ref Proceedings of the AAAI ACM Conference on AI, Ethics, and Society, 8(1), 630-642, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏