Mind the Value-Action Gap: Do LLMs Act in Alignment with Their Values?
机构 * University of Washington(华盛顿大学) ; NYU Shanghai(纽约大学上海校区) ; New York University(纽约大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI
Comments EMNLP 2025 Main Paper
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * University of Washington(华盛顿大学) ; NYU Shanghai(纽约大学上海校区) ; New York University(纽约大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI
Comments EMNLP 2025 Main Paper
机构 * AI Singapore, National University of Singapore(AI新加坡,国立新加坡大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
Comments 8 pages, no figures
机构 * Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences(脑启发认知AI实验室,自动化研究所,中国科学院) ; Beijing Key Laboratory of Safe AI and Superalignment(北京安全AI与超对齐关键实验室) ; Beijing Institute of AI Safety and Governance(北京AI安全与治理研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) ; Long-term AI(长期AI)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
专题命中 安全评测 :trustworthy(title,abstract)
Comments 25 pages, 3 figures
机构 * Department of Aerospace Engineering and Engineering Mechanics(航空航天工程与工程力学系)
专题命中 安全评测 :safety(title,abstract)
机构 * TIB -- Leibniz Information Centre for Science and Technology(莱比锡信息科学与技术研究中心) ; University of Tabriz(塔布里兹大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
Comments 10 pages of main content, 3 page references, 3 figures. Accepted to Ontology Matching Workshop at ISWC
机构 * UCSD CSE(加州大学圣地亚哥分校计算机科学系) ; UCSD HDSI(加州大学圣地亚哥分校人类发展与应用科学学院)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG
Comments Accepted to EMNLP 2025
机构 * Ubiquitous Knowledge Processing Lab, Department of Computer Science, TU Darmstadt(图宾根大学计算机科学系) ; National Research Center for Applied Cybersecurity ATHENE, Germany(德国应用网络安全国家研究中心ATHENE) ; Department of Electrical and Computer Engineering & Ingenuity Labs Research Institute, Queen’s University, Canada(加拿大女王大学电气与计算机工程系及创新实验室研究院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted by EMNLP 2025
机构 * GECAD, ISEP, Polytechnic of Porto Faculty of Engineering, University of Porto(GECAD、ISEP、波尔图理工学院工程学院、波尔图大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments 16 pages, 3 tables, 6 figures, SynDAiTE, ECML PKDD 2025
机构 * UC Berkeley(伯克利大学) ; Stanford(斯坦福大学) ; UCL(伦敦大学学院) ; Virginia Tech(弗吉尼亚理工学院) ; Nvidia(英伟达公司)
专题命中 安全评测 :safety(abstract);分类 cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL
机构 * IEEE CBMI 2025
专题命中 安全评测 :alignment(abstract);分类 cs.AI
Comments IEEE CBMI 2025. This is the authors' accepted version. The final publication is available at https://ieeexplore.ieee.org/
机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
机构 * Institute of Science Tokyo(东京科学研究院) ; Agency for Science, Technology and Research (A*STAR)(科技研究局) ; Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
Comments 36 pages, 10 tables, 4figures
专题命中 安全评测 :alignment(abstract);分类 cs.CY
机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
Comments 9 pages. International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2023), London, United Kingdom
Journal ref In Proceedings of the 2023 International Conference on Autonomous Agents and Multiagent Systems (AAMAS 23). International Foundation for Autonomous Agents and Multiagent Systems, Richland
专题命中 安全评测 :alignment(abstract)
专题命中 安全评测 :trustworthy(abstract)
Comments 10 pages, 5 tables, 2 code listings. Specification proposal available at https://github.com/subramanya1997/oidc-a/