Mi:dm K 2.5 Pro
专题命中 AI治理与伦理 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 AI治理与伦理 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
UGID: 用于去偏大型语言模型的统一图同构
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) ; South China University of Technology(华南理工大学)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 UGID通过构建Transformer的结构化计算图,在内部表示层面减少模型偏见,通过约束注意力路由和隐藏表示,提升模型行为一致性并保持安全性和实用性。
弥合负责任AI分歧的鸿沟
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
AI总结 本文通过分析3550篇论文,探讨AI安全与AI伦理之间的分歧与重叠,提出通过解决关键问题促进负责任的AI治理。
细粒度微调在激活差异中留下明显可读的痕迹
机构 * EPFL(苏黎世联邦理工学院) ; Ecole Normale Supérieure Paris-Saclay(巴黎-萨克雷高等师范学校) ; Université Paris-Saclay(巴黎-萨克雷大学) ; Harvard University(哈佛大学) ; MATS
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 研究发现狭窄微调会在激活中留下明显痕迹,揭示了微调领域偏见,并警告了使用此类模型进行广泛微调研究的局限性。
Comments ICLR 2026
推理时的推理选择性减少大语言模型中的隐性社会偏见
机构 * Cognitive Science Program Department of Psychological & Brain Sciences Indiana University Bloomington(心理与脑科学系认知科学计划印第安纳大学布卢明顿)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY
AI总结 该研究通过推理增强减少大语言模型中的隐性社会偏见,揭示推理对公平性评估的影响。
机构 * University of Southern California(南加州大学) ; Amazon AGI(亚马逊人工智能实验室)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
机构 * Pure Storage
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
Comments Accepted at 3rd Regulatable ML Workshop at NEURIPS 2025
机构 * Fondazione Bruno Kessler(布鲁诺·科斯勒基金会)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
Comments This pre-print is also available at CrimRxiv with DOI: https://doi.org/10.21428/cb6ab371.e3354ce1
机构 * University of the Basque Country(巴斯克大学) ; Lebanese International University (LIU)(黎巴嫩国际大学) ; The International University of Beirut(贝鲁特国际大学) ; IKERBASQUE
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
机构 * BNRIST, Tsinghua University(北京理工大学、清华大学) ; Independent Researcher(独立研究者)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Carnegie Mellon University(卡内基梅隆大学) ; Squirrel Ai Learning
专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
机构 * University of Calabria(卡利博利亚大学)
专题命中 AI治理与伦理 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Journal ref Cantini, R., Orsino, A., Ruggiero, M., Talia, D. Benchmarking adversarial robustness to bias elicitation in large language models: scalable automated assessment with LLM-as-a-judge. Mach Learn 114, 249 (2025)
机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(人工智能通用基础理论国家重点实验室,智能科学与技术学院,北京大学) ; Yuanpei College, Peking University(元培学院,北京大学) ; School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) ; Key Laboratory of Machine Perception (Ministry of Education), Peking University(机器感知重点实验室(教育部),北京大学) ; PKU-Wuhan Institute for Artificial Intelligence(北京大学-武汉人工智能研究院)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
Comments ACL 2025 Main
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
Comments Topic and scope refinement
机构 * MIT Media Lab(麻省理工学院媒体实验室)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
Comments PhD thesis
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
Comments This is a chapter intended for publication in a forthcoming edited volume. It is the version of the author's manuscript prior to acceptance for publication and has not undergone editorial and/or peer review on behalf of the Publisher
机构 * Department of Electrical and Electronic Engineering(电子与电气工程系) ; The Hong Kong Polytechnic University(香港理工大学) ; School of Electronics and Information(电子与信息学院) ; Northwestern Polytechnical University(西北工业大学)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
机构 * Queen’s University Vector Institute(女王大学向量研究所) ; SigmaRed Tech.(SigmaRed科技公司) ; Ernst & Young(埃森哲) ; Monark Health(Monark健康)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG
专题命中 AI治理与伦理 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments 16 pages, 2 figures
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
Comments This article is a preprint and has not been peer-reviewed. The postprint has been accepted for publication in AI and Ethics. Please cite the final version of the article once it is published
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
Comments 14 pages
Journal ref World Journal of Advanced Engineering Technology and Sciences, 2023, 10(2), 283-296
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
Comments AI Governance Workshop at the 2024 International Joint Conference on Artificial Intelligence (IJCAI)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
Comments 16 pages, work in progress