AURA: Amplifying Understanding, Resilience, and Awareness for Responsible AI Content Work
专题命中 AI治理与伦理 :safety(abstract);red teaming(abstract);分类 cs.CY
Comments To be presented at CSCW 2025
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 AI治理与伦理 :safety(abstract);red teaming(abstract);分类 cs.CY
Comments To be presented at CSCW 2025
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Comments 32 pages
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Comments ACM Conference on Fairness, Accountability, and Transparency (FAccT '24). Association for Computing Machinery, New York, NY, USA, 776-796
Journal ref In Proceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency (FAccT '24). Association for Computing Machinery, New York, NY, USA, 776-796
专题命中 AI治理与伦理 :safety(abstract);harmlessness(abstract);分类 cs.AI
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI
Comments Independent study, Exploring LLMs, Deploying LLMs and their Risks
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.LG
Comments Accepted to ICML'24 as a position paper
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.LG
Comments 21 pages, 15 figures
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL
Comments 9 pages, long paper at EMNLP 2023 proceedings
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI
Comments 54 pages, 1 figure, to be submitted
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Comments 19 pages, 2 figures, fixed rendering issues
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments ICML 2023 Oral (camera-ready); 31 pages, 5 figures
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CY
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Journal ref 2023 ACM Conference on Fairness, Accountability, and Transparency
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Comments 3 pages
Journal ref CHI 2023 Workshop on Designing Technology and Policy Simultaneously
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 49 pages; 2 Figures; 1 Table; -- Under Review
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 15 pages, 3 figures, 8 tables
Journal ref Empirical Methods in Natural Language Processing 2021
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
Comments Original version appeared in Proceedings of the 2020 AAAI ACM Conference on AI, Ethics, and Society (AIES '20), February 7-8, 2020, New York, NY, USA. 5 pages, 2 figures. Corrected some typos in this version
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI
Journal ref In proceedings of Ethics for Artificial Intelligence Workshop (AI-Ethics-2016). Pages 1-7. New York, NY. July 9 -- 15, 2016
专题命中 AI治理与伦理 :alignment(abstract,comments);分类 cs.CL、cs.AI、cs.CY
Comments Code, data, and models can be downloaded via https://github.com/agi-templar/Stable-Alignment
大语言模型中的内在自我修正:通过机制可解释性实现可解释的提示
机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(通讯工程研究院,国立台湾大学) ; MediaTek Research, Taipei, Taiwan(联发科研究,台北,台湾) ; Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电气工程系,国立台湾大学) ; Department of Electrical Engineering, National Tsing Hua University, Hsinchu, Taiwan(电气工程系,国立清华大学) ; AI Research Center (AINTU), National Taiwan University, Taipei, Taiwan(人工智能研究中心(AINTU),国立台湾大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过机制可解释性揭示大语言模型中内在自我修正的机制,证明提示引导隐藏表示偏移是其核心驱动因素。
AI公平性语境下的变量选择
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 本文针对AI公平性语境下的变量选择问题,提出将数学方法与伦理、社会意识融合的跨学科方案,主张保留所有潜在相关变量以减少隐含偏差,助力AI系统符合欧盟AI法案要求。
从孤立算法到合规优先的智能体平台:面向医院AI系统的多层架构
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对医院AI部署孤立、规模化难的问题,提出含智能体编排、合规策略、隐私保护数据层的多层架构,通过原型验证可减少任务耗时与文档工作量,为医院AI平台建设提供实用蓝图。
Comments Peer-reviewed published article
Journal ref IJISRT, 11-2026(5), IJISRT26MAY1651
FairFund-Bench:评估大语言模型资源分配中的分配偏差
机构 * University of Toronto(多伦多大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 FairFund-Bench基准通过调整审计格式等特征,发现LLM资源分配的偏差受审计类型影响,且因果框架效应强于人口统计效应,可用于评估LLM的分配偏差。
Comments 19 pages, 7 figures. Code and data: https://github.com/martinlukk/fairfund-bench
绝不向漏洞妥协:人工智能治理综合调查
专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract)
AI总结 针对人工智能发展带来的技术漏洞及社会风险,提出整合技术与社会维度的框架,围绕三个支柱构建,通过系统回顾识别核心挑战,给出综合研究议程,为开发可靠且符合伦理的人工智能系统提供指导。
Comments 26 pages, 3 figures, accepted by SCIS2026