Runtime Monitoring of Human-centric Requirements in Machine Learning Components: A Model-driven Engineering Approach
专题命中 AI治理与伦理 :safety(abstract)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 AI治理与伦理 :safety(abstract)
专题命中 AI治理与伦理 :alignment(abstract)
专题命中 AI治理与伦理 :safety(abstract)
Comments To appear in the International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2023)
专题命中 AI治理与伦理 :trustworthy(abstract)
Comments Presented at the European Workshop on Algorithmic Fairness (EWAF'23) Winterthur, Switzerland, June 7-9, 2023
专题命中 AI治理与伦理 :safety(abstract)
专题命中 AI治理与伦理 :safety(abstract)
专题命中 AI治理与伦理 :alignment(abstract)
Comments extended version of "Measuring Commonality in Recommendation of Cultural Content: Recommender Systems to Enhance Cultural Citizenship", published at RecSys 2022
专题命中 AI治理与伦理 :alignment(abstract)
专题命中 AI治理与伦理 :safety(abstract)
Comments 5 pages, 2 figures, 2 tables
专题命中 AI治理与伦理 :trustworthy(abstract)
Comments 13 pages, 4 tables, 7 figures
专题命中 AI治理与伦理 :safety(abstract)
Comments To appear in the Proceedings of the 2022 AAAI/ACM Conference on AI, Ethics, and Society (AIES '22)
专题命中 AI治理与伦理 :alignment(abstract)
Comments CVPRW 2022 - AI for Content Creation Workshop. Code at https://github.com/runwayml/guided-inpainting
专题命中 AI治理与伦理 :safety(abstract)
Comments Submitted to ITSC 2022
专题命中 AI治理与伦理 :safety(abstract)
Comments 2021 IEEE International Conference on Big Data (IEEE BigData 2021)
专题命中 AI治理与伦理 :alignment(abstract)
专题命中 AI治理与伦理 :safety(abstract)
专题命中 AI治理与伦理 :safety(abstract)
Journal ref IEEE Control Systems Letters, 2021
专题命中 AI治理与伦理 :safety(abstract)
Comments 99 pages, 17 figures
专题命中 AI治理与伦理 :alignment(abstract)
Comments ApSS, accepted. arXiv admin note: substantial text overlap with arXiv:1912.05429
专题命中 AI治理与伦理 :alignment(abstract)
Comments To be submitted. Comments welcome
专题命中 AI治理与伦理 :safety(abstract)
专题命中 AI治理与伦理 :safety(abstract)
Journal ref Journal of Computing, Volume 1, Issue 1, pp 195-199, December 2009