Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments 14 pages, 3 figures
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments 18 pages, 9 figures
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG
Comments 12 pages
Journal ref Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining, 2024
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments Survey of Federated Foundation Models (FedFM)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
Comments Supplementary material PDF attached. Submitted to Artificial Intelligence for the Earth Systems (American Meteorological Society) on 18 April 2024
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
Comments Presented at KI 2024 - 47th German Conference on AI, 2nd Workshop on Public Interest AI, 23 September, 2024, Wuerzburg, DE
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
Comments 24 pages
专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG
Comments AIES 2024
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
Comments Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (ACL 2024)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY
Comments This work was presented at the 9th International Symposium on Language & Knowledge Engineering (LKE 2024) Dublin, Ireland, 4 - 6 June, 2024
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments 15 pages
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :RLHF(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments 12 pages and 50 pages of supplementary material, 7 figures
专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG
Comments 20 pages, 6 figures
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments 18 pages and 17 figures
Journal ref Algorithms 2024, 17(7), 314
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments ECCV 2024. Project: https://weihaox.github.io/UMBRAE
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
Comments 18 pages, 12 tables, 1 algorithm pseudocode, 7 figures
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
Comments 36 pages, 10 figures. Github https://github.com/NJU-LHRS/LHRS-Bot
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY
Comments Pre-print
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments 9 pages, ICML 2024 Workshop on Mechanistic Interpretability