Beyond Accuracy: Evaluating Self-Consistency of Code Large Language Models with IdentityChain
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG
Comments ICLR 2024
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG
Comments ICLR 2024
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments 10 pages, 4 figures, 4 tables
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments Accepted and presented in 26th International Conference on Computer and Information Technology (ICCIT 2023)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments 9 pages main text, 26 pages total
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments Working in progress and will open-source soon
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
Comments 28 pages, 3 figures, 16 tables
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments 5 figures 5 tables
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments The paper is accepted In 1st ACM SIGSPATIAL International Workshop on Advances in Urban-AI (UrbanAI 23), November 13, 2023, Hamburg, Germany
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments EACL 2024 camera-ready
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Journal ref Mechanical Systems and Signal Processing, Volume 200, 1 October 2023, 110581
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments The paper submitted to IDETC/CIE2023, the International Design Engineering Technical Conferences & Computers and Information in Engineering Conference, has been accepted
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments Demo and implementation at https://auffusion.github.io
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments ATTRIB Workshop at NeurIPS 2023
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments NeurIPS 2023 Workshop on Adaptive Experimental Design and Active Learning in the Real World (RealML)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments PhD dissertation
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
Comments 30 pages, 7 figures
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY
Comments Accepted to Workshop on Socially Responsible Language Modelling Research (SoLaR) at the 2023 Conference on Neural Information Processing Systems (NeurIPS 2023)