Risk Sensitive Model-Based Reinforcement Learning using Uncertainty Guided Planning
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments Safe RL Workshop NeurIPS 2021
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments Safe RL Workshop NeurIPS 2021
专题命中 安全评测 :safety(abstract);分类 cs.LG
Comments arXiv admin note: text overlap with arXiv:2011.04041
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments Accepted in: Fourth Workshop on Machine Learning and the Physical Sciences (35th Conference on Neural Information Processing Systems; NeurIPS2021); final version
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments 7 pages
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments Accepted at NeurIPS 2021 Workshop on Privacy in Machine Learning (PriML)
专题命中 安全评测 :safety(abstract);分类 cs.LG
Journal ref Electronics. 2021; 10(20):2558
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
专题命中 安全评测 :safety(abstract);分类 cs.AI
Comments 8 pages, 2021 IEEE Conference on Artificial Intelligence Testing (AITest 2021)
专题命中 安全评测 :safety(abstract);分类 cs.LG
Comments 16 pages, 10 figures, 3 tables
专题命中 安全评测 :safety(abstract);分类 cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments Published in Artificial Intelligence for Engineering Design, Analysis and Manufacturing. arXiv admin note: text overlap with arXiv:2001.05014
Journal ref Artificial Intelligence for Engineering Design, Analysis and Manufacturing, 35(2), 2021, 251-264
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Journal ref International Cross-Domain Conference for Machine Learning and Knowledge Extraction 2021 Aug 17 (pp. 293-308). Springer, Cham
专题命中 安全评测 :alignment(abstract);分类 cs.CL
Comments EMNLP 2021
专题命中 安全评测 :safety(abstract);分类 cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.CY
Comments 25 pages, 8 figures
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
Comments Accepted by Phil. Trans. Royal Society (A): Math, Phys & Engg Sci., 379(219x), 2021, Oxford, UK
Journal ref Phil. Trans. Royal Society (A): Math, Phys & Engg Sci., 379(219x), 2021, Oxford, UK
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.AI
Comments 11 pages, 6 figures, 2 tables
专题命中 安全评测 :alignment(abstract);分类 cs.CL
Comments 10 pages, Accepted at CIKM 2021
专题命中 安全评测 :safety(abstract);分类 cs.LG
Comments 57 pages
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
Comments Accepted to ICML 2021 Workshop on Human in the Loop Learning (HILL)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
Comments Accepted to Interspeech2021
专题命中 安全评测 :safety(abstract);分类 cs.LG
Comments corrected typos, added references, added authors, added acknowledgements
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments 10 pages, 6 figures
专题命中 安全评测 :safety(abstract);分类 cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL
Comments Accepted to ACL 2021 Findings
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments 15 pages, 4 figures
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments International Broadcasting Convention, 11-14 Sep 2020, Amsterdam, Netherlands (Technical Paper section, Virtual)