An Empirical Evaluation of Large Language Models on Consumer Health Questions
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
Comments 15 pages,8 figures
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
Comments v2 is the AAAI'25 camera-ready version, including the appendix, which has been enhanced based on the reviewers' comments
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments Accepted at AAAI 2025
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments 17 pages, 4 figures, 1 table
Journal ref 2024 IEEE 22nd International Conference on Industrial Informatics (INDIN)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted at ICON 2024
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
Comments 16 pages, 2 figures
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted by EMNLP 2024. Please cite the conference version of this paper, e.g., "Zongjie Li, Chaozheng Wang, Pingchuan Ma, Daoyuan Wu, Shuai Wang, Cuiyun Gao, and Yang Liu. 2024. Split and Merge: Aligning Position Biases in LLM-based Evaluators. (EMNLP 2024)"
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments 9 pages, accepted by ICML 2024, final version
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments 19 pages, 5 figures and 4 supplementary figures
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Journal ref 2024 39th Conference on Design of Circuits and Integrated Systems (DCIS)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Journal ref 2024 Journal of Systems Architecture (JSA)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted by COLING 2025 conference
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments 9 pages, 10 figures, IEEE International Conference on AI in Cybersecurity (ICAIC), 2025
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted in BlackboxNLP @ EMNLP 2024
Journal ref Proceedings of the 7th BlackboxNLP Workshop: Analyzing and Interpreting Neural Networks for NLP, pages 364-388, November 2024, Miami, Florida, US. Association for Computational Linguistics
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
Comments ChineseWebTex2.0 dataset is available at https://github.com/CASIA-LM/ChineseWebText-2.0
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments Accepted to the 22nd International Conference on Artificial Intelligence in Medicine (AIME'24)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments 19 pages, 7 figures, 15 tables
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG