MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models
专题命中 安全评测 :RLHF(abstract);分类 cs.CL、cs.AI
Comments Published to AAAI-25 Bridge Program
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :RLHF(abstract);分类 cs.CL、cs.AI
Comments Published to AAAI-25 Bridge Program
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
Comments Accepted to NAACL 2025 findings
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY
Journal ref Michigan Journal of International Law 2024
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments 22 pages, 5 figures
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
Comments Findings of the Association for Computational Linguistics: NAACL 2025
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments Preprint, Accepted to the International Conference on Machine Learning Technologies (ICMLT 2025), Helsinki, Finland
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Journal ref In International Conference on Neural-Symbolic Learning and Reasoning (pp. 312-330). Cham: Springer Nature Switzerland (2024)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Journal ref Statistics 0 (2025), 1-26
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments First two authors contributed equally to this work
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments Preprint
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments 10 pages, 12 figures, 3 tables, 3 algorithms, 2024 IEEE 6th International Conference on Trust, Privacy and Security in Intelligent Systems, and Applications (TPS-ISA), Washington, DC, USA
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments Accepted by IEEE Wireless Communications
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
Comments 35 pages, 9 figures, 16 tables
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Journal ref Discovery Science 2024, Springer Nature