A Hybrid Defense Strategy for Boosting Adversarial Robustness in Vision-Language Models
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments 24 pages, 4 figures. arXiv admin note: substantial text overlap with arXiv:2306.14786
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments 19 pages, 6 figures, 12 tables
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments 15 pages, 2 figures, 1 table
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
Journal ref 2022 Proceedings of the 30th ACM International Conference on Multimedia (ACMMM)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG
Comments EMNLP 2024 Findings
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments NeurIPS 2024
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
Comments Haresh Karnan's PhD Dissertation A recording of the defense talk can be accessed here: https://youtu.be/MssiO6g0Gb8
Journal ref The University of Texas at Austin, May 2024
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
Comments NeurIPS'24
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments 12 pages, 3 figures, Accepted to JCDL 2024 Research Track
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments 11 pages, 2 figures
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments PhD thesis
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
Comments 8 pages, 7 figures, 3 tables. IEEE CASE 2024
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments European Conference on Computer Vision ECCV 2024 BEW Workshop Best Paper
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments Published in The Journal of Data centric Machine Learning Research (DMLR), Vol 1, (17):1-58 (2024)
Journal ref Journal of Data-centric Machine Learning Research (DMLR), Vol 1, (17):1-58, (2024)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments 21 pages, 13 figures, 5 listings, 1 table
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
Comments 17 pages, 5 figures, 3 tables
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG
Comments Oral presentation at KDD 2024 GenAI Evaluation workshop