RIRO: Reshaping Inputs, Refining Outputs Unlocking the Potential of Large Language Models in Data-Scarce Contexts
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :alignment(abstract);分类 cs.CL
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
专题命中 安全评测 :alignment(abstract);分类 cs.LG
Comments This paper supercedes our previous VAS paper (arXiv:2402.02055). It's accepted by NeurIPS2024 as spotlight paper. DataComp benchmark: https://www.datacomp.ai/dcclip/leaderboard.html
专题命中 安全评测 :alignment(abstract);分类 cs.AI
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
Comments ICLR 2024 camera version (9 pages, 5 figures, 11 tables)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
专题命中 安全评测 :alignment(abstract);分类 cs.CL
Comments accepted in the First Workshop on Language Models for Low-Resource Languages (LoResLM) co-located with the 31st International Conference on Computational Linguistics (COLING 2025)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
Comments This paper has been accepted by TACL; A pre-MIT Press publication version; Longyue Wang is the Corresponding Author
专题命中 安全评测 :alignment(abstract);分类 cs.LG
Comments Published at Interpretable AI: Past, Present and Future Workshop at NeurIPS 2024
专题命中 安全评测 :safety(abstract);分类 cs.LG
Comments Paper was accepted by ICMLA 2021 (20th IEEE International Conference on Machine Learning and Applications). Code available under https://github.com/RL-INA/LemgoRL
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
Comments 8 pages
专题命中 安全评测 :alignment(abstract);分类 cs.CL
专题命中 安全评测 :alignment(abstract);分类 cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.AI
Comments Published as a WWW'24 full paper
专题命中 安全评测 :alignment(abstract);分类 cs.LG
Comments 38 pages, 14 figures. ICML 2022 Long Talk
专题命中 安全评测 :safety(abstract);分类 cs.CL
Comments EMNLP 2024
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
Comments Proceedings of the 2023 AAAI Fall Symposium on Integrating Cognitive Architectures and Generative Models
Journal ref Proceedings of the 2023 AAAI Fall Symposia, vol.2, no. 1, 2023
专题命中 安全评测 :safety(abstract);分类 cs.AI
专题命中 安全评测 :harmlessness(abstract);分类 cs.CL
Comments EMNLP 2024 (Main Conference)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments 8 pages, 3 figures
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
Comments N2Women'24 Workshop, MobiSys 2024, Tokyo, Japan
专题命中 安全评测 :safety(abstract);分类 cs.AI
Comments 16 pages, 9 figures
专题命中 安全评测 :safety(abstract);分类 cs.CL
Comments working paper
专题命中 安全评测 :safety(abstract);分类 cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.AI
Comments Under review; 12 pages, 8 figures
专题命中 安全评测 :safety(abstract);分类 cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.AI
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments 16 pages, 11 figures
专题命中 安全评测 :alignment(abstract);分类 cs.AI