Civil Society in the Loop: Feedback-Driven Adaptation of (L)LM-Assisted Classification in an Open-Source Telegram Monitoring Tool
机构 * HTW Berlin(柏林应用技术大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * HTW Berlin(柏林应用技术大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
机构 * Northeastern University(东北大学) ; Harvard University(哈佛大学) ; Cornell University(康奈尔大学) ; Tulane University(路易斯安那州立大学) ; University of Washington(华盛顿大学) ; Futurewei Technologies(未来科技) ; AIBAO LLC
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :alignment(abstract);safety(abstract)
机构 * Purple Mountain Laboratories(紫金山实验室) ; Fudan University(复旦大学)
专题命中 安全训练 :safety(abstract);jailbreak(abstract)
机构 * Rice University(里士大学) ; Apple, Inc.(苹果公司)
专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of California, Davis(加州大学戴维斯分校) ; University of Southern California(南加州大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2025
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments This manuscript builds upon an earlier version posted to TechRxiv. This arXiv version includes an updated comparison with GRPO (Group Relative Policy Optimization)
机构 * Microsoft Research India(微软印度研究院)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.CY、cs.LG
Comments AAAI 2025--camera ready + extended abstract
机构 * College of Design and Engineering, National University of Singapore(新加坡国立大学设计与工程学院) ; Department of Mathematics, National University of Singapore(新加坡国立大学数学系) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 19 pages, 9 figures, 11 tables, under review. Code is available at: https://github.com/songmzhang/DSKDv2. arXiv admin note: text overlap with arXiv:2406.17328
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to EMSE
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 20 pages
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 62 pages, 7 figures in main text, 36 figures in appendix
专题命中 安全训练 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments This paper has been accepted for publication in the proceedings of the 2024 Eighth IEEE International Conference on Robotic Computing (IRC)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2024 Poster
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 40 pages. Findings of EMNLP 2024
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
Journal ref CHIL 2024
专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Journal ref Published in AIES 2024
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published as a main conference paper at ACL 2024
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ICLR 2024. First two authors contributed equally
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Presented at NeurIPS 2023 workshops: Tackling Climate Change with Machine Learning & Computational Sustainability
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY、cs.LG