Generating Counterfactual Trajectories with Latent Diffusion Models for Concept Discovery
专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments Published at International Conference on Pattern Recognition (ICPR) 2024
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments Published at International Conference on Pattern Recognition (ICPR) 2024
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments 7 pages, 5 figures, 2 tables, 3 code blocks
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments Project webpage at https://syzygy-project.github.io/. Preliminary version accepted at LLM4Code 2025, 34 pages
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
Comments technical report, 55 pages
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
Comments 11 pages, submit to ACL
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Journal ref Proceedings of the 41st International Conference on Machine Learning, PMLR 235:9872-9903, 2024
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments Accepted by AAAI 2025
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
Comments Published as a long paper at the 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP). Official version of paper within conference proceedings is available at http://aclanthology.org/2024.emnlp-main.332
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments Accepted version Energy and AI: https://doi.org/10.1016/j.egyai.2024.100448
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
Comments NeurIPS 2024; Code is released at https://github.com/Scarelette/CulturePark. arXiv admin note: substantial text overlap with arXiv:2402.10946
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments Project website: https://relational-reasoning-nav.github.io/; 20 pages, 9 figures, 6 tables
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments Accept at NeurIPS 2024 Dataset and Benchmark Track
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
Comments 4 pages, 2 tables
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG
Comments Published in NeurIPs 2024
专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG
Comments Findings of EMNLP 2024
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
Comments 20 pages, 9 figures
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
Comments 22 pages, 7 figures, 34 references
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY
Comments 17 pages, 6 Figures, 13 Tables, EMNLP'24 Mains
专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments 57 pages, 8 figures, 5 tables
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG