SafeChat: A Framework for Building Trustworthy Collaborative Assistants and a Case Study of its Usefulness
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.LG
专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.CY
Comments 21 pages, 6 figures, 1 table
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL
Comments NeurIPS 2024 Workshop on Safe Generative Artificial Intelligence (SafeGenAI)
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI
Comments 24 pages, 3 figures and 10 Code blocks, to be presented in the conference
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY
Comments NeurIPS 2024 Track on Datasets and Benchmarks (Spotlight)
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.LG
Comments This work has been submitted to the IEEE Internet of Things Journal for possible publication
专题命中 安全评测 :prompt injection(title,abstract);safety(abstract);分类 cs.LG
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY
Comments Code and models are available at https://github.com/GraySwanAI/circuit-breakers
专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.AI
专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.AI
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI
专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL
Comments 20 pages, 8 tables, 16 figures
专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.AI
Comments Withdraw because the content of the paper has been largely revised. The newest version is very different than the submitted one
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI
Comments 16 pages, 7 figures, 6 tables
Journal ref CAAI Transactions on Intelligence Technology 24686557 (ISSN) 24682322 (eISSN) 2023
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL
Comments Working in Process
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CY
Journal ref Frontiers in Computer Science. 2023;5
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CY
Comments 10 pages, 2 tables
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI
Comments Accepted in the ACM Web Conference (WWW 2022)
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.LG
Comments Neu
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI
Comments 55 pages
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI
Comments 15 pages, 4 figures
专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.LG
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Project webpage: https://agent-force.github.io/unified-alignment-for-agents.html
探索大型语言模型的二次风险
机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) ; Beijing Zhongguancun Academy(北京中关村学院) ; Department of Computer Science and Technology, THBI Lab, Tsinghua University(计算机科学与技术系,清华大学THBI实验室) ; CFAR, A*STAR, Singapore(新加坡A*STAR CFAR)
专题命中 安全评测 :jailbreak(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出二次风险作为新型失败模式,通过SecLens框架系统评估,揭示了大型语言模型在良性交互中存在广泛且转移性强的有害行为,强调需加强安全机制。
Comments 18 pages, 5 figures
SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试
专题命中 安全评测 :safety(title,abstract);alignment(abstract)
AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。
NeST:面向基于大语言模型的时间序列预测的邻域感知语义对齐与时间调制
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 NeST框架通过邻域感知语义对齐与时间调制构建文本整合提示词微调LLM,在8个基准及9个真实光伏数据集的时间序列预测中,MSE、R²等指标优于现有方法,泛化性强。