Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
Comments Technical Paper
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.CY
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Journal ref Int. J. Med. Inform.185 (2024)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments Submitted to Information Science Journal
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments Transactions on Machine Learning Research (TMLR), 2024
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CY、cs.LG
Comments 14 pages, 2 figures, submitted to ACM Conference on Fairness, Accountability, and Transparency 2024 (ACM FAccT '24)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
Comments AI deception, Large Language Models, ChatGPT
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.LG
Comments ICLR 2024 Camera Ready
专题命中 安全评测 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.LG
Comments 18 pages, 12 figures
专题命中 安全评测 :alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
Comments ICCV AROW 2023
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments 12 pages, 10 figures
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments Published on PLDI 2019
不想让你的大语言模型(LLM)推荐核打击?试试用日语提问
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI;trustworthy(journal_ref)
AI总结 该研究发现,用日语提问可降低部分LLM在核打击场景中的发动率,其机制为模型的推理语言而非输入语言,且仅适用于在英语中已存在犹豫的模型,表明LLM安全行为具语言依赖性。
Journal ref Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026), Jul 2026, San Diego, United States. pp.489-502
沉默的偏见:LLMs所学习到的拒绝的黑暗面
专题命中 安全评测 :alignment(abstract,comments);safety(abstract);分类 cs.CL
AI总结 本文提出Silenced Bias Benchmark,通过激活引导减少问答中的拒绝,揭示模型潜在的公平性问题,挑战传统公平评估方法。
Comments Accepted to The 40th Annual AAAI Conference on Artificial Intelligence - AI Alignment Track (Oral)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.LG;red teaming(comments)
Comments This paper was accepted in NeurIPS 2024 workshop on Red Teaming GenAI: What can we learn with Adversaries?
专题命中 安全评测 :trustworthy(abstract,comments);safety(abstract);分类 cs.LG
Comments Under Review ACM Computing Surveys "Special Issue on Trustworthy AI"
EXPL-FR:基于视觉-语言对齐的人脸识别模型解释方法
机构 * Fraunhofer IGD(弗劳恩霍夫应用研究促进协会图形数据处理研究所) ; TU Darmstadt(达姆施塔特工业大学)
专题命中 安全评测 :alignment(title)
AI总结 EXPL-FR是一种基于视觉-语言对齐的人脸识别模型解释方法,通过轻量适配器在FR嵌入空间内生成语义特征,支持多粒度解释,可实现无标签的属性级审计与模型性能排名。
Comments Accepted at the ECCV 2026 Workshops
人类与人工智能——促进可信且可理解的协作
专题命中 安全评测 :trustworthy(title)
AI总结 该研究围绕人类与AI的可信可理解协作,通过在线调查分析12个可解释性与可控性相关方面,发现二者受普遍重视但意见分散,受个人视角等多因素影响。
Comments Comments: 19 pages, dual-language (English and German)
面向基于大语言模型的软件的可信验收测试的需求增强生成技术
专题命中 安全评测 :trustworthy(title)
AI总结 该研究针对基于大语言模型的软件的验收测试缺口,提出需求增强生成技术与置信度校准级联判定方法,经工业案例验证可提升预言机质量、准确率与成本效率,具备工业可行性。
Comments Accepted at ASE2026
自信但不可靠:对基于脑MRI的视觉语言模型的行为安全审计
机构 * Georgia State University(佐治亚州立大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Emory University(埃默里大学) ; TReNDS Center(TReNDS中心)
专题命中 安全评测 :safety(title)
AI总结 本研究对6个指令微调VLMs开展脑MRI行为安全审计,发现其置信度校准差、存在大量高置信度错误,提出医学图像VLM评估需报告置信度可靠性等指标。
PERA:一种感知-推理-行动接口,用于6G的传感、认知推理和可信智能体响应
专题命中 安全评测 :trustworthy(title)
AI总结 研究针对下一代网络实现中传统机器学习和大语言模型的局限,提出基于感知-推理-行动(PERA)范式的生成网络智能,用多任务架构取代边缘模型,降低复杂性与能耗,通过案例研究验证其在链路状态分类和波束预测上的有效性。
Comments 9 pages, 5 figures, 1 table, magazine paper, submitted to IEEE for possible publication