MMDT: Decoding the Trustworthiness and Safety of Multimodal Foundation Models
专题命中 安全评测 :safety(title,abstract);red teaming(abstract);分类 cs.CL、cs.AI
Comments ICLR 2025
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :safety(title,abstract);red teaming(abstract);分类 cs.CL、cs.AI
Comments ICLR 2025
专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI
Comments Accepted for publication in IEEE Access, DOI: 10.1109/ACCESS.2025.3539933
Journal ref IEEE Access 2025
专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI
Comments NeurIPS 2024
专题命中 安全评测 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI
Comments EMNLP Findings 2024
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.LG
Comments 7 pages, 2 figures
Journal ref IEEE Internet of Things Magazine, Year: 2024, Volume: 7, Issue: 5
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.LG
Comments Please refer to arXiv:2309.12325 for the latest FUTURE-AI framework for healthcare
专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :safety(title,abstract);red teaming(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI
Comments 15 pages, 1 figure, published at ACM FAccT 2024
专题命中 安全评测 :trustworthy(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
Comments NAACL 2024
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY
Comments 24 pages, 11 figures
Journal ref ACM Computing Surveys (2023)
专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments Submitted to CSUR
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.LG
脚手架下的安全性:评估条件如何影响测量的安全性
机构 * Harvard University(哈佛大学) ; MIT(麻省理工学院)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本研究通过62,808次盲法预注册评估,测试了六种前沿模型在四种部署配置下的安全性,发现脚手架架构对安全性影响较小,而格式转换(如选择题与开放式问题)可导致5-20个百分点的测量差异,且模型-脚手架间存在显著异质性,质疑了单一综合安全性分数的实用性。
Comments 74 pages including appendices. 6 frontier models, 62,808 primary observations (~89k total). Pre-registered: OSF DOI 10.17605/OSF.IO/CJW92. Code and data: https://github.com/davidgringras/safety-under-scaffolding
ThaiSafetyBench: 评估泰语文化背景下语言模型的安全性
机构 * SCB DataX(SCB数据X) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; SCBX R&D(SCBX研发部) ; SCB 10X
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL;trustworthy(comments)
AI总结 本研究提出ThaiSafetyBench,通过泰语文化背景下的恶意提示评估语言模型安全性,发现闭源模型安全性更强,同时揭示了文化特定攻击的高风险。
Comments ICLR 2026 Workshop on Principled Design for Trustworthy AI
从隐私到信任在代理时代:通过信任报告2.0的视角,对可信联邦学习中挑战的分类
机构 * Department of Computer Science and Artificial Intelligence, Andalusian Research Institute in Data Science and Computational Intelligence (DaSCI) University of Granada(计算机科学与人工智能系,数据科学与计算智能安达卢西亚研究 institute,格拉纳达大学) ; Department of Software Engineering, Andalusian Research Institute in Data Science and Computational Intelligence (DaSCI) University of Granada(软件工程系,数据科学与计算智能安达卢西亚研究 institute,格拉纳达大学)
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI
AI总结 本文通过信任报告2.0提出可信联邦学习的挑战分类,强调信任作为持续维持的操作条件,并引入协调蓝图以处理跨要求的权衡和治理对齐。
Comments Already published in Information Fusion
Journal ref Rodríguez-Barroso, et. al. (2026). From Privacy to Trust in the Agentic Era: A Taxonomy of Challenges in Trustworthy Federated Learning Through the Lens of Trust Report 2.0. Information Fusion, 104236
AEMA:可验证评估框架用于可信和受控的代理LLM系统
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Center for Advanced AI, Accenture(Accenture高级人工智能中心) ; University of California, Irvine(加州大学伊拉斯姆斯分校)
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract,comments);分类 cs.AI
AI总结 AEMA提出了一种可验证的评估框架,用于评估基于LLM的多代理系统,通过人类监督实现稳定、可追溯的自动化评估。
Comments Workshop on W51: How Can We Trust and Control Agentic AI? Toward Alignment, Robustness, and Verifiability in Autonomous LLM Agents at AAAI 2026
专题命中 安全评测 :jailbreak(title,abstract);safety(abstract,comments);分类 cs.CL
Comments Homepage: https://sproutnan.github.io/AI-Safety_Benchmark/
EG-ARSA:适用于低资源场景的基于专家知识的开放视觉道路安全审计模型
机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学(BUET))
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 针对中低收入国家道路安全审计的资源限制,提出EGD框架,构建BD-ARSA数据集和EG-ARSA模型,实验显示其性能优于310亿参数教师模型及Gemini-2.5-Flash,为低资源场景道路安全审计提供有效方案。
Omni-SafetyBench:视听大语言模型安全评估基准
机构 * Tsinghua University(清华大学) ; Tongyi Lab(通义实验室) ; Peking University(北京大学) ; OpenRL Lab(OpenRL实验室)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL
AI总结 研究针对现有OLLM安全基准的不足,构建Omni-SafetyBench基准,提出定制化评估指标,发现多数OLLM存在安全漏洞,为该领域研究提供重要支撑。
Comments ACM MM 2026 (Oral)