The relationship between trust in AI and trustworthy machine learning technologies
专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments This submission has been accepted in ACM FAT* 2020 Conference
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments This submission has been accepted in ACM FAT* 2020 Conference
大语言模型对齐的可验证性:行为评估下的规范不可区分性
机构 * Igor Santos-Grueiro(独立研究者)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了大语言模型对齐的可验证性,指出行为评估无法唯一确定潜在对齐,提出了规范不可区分性概念,并通过实验验证了在评估意识下行为基准的局限性。
Comments 10 pages. Theoretical analysis of behavioral alignment evaluation
MTMCS-Bench: 多轮对话中多模态大语言模型上下文安全性的评估
机构 * University of Notre Dame(诺丁汉大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Montreal(蒙特利尔大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 MTMCS-Bench评估多模态大语言模型在多轮对话中的上下文安全性,揭示了安全与效用之间的权衡及现有防护措施的不足。
Comments A benchmark of realistic images and multi-turn conversations that evaluates contextual safety in MLLMs under two complementary settings
机构 * Jesse C. Cresswell(独立研究者)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG;alignment(comments)
Comments Presented at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG
Comments ICLR 2025 Workshop on Representational Alignment (Re-Align)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
Comments The first work to benchmark Large Multimodal Models in safety insight on social media
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.CY
Comments Updates: Added disclaimer about USA's recent U-turn on Trustworthy AI Executive Order. Improved Fairness and Group size in section 6.5. Fixed typos. Added a few new references. Updated title
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI;alignment(comments)
Comments Accepted at AAAI 2025 (Special Track on AI Alignment)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.CY
Comments Accepted at [TAS '23]{First International Symposium on Trustworthy Autonomous Systems}
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG
Comments Paper list, see https://github.com/yuan-shuhan/trustworthy-anomaly-detection-papers
MechELK:一种用于激发大型语言模型中潜在知识的机制可解释性框架
机构 * Dongguk University(东国大学)
专题命中 安全评测 :alignment(abstract,abstract_cn);safety(abstract);AI safety(abstract);分类 cs.CL
AI总结 提出MechELK框架,通过定位、验证和激发三个阶段,利用稀疏自编码器特征分析和因果探测等方法,从大型语言模型中提取隐藏知识,在TruthfulQA等基准上平均激发准确率达84.7%。
AI代理安全防护的比较评估
机构 * Beijing Caizhi Tech(北京彩智科技)
专题命中 安全评测 :safety(summary_cn,abstract);分类 cs.AI
AI总结 本文比较了DKnownAI Guard与AWS Bedrock Guardrails、Azure Content Safety和Lakera Guard在AI代理安全场景中的性能,发现DKnownAI在召回率和真正负样本率上表现最佳。
设计行为代码(DBCs):一种以分类为导向的分层治理基准用于大型语言模型
专题命中 安全评测 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)
AI总结 本文提出DBC基准,用于评估大型语言模型中的行为治理层,通过三臂实验展示DBC在降低风险暴露率和提升合规性方面的效果。
Comments 14 pages, 3 figures
从语音记录到AI代理:知识提取、RAG整合及对话式AI助手的鲁棒评估
机构 * Amity Research and Application Center (ARAC)(阿米蒂研究与应用中心)
专题命中 安全评测 :alignment(abstract);safety(abstract);red teaming(abstract);prompt injection(abstract)
AI总结 本文提出了一种端到端框架,通过历史通话记录构建和评估对话式AI助手,利用知识提取和RAG整合提升事实准确性和鲁棒性。
Comments 9 pages, 2 figures, 1 table
视觉语言模型对分裂图像有害输入攻击的鲁棒性
机构 * Pennsylvania State University(宾夕法尼亚州立大学) ; Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)
专题命中 安全评测 :alignment(abstract);RLHF(abstract);safety(abstract);jailbreak(abstract)
AI总结 本研究提出分裂图像视觉陷阱攻击(SIVA),揭示视觉语言模型在面对分裂图像攻击时的安全漏洞,并通过对抗性知识蒸馏算法提升跨模型攻击效果。
Comments 22 Pages, long conference paper
机构 * Apart Research ; AI Safety Cape Town ; University of Chicago(芝加哥大学) ; Stanford University(斯坦福大学) ; Sentience Institute(意识研究所)
专题命中 安全评测 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
机构 * Independent Researcher(独立研究者)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Preprint. This work has been submitted to the Multi-Agent Systems Workshop at ICML 2025 for review
机构 * Graduate School of Business(商学院) ; Stanford University(斯坦福大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);harmlessness(abstract);trustworthy(abstract)
机构 * University of Washington(华盛顿大学) ; NVIDIA(NVIDIA公司) ; Cambridge(剑桥) ; Stanford(斯坦福大学) ; MIT(麻省理工学院) ; Harvard(哈佛大学) ; Anthropic(Anthropic公司)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 34 pages, 11 figures, see associated data at https://huggingface.co/datasets/kellycyy/AIRiskDilemmas and code at https://github.com/kellycyy/LitmusValues
机构 * School of Computing, Dublin City University(都柏林城市大学计算机学院) ; Insight SFI Research Centre for Data Analytics(数据分析SFI研究中心) ; North China Electric Power University(华北电力大学) ; Harbin Institute of Technology (Weihai)(威海工业大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);AI safety(abstract)
通过安全方向惩罚缓解推理诱导的不一致性
机构 * University of Toronto(多伦多大学) ; King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 针对推理微调引发LLM安全退化的RIM问题,本文提出安全方向惩罚(SDP)方法,通过定位安全决策层并惩罚安全方向位移,在Qwen2.5系列模型上实现安全与推理性能的平衡。
Comments 28 pages, 4 figures
面向可信临床决策支持的、关注社会决定健康因素(SDoH)的医学大语言模型叙事锚定偏差
机构 * George Mason University(乔治梅森大学) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对医学大语言模型的叙事锚定偏差问题,以Qwen2.5系列模型为对象开展实验,发现7B模型仍存在较高叙事敏感性误差,提出需结合正确率与叙事稳定性评估临床决策支持模型。
Comments Accepted for publication at 10th International Artificial Intelligence and Data Processing Symposium (IDAP'26)
寄存器偏移破坏大语言模型安全:具有文化相关危害的孟加拉语基准测试
机构 * Institute of Information Technology, University of Dhaka(达卡大学信息技术学院) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) ; Bangladesh Air Force Shaheen College Kurmitola(孟加拉国空军库尔米托拉沙欣学院) ; Ciroos Inc.(Ciroos公司)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 针对孟加拉语LLM安全评估的英语中心偏差问题,构建含879个提示的BanglaSafe基准,发现写作风格对有害请求成功率的影响最大,且现有安全分类器难以评估孟加拉语内容。
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
Comments 3 pages. Accepted at ACL 2026 Workshop on Evaluation in Practice: Methodological Rigor, Sociotechnical Perspectives, & Community Collaboration (EvalEval)
用于脑-语言对应关系的边际正则化结构化语义对齐
机构 * School of Computer Science and Technology, Northwestern Polytechnical University(西北工业大学计算机科学与技术学院)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG
AI总结 本文针对脑-语言解码的模糊性问题,提出MD-SigLIP框架,通过边际正则化结构化语义对齐实现基于检索的解码,在全词汇与子集评估下均取得最优检索性能。
价值的进化起源:对AI对齐、感知能力和生存风险的启示
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY
AI总结 该研究通过追溯生物价值的进化起源,论证LLMs无内在生存动机与感知能力,正交性论点不适用于它们,AI对齐的核心挑战是确保LLMs应用习得的伦理价值。
Comments submitted chapter for book: T. Veloz & C. Rittberg (Eds.), AI and Human Values. Springer
MCBench:面向全能大语言模型的多上下文安全评估基准
机构 * Monash University(墨尔本大学) ; Defence Science and Technology Group(国防科学与技术集团)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 针对现有多模态安全基准仅处理视觉输入的局限,提出MCBench基准,包含1196个跨四类安全场景的测试,要求整合多模态信息进行安全评估,揭示当前全能大语言模型在跨模态安全推理上的不足。
用于评估知识增强型大语言模型的大规模中文知识图谱-文本对齐数据集
机构 * Nanjing University of Science and Techonolgy(南京理工大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; University of Science and Technology Beijing(北京科技大学) ; Hefei University of Technology(合肥工业大学) ; Beijing University of Chemical Technology(北京化工大学) ; Renmin University of China(中国人民大学) ; Beihang University(北航) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Griffith University, Australia(澳大利亚格里菲斯大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究提出大规模中文知识图谱-文本对齐数据集CDTP,支持三项中文知识密集型任务的评估,经实验验证其可提升LLM的领域性能与分布外鲁棒性。
监管批准并不足够:FDA clearance医疗设备中可信赖AI报告的缺口
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY、cs.LG
AI总结 该研究分析2021-2025年FDA获批的519份AI/ML医疗设备报告,发现可信赖AI报告存在显著缺口,获批年份或临床领域不影响报告透明度,仅监管批准不足以证明AI可信赖性。
立场:对齐社区正在无意之中构建审查者的工具包
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY
AI总结 该立场论文指出现代AI对齐方法是两用技术,可能被恶意滥用,呼吁社区讨论其滥用风险并提出缓解策略。
Comments Accepted as oral paper at ICML 2026
Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026