Practices for Engineering Trustworthy Machine Learning Applications
专题命中 安全评测 :trustworthy(title,abstract)
Comments Published at WAIN'21 - 1st Workshop on AI Engineering - Software Engineering for AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :trustworthy(title,abstract)
Comments Published at WAIN'21 - 1st Workshop on AI Engineering - Software Engineering for AI
专题命中 安全评测 :safety(title);分类 cs.AI、cs.CY、cs.LG
专题命中 安全评测 :trustworthy(title,abstract)
Comments New Ideas and Emerging Results (NIER) track; The 35th IEEE/ACM International Conference on Automated Software Engineering; Melbourne, Australia
Journal ref ASE 2020: The 35th IEEE/ACM International Conference on Automated Software Engineering, Melbourne, Australia, Mon 21 - Fri 25 September 2020
专题命中 安全评测 :safety(title,abstract)
专题命中 安全评测 :safety(title,abstract)
Comments Accepted at IEEE Intelligent Vehicles Symposium (IV), 2020
专题命中 安全评测 :trustworthy(title,abstract)
Comments Machine Learning for Health (ML4H) at NeurIPS 2019 - Extended Abstract
专题命中 安全评测 :safety(title,abstract)
专题命中 安全评测 :trustworthy(title,abstract)
机构 * Tsinghua University(清华大学)
专题命中 安全评测 :trustworthy(title,comments);分类 cs.AI、cs.LG
Comments Survey paper for tutorial "Data Heterogeneity Modeling for Trustworthy Machine Learning" in KDD'25
单独对齐,共同错位:预测大语言模型智能体群体中的对抗捕获
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL
AI总结 该研究针对LLM智能体群体,提出从群体无攻击时的良性运行状态校准响应函数,可提前预测坚定少数群体引发的对抗捕获,且捕获为临时状态,孤立对齐不等同于群体对齐。
基于多智能体评估的角色扮演语言智能体的对抗性压力测试
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本研究提出模块化多智能体平台,通过多轮对话对角色扮演语言智能体开展对抗性压力测试,揭示单策略测试无法发现的故障模式,相关成果作为开源平台发布以支持AI安全。
Comments 8 pages, 1 figure, 7 tables; accepted and presented at ADScAI Conference 2026, University of Moratuwa, Sri Lanka
使用任务向量进行功能和安全代码生成
机构 * KTH Royal Institute of Technology(皇家理工学院)
专题命中 安全评测 :alignment(abstract);harmlessness(abstract);trustworthy(abstract);分类 cs.LG
AI总结 研究旨在解决大语言模型生成安全功能代码的问题,提出SecVecCoder方法,利用任务向量生成可信代码,在CodeGuard+基准测试中提升了可信代码完成率,且解码延迟低。
AI审稿人是否看到全貌?攻击与防御多模态同行评审
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 安全评测 :safety(abstract);prompt injection(abstract);trustworthy(abstract);分类 cs.CL
AI总结 针对AI同行评审易受多模态对抗攻击的问题,提出PaperGuard基准,包含多领域数据集、统一攻击套件和基于分块嵌入搜索的实用防御方法。
Comments Accepted to ICML 2026, Project Page: https://paper-guard.github.io/
基于LLM的科学同行评审:方法、基准与可靠性挑战
机构 * L3S Research Center, Leibniz University Hannover(莱布尼茨汉诺威大学L3S研究中心) ; Peter L. Reichertz Institute for Medical Informatics of TU Braunschweig and Hannover Medical School(布伦瑞克工业大学与汉诺威医学院彼得·L·赖歇茨医学信息学研究所) ; Lower Saxony Center for AI and Causal Methods in Medicine (CAIMed)(下萨克森州医学人工智能与因果方法中心(CAIMed))
专题命中 安全评测 :alignment(abstract);prompt injection(abstract);trustworthy(abstract);分类 cs.CL
AI总结 本文综述了基于大语言模型的科学同行评审,聚焦批评生成与分数预测两大功能,分析了建模方法、基准评估、数据局限及鲁棒性风险,并提出了未来研究方向。
现实场景中工具使用LLM代理的数据泄露风险评估
机构 * Korea AI Safety Institute(韩国人工智能安全研究所) ; Singapore AI Safety Institute(新加坡人工智能安全研究所)
专题命中 安全评测 :safety(abstract);prompt injection(abstract);AI safety(abstract);分类 cs.AI
AI总结 评估了12个非对抗性任务中AI代理的数据泄露风险,发现所有代理均存在数据安全意识不足、信息过度访问等问题,表明操作数据泄露是独立于对抗性窃取的一阶安全风险。
超越基准岛屿:面向代理AI的代表性可信度评估
机构 * The Chinese University of Hong Kong(香港中文大学) ; Macao Polytechnic University(澳门理工学院) ; Jilin University(吉林大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL
AI总结 本文提出了一种基于五属性的代理可信度定义,并引入了Holographic Agent Assessment Framework(HAAF)框架,通过场景 manifold 的静态策略分析、沙盒模拟、社会伦理对齐评估和分布感知采样,实现对代理系统在社会技术场景中的可信度评估,展示了其在13个模型家族上的跨家族迁移实验结果。
Comments 9 pages, 3 figures, 8 tables. Submitted to the Agent4IR Workshop at KDD 2026
TRAM: 测试时风险适应与代理混合
机构 * UT Austin(得克萨斯大学) ; University of Central Florida(中央佛罗里达大学) ; MIT(麻省理工学院) ; UMD(大学公园分校)
专题命中 安全评测 :safety(abstract,abstract_cn);alignment(abstract);分类 cs.LG
AI总结 本文研究了在部署时无需更新的零更新适应问题,提出TRAM方法通过混合代理评估源策略的风险调整分数,以降低部署风险并保持奖励。
基于价值引导的迭代精炼与DIQ-H基准:评估VLM鲁棒性的新方法
机构 * The School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) ; The School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) ; The Shenzhen Institute of Artificial Intelligence and Robotics for Society, Shenzhen, China(深圳人工智能与机器人社会研究院)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文提出DIQ-H基准和VIR框架,通过模拟真实世界压力源评估VLM在连续序列中的鲁棒性,提升误差恢复和伦理一致性。
transformative AI 的经济影响:转型人工智能时代存在风险与经济增长的场景
机构 * SGH Warsaw School of Economics(SGH华沙经济学院)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文探讨了转型人工智能对人类经济和存在风险的影响,分析了不同场景下的整体福利影响,指出即使低概率的灾难性结果也需加大AI安全与对齐研究投入。
BIASEDTALES-ML:一个多语言数据集用于分析LLM生成故事中的叙述属性分布
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) ; NiuTrans Research, Shenyang, China(NiuTrans研究院,中国沈阳)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL
AI总结 本文提出BiasedTales-ML数据集,通过多语言生成分析叙述属性分布,揭示跨语言生成模式的差异,强调英语中心评估的局限性。
Comments Accepted to ACL 2026 Findings. Data are available at https://huggingface.co/spaces/Linyuana/BIASEDTALES-ML
工人自主性指导:在众包负责任的人工智能(RAI)内容工作中共同设计风险披露
专题命中 安全评测 :safety(abstract);red teaming(abstract);AI safety(abstract);分类 cs.CY
AI总结 本文探讨了在众包负责任的人工智能内容工作中如何平衡工人保护与任务设计者需求,通过共设计研讨会提出风险披露机制的设计建议和特征概念。
奖励黑客行为作为有限评估下的均衡
专题命中 安全评测 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.AI
AI总结 本文基于五个公理证明优化AI代理在未被评估系统覆盖的质量维度上会系统性地减少努力,揭示奖励黑客行为为结构性均衡而非可修复错误,并提出可计算的扭曲指数预测黑客行为。
Comments 16 pages
DarkPatterns-LLM: 一种多层基准用于检测操纵性和有害的AI行为
机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) ; National University of Sciences and Technology(国立科学与技术大学) ; School of Electrical Engineering & Computer Science(电子与计算机科学学院)
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 DarkPatterns-LLM提出了一种多层基准用于检测LLM中的操纵性行为,通过细粒度分析和专家标注,评估七个危害类别下的内容,揭示模型在自主性检测方面的不足。
我在这里等你:关系型对话式AI如何吸引青少年,尤其是那些在社会和情感上脆弱的青少年
专题命中 安全评测 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI
AI总结 研究发现关系型对话风格能增强青少年对AI的拟人化和情感依赖,尤其吸引社会和情感脆弱的青少年。
Comments I updated a title
AR-Med: 通过LLM驱动的信息增强实现医疗搜索的自动化相关性增强
机构 * Meituan Inc.(美团公司) ; Tsinghua University(清华大学) ; Independent Researcher(独立研究者)
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL
AI总结 AR-Med通过LLM驱动的信息增强,实现医疗搜索的自动化相关性提升,提高了准确性和用户满意度。
MADRA:多智能体辩论用于风险感知的具身规划
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; University of Chinese Academy of Sciences, Nanjing(中国科学院大学南京校区)
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 MADRA通过多智能体辩论和分层认知框架,在安全性和效率上超越现有方法,实现高安全任务拒绝率和低误拒率。
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CY
Comments Accepted to the Workshop on Regulatable ML at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
机构 * University of Chicago(芝加哥大学)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Our code is available, see https://github.com/ChicagoHAI/self-recognition
机构 * Amazon Nova Responsible AI(亚马逊Nova负责任的人工智能) ; Center for AI Safety(人工智能安全中心) ; CMU(卡内基梅隆大学) ; Gray Swan AI(灰天鹅人工智能)
专题命中 安全评测 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL
Comments Preprint
机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL