Identifying Roles, Requirements and Responsibilities in Trustworthy AI Systems
专题命中 安全评测 :trustworthy(title);分类 cs.CY
Comments Pre-print of paper submitted to Workshop on Reviewable and Auditable Pervasive Systems (WRAPS)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :trustworthy(title);分类 cs.CY
Comments Pre-print of paper submitted to Workshop on Reviewable and Auditable Pervasive Systems (WRAPS)
专题命中 安全评测 :alignment(title);分类 cs.LG
Comments 11 pages, 4, figures
专题命中 安全评测 :trustworthy(title);分类 cs.LG
专题命中 安全评测 :safety(title);分类 cs.LG
专题命中 安全评测 :alignment(title);分类 cs.LG
Comments Accepted to ICML 2019
专题命中 安全评测 :trustworthy(title);分类 cs.AI
专题命中 安全评测 :safety(title);分类 cs.LG
Comments 16 pages
Journal ref Asian Conference on Machine Learning 2013, Canberra : Australia (2013)
训练模型,而非读者:可验证激活解释的可解码性监督
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 研究自然语言自动编码器对隐藏激活解释评分的问题,提出RECAP等方法,能使指定内容可解码,提高解释忠实度与安全性,如在预训练模型上实现可靠探测解码,提升对真实声明评分及识别谎言能力。
NeurIPS与ICML 2025立场论文 track 的调查
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.CY
AI总结 本文审计了NeurIPS和ICML 2025立场论文 track 的公开投稿,发现其以改革派批判为主,建议增设方向设定类工作,并提出四项CFP层面干预措施以优化投稿结构。
听、推理与分段:使大型音频语言模型(LALMs)与编辑判断对齐以实现媒体章节化
机构 * University of Surrey(萨里大学)
专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究针对LALMs在实际媒体章节化部署的不足,提出基于GRPO与CoT的AudioChaps框架,构建三类数据集,使AudioChaps-R1的平均F1较SOTA提升49个百分点,实现非结构化听觉流到结构化媒体的可靠转换。
Comments 19 pages, 9 figures, 8 tables
HarmProfile:刻画前沿大语言模型中的有害分布
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出HarmProfile基准数据集,收集23个前沿LLMs的超8万条有害输出,发现其有害性与多样性随模型能力增长,潜藏对齐表面下的危险知识。
重新审视关机问题
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文重新评估了AI关机问题的难度,指出现有论证未能证明其难以解决,且相关技术方案对模型性能造成了高安全代价。
Logit边界几何置信接口与稀疏层束 enclaves 协议:安全网络电子健康记录(EHR)互操作性的自包含底层架构
机构 * Light Imaging Technologies, Inc.(光成像技术公司)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出Logit边界几何置信接口与稀疏层束 enclaves 协议,构建EHR互操作的自包含底层架构,经GBI BoundaryBench v0.1评估,Qwen3-4B-Instruct-2507在该接口下无符合要求的输出,为接受边界提供实证证据。
Comments 39 pages; executable Julia verification code included as ancillary material; companion public benchmark: https://github.com/AlvinSpivey/GBI-BoundaryBench
Infra-Bayesian 强化学习智能体在最坏情况鲁棒性上优于经典强化学习
机构 * Purdue University(普渡大学) ; Carnegie Mellon University(卡内基梅隆大学) ; WorldQuant University(WorldQuant大学) ; UC Berkeley(加州大学伯克利分校) ; Aix-Marseille University(阿维尼翁-马赛大学) ; MIT(麻省理工学院) ; University of Zurich(苏黎世大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of Stuttgart(斯图加特大学) ; University of Buenos Aires(布宜诺斯艾利斯大学) ; California State University, Fresno(弗雷斯诺加州州立大学) ; University of Chicago(芝加哥大学)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 针对经典强化学习在模型误设和策略依赖不确定性下的失败,提出 Infra-Bayesian 框架,通过区分概率不确定性和 Knightian 不确定性并采用最坏情况决策,在有限状态无状态决策问题中实现更低的最坏情况遗憾。
Comments RLC 2026: Accepted to Finding the Frame Workshop
FinTrace: LLM工具调用在长周期金融任务中的轨迹级综合评估
机构 * Stevens Institute of Technology(斯蒂文斯理工学院) ; Independent Researcher(独立研究者) ; The FinAI(FinAI) ; Duke University(杜克大学)
专题命中 安全评测 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出FinTrace基准,通过800个专家标注的轨迹评估LLM工具调用,揭示模型在信息利用和最终答案质量上的不足,并通过FinTrace-Training数据集提升中间推理能力,但最终答案质量仍受限。
潜在上下文是否有帮助?北极航运中逆强化学习的受控评估
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过对北极航运航次的受控评估,发现非线性共享奖励模型优于线性基线,添加船舶特定潜在上下文反而降低性能,表明可观测特征已能解释行为差异,为安全关键领域的AI部署提供支持。
从经济智能体到智能体经济:经济世界模型的系统蓝图
机构 * Shenzhen Loop Area Institute(深圳河套学院) ; School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; University of Hong Kong(香港大学) ; Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。
Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models
SCP-NL2TL:用于自然语言到时间逻辑规范的带语义验证的选择性共形预测
机构 * University of California, Riverside(加州大学河滨分校) ; City University of Hong Kong(香港城市大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出SCP-NL2TL框架,结合选择性共形预测与语义验证,可生成自然语言到时间逻辑的规范并判断其可靠性,在三类逻辑上提升了翻译可靠性与鲁棒性,为可信自然语言接口提供了基础。
神经符号AI中的符号接地:推理快捷方式的入门介绍
机构 * University of Trento(特伦托大学) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; Sapienza University of Rome(罗马大学) ; University of Edinburgh(爱丁堡大学) ; Huawei Labs(华为实验室)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文探讨神经符号AI中推理快捷方式的问题,分析其成因与影响,并提供解决方法与策略,以提升模型的可靠性和可信度。
Comments Published on JAIR (Integration of Logical Constraints in Deep Learning special track)
大型语言模型微调生命周期中的安全:威胁、防御、评估与未来方向
机构 * Hangzhou Normal University(杭州师范大学) ; Zhejiang University(浙江大学) ; China Mobile (Zhejiang) Innovation Research Institute Co., Ltd.(中国移动(浙江)创新研究院有限公司) ; Quantum Cloud Computing and Distributed Systems (qCLOUDS) Lab, School of Computing and Information Systems(量子云计算与分布式系统(qCLOUDS)实验室,计算与信息学院) ; The University of Melbourne(墨尔本大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文系统综述了大型语言模型微调过程中的安全威胁与防御,提出了基于生命周期的三阶段框架,并通过统一实验评估了攻击与防御的有效性及跨阶段局限性。
Comments 39 pages, 7 figures, 22 tables
Journal ref Software: Practice and Experience, 2026
Token Buncher: 保护大语言模型免受有害强化学习微调的威胁
机构 * Nanyang Technological University(南洋理工大学) ; Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,A*STAR) ; Northwestern University(西北大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG
AI总结 本文提出TokenBuncher,通过限制模型响应熵来防御基于强化学习的有害微调,实验显示其能有效抑制有害行为同时保持正常任务性能。
Comments Accepted by ACM CCS 26
语言模型输出分布中的尾部风险估计
机构 * Columbia University(哥伦比亚大学) ; Department of Computer Science, New York University(纽约大学计算机科学系) ; Center for Data Science, New York University(纽约大学数据科学中心)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 提出一种基于重要性采样的方法,通过创建不安全版本来高效估计语言模型产生有害输出的尾部概率,在10-20倍更少样本下匹配蒙特卡洛估计,并揭示模型对输入的敏感性。
Comments Accepted to ICML 2026
不要走线:边界引导用于过滤生成
机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Stanford University, Department of Computer Science, Stanford, California, USA(斯坦福大学计算机科学系)
专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG
AI总结 本文提出边界引导方法,通过强化学习微调生成模型,使其远离分类器边缘,从而提升生成输出的安全性和实用性。
Comments Accepted at ICML 2026
SynopticBench:在生成未来天气预报讨论上评估视觉-语言模型
机构 * Department of Environmental Sciences(环境科学系) ; School of Data Science(数据科学学院)
专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文提出SynopticBench数据集和SPACE评估框架,用于评估视觉-语言模型在生成天气现象描述中的性能,揭示现有评估指标的局限性。
Comments Accepted for presentation at Climate Informatics 2026
PatientAgentBench:一个用于评估面向患者的健康人工智能代理的基准框架
机构 * Amazon Health AI(亚马逊健康人工智能)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 研究面向患者的健康人工智能代理评估问题,核心方法是用PatientAgentBench框架,通过语言模型评审团在多维度评估,主要贡献是发现模型临床差距,发布可重复、经临床医生验证的评估标准助领域弥补差距。
Comments Code: https://github.com/amazon-science/PatientAgentBench
大语言模型的策略规划与预训练语言覆盖范围成反比
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 研究前沿模型中策略规划与预训练语言覆盖范围的关系,应用Petri框架评估Qwen3-30B-A3B,发现策略规划得分与预训练语言覆盖范围成反比,低资源语言得分更高,且该影响在不同策略行为中不均一。
TaylorPODA:一种基于泰勒展开的方法,用于改进不透明模型的事后归因
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 研究针对不透明模型事后归因方法缺乏普遍标准的问题,提出基于泰勒展开框架的TaylorPODA方法,通过引入假设、分析矛盾、设计可控分配机制等,使其既满足假设又适应下游目标,提升了归因与用户定义效用的对齐及解释的可交流性。
Comments 21 pages, 4 figures. Submitted to TMLR. Re-upload with amended manuscript
基于物理可验证证据和大语言模型的轴承故障诊断报告
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 针对安全关键型机械系统中AI诊断的验证问题,提出诊断证据网络DENet,将输出扩展为结构化证据记录,包括分类、预测特征频率等,能检测误分类,还通过约束语言模型减少无根据声明率,提升诊断可靠性。
StackingNet:跨独立AI基础模型的集体推理
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 StackingNet通过元集成框架整合独立模型输出,提升准确率并减少误差,无需内部参数或训练数据,有效识别和修剪退化模型,在语言理解、视觉属性估计和学术论文评分中优于单一模型和经典集成方法。
基于多模态语言模型的计算幽默:方法、数据集、评估及挑战
机构 * Case Western Reserve University(凯斯西储大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 本研究聚焦于单图像和多面板作品中的视觉幽默理解,通过与先前综述对比,按能力层次组织文献,综合基准设计等内容,追溯领域转变,指出进展的主要障碍包括易出现捷径的评估、文化覆盖有限等问题。