CIA+TA Risk Assessment for AI Reasoning Vulnerabilities
机构 * Independent Researcher(独立研究者)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Independent Researcher(独立研究者)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI
机构 * Fangyi Yu
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI
Comments 40 pages, 6 figures, Project Page: https://yjyddq.github.io/RiOSWorld.github.io/
专题命中 安全评测 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.CL
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI
面向海事自主船舶自动化透明度的可解释决策支持与自适应人机接口综述
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.CY
AI总结 本综述针对海事自主船舶自动化透明度,整合100项研究,提出自适应透明度框架,明确透明度设计策略与关键近阶段改进手段,以降低认知负荷、提升接管及时性并保障安全运行。
可信检索增强生成:用于检测生成式人工智能系统中错误信息和知识投毒的评估智能体
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI
AI总结 该研究针对RAG系统的安全-可靠性鸿沟,提出结合NLI验证、五信号投毒检测器及可信指数的评估智能体,在TruthfulQA等数据集上实现高检测性能,可阻止RAG系统的不安全指令注入。
Comments 7 pages, 1 figure. Accepted for publication in the Main Research Track of the Twenty-First International Conference on Software Engineering Advances (ICSEA 2026)
可审计性原生:面向企业金融领域可信大语言模型分析的本体驱动框架
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI
AI总结 本文针对企业金融大语言模型应用的信任问题,提出知识驱动分析框架KDAF,结合本体与CARP技术,在FinanceBench评估中,其可审计性优于基线方法,表明可审计性是该框架的核心优势。
Comments 20 pages, 1 figure, 4 tables, 1 algorithm. Artifact deposit with configurations, ontology schema, prompts, audit reports and reconstruction scripts: https://doi.org/10.5281/zenodo.22022068
小语言模型中的可解释跨语言对齐:探究日英双语大语言模型的文化与语用推理
机构 * Sakaguchi–Inui Laboratory (Tohoku University)(东北大学坂口–乾实验室) ; Natural Language Understanding Team at RIKEN AIP(理化学研究所先进智能项目中心自然语言理解团队) ; Swallow Project at the Institute of Science Tokyo(东京科学大学Swallow项目) ; Sakana AI ; Tohoku University(东北大学) ; RIKEN AIP(理化学研究所先进智能项目中心) ; Institute of Science Tokyo(东京科学大学)
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.LG
AI总结 本研究构建J-PragEval-v0基准,结合线性探针与教师强制评估探究TinySwallow-1.5B的日英语用表征,提出语用表征引导方法,下一步将扩展至Llama-3.1-Swallow-8B。
Comments 15 pages, no figures. Introduces the J-PragEval-v0 minimal-pair benchmark
DoGMA:一种用于肿瘤学多组学对齐与多任务学习的中心法则引导基础模型
专题命中 安全评测 :alignment(title);分类 cs.AI、cs.LG
AI总结 本研究提出中心法则引导的多组学基础模型DoGMA,通过Transformer-MoE架构结合定向注意力与掩码分层多组学重构预训练,在泛癌多组学下游任务中展现出优异性能,为多组学注意力机制设计提供新方向。
对齐发现与诊断:一种自洽的强化学习框架用于可信的放射学报告
机构 * University of Pittsburgh(匹兹堡大学) ; University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校) ; The University of Manchester(曼彻斯特大学)
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
AI总结 本文提出了一种自洽的强化学习框架,用于生成可信的放射学报告,通过优化生成过程和减少幻觉,提升了临床效果。
AI智能体时代需要新的科学范式以维持可信科学
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.CY
AI总结 针对AI自主研究智能体带来的科学产出验证缺口扩大问题,该文提出需进化科学验证基础设施的标准,以应对无人能核查结果等风险,维持科学信任。
Comments Accepted at ICML 2026, Position Paper Track
大语言模型的可靠概率安全边界
机构 * University of Oxford(牛津大学) ; Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) ; University of Birmingham(伯明翰大学)
专题命中 安全评测 :safety(title);分类 cs.CL、cs.AI
AI总结 研究提出框架计算大语言模型生成有害输出概率的严格边界,利用克洛普 - 皮尔逊置信区间,通过潜在空间特征优先探索有害分支,能高效计算可靠下界,实验验证方法有效性,为模型评估和认证提供新途径。
Comments The Initial version of this manuscript has been available on OpenReview, see https://openreview.net/forum?id=papImkPLf5
SFGA:一种用于可信SFT数据采购的具有裁决升级的统计优先门控架构
机构 * DGrid AI(DGrid人工智能)
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
AI总结 研究如何采购监督微调数据,提出统计优先门控架构SFGA,将采购视为成本感知路由问题,经实验在准确率、F1值和成本上取得良好平衡,还报告辩论路径负面诊断,为测量和校准构建合成基准。
BizFinBench.v2:通过真实用户数据和离线/在线双语评估实现金融领域可靠的大语言模型
机构 * HiThink Research(HiThink研究机构) ; Shanghai University of Finance and Economics(上海财经大学)
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
AI总结 研究针对大语言模型在金融应用中实际效果与报告性能差距大的问题,构建BizFinBench.v2基准,涵盖中美股票市场真实用户数据及多个任务,通过实验评估模型,揭示现有模型局限,为金融领域大语言模型部署提供基础。
TRIAGE:可信检索工具与图评估
机构 * IRT-SystemX(SystemX研究院)
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI
AI总结 研究基于LLM驱动自动构建的知识图谱评估问题,引入TRIAGE框架,通过特定阶段指标对知识图谱构建与使用各阶段评估,可定位失败环节并给出改进方向。
Skin-R1: 基于视觉-语言模型的临床知识引导的皮肤病诊断
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI
AI总结 Skin-R1结合教材引导的临床推理监督与强化学习,提升皮肤病诊断的准确性和鲁棒性,通过构建基于教材的推理生成器和强化学习框架,改进模型在异构数据集和稀疏标注下的表现。
Comments ECCV 2026
ASALT: 多智能体强化学习中横向迁移的自适应状态对齐
机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯学院) ; Ericsson Research(爱立信研究)
专题命中 安全评测 :alignment(title);分类 cs.AI、cs.LG
AI总结 提出ASALT方法,通过观测级和状态级适配器将目标域观测和全局状态映射到共享嵌入空间,解决源域与目标域状态空间维度不匹配问题,实现跨域知识迁移,在合作场景中提升样本效率和全局回报。
Comments Accepted at RLC 2026 conference
可信多智能体系统:使用Argent信令协议缓解语义漂移
机构 * Synechron Inc(Synechron公司)
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI
AI总结 提出Argent信令协议(ASP),通过结构化质量信号区分可修复与不可修复的失败,在文档问答和多智能体系统中分别提升通过率和阻断无依据传播。
Comments 17 pages
可判定性通过构造实现:面向可信AI的设计时验证
机构 * SpeakEZ Technologies
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
AI总结 提出一种设计时验证框架,通过将AI模型属性约束为有限生成阿贝尔群上的可判定问题,在训练前以极低计算成本验证数值稳定性、计算正确性和物理一致性,消除后验验证开销。
Comments 21 pages, 1 figure
TinyJudge: 通过轻量级专家集成实现不可验证约束对齐
机构 * Harbin Institute of Technology SCIR Lab(哈尔滨工业大学SCIR实验室) ; Peking University(北京大学) ; Huawei Technologies Co., Ltd(华为技术有限公司)
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.LG
AI总结 针对LLM遵循不可验证约束时奖励黑客和计算开销大的问题,提出TinyJudge框架,利用多个小型语言模型集成提供奖励,在五个基准上平均性能提升约10%,奖励精度提升12%,训练速度提升3倍。
Comments ACL 2026 Main Conference;15 pages, 9 figures
语音情感识别中音频语言模型的声学线索对齐
机构 * DFG's Reinhart Koselleck project(德国科研基金Reinhart Koselleck项目) ; EU H2020 project(欧盟H2020项目)
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
AI总结 研究音频语言模型中显式声学线索的对齐性,通过eGeMAPS特征提取六种可解释声学概念标记,发现对齐标记提升UAR,而错乱标记降低性能,模型对符号线索敏感但仍部分依赖音频信号。
Comments 6 pages, 3 figures, 3 tables
食物噪音与虚假安全:系统评估LLMs如何在临床医生反馈下未能适应饮食障碍查询
机构 * University of Aberdeen(阿伯丁大学) ; University of Colorado Anschutz(科罗拉多大学安舒茨分校) ; Heriot-Watt University(赫里奥特-瓦特大学) ; University College London(伦敦大学学院)
专题命中 安全评测 :safety(title);分类 cs.CL、cs.AI
AI总结 本研究通过与临床饮食障碍专家合作,系统评估了大型语言模型在处理饮食障碍用户查询时,因不加批判地适应不安全或自伤请求而可能产生的危害。
识别LLM中高置信度的社会偏见以构建可信的对话辅导代理
机构 * University of Hawaii at Manoa(夏威夷大学马诺亚分校)
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI
AI总结 本研究通过生成对话数据集,评估大型语言模型在辅导场景中检测社会偏见的能力,发现模型在对话上下文中比基准测试更难检测偏见,且对错误判断过度自信,影响推理和反馈。
Comments Accepted for AIED 2026
规范-代码对齐的保真度探针
机构 * AWS Agentic AI(AWS智能AI)
专题命中 安全评测 :alignment(title);分类 cs.AI、cs.LG
AI总结 本文提出保真度探针,通过从参考artifact生成的自然语言问题和代码派生的地面真实答案,从候选规范中回答问题。保真度是同意探针的比例,分解为矛盾率和覆盖缺口率,驱动针对性的规范编辑以达到收敛。在15个程序、约12000行COBOL基准(AWS CardDemo)上,通过八次迭代将冻结测试规范的保真度从0.63提升到0.94,其中平台位置由仅需四次速率数据的两状态马尔可夫固定点$F^\dagger$预测。探针来自LLM读取代码或静态分析管道对其控制流、数据流和系统依赖图的处理,具有可调混合比例。一个带有冻结留出集的探针重采样协议提供了Hoeffding有界的过拟合判别;我们测量的训练/测试差距保持在该包络线下一个数量级。三种基于图的混合提升了保真度16到30分;跨分布评估显示LLM和符号通道在经验上互补。在五个独立LLM家族(Anthropic、DeepSeek、Google、Alibaba、OpenAI)上进行的跨家族生成器扫描确认了收敛行为不依赖于任何单一模型家族:五个非Claude生成器中有三个产生了与马尔可夫固定点预测一致的轨迹,而冻结测试协议主动否定了两个探针分布随迭代变化的生成器。该方法适用于任何应描述相同行为的artifact对。
Comments 29 pages, 14 figures, 11 tables
反馈归一化的开发者内存用于强化学习编码代理:一种安全门控MCP架构
机构 * PythaLab, Yildiz Technical University, Istanbul, Türkiye(PythaLab,伊兹密尔技术大学,伊斯坦布尔,土耳其)
专题命中 安全评测 :safety(title);分类 cs.CL、cs.LG
AI总结 本文提出RL Developer Memory架构,通过归一化反馈和安全门控机制提升强化学习编码代理的内存管理,实验证明其在确定性任务中的有效性。
Comments 25 pages, 5 figures, 7 tables. Preprint. Implementation and supplementary artifacts are available at the project repository
通过中文文本歧义揭示可信大语言模型的脆弱性
机构 * Chalmers University of Technology(楚德斯技术大学)
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI
AI总结 研究大语言模型在处理中文歧义文本时的脆弱性,通过创建基准数据集发现模型在歧义处理上存在显著缺陷,影响实际应用。
Comments Accepted at KDD workshop on Evaluation and Trustworthiness of Agentic and Generative AI Models (Agentic & GenAI Evaluation Workshop KDD '25)