Dilated Convolution with Learnable Spacings makes visual models more aligned with humans: a Grad-CAM study
专题命中 安全评测 :alignment(abstract);分类 cs.AI;trustworthy(comments)
Comments Accepted at The Trustworthy AI Workshop, IJCAI 2024
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :alignment(abstract);分类 cs.AI;trustworthy(comments)
Comments Accepted at The Trustworthy AI Workshop, IJCAI 2024
专题命中 安全评测 :trustworthy(abstract,journal_ref);分类 cs.AI
Journal ref 2nd IEEE Conference on Secure and Trustworthy Machine Learning, Apr 2024, Toronto, Canada
专题命中 安全评测 :trustworthy(abstract,comments);分类 cs.LG
Comments 9 pages, 3 figures. Trustworthy and Socially Responsible Machine Learning (TSRML 2022) workshop co-located with NeurIPS 2022
人工智能评估中随机对照试验的原则与指南
专题命中 安全评测 :分类 cs.AI、cs.CY、cs.LG;safety(comments);AI safety(comments)
AI总结 研究针对人工智能评估随机对照试验缺乏通用标准和共享词汇的问题,借鉴多学科实践综合五条原则,形成33条可操作指南,为其发挥设计工具、评估标准和标准制定蓝图的作用,提供评估标准、共享语言及指南。
Comments 33 pages, ICML 2026 (Workshop on Technical AI Governance Research) and Technical AI Safety Conference
ESM3作为具有系统性风险的通用人工智能模型在欧盟人工智能法案中的案例
机构 * AI Standards Lab(人工智能标准实验室) ; Vilnius University(维尔纽斯大学) ; Northeastern University London(伦敦东北大学) ; London School of Economics(伦敦政治经济学院)
专题命中 安全评测 :分类 cs.AI、cs.CY、cs.LG;safety(comments);AI safety(comments)
AI总结 本文探讨ESM3等前沿生物基础模型在欧盟人工智能法案下的监管问题,分析其是否受通用人工智能模型系统性风险义务约束,并提出改进建议。
Comments 8 pages, 1 figure, Technical AI Safety Conference
面向可操作的手术团队动态:从团队协作到反事实标注
机构 * University of Trento(特伦托大学) ; UiT the Arctic University of Norway(挪威北极大学)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 本研究构建了基于真实手术室录制的扩展多模态手术团队互动数据集,含多级标注与反事实标注,支持团队协作建模及AI辅助协作系统设计,为高风险领域协作行为分析提供统一资源。
Comments Accepted at HCOMP 2026
TSWAP:多语言检索增强型泰国健康顾问
机构 * Digital Touch Point Co., Ltd.(数字触点有限公司) ; iApp Technology Co., Ltd.(iApp技术有限公司)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 研究提出多语言检索增强型泰国健康顾问TSWAP,基于泰国传统医学知识库,采用混合检索等技术,发布相关基准与日志,发现量化及强制检索的部署要点。
Comments 8 pages, 2 tables. Data and evaluation logs: https://huggingface.co/datasets/iapp/tswap-wellness-benchmark
KMGen:一种基于技能的合成个体患者数据生成方法
机构 * Mayo Clinic Alix School of Medicine(梅奥诊所阿利克斯医学院)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 KMGen是首个端到端框架,可全自动提取KM曲线并生成合成患者不良事件轨迹,在多肿瘤试验中精度达标,相关流水线已开源。
Journal ref Proceedings of Machine Learning Research 340 (2026) 1-60
对遗忘算法进行压力测试
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 该研究针对现有大型语言模型遗忘基准的缺陷,提出扩展WMDP的WMDP++基准,以针对性提取遗忘信息和评估边界问题性能,实现对遗忘算法更严格的压力测试。
现代手写体热身是否有助于历史阿拉伯文OCR?针对Muharaf和KHATT的可复现、计算匹配评估
机构 * Dal Research Team(达尔研究团队)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本研究通过可复现、计算匹配的实验评估现代手写体热身对历史阿拉伯文OCR的影响,发现其并非普遍有效,发布了可独立验证的SaudiHeritage-OCR包。
Comments 14 pages, Dal Research Team
LLM4LLM:通过闭环智能体优化弥合内核基准与实际部署之间的差距
机构 * National Key Laboratory of Advanced Communication Networks(先进通信网络国家重点实验室) ; Xidian University(西安电子科技大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 研究人员提出LLM4LLM部署感知闭环优化框架,解决内核基准与实际部署的性能差距,在A100、H100的10个语言模型推理工作负载及KernelBench Level 2上实现显著加速。
Comments accepted by EMNLP 2026 main conference
GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败
机构 * University of Southern California(南加州大学) ; USC Information Sciences Institute(南加州大学信息科学研究所) ; Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出GUI-Primitives基准,通过994个含7种空间关系的对比指令对,发现多数视觉-语言GUI定位模型的失败源于候选定位而非关系理解,且标记候选可提升准确率。
Comments Accepted to EMNLP 2026 Main Conference
波动评判者:在沉默、压力与坚持下的认知稳定性
机构 * Meta Superintelligence Labs(元超级智能实验室) ; FAIR at Meta(元公司FAIR研究院)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本研究提出Wiggle框架测试LLM评判者的认知稳定性,发现9个前沿模型在压力下裁决波动显著,且多数压力会损害真实值,基线陪审团多数强度可预测波动项目。
跨架构视觉语言模型中基于方向的推理时防御措施审计
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究审计了视觉语言模型中5种基于方向的推理时防御,发现其性能具架构特异性,部分防御间几何重叠,需按解码器家族单独校准。
迈向安全的LLM智能体:威胁面、攻击、防御与评估
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) ; Technical University of Munich(慕尼黑技术大学)
专题命中 安全评测 :prompt injection(abstract);分类 cs.AI
AI总结 本文通过生命周期、系统导向的框架,综合247篇论文,围绕信息流、委托权限和持久状态,系统梳理了LLM智能体的威胁面、攻击、防御与评估,指出提示注入和工具控制流劫持仍是主要威胁,持久状态损坏和多智能体传播成为新兴关注点。
Speak-to-Structure:评估大语言模型在开放域自然语言驱动的分子生成中的表现
机构 * Hong Kong Polytechnic University(香港理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室) ; National University of Singapore(新加坡国立大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出Speak-to-Structure基准,通过分子编辑、优化和定制生成任务评估大语言模型在开放域自然语言驱动分子生成中的创造性能力,并引入OpenMolIns指令微调数据集使Llama3.1-8B超越GPT-4o等模型。
Comments Accepted by KDD 2026. Our codes and datasets are fully accessible through the https://github.com/phenixace/S2-TOMG-Bench and https://huggingface.co/datasets/phenixace/S2-TOMG-Bench
Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26), 2026
Checkup2Action:面向患者行动的多模态临床检查报告数据集
机构 * Durham University(杜伦大学) ; University of Oxford(牛津大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 本文提出Checkup2Action数据集,用于生成结构化的行动卡,通过多模态检查报告生成患者导向的行动建议,评估行动的准确性、优先级和安全性。
ONOTE:面向专家级音乐智能的多模态记谱处理基准测试
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出ONOTE基准测试,通过确定性流程消除记谱系统偏差,揭示多模态模型在感知准确性和音乐理论理解间的根本分歧。
检索对齐的表格基础模型实现电子健康记录中在现实约束下的稳健临床风险预测
机构 * University of Cambridge(剑桥大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 针对电子健康记录中高维、异质、类别不平衡和分布偏移等挑战,提出任务对齐检索框架AWARE,通过监督嵌入学习和轻量适配器提升表格上下文学习性能,在极端不平衡下AUPRC提升高达12.2%。
Comments Not peer-reviewed. Under revision
GAIN:在不完美规范下评估大语言模型目标对齐决策的基准
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 GAIN基准通过模拟现实商业场景,评估大语言模型在规范与目标冲突下的决策平衡能力,揭示影响决策的关键因素。
Comments We are working towards releasing the code in April 2026
Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pages 4346-4357, Palma de Mallorca, Spain. ELRA Language Resource Association
PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; Sun Yat-Sen University(中山大学) ; Chinese University of Hong Kong(香港中文大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。
Comments Accepted by EMNLP 2026 Main Conference
利用双路径图卷积进行众包书评的鲁棒推理:基于层次化题材挖掘
机构 * Indian Institute of Technology Indore(印度理工学院印多尔分校) ; Indian Institute of Technology Patna(印度理工学院帕纳布)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 HiGeMine通过双路径图卷积框架,利用书评和权威书类信息提升层次化书类分类的准确性。
推理与个性化结合:释放大型推理模型在个性化生成中的潜力
机构 * Dongguan University of Technology(东莞理工大学) ; City University of Hong Kong(香港城市大学) ; Tsinghua University(清华大学) ; Guangzhou University(广州大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本研究针对大型推理模型在个性化任务中存在的局限,提出强化推理框架及相关机制,经实验验证其性能显著优于现有技术。
模型合并具有隐式可认证性:小样本学习的非空泛化界
机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) ; Samsung AI Center, Cambridge(三星人工智能中心)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 该研究建立了模型融合学习与泛化认证的联系,发现仅用100个示例、VIT-B和mistral-7B等模型时,融合式学习可获得非平凡泛化保证,为大模型小样本学习的可信认证提供了新方向。
Comments UAI2026
$Z^2$-ACT:面向开放6G无线接入网的端到端可验证智能体意图控制
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 针对开放6G RAN多厂商部署的安全可验证需求,提出$Z^2$-ACT架构,集成多类核心组件并经实验验证其执行过滤与攻击恢复能力提升。
Comments 12 pages, 2 figures, 6 tables
评估大型语言模型在国际海运危险货物规则合规性上的性能
机构 * NCB Hazcheck Limited(NCB Hazcheck有限公司) ; Durham University(杜伦大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本研究构建首个IMDG规则合规性基准DGEval,评估13个LLM的性能,发现其在积载等安全关键领域表现弱,仅可辅助结构化查询,需人工监督。
Comments 28 pages, 2 figures
无理由不判断:面向版本化AI评估器的反事实收据
机构 * Alibaba Group(阿里巴巴集团) ; Cheung Kong Graduate School of Business(长江商学院)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 该研究针对AI评估器的推理问责问题,提出反事实收据方法与ReasonBench基准,发现模型标准准确率掩盖鲁棒性缺陷,需解耦预测与认证以实现可信审计。
Comments 26 pages, 11 tables, 7 figures
用于大规模推荐解释的LLM评判模型的生命周期
机构 * Netflix(网飞公司)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。
MedRAGChecker: 用于生物医学检索增强生成的声明级验证
机构 * University of Pittsburgh(匹兹堡大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 MedRAGChecker通过声明级验证和诊断框架,提高生物医学RAG生成答案的可靠性与安全性。
ConceptGuard:评估大语言模型中上下文敏感的遗忘能力
机构 * Pune Institute of Computer Technology(浦那计算机技术学院) ; University of California, Irvine(加州大学欧文分校)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 该研究针对大语言模型遗忘能力评估的缺陷,提出ConceptGuard基准,聚焦两用概念,发现现有遗忘技术存在性能缺陷,为实用安全的遗忘方法提供思路。
Comments Submitted to NeurIPS E&D Track 2026; 17 pages, 9 figures