arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9419 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9419 篇

2604.05662 2026-04-08 cs.SE cs.CY 57%

Understanding: reframing automation and assurance

理解:重新定义自动化与保证

Robin Bloomfield

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文探讨了安全性和保证案例在负责任的工程和治理决策中可能脱离理解的问题,提出通过结构化论证、证据和理论自动化构建Assurance 2.0,以增强决策中的理解能力。

Comments Preprint for Workshop on Formal Arguments for CPS Certification FACCT May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05482 2026-04-08 cs.CV cs.AI 57%

Unifying VLM-Guided Flow Matching and Spectral Anomaly Detection for Interpretable Veterinary Diagnosis

统一视觉语言模型引导的流匹配与谱异常检测用于可解释的兽医诊断

Pu Wang, Zhixuan Mao, Jialu Li, Zhuoran Zheng, Dianjie Lu, Youshan Zhang

机构 * School of Mathematics, Shandong University(山东大学数学学院) Shenzhen Loop Area Institute(深圳河套学院) Yeshiva University(叶史瓦大学) Qilu University of Technology(齐鲁工业大学) Shandong Normal University(山东师范大学) Chuzhou University(滁州学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种结合流匹配与谱异常检测的新方法,通过视觉语言模型引导分割和随机矩阵理论分析,实现高精度可解释的犬类气胸诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05371 2026-04-08 cs.AI 57%

LLM-as-Judge for Semantic Judging of Powerline Segmentation in UAV Inspection

基于LLM的语义判断用于无人机巡检中的电力线分割

Akram Hossain, Rabab Abdelfattah, Xiaofeng Wang, Kareem Abdelfatah

机构 * School of Computing Sciences and Computer Engineering, The University of Southern Mississippi(南密西西比大学计算科学与计算机工程学院) Electrical Engineering Department, University of South Carolina(南卡罗来纳大学电气工程系) Computer Science Department, Faculty of Computers & Artificial Intelligence, Fayoum University(法尤姆大学计算机与人工智能学院计算机科学系)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文研究利用大语言模型作为语义判断器,评估无人机搭载模型生成的电力线分割结果可靠性,通过设计两个评估协议测试其重复性和感知敏感性,证明在约束条件下LLM能可靠监控关键任务的分割质量。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05348 2026-04-08 cs.AI 57%

From Retinal Evidence to Safe Decisions: RETINA-SAFE and ECRT for Hallucination Risk Triage in Medical LLMs

从视网膜证据到安全决策:RETINA-SAFE和ECRT在医疗大语言模型幻觉风险分层中的应用

Zhe Yu, Wenpeng Xing, Meng Han

机构 * Binjiang Institute of Zhejiang University(浙江大学滨江研究院) Communication University of Zhejiang(浙江传媒学院) Zhejiang University(浙江大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出RETINA-SAFE和ECRT框架,通过视网膜分级记录构建证据基准,解决医疗LLM中证据不足或冲突导致的幻觉风险分层问题,提升风险评估的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05110 2026-04-08 cs.CV cs.AI 57%

Simultaneous Dual-View Mammogram Synthesis Using Denoising Diffusion Probabilistic Models

同时双视角乳腺X线合成使用去噪扩散概率模型

Jorge Alberto Garza-Abdala, Gerardo A. Fumagal-González, Eduardo de Avila-Armenta, Sadam Hussain, Jasiel H. Toscano-Martínezb, Diana S. M. Rosales Gurmendi, Alma A. Pedro-Pérez, Jose G. Tamez-Pena

机构 * Tecnologico de Monterrey, School of Engineering and Sciences(蒙特雷科技大学工程与科学学院) School of Engineering, Pontificia Universidad Católica de Chile(智利天主教大学工程学院) Tecnologico de Monterrey, School of Medicine and Health Sciences(蒙特雷科技大学医学与健康科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种三通道去噪扩散概率模型,同时生成乳腺的CC和MLO视角,通过绝对差编码保持全局结构,用于乳腺影像数据增强和交叉视角AI应用。

Comments Accepted and presented at SPIE Medical Imaging 2025 (Vancouver, Canada)

Journal ref Proc. SPIE 13925, 139251C (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24536 2026-04-08 cs.CL cs.HC 57%

Robust Multilingual Text-to-Pictogram Mapping for Scalable Reading Rehabilitation

鲁棒多语言文本到图示映射以实现可扩展的阅读康复

Soufiane Jhilal, Martina Galletti

机构 * Sony Computer Sciences Laboratories(索尼计算机科学实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出一种多语言AI界面,通过自动增强文本并映射相关图示,帮助特殊教育需求儿童提高阅读理解能力,经过五种语言评估显示系统在语义安全性和可用性方面具有技术可行性。

Comments Accepted at IEEE ICALT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04816 2026-04-08 cs.OS cs.CL cs.DC 57%

Horizon-LM: A RAM-Centric Architecture for LLM Training

Horizon-LM:一种以RAM为中心的LLM训练架构

Zhengqing Yuan, Lichao Sun, Yanfang Ye

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 Horizon-LM通过重新定义CPU和GPU的角色,以主机内存为核心参数存储,实现大模型训练的内存优化,提升训练吞吐量并降低对多GPU集群的依赖。

Comments This paper contained an error in the throughput computation used in the experimental evaluation. Specifically, the TFLOPS calculation omitted the 12HL term in the training FLOPs formula, which led to systematic underestimation of the reported throughput numbers in the experimental results. We are withdrawing this version to correct the evaluation and avoid confusion for readers

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06565 2026-04-08 cs.CL 57%

EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation

EVM-QuestBench: 一个基于执行的自然语言交易代码生成基准测试

Pei Yang, Wanyi Chen, Ke Wang, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出EVM-QuestBench,一个基于执行的自然语言交易脚本生成基准测试,包含107个任务,通过动态评估和模块化架构评估20个模型,发现单步精度与多步流程完成存在显著差异。

Comments 10 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04878 2026-04-07 cs.AI cs.PF 57%

Learning, Potential, and Retention: An Approach for Evaluating Adaptive AI-Enabled Medical Devices

学习、潜能与保留:评估自适应AI医疗设备的方法

Alexis Burgon, Berkman Sahiner, Nicholas A Petrick, Gene Pennello, Ravi K Samala

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出三种测量方法:学习、潜能和保留,用于评估自适应AI医疗设备的性能变化,通过模拟人口变化验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04875 2026-04-07 cs.CV cs.AI cs.MM 57%

DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing

DIRECT:通过分层多智能体规划和意图引导编辑实现视频混剪创作

Ke Li, Maoliang Li, Jialiang Chen, Jiayu Chen, Zihao Zheng, Shaoqi Wang, Xiang Chen

机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出DIRECT框架,通过分层多智能体规划和意图引导编辑解决视频混剪中多模态协调问题,提出Mashup-Bench基准并验证了方法在客观和主观评估上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04791 2026-04-07 cs.CL 57%

How Far Are We? Systematic Evaluation of LLMs vs. Human Experts in Mathematical Contest in Modeling

我们离目标还有多远?对LLMs与人类专家在数学建模竞赛中的系统评估

Yuhang Liu, Heyan Huang, Yizhe Yang, Hongyan Zhao, Zhizhuo Zeng, Yang Gao

机构 * Beijing Institute of Technology(北京理工大学) Southeast Academy of Information Technology(东南信息技术研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文系统评估了LLMs与人类专家在数学建模竞赛中的能力差异,揭示了当前先进LLMs在执行阶段存在显著缺陷,需超越模型扩展的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04103 2026-04-07 cs.AI 57%

Compliance-by-Construction Argument Graphs: Using Generative AI to Produce Evidence-Linked Formal Arguments for Certification-Grade Accountability

基于构造的合规性论证图:利用生成式AI生成证据关联的正式论证以实现认证级问责

Mahyar T. Moghaddam

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种结合生成式AI与结构化正式论证表示的合规性架构,通过类型化论证图、检索增强生成、推理验证内核和溯源账本,确保论证的可验证性和可追溯性,防止不支持的主张进入决策记录。

Comments Accepted at FACCT 2026, IoT CPS Week

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03151 2026-04-07 cs.AI 57%

Enhancing Foundation VLM Robustness to Missing Modality: Scalable Diffusion for Bi-directional Feature Restoration

增强基础视觉语言模型对缺失模态的鲁棒性:可扩展的扩散用于双向特征恢复

Wei Dai, Haoyu Wang, Honghao Chang, Lijun He, Fan Li, Jian Sun, Haixia Bi

机构 * Department of Electronics Information \ 'an Jiaotong University Xi'an China School of Information Communications Engineering \ 'an Jiaotong University Xi'an China School of Mathematics Statistics \ 'an Jiaotong University Xi'an China Information \ 'an Jiaotong University Communications Engineering \ 'an Jiaotong University Statistics \ 'an Jiaotong University

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种通用缺失模态恢复策略,通过增强扩散模型实现双向特征对齐,提升视觉语言模型在模态缺失情况下的鲁棒性和可扩展性。

Comments 10 pages, 8 figures, 6 tables. Experiments and some details have been updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08565 2026-04-07 cs.HC cs.AI 57%

Rewriting Video: Text-Driven Reauthoring of Video Footage

重写视频:基于文本的视频重写

Sitong Wang, Anh Truong, Lydia B. Chilton, Dingzeyu Li

机构 * Columbia University(哥伦比亚大学) Adobe Research(Adobe研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于文本的视频重写方法,通过生成重建算法将视频转为可编辑文本提示,并通过交互式工具Rewrite Kit实现视频内容的重写,探讨了文本驱动视频重写的新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05656 2026-04-07 cs.AI 57%

HAG: Hierarchical Demographic Tree-based Agent Generation for Topic-Adaptive Simulation

HAG:基于主题自适应的分层人口树状代理生成

Rongxin Chen, Tianyu Wu, Bingbing Xu, Jiatang Luo, Xiucheng Xu, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出HAG框架,通过分层决策过程生成符合主题需求的代理群体,提升宏观分布与微观一致性。实验表明HAG在减少群体对齐误差和增强社会一致性方面表现优异。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06668 2026-04-07 cs.IR cs.LG 57%

Contradictions in Context: Challenges for Retrieval-Augmented Generation in Healthcare

上下文中的矛盾:医疗领域检索增强生成的挑战

Saeedeh Javadi, Sara Mirabi, Manan Gangar, Bahadorreza Ofoghi

机构 * Deakin University(迪肯大学) RMIT University(皇家墨尔本理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文研究了在医疗领域使用检索增强生成方法时,源文档中过时或矛盾信息对模型性能的影响,提出了一个基准数据集并分析了不同LLM的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04701 2026-04-07 cs.CL 57%

XiYan-SQL: A Novel Multi-Generator Framework For Text-to-SQL

XiYan-SQL:一种新型多生成器框架用于文本到SQL

Yifu Liu, Yin Zhu, Yingqi Gao, Zhiling Luo, Xiaoxia Li, Xiaorong Shi, Yuntao Hong, Jinyang Gao, Yu Li, Bolin Ding, Jingren Zhou

机构 * Alibaba Cloud Computing Co., Ltd.(阿里云计算有限公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出XiYan-SQL框架,通过多生成器 ensemble 方法生成高质量SQL查询,并结合schema过滤和选择模型提升性能,实现在BIRD和Spider数据集上均取得SOTA结果。

Comments Published in IEEE TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03695 2026-04-07 cs.CL 57%

POEMetric: The Last Stanza of Humanity

POEMetric:人类的最后一段

Bingru Li, Han Wang, Hazel Wilkinson

机构 * University of Birmingham(伯明翰大学) University of Trento(特伦托大学) Institute of Data and AI (IDAI)(数据与人工智能研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出POEMetric框架,评估诗歌生成能力,通过人类和LLM的对比发现,尽管顶级模型在形式准确性和主题匹配上表现优异,但整体诗歌质量仍逊于人类诗人。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03587 2026-04-07 cs.CR cs.AI 57%

SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization

SecPI: 通过安全推理内化实现安全代码生成

Hao Wang, Niels Mündler, Mark Vero, Jingxuan He, Dawn Song, Martin Vechev

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 SecPI通过内化结构化安全推理,使推理模型在无需安全指令的情况下生成安全代码,经验证在多个安全基准测试中显著提升代码功能正确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08388 2026-04-07 cs.AI 57%

A Hierarchical Error-Corrective Graph Framework for Autonomous Agents with LLM-Based Action Generation

一种用于自主代理的分层错误校正图框架:基于大语言模型的动作生成

Cong Cao, Jingyao Zhang, Kun Tong

机构 * Independent Researcher(独立研究者) Beihang University(北京航空航天大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出HECG框架,通过多维可转移策略、误差矩阵分类和因果-上下文图检索三大创新,提升自主代理在动态任务中的策略选择、错误分析和情境适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04755 2026-04-07 cs.LG 57%

KindSleep: Knowledge-Informed Diagnosis of Obstructive Sleep Apnea from Oximetry

KindSleep:基于血氧数据的阻塞性睡眠呼吸暂停诊断

Micky C Nnamdi, Wenqi Shi, Cheng Wan, J. Ben Tamo, Benjamin M Smith, Chad A Purnell, May D Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) UT Southwestern Medical Center(德克萨斯大学西南医学中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 KindSleep利用深度学习整合临床知识与单通道血氧数据,实现精准的阻塞性睡眠呼吸暂停诊断,其在不同人群中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22783 2026-04-07 cs.IR cs.CV cs.LG cs.MM cs.SD 57%

Compact Hypercube Embeddings for Fast Text-based Wildlife Observation Retrieval

紧凑超立方体嵌入用于快速基于文本的野生动物观察检索

Ilyass Moummad, Marius Miron, David Robinson, Kawtar Zaher, Hervé Goëau, Olivier Pietquin, Pierre Bonnet, Emmanuel Chemla, Matthieu Geist, Alexis Joly

机构 * Inria, LIRMM, UM(法国国家信息与自动化研究所,蒙彼利埃计算机科学实验室,蒙彼利埃大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出紧凑超立方体嵌入框架,通过二进制表示实现高效文本检索,提升大规模野生动物图像和音频数据库的检索效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21439 2026-04-07 cs.AI 57%

The Paradox of Robustness: Decoupling Rule-Based Logic from Affective Noise in High-Stakes Decision-Making

鲁棒性悖论:在高风险决策中解耦基于规则的逻辑与情感噪声

Jon Chun, Katherine Elkins

机构 * Kenyon College(凯尼恩学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究揭示了大语言模型在高风险决策中对情感噪声的鲁棒性悖论,通过三个领域实验发现模型在逻辑约束下比人类更稳定,但对提示格式敏感。

Comments 47 pages, 14 figures, 23 tables. Substantially revised from v1: added immigration domain extension (14,183 cells), adversarial narrative pilot (2,054 cells), reasoning-trace analysis, scaffolding decomposition. Total: 84,245 valid responses across 13 experiments. Under review at TMLR. Code and data will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03216 2026-04-06 cs.CL 57%

BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence

BAS:一种基于决策理论的评估大语言模型置信度的方法

Sean Wu, Fredrik K. Gustafsson, Edward Phillips, Boyan Gao, Anshul Thakur, David A. Clifton

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Oxford Suzhou Centre for Advanced Research(牛津大学苏州高等研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出BAS,一种基于决策理论的评估方法,用于评估大语言模型置信度在不同风险偏好下的决策支持能力,揭示置信度与决策可靠性之间的关系,并展示如何通过干预提升置信度可靠性。

Comments 24 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03201 2026-04-06 cs.AI 57%

Coupled Control, Structured Memory, and Verifiable Action in Agentic AI (SCRAT -- Stochastic Control with Retrieval and Auditable Trajectories): A Comparative Perspective from Squirrel Locomotion and Scatter-Hoarding

耦合控制、结构化记忆与可验证行为在代理AI中的应用(SCRAT -- 随机控制与可审计轨迹:从松鼠运动与散落储藏的比较视角)

Maximiliano Armesto, Christophe Kolb

机构 * Taller Technologies

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文从松鼠生态角度探讨代理AI中控制、记忆与可验证行为的耦合机制,提出结构化记忆模型与延迟验证信号,验证三种假设以提升系统鲁棒性与可靠性。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03131 2026-04-06 cs.CR cs.AI 57%

A Systematic Security Evaluation of OpenClaw and Its Variants

对OpenClaw及其变种的系统性安全评估

Yuhang Wang, Haichang Gao, Zhenxing Niu, Zhaoxiang Liu, Wenjing Zhang, Xiang Wang, Shiguo Lian

机构 * Xidian University(西安电子科技大学) Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文系统评估了六个OpenClaw系列代理框架的安全性,发现代理系统存在显著安全漏洞,且其风险高于孤立使用的基础模型。

Comments 39 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02678 2026-04-06 stat.ME cs.AI stat.AP 57%

Eligibility-Aware Evidence Synthesis: An Agentic Framework for Clinical Trial Meta-Analysis

有资格意识的证据合成:一个用于临床试验元分析的代理框架

Yao Zhao, Zhiyue Zhang, Yanxun Xu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 EligMeta框架整合了自动化试验发现与有资格意识的元分析,通过自然语言查询生成可复现的试验选择,并基于资格对研究加权,以产生特定群体的汇总估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02539 2026-04-06 cs.IR cs.LG 57%

Synapse: Evolving Job-Person Fit with Explainable Two-phase Retrieval and LLM-guided Genetic Resume Optimization

Synapse:通过可解释的双阶段检索和LLM引导的遗传简历优化实现就业-个人匹配

Ansel Kaplan Erol, Seohee Yoon, Keenan Hom, Xisheng Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 Synapse通过双阶段检索和遗传优化提升招聘推荐系统,解决信息不平衡问题,提高推荐精度和透明度,实验显示nDCG@10提升22%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18545 2026-04-06 cs.CV cs.AI 57%

CoDA: Exploring Chain-of-Distribution Attacks and Post-Hoc Token-Space Repair for Medical Vision-Language Models

CoDA:探索链式分布攻击及事后令牌空间修复用于医疗视觉-语言模型

Xiang Chen, Fangfang Yang, Chunlei Meng, Yuxian Dong, Ang Li, Yiwei Wei, Jiahuan Long, Jiujiang Guo, Chengyin Hu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出CoDA框架,通过构建临床合理的流程偏移,评估医疗视觉-语言模型在真实临床工作流中的可靠性,发现零样本性能显著下降,并引入事后修复策略提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13303 2026-04-06 cs.LG 57%

On the Extreme Variance of Certified Local Robustness Across Model Seeds

关于模型种子下认证局部鲁棒性极值方差的研究

Minh Le, Phuong Cao

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究揭示了训练种子差异导致认证鲁棒性极值方差显著,质疑了验证结果的可靠性,并呼吁增加置信区间报告和更全面的验证方法。

详情

展开后加载摘要…

URL PDF HTML 收藏