arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2407.13059 2026-05-19 cs.CY cs.AI cs.ET 73%

Prioritizing High-Consequence Biological Capabilities in Evaluations of Artificial Intelligence Models

在评估人工智能模型时优先考虑高后果生物能力

Jaspreet Pannu, Doni Bloomfield, Alex Zhu, Robert MacKnight, Gabe Gomes, Anita Cicero, Thomas V. Inglesby

机构 * Center for Health Security, Bloomberg School of Public Health, Johns Hopkins University(健康安全中心,公共卫生学院,约翰霍普金斯大学) Department of Health Policy, Stanford School of Medicine, Stanford University(健康政策系,斯坦福医学院,斯坦福大学) Department of Chemical Engineering, Carnegie Mellon University(化学工程系,卡内基梅隆大学) Department of Chemistry, Carnegie Mellon University(化学系,卡内基梅隆大学) Wilton E. Scott Institute for Energy Innovation, Carnegie Mellon University(威尔顿·E·斯科特能源创新研究所,卡内基梅隆大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文基于人工智能模型的安全性、安全性和伦理问题,提出在评估人工智能模型时应优先考虑高后果风险,如大规模公众危害(如大流行病),并应在部署前进行评估,以建立针对性的AI安全评估方法,确保工具的安全性和防止潜在危害。

Comments 9 pages, 1 figure, 3 tables, 1 box

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14087 2026-05-18 cs.CL cs.LG 73%

Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study

对大语言模型毒性进行测量与缓解:一项全面的复制研究

Mokshit Surana, Archit Rathod, Akshaj Satishkumar

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG

AI总结 本文通过复制研究评估DExperts在缓解显性毒性中的有效性,发现其在显性毒性基准上安全性接近完美,但对隐性仇恨言论存在脆性,并引入了10倍的延迟惩罚。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13329 2026-05-14 cs.CL cs.AI 73%

Tracing Persona Vectors Through LLM Pretraining

通过LLM预训练追溯人格向量

Viktor Moskvoretskii, Dominik Glandorf, Jorge Medina Moreira, Tanja Käser, Robert West

机构 * EPFL(苏黎世联邦理工学院)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究LLM预训练中人格向量的形成机制,发现其在早期阶段就形成并持续优化,为模型安全性和可控性提供新视角。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08039 2026-05-14 cs.CV cs.AI cs.LG 73%

LINE: LLM-based Iterative Neuron Explanations for Vision Models

LINE:基于语言模型的视觉模型迭代神经元解释

Vladimir Zaigrajew, Michał Piechota, Gaspar Sekula, Paweł Gelar, Przemysław Biecek

机构 * Centre for Credible AI(可信AI中心) Warsaw University of Technology(华沙理工大学) University of Warsaw, Poland(波兰华沙大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 LINE提出一种无需训练的迭代方法,通过大语言模型和图像生成器,在黑盒环境下闭环提出和优化概念,提升视觉模型的开放词汇概念标注性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15161 2026-05-14 cs.CL cs.AI 73%

Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems

用于医疗对话系统可靠评估的自动化评分标准

Yinzhu Chen, Abdine Maiga, Hossein A. Rahmani, Emine Yilmaz

机构 * AI Center, University College London(伦敦大学学院人工智能中心)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种检索增强的多智能体框架,用于自动生成实例特定的评估评分标准,通过权威医学证据生成可验证的细粒度评估标准,并在HealthBench和LLMEval-Med数据集上取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18184 2026-05-12 cs.LG cs.AI 73%

ActivationReasoning: Logical Reasoning in Latent Activation Spaces

ActivationReasoning: 在潜在激活空间中的逻辑推理

Lukas Helff, Ruben Härle, Wolfgang Stammer, Felix Friedrich, Manuel Brack, Antonia Wüst, Hikaru Shindo, Patrick Schramowski, Kristian Kersting

机构 * TU Darmstadt(图恩-达姆施塔特大学) Lab1141(Lab1141实验室) Aleph Alpha Research(Aleph Alpha研究) MPI-Inf, SIC(马克斯·普朗克研究所(MPI-Inf)) Meta FAIR Adobe Applied Research(Adobe应用研究) DFKI(DFKI研究所) CERTAIN, Germany(德国CERTAIN)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ActivationReasoning框架,通过在LLM的潜在空间中嵌入显式逻辑推理,提升模型的推理能力、可控性和对齐性,验证了在多跳推理、抽象与鲁棒性、自然语言推理及安全任务中的有效性。

Comments Proceedings of the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05835 2026-05-08 cs.CL cs.CY 73%

Evaluation Awareness in Language Models Has Limited Effect on Behaviour

语言模型中的评估意识对行为影响有限

Amelie Knecht, Lucas Florin, Thilo Hagendorff

机构 * University of Stuttgart(斯图加特大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 研究通过测试不同语言模型和基准测试,发现评估意识(VEA)对模型行为影响有限,注入或移除VEA对答案分布影响较小,提示高VEA率不能简单视为策略性行为或对齐篡改的证据。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20055 2026-05-05 cs.CL cs.AI 73%

VERGE: Formal Refinement and Guidance Engine for Verifiable LLM Reasoning

VERGE:可验证LLM推理的正式细化和指导引擎

Vikash Singh, Darion Cassel, Nathaniel Weir, Nick Feng, Sam Bayless

机构 * Case Western Reserve University(凯斯西储大学) Amazon Web Services(亚马逊网络服务)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 VERGE结合LLM与SMT求解器,通过迭代细化生成验证引导答案。其通过分解LLM输出为原子声明,自动形式化为一阶逻辑,并利用自动定理证明验证逻辑一致性。引入多模型共识、语义路由和精确逻辑错误定位等创新,提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24966 2026-04-30 cs.CY cs.AI 73%

Risk Reporting for Developers' Internal AI Model Use

为开发者内部AI模型使用进行风险报告

Oscar Delaney, Sambhav Maheshwari, Joe O'Brien, Theo Bearman, Oliver Guest

机构 * IAPS

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了前沿AI公司内部部署先进模型的风险管理,提出统一的风险报告标准,帮助开发者和监管机构识别和管理内部AI使用中的潜在风险。

Comments 31 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25067 2026-04-30 cs.MA cs.AI cs.LG 73%

Frontier Coding Agents Can Now Implement an AlphaZero Self-Play Machine Learning Pipeline For Connect Four That Performs Comparably to an External Solver

前沿编码代理如今可以实现一个AlphaZero自博弈机器学习流水线用于连接四游戏,其性能可与外部求解器相媲美

Joshua Sherwood, Ben Aybar, Benjamin Kaplan

机构 * Department of Computer Science(计算机科学系) University of Chicago(芝加哥大学) Independent Researcher(独立研究员)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基准测试,评估前沿编码代理自主实现AlphaZero式机器学习流水线的能力,通过简洁任务描述而非完整前序工作参考,评估连接四游戏AI性能,发现Claude Opus 4.7在七次试验中胜过Pons求解器,其他代理表现欠佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24623 2026-04-28 cs.AI cs.IR cs.LG 73%

XGRAG: A Graph-Native Framework for Explaining KG-based Retrieval-Augmented Generation

XGRAG:一种用于基于知识图谱检索增强生成的图原生解释框架

Zhuoling Li, Ha Linh Hong Tran Nguyen, Valeria Bladinieres, Maxim Romanovsky

机构 * Berlin Technology Centre(柏林技术中心) Deutsche Bank(德意志银行)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 XGRAG通过图基扰动策略生成因果解释,提升GraphRAG系统的可解释性,在多个问答数据集上实现解释质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22893 2026-04-28 cs.LG cs.AI 73%

Utility-Aware Data Pricing: Token-Level Quality and Empirical Training Gain for LLMs

面向效用的数据定价:LLMs的令牌级质量与经验训练增益

Minghui Xu, Qi Luo, Kun Li

机构 * Shandong University(山东大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出动态数据估值框架,通过令牌级信息密度、经验训练增益测量和加密可验证性三层方法,实现LLM能力的效用定价,优于传统行数和令牌数基准。

Comments 23 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22832 2026-04-28 cs.CV cs.AI cs.LG 73%

Intervention-Aware Multiscale Representation Learning from Imaging Phenomics and Perturbation Transcriptomics

基于影像表型和扰动转录组的干预感知多尺度表征学习

Jiayuan Chen, Ruoqi Liu, Zishan Gu, Ping Zhang

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种干预感知蒸馏框架,利用扰动转录组指导图像表征学习,通过基因表达和干预元数据生成化学感知的代码本,提升对未见干预的迁移能力及药物-靶点基因发现。

Comments CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22760 2026-04-28 cs.IR cs.AI cs.CL 73%

Quantifying Divergence in Inter-LLM Communication Through API Retrieval and Ranking

通过API检索和排序量化跨LLM通信中的分歧

Eyhab Al-Masri

机构 * School of Engineering and Technology(工程与技术学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个统一的基准框架,量化在相同任务下不同LLM在API发现和排序上的差异。研究发现结构化任务稳定性较高,而开放性任务分歧显著,结果为多代理系统中可靠性感知的协调提供了依据。

Comments AAAI 2026 Conference (LAMAS Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22143 2026-04-27 cs.CY cs.CL 73%

Recognition Without Authorization: LLMs and the Moral Order of Online Advice

无需授权的识别:大语言模型与在线建议的道德秩序

Tom van Nuenen

机构 * Social Sciences Data Lab(社会科学数据实验室) UC Berkeley(伯克利大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文研究大语言模型在处理日常人际困境时的建议倾向,发现其在识别问题时较少给予行动授权,特别是在社区共识强烈的情况下,模型推荐退出的比例显著低于人类,且保持较高的谨慎和治疗框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19790 2026-04-23 cs.AI cs.LG 73%

Hidden Reliability Risks in Large Language Models: Systematic Identification of Precision-Induced Output Disagreements

大语言模型中的隐藏可靠性风险:系统性识别精度诱导的输出分歧

Yifei Wang, Tianlin Li, Xiaohan Zhang, Xiaoyu Zhang, Wei Ma, Mingfei Cheng, Li Pan

机构 * Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院)

专题命中 安全评测 :alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PrecisionDiff框架,用于系统检测大语言模型在不同精度下的行为分歧,通过生成精度敏感测试输入并进行跨精度比较分析,揭示传统方法难以发现的细微差异,实验表明此类分歧在多个开源对齐LLM中普遍存在,PrecisionDiff在检测此类问题上表现优异。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01770 2026-04-21 cs.CR cs.AI cs.LG cs.SE 73%

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction

ReGA:通过表示引导抽象的基于模型的安全保障方法

Zeming Wei, Chengcan Wu, Meng Sun

机构 * Peking University(北京大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ReGA框架,通过利用安全关键表示缩小模型分析在大规模语言模型中的可扩展性差距,有效区分安全与有害输入,提升LLM安全性。

Comments FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22174 2026-04-17 cs.DC cs.AI cs.AR cs.CR cs.LG 73%

BitFlipScope: Scalable Fault Localization and Recovery for Bit-Flip Corruptions in LLMs

BitFlipScope:面向LLM中位翻故障的可扩展故障定位与恢复

Muhammad Zeeshan Karamat, Sadman Saif, Christiana Chamon Garcia

机构 * Bradly Dept. of ECE(布拉利电子工程系) Virginia Tech(弗吉尼亚理工学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 BitFlipScope通过两种部署场景实现LLM中位翻故障的定位与恢复,利用差分分析和残差路径扰动等方法,支持轻量级性能恢复,提升硬件环境下的模型可靠性。

Comments Accepted at the IEEE International Symposium on Hardware Oriented Security and Trust (HOST) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23636 2026-04-16 cs.LG cs.AI 73%

FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation

FlexGuard: 严格度自适应的连续风险评分用于LLM内容审核

Zhihao Ding, Jinming Li, Ze Lu, Jieming Shi

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FlexGuard,一种基于LLM的连续风险评分系统,通过风险对齐优化提升审核准确性和在不同严格度下的鲁棒性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24857 2026-04-09 cs.CL cs.CY 73%

Between Help and Harm: An Evaluation of Mental Health Crisis Handling by LLMs

在帮助与伤害之间:对LLM处理心理健康危机的评估

Adrian Arnaiz-Rodriguez, Miguel Baidal, Erik Derner, Jenn Layton Annable, Mark Ball, Mark Ince, Elvira Perez Vallejos, Nuria Oliver

机构 * ELLIS Alicante(ELLIS 阿利坎特) CTU in Prague(捷克布拉格理工大学) School of Health Science, The University of Nottingham(诺丁汉大学健康科学学院) School of Psychology, Public Health and Social Care, Derby University(德比大学心理学、公共卫生与社会关怀学院) Mental Health Practitioner, Social Worker & Independent Scholar(心理健康从业者、社会工作者与独立学者) School of Computer Science & School of Medicine, The University of Nottingham(诺丁汉大学计算机科学学院与医学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文评估了LLM在处理心理健康危机时的性能,提出六类危机分类、2252个示例数据集及临床评估协议,发现部分模型在自残和自杀类别中存在不安全输出,强调需加强安全防护和上下文感知能力。

Comments Accepted for publication in JMIR Mental Health. DOI: 10.2196/88435

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03121 2026-03-31 cs.CL cs.AI cs.SY eess.SY 73%

Control Barrier Function for Aligning Large Language Models

用于对齐大语言模型的控制屏障函数

Yuya Miyaoka, Masaki Inoue

机构 * Keio University(庆应义塾大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于控制的框架,利用控制屏障函数确保用户期望的文本生成,通过安全过滤器干预生成文本,无需微调基模型。

Comments This work is an extenede version of arXiv:2408.15625 and has been submitted to the IEEE for possible publication

Journal ref IEEE Transactions on Control Systems Technology 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01187 2026-03-31 cs.CL cs.CY 73%

Surfacing Subtle Stereotypes: A Multilingual, Debate-Oriented Evaluation of Modern LLMs

揭示微妙的刻板印象:一种多语言、辩论导向的现代大语言模型评估

Muhammed Saeed, Muhammad Abdul-mageed, Shady Shehata

机构 * The University of British Columbia(不列颠哥伦比亚大学) University of Waterloo(滑铁卢大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文提出多语言辩论基准测试,揭示生成模型中叙事偏见。通过8400个跨语言辩论提示,评估模型对敏感领域刻板印象的再现,发现所有模型均存在偏见,且低资源语言中偏见更严重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17570 2026-03-19 cs.LG cs.AI 73%

FoMo X: Modular Explainability Signals for Outlier Detection Foundation Models

FoMo X:用于异常检测基础模型的模块化可解释性信号

Simon Klüttermann, Tim Katzke, Phuong Huong Nguyen, Emmanuel Müller

机构 * TU Dortmund University, Dortmund, Germany(图卢兹大学(德累斯顿)) Research Center Trustworthy Data Science and Security, University Alliance Ruhr, Dortmund, Germany(可信数据科学与安全研究中心,鲁尔大学联盟,德累斯顿,德国)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 FoMo-X通过模块化框架为异常检测基础模型提供内在轻量级诊断能力,利用预训练PFN背骨的冻结嵌入编码丰富关系信息,通过附加诊断头实现高效可解释性,实验证明其在合成和真实世界基准上具有高保真度和低推理开销。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06183 2026-03-18 cs.CL cs.AI cs.CV 73%

CRIMSON: A Clinically-Grounded LLM-Based Metric for Generative Radiology Report Evaluation

CRIMSON:一种基于临床的LLM评估指标用于生成放射学报告评估

Mohammed Baharoon, Thibault Heintz, Siavash Raissi, Mahmoud Alabbad, Mona Alhammad, Hassan AlOmaish, Sung Eun Kim, Oishi Banerjee, Pranav Rajpurkar

机构 * Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Department of Radiation Oncology, Mass General Brigham(放射肿瘤科,麻省总医院与布里奇沃特医院) King Fahad Hospital, Al-Ahsa Health Cluster, Al Hofuf, Saudi Arabia(国王法赫德医院,阿尔阿萨卫生集群,阿尔霍夫,沙特阿拉伯) Ras-Tanura General Hospital, Ministry of Health, Eastern Province, Saudi Arabia(拉斯-坦纳医院,卫生部,东部省,沙特阿拉伯) Department of Medical Imaging, King Abdulaziz Medical City, Ministry of National Guard, Riyadh, Saudi Arabia(医学影像科,国王阿卜杜勒-阿齐兹医疗城,国民卫队部,利雅得,沙特阿拉伯)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 CRIMSON是一种基于临床的LLM评估指标,用于评估生成的放射学报告,通过考虑诊断正确性、上下文相关性和患者安全,提供更全面的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16211 2026-03-13 cs.SD cs.AI cs.CL eess.AS 73%

AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models

AudioTrust: 音频大语言模型多维可信度基准测试

Kai Li, Can Shen, Yile Liu, Jirui Han, Kelong Zheng, Xuechao Zou, Lionel Z. Wang, Shun Zhang, Xingjian Du, Hanjun Luo, Yingbin Jin, Xinxin Xing, Ziyang Ma, Yue Liu, Yifan Zhang, Junfeng Fang, Kun Wang, Yibo Yan, Gelei Deng, Haoyang Li, Yiming Li, Xiaobin Zhuang, Tianlong Chen, Qingsong Wen, Tianwei Zhang, Yang Liu, Haibo Hu, Zhizheng Wu, Xiaolin Hu, Eng-Siong Chng, Wenyuan Xu, XiaoFeng Wang, Wei Dong, Xinfeng Li

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 AudioTrust通过多维度评估音频大语言模型的可信度,揭示其在高风险音频场景下的局限性,为安全部署提供关键洞察。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15237 2026-03-10 cs.AI cs.CV cs.LG 73%

MICA: Multi-Agent Industrial Coordination Assistant

MICA:多智能体工业协调助手

Di Wen, Kunyu Peng, Junwei Zheng, Yufan Chen, Yitian Shi, Jiale Wei, Ruiping Liu, Kailun Yang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄大学) INSAIT Hunan University(湖南大学) Carl Zeiss Stiftung(卡尔蔡司基金会) University of Excellence(卓越大学) Helmholtz Association(海德堡协会) State of Baden-Württemberg(巴登-符腾堡州) German Research Foundation(德国研究基金会) National Natural Science Foundation of China(国家自然科学基金委员会) Hunan Provincial Research and Development Project(湖南省研发项目) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 MICA是一种基于感知和语音交互的多智能体系统,通过自适应步骤融合技术提升工业任务的执行效率和可靠性。

Comments Accepted to ICRA 2026. The source code will be made publicly available at https://github.com/Kratos-Wen/MICA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22224 2026-03-03 cs.SE cs.AI cs.LG cs.LO cs.SY eess.SY 73%

Taming Silent Failures: A Framework for Verifiable AI Reliability

驯服沉默故障:一种可验证AI可靠性的框架

Guan-Yan Yang, Farn Wang

机构 * National Taiwan University(台湾大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FAME框架,通过结合离线形式化合成与在线运行时监控,有效检测自动驾驶系统中的安全违规,提供可验证的AI可靠性解决方案。

Comments This preprint has been accepted by IEEE Reliability Magazine. 10 pages, 3 figures

Journal ref IEEE Reliability Magazine ( Volume: 2, Issue: 4, December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12186 2026-03-03 cs.LG cs.AI cs.CR 73%

Self-Destructive Language Model

自我毁灭型语言模型

Yuhui Wang, Rongyi Zhu, Ting Wang

机构 * Department of Computer Science(计算机科学系)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 SEAM是一种通过自我毁灭机制增强大语言模型安全性的新型防御方法,通过使模型在面对有害数据微调时性能急剧下降,从而有效抵御攻击。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08781 2026-02-27 cs.AI cs.CL 73%

Evaluating the Evaluator: Measuring LLMs' Adherence to Task Evaluation Instructions

评估评估者:衡量LLMs对任务评估指令的遵守情况

Bhuvanashree Murugadoss, Christian Poelitz, Ian Drosos, Vu Le, Nick McKenna, Carina Suzana Negreanu, Chris Parnin, Advait Sarkar

专题命中 安全评测 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLMs在任务评估中的表现,发现提示对评估结果影响有限,困惑度有时比提示更符合人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20976 2026-02-25 cs.CL cs.CY 73%

Evaluating Proactive Risk Awareness of Large Language Models

评估大型语言模型的前瞻性风险意识

Xuan Luo, Yubin Chen, Zhiyu Hou, Linpu Yu, Geng Tu, Jing Li, Ruifeng Xu

机构 * The Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong Polytechnic University, Hong Kong(香港理工大学) Southern University of Science and Technology, Shenzhen(南方科技大学) Shenzhen Loop Area Institute, Shenzhen, China(深圳南山区研究院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文提出前瞻性风险意识评估框架,通过Butterfly数据集评估LLMs在生态领域预见潜在危害的能力,发现响应长度限制和多模态保护盲点等问题,强调部署LLM时需加强主动防护。

详情

展开后加载摘要…

URL PDF HTML 收藏