arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2608.20345 2026-08-24 cs.CL cs.AI cs.CY 新提交 82%

When Vocabulary Comprehension Fails Clinical Reasoning: Evaluating Therapy Bots' Safety Risks for Generation Alpha

当词汇理解失效于临床推理:评估面向阿尔法世代(Gen Alpha,2010-2024年出生)的治疗机器人的安全风险

Manisha Mehta, Virendra Mehta

机构 * Lynbrook High School(林布鲁克高中) University of Trento(特伦托大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究构建两个基准评估Claude、GPT-4o等LLM的治疗机器人安全风险,发现其存在10-14个百分点的词汇理解与临床风险校准差距,识别六种失败模式,提出四项监管与技术改进建议。

Comments 42 pages, 6 figures. Accepted at ACM FAccT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09471 2026-08-21 cs.CV 版本更新 82%

CKAA: Cross-subspace Knowledge Alignment and Aggregation for Robust Continual Learning

CKAA:用于鲁棒持续学习的跨子空间知识对齐与聚合

Lingfeng He, De Cheng, Zhiheng Ma, Huaijie Wang, Dingwen Zhang, Nannan Wang, Xinbo Gao

机构 * School of Telecommunications Engineering, Xidian University(西安电子科技大学电信工程学院) School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) SUAT-Faculty of Computational Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术大学SUAT计算微电子学院) Brain and Artificial Intelligence Laboratory, Northwestern Polytechnical University(西北工业大学脑与人工智能实验室)

专题命中 安全评测 :alignment(title,abstract)

AI总结 该研究针对基于PEFT的持续学习方法在误导性任务ID下决策模糊的问题,提出CKAA框架,通过DKA和TC-MoA两项创新提升鲁棒性,实验显示其性能优于同类方法。

Comments Accepted by IEEE Transactions on Image Processing (TIP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10796 2026-08-12 cs.CV 新提交 82%

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准

Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

专题命中 安全评测 :alignment(title,abstract)

AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28969 2026-08-12 cs.CV 版本更新 82%

SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs

SafeNexus:在多模态大语言模型(MLLMs)中发现与调控模态通用安全神经元

Jian Yu, Fei Shen, Cong Wang, Jian Wang, Lu Jin, Xiaoyu Du, Jinhui Tang, Tat-Seng Chua

专题命中 安全评测 :safety(title,abstract);alignment(abstract)

AI总结 SafeNexus是一种跨模态安全对齐框架,通过定位并调控模态通用安全神经元,提升多模态大语言模型在跨模态威胁下的安全性,且能保留模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08485 2026-08-11 cs.AI cs.CL cs.LG 新提交 82%

HoloAegis: Frozen Representation, Topological Inference: Minimally Parametric Safety Manifolds for Zero-Shot LLM Guardrails

HoloAegis:冻结表示、拓扑推理:用于零样本大语言模型(LLM)护栏的最小参数安全流形

Tak Ho Alex Li, Kaijie Liu, Lik-Hang Lee, Kin Chung Ho, Ping Shum, Michael K. Ng

机构 * Hong Kong Baptist University(香港浸会大学) Guangdong Polytechnic Normal University(广东技术师范大学) Guangdong Institute of Digital Industry(广东数字产业研究院) The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学) Southern University of Science and Technology(南方科技大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HoloAegis是一种最小参数拓扑推理框架,通过冻结语义表示的纯几何推理实现零样本LLM安全护栏,在8个基准测试中达到最先进准确率,兼具低延迟、零冷启动数据和跨语言迁移能力。

Comments Preprint, August 2026. 10 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08044 2026-08-05 cs.LG cs.AI cs.CL 版本更新 82%

When Behavioral Safety Evaluation Fails: A Representation-Level Perspective

当行为安全评估失败时:表征层面的视角

Enyi Jiang, Anders Gjølbye, Yibo Jacky Zhang, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Technical University of Denmark(丹麦技术大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出行为安全与干预鲁棒性之间的“审计差距”,通过构建解离模型和引入潜在脆弱性评分(LVS),证明行为安全指标不足以衡量表征层面的鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29199 2026-08-03 cs.CR 新提交 82%

Alignment Is Local: A Paired Diagnostic for GUI Agents under User-Side Persuasion

对齐是局部的:用户侧说服下GUI智能体的配对诊断

Haoxin An, Yunpeng Song, Zihao Bai, Zhongmin Cai, Guojun Xiong, Chenhao Lin, Wentao Chen, Feng Wei, Chao Shen

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract)

AI总结 本文通过配对诊断发现GUI智能体的提示级对齐是局部现象,一行防护栏可大幅降低单次ASR,但四轮升级链会使其防护效果下降,静态单轮ASR高估了实际部署的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26518 2026-07-31 cs.CV 版本更新 82%

EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding

EgoSafe:用于视觉安全理解的第一人称移动采集基准

Yuyun Chen, Tianao Li, TianQuan Feng, Cen Chen, Huiping Zhuang, Hao Peng, Ziqian Zeng

机构 * South China University of Technology(华南理工大学) Beihang University(北京航空航天大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract)

AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21134 2026-07-28 cs.CL cs.CY cs.LG 版本更新 82%

TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law

TRIDENT:评估金融、医学和法律领域大语言模型的安全性

Zheng Hui, Yijiang River Dong, Ehsan Shareghi, Nigel Collier

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 研究针对大语言模型在金融、医学和法律领域的安全评估问题,基于相关伦理准则定义安全原则并引入Trident-Bench基准进行评估,揭示了不同模型的安全差距,为LLM安全研究提供了系统资源和研究基础。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20485 2026-07-24 cs.AI cs.CL cs.LG 新提交 82%

Expectation Alignment of Language Models for Real-World User Expectations

语言模型与现实世界用户期望的期望对齐

Miaomiao Li, Yang Wang, Bin Liang, Shudong Liu, Zhiwei Zhang, Kam-Fai Wong

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究LLMs是否满足用户期望,提出提取期望程序并引入ExpectBench基准,分析发现LLMs存在问题,进而提出LENS框架,可让模型内化期望以生成更契合的响应,凸显明确建模用户期望对实现现实人机对齐的重要性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16127 2026-07-20 cs.CL cs.AI cs.LG 版本更新 82%

AuAu: A Benchmark for Auditing Authoritarian Alignment in Large Language Models

AuAu: 大型语言模型中威权对齐审计基准

Andreas Einwiller, Max Klabunde, Florian Lemmerich

机构 * University of Zurich(苏黎世大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AuAu基准,结合心理测量、情境行为测试和用户提示评估LLM的威权倾向,发现17个模型均存在显著威权响应,且系统提示可操纵多数模型。

Comments v2, 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15202 2026-06-16 cs.CV 新提交 82%

Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments

安全相关环境中的人类注视与视觉语言模型注意力的比较

Marta Vallejo, Siwen Wang

机构 * Heriot-Watt University(赫瑞-瓦特大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract)

AI总结 本研究通过眼动追踪实验和GPT-4o等视觉语言模型,比较了人类与模型在安全相关场景中的注意力分布,发现模型无需训练数据即可近似人类注视模式。

Comments 30 pages, 33 figures. Submitted as a preprint. Code and data available upon reasonable request

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17552 2026-06-15 eess.SY cs.SY 版本更新 82%

TRUST-UP: Trustworthy Reinforcement learning Using Safe Techniques for UAV Pursuit

TRUST-UP:使用安全技术的可信强化学习用于无人机追踪

Yaosheng Deng, Mengtao Lyu, Junjie Gao, Jiaping Xiao, Mir Feroskhan

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract)

AI总结 提出TRUST-UP算法,通过控制障碍函数安全滤波和切换策略,实现无人机在拥挤城市环境中的安全自主追踪,满足航空认证的可信需求。

Comments Accepted manuscript. Accepted for publication in Advanced Engineering Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13379 2026-06-12 cs.CR cs.AI cs.CL cs.LG cs.SE 版本更新 82%

Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents

多轮交互中的安全隐患:工具使用智能体的多轮安全风险基准与防御

Xu Li, Simon Yu, Minzhou Pan, Yiyou Sun, Bo Li, Dawn Song, Xue Lin, Weiyan Shi

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出多轮工具使用安全基准MT-AgentRisk,发现多轮设置下攻击成功率平均增加16%,并设计无训练、与工具无关的自探索防御方法ToolShield,平均降低30%攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11201 2026-06-11 cs.LG cs.AI cs.CL 新提交 82%

To Intervene or Not: Guiding Inference-time Alignment with Probabilistic Model Blending

干预还是不干预:通过概率模型混合指导推理时对齐

Jin Gan, Xin Li, Jun Luo

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BlendIn框架,通过质量感知对齐和按可靠性加权混合模型知识,解决推理时对齐中指导有效性差异大的问题,在困难模型对上实现最高50%的性能提升。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18905 2026-06-08 cs.LG cs.AI cs.CL 版本更新 82%

TRUE: A Trustworthy Unified Explanation Framework for Large Language Model Reasoning

TRUE:一种用于大语言模型推理的可信统一解释框架

Yujiao Yang

机构 * Dalian University of Technology(大连理工大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TRUE框架,通过可执行推理验证、可行域DAG建模和因果故障模式分析,为LLM推理提供实例级、局部结构级和类别级的多层次可验证解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20158 2026-06-05 cs.CV 82%

Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMs

在安全对齐的连续视觉指令微调中实现和谐参数适应

Ziqi Wang, Chang Che, Qi Wang, Hui Ma, Zenglin Shi, Cees G. M. Snoek, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract)

AI总结 本文研究了在安全对齐的连续视觉指令微调中如何平衡安全性和任务性能,提出了一种名为和谐参数适应(HPA)的后训练框架,通过参数分区、平衡选择和正交调整来缓解遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06310 2026-06-04 cs.SE 82%

Trustworthy AI Software Engineers

可信赖的AI软件工程师

Aldeida Aleti, Baishakhi Ray, Rashina Hoda, Simin Chen

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract)

AI总结 本文探讨AI代理作为软件工程师的信任问题,提出以证据为中心的检查方法,从技术质量、透明度、认知谦逊和社会伦理等维度定义可信赖性。

Comments The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22396 2026-06-04 cs.CL cs.AI cs.CY cs.HC physics.soc-ph 82%

Culturally Grounded Personas in Large Language Models: Characterization and Alignment with Socio-Psychological Value Frameworks

大型语言模型中的文化基础人物角色:与社会心理价值框架的表征与对齐

Candida M. Greco, Lucio La Cava, Andrea Tagarelli

机构 * DIMES, University of Calabria, Italy(意大利卡拉布里亚大学DIMES研究所)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究通过世界价值观调查、英格尔哈特-韦尔策尔文化地图和道德基础理论,评估大型语言模型生成的文化基础人物角色是否准确反映不同文化条件下的世界和道德价值体系,并分析其跨文化结构和道德变异。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31021 2026-06-01 cs.AI cs.CL cs.LG 82%

A Persona-Based Evaluation Framework for Pluralistic Alignment in Generative AI

基于人格的生成式AI多元对齐评估框架

Atahan Karagoz

机构 * Atahan Karagöz(阿塔汗·卡拉戈兹)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种状态空间约束仿真框架,通过合成认知轮廓替代单一评估函数,实现反映真实世界共识变异性的多元、视角依赖的基准测试,并分析仿真评估者的稳定性问题,论证动态调节机制的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27402 2026-05-28 cs.CY cs.AI cs.CL 82%

REC-CBM: Rubric-Aware Error-Correction Concept Bottleneck Models for Trustworthy Open-Ended Grading

REC-CBM:面向可信开放评分的基于规则感知的错误修正概念瓶颈模型

Chengshuai Zhao, Fan Zhang, Kumar Satvik Chaudhary, Yiwen Li, Lo Pang-Yun Ting, Ying-Chih Chen, Huan Liu

机构 * School of Computing and Augmented Intelligence, Arizona State University, USA(计算与增强智能学院,亚利桑那州立大学,美国) Mary Lou Fulton Teachers College, Arizona State University, USA(玛丽·卢·福洛顿教师学院,亚利桑那州立大学,美国) Department of Computer Science, National Yang Ming Chiao Tung University, TW(国立阳明交通大学计算机科学系,台湾)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出REC-CBM模型,通过规则感知概念编码器、序数成对校准目标和潜在概念错误修正模块,解决开放评分中标准概念瓶颈模型无法建模细粒度规则维度、忽略评分序数语义和概念标注不可靠的问题,在提升评分性能的同时保持可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23024 2026-05-25 cs.AI cs.CC cs.CL cs.LG 82%

The Deterministic Horizon: Impossibility Results as Design Specifications for Trustworthy AI Systems

确定性视界:作为可信AI系统设计规范的不可行性结果

Dongxin Guo

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过证明架构决定的准确率上限、偏好学习的样本复杂度跳跃、多阶段检索的指标数量要求等16个不可行性结果,将计算极限转化为可信AI系统的设计规范。

Comments PhD thesis, Department of Computer Science, The University of Hong Kong, 2026. 271 pages, 18 figures, 15 tables, 5 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20241 2026-05-21 cs.LG cs.AI cs.CL 82%

Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry

Geometry-Lite: 通过层间边际几何进行可解释的安全探测

Woo Seob Sim, Yu Rang Park

机构 * Yonsei University(延世大学) Yonsei University College of Medicine(延世大学医学院) Department Biomedical Systems Informatics(生物医学系统信息学部门)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大语言模型在提示级别上的安全探测问题,提出了一种名为Geometry-Lite的紧凑探测器,通过层间边际几何分析来提高安全检测的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08277 2026-05-21 q-bio.NC cs.AI cs.CL cs.CV cs.LG 82%

Task-conditioned probing of instruction-tuned multimodal LLMs: Region-specific brain alignment patterns under naturalistic stimuli

基于任务的指令调制多模态大语言模型探测:在自然主义刺激下的区域特定大脑对齐模式

Subba Reddy Oota, Khushbu Pahwa, Prachi Jindal, Satya Sai Srinath Namburi, Maneesh Singh, Tanmoy Chakraborty, Bapi S. Raju, Manish Gupta

机构 * Technische Universität Berlin(柏林技术大学) Rice University(Rice 大学) AWS AI Labs, Amazon(Amazon 人工智能实验室) IIT Delhi(德里理工学院) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) Spector Inc(Spector 公司) IIIT-Hyderabad(海得拉巴理工学院) Microsoft(微软)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了指令调制多模态大语言模型在自然主义刺激下的大脑对齐模式,通过比较不同模型在视频和音频任务中的表现,揭示了指令调制对模型表示能力的影响。

Comments 57 pages, 39 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15168 2026-05-15 cs.CL cs.AI cs.LG stat.ML 82%

Text Knows What, Tables Know When: Clinical Timeline Reconstruction via Retrieval-Augmented Multimodal Alignment

文本知晓什么,表格知晓何时:通过检索增强的多模态对齐进行临床时间线重建

Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim, Jeremy C. Weiss

机构 * National Library of Medicine National Institutes of Health(国家医学图书馆国立卫生研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种检索增强的多模态对齐框架,通过结合文本和结构化EHR数据,提高临床时间线的精确度,提升时间一致性,同时保持事件匹配率。

Comments Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim (authors contributed equally)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14034 2026-05-15 cs.AI cs.CL cs.CY 82%

From Descriptive to Prescriptive: Uncover the Social Value Alignment of LLM-based Agents

从描述性到规范性:揭示基于大语言模型的智能体的社会价值对齐

Jinxian Qu, Qingqing Gu, Teng Chen, Luo Ji

机构 * Geely AI Lab(Geely人工智能实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出基于价值的框架,利用GraphRAG将原则转化为价值指令,通过检索合适指令引导智能体行为,基于马斯洛需求层次和普鲁奇克情感轮理论评估预期行为,实验显示在DAILYDILEMMAS基准上优于基线方法。

Comments Accepted by CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13709 2026-05-14 cs.CL cs.AI cs.LG 82%

Children's English Reading Story Generation via Supervised Fine-Tuning of Compact LLMs with Controllable Difficulty and Safety

通过监督微调紧凑LLMs实现儿童英语阅读故事生成:具有可控难度和安全性的方法

Qian Shen, Fanghua Cao, Min Yao, Shlok Gilda, Bonnie J. Dorr, Walter L. Leite

机构 * University of Florida(佛罗里达大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过监督微调紧凑LLMs生成儿童英语阅读故事,实现可控难度和安全性,实验表明微调模型在难度指标上优于零样本模型。

Comments Comments: 15 pages, 4 figures. Author Two and Author Three contributed equally. Accepted by the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026), ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09119 2026-05-12 cs.LG cs.AI cs.CL 82%

Personalized Alignment Revisited: The Necessity and Sufficiency of User Diversity

个性化对齐再审视:用户多样性必要性和充分性

Enoch Hyunwook Kang

机构 * Foster School of Business, University of Washington, Seattle, Washington, USA(华盛顿大学福斯特商学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了个性化对齐的理论条件,证明用户多样性是实现高效个性化识别的关键,提出用户多样性条件决定在线 regrets 和离线样本复杂度的最优速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08198 2026-05-12 cs.LG cs.AI cs.CY 82%

FairHealth: An Open-Source Python Library for Trustworthy Healthcare AI in Low-Resource Settings

FairHealth: 一个用于低资源环境可信医疗AI的开源Python库

Farjana Yesmin

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 FairHealth通过整合公平性审计、隐私保护联邦学习、可解释性工具等模块,解决低资源医疗AI工具包的关键缺口,提升全球南医疗数据的可信度与公平性。

Comments 8 pages, open-source Python library

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06652 2026-05-08 cs.LG cs.AI cs.CL 82%

When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels

在没有基准的情况下:在无标签的情况下验证比较LLM安全性评分

Sushant Gautam, Finn Schwall, Annika Willoch Olstad, Fernando Vallecillos Ruiz, Birk Torpmann-Hagen, Sunniva Maria Stordal Bjørklund, Leon Moonen, Klas Pettersen, Michael A. Riegler

机构 * Simula Metropolitan Center for Digital Engineering(Simula 数字工程中心) Oslo Metropolitan University(奥斯陆 Metropolitan 大学) University of Oslo(奥斯陆大学) Simula Research Laboratory(Simula 研究实验室) Norwegian Directorate of Health(挪威健康 Directorate)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出在无标签情况下验证LLM安全性的方法,通过构建仪器有效性链来替代真实标签,通过实验验证其有效性,并展示了在不同场景下的应用和结果。

Comments SimpleAudit Repository: https://github.com/kelkalot/simpleaudit

详情

展开后加载摘要…

URL PDF HTML 收藏