arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-17 至 2026-02-17 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2602.13246 2026-02-17 cs.CY cs.AI 79%

Global AI Bias Audit for Technical Governance

全球人工智能偏见审计用于技术治理

Jason Hung

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文通过全球人工智能数据集对Llama-3 8B模型进行压力测试,揭示了全球南北在人工智能技术知识和信息获取上的显著差距,呼吁更包容的数据表示以促进全球AI治理。

Comments 16 pages, 5 graphs, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14606 2026-02-17 cs.MA cs.AI cs.CE 70%

Towards Selection as Power: Bounding Decision Authority in Autonomous Agents

迈向选择作为权力:自主代理中决策权威的边界

Jose Manuel de la Chica Rodriguez, Juan Manuel Vera Díaz

机构 * AI Lab, Grupo Santander Madrid, Spain(AI实验室,西班牙 Grupo Santander 马德里)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一种治理架构,通过机械机制限制自主代理的选择权,以防止确定性结果并提升可审计性,重新定义治理为受限制的因果权力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14158 2026-02-17 cs.CL cs.AI cs.MA 62%

A Multi-Agent Framework for Medical AI: Leveraging Fine-Tuned GPT, LLaMA, and DeepSeek R1 for Evidence-Based and Bias-Aware Clinical Query Processing

面向医疗AI的多智能体框架:利用微调的GPT、LLaMA和DeepSeek R1进行基于证据和偏见意识的临床查询处理

Naeimeh Nourmohammadi, Md Meem Hossain, The Anh Han, Safina Showkat Ara, Zia Ush Shamszaman

机构 * Department of Computing Games, Teesside University, Middlesbrough, United Kingdom Centre for Digital Innovation, Teesside University, Middlesbrough, United Kingdom Faculty of Business \& Technology, University of Sunderland, Sunderland, United Kingdom

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多智能体框架,利用微调的GPT、LLaMA和DeepSeek R1,结合证据检索和偏见检查,提升医疗问答的可靠性与准确性。

Comments 27 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13253 2026-02-17 cs.CY cs.AI 62%

Implicit Bias in LLMs for Transgender Populations

LLMs对跨性别人群的隐性偏见

Micaela Hirsch, Marina Elichiry, Blas Radi, Tamara Quiroga, David Restrepo, Luciana Benotti, Veronica Xhardez, Jocelyn Dunstan, Enzo Ferrante

机构 * Instituto de Ciencias de la Computación (UBA-CONICET)(计算机科学研究所(UBA-CONICET)) Hospital Dr. Lucio Melendez(Lucio Melendez医院) Universidad de Buenos Aires(布宜诺斯艾利斯大学) Universidad Católica de Chile(智利天主大学) MICS, CentraleSupélec - Université Paris-Saclay(MICS,CentraleSupélec-巴黎萨克雷大学) Universidad Nacional de Córdoba(科迪利亚国家大学) Fundación Vía Libre(自由之路基金会) CIECTI

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本研究揭示了LLMs对跨性别人群的隐性偏见,通过词语关联测试和医疗预约分配任务发现LLMs在多个类别中存在负面关联,并指出需研究以减少LLMs中的刻板印象偏见,确保医疗应用中的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏