arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 144 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 144 篇

2608.02244 2026-08-04 cs.DC cs.SY eess.SY 新提交 71%

Efficiency and Cost Alignment in Batched LLM Serving via Resource-Fair Scheduling

通过资源公平调度实现批量大语言模型(LLM)服务的效率与成本对齐

Dayi Yao, Zijie Zhou

专题命中 AI治理与伦理 :alignment(title)

AI总结 本文针对批量LLM服务中异构请求导致的资源分配低效问题,提出ISJL算法,实现高吞吐量的同时对齐最大驱动批次成本与token计量收入,达到3/4的竞争比下界,平衡了FCFS与LJF的优缺点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03532 2026-08-05 cs.CL 新提交 70%

Cross-Lingual Bias in Large Language Models: A Comparative Analysis of English and Swahili

大语言模型中的跨语言偏见:英语与斯瓦希里语的对比分析

Ruolei Zhang, Teddy Njuguna, Yue Feng

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究通过对比GPT-5.2与Gemini 2.5 Flash在英语和斯瓦希里语上的9类人口统计偏见表现,发现偏见会转变而非转移,仅英语偏见审计无法覆盖多语言部署需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18459 2026-07-22 cs.CY 新提交 70%

Intelligent Cause Prioritisation? An Analysis of AI Policy Priorities and Governance in Africa

智能因果优先级排序?非洲人工智能政策优先级与治理分析

Osaremen Iluobe, Kisso Selvan

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY

AI总结 该研究聚焦非洲人工智能政策,通过分析相关资料发现,非洲各国政府急于借人工智能加速经济转型,虽重视其机遇,却相对忽视人工智能安全。

Comments 21 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30666 2026-07-01 cs.CY 新提交 70%

Reframing AGI Confrontation with Off Earth Autonomy

重构与地外自主性的AGI对抗

Alexey Potapov

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 本文质疑AI安全叙事中关于强大智能体必然寻求权力并与人类对抗的结论,提出存在地外自主性路径时,早期合作可取代对抗,并通过决策理论模型分析激励转变及其治理启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30661 2026-07-01 cs.CY 新提交 70%

Understanding Censorship in Large Language Models: From Mechanisms to Governance

理解大型语言模型中的审查:从机制到治理

Quanyan Zhu

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 本文从社会技术视角审视LLM审查,涵盖数据、对齐、政策、推理时审核及法规,分析其表现形式、测量挑战与治理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11251 2026-08-13 cs.CY cs.AI cs.LG 新提交 67%

Variable Selection in the Context of AI Fairness

AI公平性语境下的变量选择

Ivan Luciano Danesi, Chiara Frigerio, Fabio Maccaferri, Giorgio Alessandro Motta, Pietro Zecca

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文针对AI公平性语境下的变量选择问题,提出将数学方法与伦理、社会意识融合的跨学科方案,主张保留所有潜在相关变量以减少隐含偏差,助力AI系统符合欧盟AI法案要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06112 2026-08-07 cs.AI cs.CL cs.LG cs.MA 新提交 67%

From Siloed Algorithms to Compliance-First Agentic Platforms: A Multi-Layered Architecture for Hospital AI Systems

从孤立算法到合规优先的智能体平台:面向医院AI系统的多层架构

Manideep Dhar, Ritwik Singh, Sharat Chandra Kumar Manikonda

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对医院AI部署孤立、规模化难的问题,提出含智能体编排、合规策略、隐私保护数据层的多层架构,通过原型验证可减少任务耗时与文档工作量,为医院AI平台建设提供实用蓝图。

Comments Peer-reviewed published article

Journal ref IJISRT, 11-2026(5), IJISRT26MAY1651

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28934 2026-08-03 cs.CL cs.AI cs.CY 新提交 67%

FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation

FairFund-Bench:评估大语言模型资源分配中的分配偏差

Martin Lukk

机构 * University of Toronto(多伦多大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 FairFund-Bench基准通过调整审计格式等特征,发现LLM资源分配的偏差受审计类型影响,且因果框架效应强于人口统计效应,可用于评估LLM的分配偏差。

Comments 19 pages, 7 figures. Code and data: https://github.com/martinlukk/fairfund-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07359 2026-07-09 cs.CR 新提交 67%

The AI Resilience Gap: Bringing Artificial Intelligence Inside the Operational Resilience Perimeter

人工智能弹性差距:将人工智能纳入运营弹性范围

Jonathan Shelby

专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract)

AI总结 研究人工智能在受监管公司应用中运营弹性不足问题,提出人工智能弹性框架,通过依赖映射等方法将人工智能依赖纳入运营弹性范围,弥补监管逻辑差距,为相关人员提供可操作路径。

Comments 11 pages, 2 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07612 2026-06-09 cs.CY cs.AI cs.LG 新提交 67%

Position: Anthropomorphic Misalignment Research Needs Stronger Evidence

立场:拟人化错位研究需要更强证据

Vansh Gupta, Peter Nutter, Samuel Stante, Andreas Krause, Florian Tramèr, Lukas Fluri, Xin Chen, Anna Hedström

机构 * University of Cambridge(剑桥大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文指出拟人化错位研究(AMR)在概念模糊、数据不鲁棒、实验设计不足等问题上存在证据薄弱,提出证据层级框架和诊断清单以提升方法论严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20421 2026-08-24 cs.CY cs.AI 新提交 62%

Six misconceptions about large language models: A minimal model and diagnostic taxonomy

大型语言模型的六大误解:一个极简模型与诊断分类法

Zhicheng Lin

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 该研究提出以四组区分为核心的LLM极简模型,诊断六大误解,应用于出版商AI政策案例,为纠正民间理论错误提供诊断工具。

Comments 20 pages, 1 figure, 2 tables, and 2 boxes. Published in PNAS Nexus

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18122 2026-08-20 cs.CY cs.AI 新提交 62%

Global Index on Responsible AI 2026 : Conceptual Framework and Methodology

2026年全球负责任AI指数:概念框架与方法论

Fola Adeleke, Rachel Adams, Ayantola Alayande, Daniela Benavente, Ana Florido, Nicolás Grossman, Leah Junck

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 该研究介绍2026年全球负责任AI指数(GIRAI)第二版的方法论,优化框架维度与指标,经审计验证,用于跨国评估各国负责任AI治理,助力相关主体识别保护成效与差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16893 2026-08-19 cs.CY cs.AI 新提交 62%

A Framework for Using and Evaluating LLMs as Surrogate Experts in Security Surveys: Reliability, Bias, and Implications

在安全调查中使用和评估大语言模型(LLM)作为代理专家的框架:可靠性、偏差及启示

Despoina Giarimpampa, Roland Meier, Tegawendé F. Bissyandé, Vincent Lenders, Jacques Klein

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究提出了评估LLM作为安全调查代理专家的框架,发现LLM虽内部一致但与专家响应存在系统性偏差,可用于试点和假设生成但不能替代专家征询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16891 2026-08-19 cs.AI cs.CE cs.CR cs.CY 新提交 62%

Runtime Governance for Agentic AI: Action-Boundary Control with Trusted Provenance and Fail-Closed Execution

智能体AI的运行时治理:基于可信溯源与故障闭锁执行的行动边界控制

Adam Mazzocchetti

机构 * SPQR Technologies Inc.(SPQR科技公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 该研究提出Aegis运行时治理系统,通过可信决策层调解智能体AI的工具行动提案,在沙堡语料库评估中成功阻止风险提案转化为治理副作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15424 2026-08-18 cs.MA cs.AI cs.LG 新提交 62%

ETHOS: Towards a Modular Ethics Framework for Clinical Multi-Agent Systems

ETHOS:面向临床多智能体系统的模块化伦理框架

Rakesh Sharma, Sydney Pugh, Cameron Beeche, Pankhuri Singhal, Rachel Wu, Margaret Eby, Jeffrey Duda, James Gee, Kyra O'Brien, Hersh Sagreiya, Marina Serper, Victoria Gershuni, Angela Bradbury, Anurag Verma, Eric Eaton, Kevin B. Johnson, Walter Witschey

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 ETHOS是可与现有临床多智能体系统集成的模块化伦理框架,通过分层治理提升决策可靠性,将AI伦理原则转化为可部署的安全保障。

Comments Preprint of an article submitted for consideration in Pacific Symposium on Biocomputing \textcopyright\ 2027 World Scientific Publishing Company. \url{https://psb.stanford.edu/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12166 2026-08-13 cs.CY cs.AI cs.SY eess.SY 新提交 62%

Co-constructing sociotechnical AI governance: participatory system mapping using algorithm registers

协同构建社会技术型AI治理:利用算法登记册的参与式系统映射

Íñigo de Troya, Maurus Enbergs, Neelke Doorn, Roel Dobbe

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文以荷兰某城市算法登记册为案例,通过多利益相关者参与式映射结合STPA分析,揭示登记册的遮蔽性,为多元社会技术型AI治理提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07786 2026-08-11 cs.AI cs.LG 新提交 62%

Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space

谁构建了这个模型?通过权重空间中的光谱指纹追踪大语言模型(LLM)谱系

Yiwei Chen, Bingqi Shang, Sijia Liu

机构 * Michigan State University(密歇根州立大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出几何指纹框架,通过权重空间的光谱能量和子空间对齐分析,实现对110余个开源权重LLM对的谱系区分,为模型溯源提供稳健可解释的信号。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29071 2026-08-03 cs.LG cs.AI 新提交 62%

Federated Foundation Models Fine-Tuning with Heterogeneous Compressed Clients

采用异构压缩客户端的联邦基础模型微调

Shengkun Zhu, Jinshan Zeng, Zhihua Allen-Zhao, Mayi Xu, Quanqing Xu, Wei Ren, Qiang Yang, Yang Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) OceanBase, Ant Group(蚂蚁集团OceanBase) School of Management, Xi’an Jiaotong University(西安交通大学管理学院) School of Mathematics and Statistics, Xidian University(西安电子科技大学数学与统计学院) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, China University of Geosciences(中国地质大学计算机学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对基础模型联邦学习的资源不对称问题,提出FedSLM框架,通过SVD分解等技术实现异构压缩客户端的联邦微调,实验显示其在多基准上优于现有基线且客户端内存需求更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26068 2026-07-30 econ.GN cs.AI cs.CY q-fin.EC 新提交 62%

The Human Utility Factor: A Computable Welfare Metric That Reframes AI Governance as a Constrained Optimisation Problem

人类效用因子:一种可计算的福利度量,将AI治理重新构建为约束优化问题

Sivasathivel Kandasamy

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究提出人类效用因子(HUF)这一可计算福利度量,将AI治理转化为约束优化问题,经多智能体强化学习评估,发现需明确约束再分配以避免高自动化均衡损害社会目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26067 2026-07-30 cs.CY cs.AI 新提交 62%

The Easy Trap: Why LLMs Underestimate Misconception-Driven Difficulty

易陷阱:为何大语言模型低估由误解驱动的难度

Amanda La Hadi, Muhammad Johan Alibasa, Guanliang Chen, A. Taufiq Asyhari

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 该研究发现,用于教育评估难度估计的LLM会系统性低估由学习者误解驱动的数学题难度,提出“易陷阱”现象,其仅能捕捉难度大致排序,无法反映学生实际认知难度。

Comments This paper poster presented on 19th Educational Data Mining Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24391 2026-07-28 cs.CY cs.AI 新提交 62%

Regulating for AI Legitimacy

规范人工智能的合法性

Gilad Abiri

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 研究人工智能治理中合法性这一自主监管目标,指出其与对齐不同。分析人工智能合法性在透明度、私人权力和行政自动化方面的问题,探讨法律作用并提出整合、熟悉度、争议三个原则以解决相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21063 2026-07-24 cs.CL cs.CY cs.HC 新提交 62%

QuantiBias: Benchmarking Quantization-Induced Bias in LLMs

QuantiBias:量化大语言模型中量化诱导偏差的基准测试

Emilio Ferrara

机构 * University of Southern California(南加州大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.CY

AI总结 研究大语言模型量化中的偏差问题,提出QuantiBias基准测试,通过结合多种控制和对比有无推理的构建来评估偏差,发现量化器按无偏差预防信号的数据分配精度,推理对部分偏差有减半效果,强调需重新评估量化模型的开放式偏差。

Comments Benchmark protocol on Hugging Face: https://huggingface.co/datasets/emilioferrara/quantibias

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16130 2026-07-20 cs.CY cs.AI cs.SY eess.SY 新提交 62%

A Methodology for Auditable Trustworthiness Levels in AI Lifecycle Governance

人工智能生命周期治理中可审计可信度水平的一种方法

Andrea Ferrario

机构 * Institute of Biomedical Ethics and History of Medicine, University of Zürich(生物医学伦理与医学史研究所,苏黎世大学) SUPSI, Dalle Molle Institute for Artificial Intelligence (IDSIA)(SUPSI人工智能研究所) ETH Zürich(苏黎世联邦理工学院)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 研究人工智能治理中系统可信度判断问题,提出轻量级方法,含形式框架与治理程序两部分,用决策树建模,能产生可信度平台等,通过合成轨迹说明方法可支持合规文档编制和生命周期监测。

Comments 32 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15282 2026-07-20 cs.HC cs.AI cs.CL 新提交 62%

Empathy as Predictive Misalignment Tolerance: A Co-Regulation Framework and the Regime Structure of Dialogue Repair

作为预测性偏差容忍度的同理心:一个协同调节框架和对话修复的机制结构

Molood Arman

机构 * Independent Researcher(独立研究者)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究将同理心重新定义为预测性偏差容忍度,提出解释性错误容忍(IET)框架,通过两个计算探针评估。结果发现修复存在依赖机制的结构,揭示噪声水平等因素间相互作用,表明长时间互动中同理心是调节分歧动态,促使共情AI设计转向管理解释距离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14353 2026-07-17 cs.CY cs.AI cs.SY eess.SY 新提交 62%

Unsafe at any AUC: Unlearned Lessons from Sociotechnical Disasters for Responsible AI

在任何AUC下都不安全:从社会技术灾难中汲取的关于负责任人工智能的未吸取教训

Joshua A. Kroll, Andrew Smart, R. Stuart Geiger, Abigail Z. Jacobs

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究从切尔诺贝利等社会技术灾难中汲取未吸取的教训,探讨其对人工智能的启示,指出人工智能开发和使用可在组织风险处理、需求责任追溯及整体安全方法等方面受益,以避免类似灾难在现代系统中重演。

Comments Accepted to the Harvard Data Science Review, Volume 8(3), Summer 2026

Journal ref Harvard Data Science Review, Volume 8(3), Summer 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14309 2026-07-17 cs.AI cs.CY 新提交 62%

Traccia: An OpenTelemetry-Based Governance Platform for AI Systems

Traccia:一个基于OpenTelemetry的人工智能系统治理平台

Nutan Kumar Naik, Aditya Kumar Saroj, Vijay Prasad Poudel, Saurav Samantray, Abhishek Patel

机构 * National Institute of Technology Rourkela(鲁尔基国立技术学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 研究针对大语言模型和人工智能驱动智能体发展带来的软件治理问题,提出基于OpenTelemetry构建多层次人工智能治理堆栈Traccia,通过添加遥测数据等解决对齐问题,自动创建合规证据包,为企业管理自主人工智能系统创建机器可读基础。

Comments 26 pages, 2 figures, 3 tables, Declaration of generative AI and AI-assisted technologies in the writing process, Declaration of competing interest

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09749 2026-07-14 eess.SP cs.AI cs.LG 新提交 62%

MorphologyFM: A Foundation Model for Morphology-Aware Representation Learning from ECG and Pulse Oximetry Waveforms

MorphologyFM:一种用于从心电图和脉搏血氧波形中进行形态感知表示学习的基础模型

Saiyang Feng, Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究针对现有生理波形方法未保留临床意义波形形态的问题,提出多模态基础模型MorphologyFM,通过形态感知自监督学习目标预训练,结合多种技术学习相关表示,在多下游任务中表现优于其他方法,证明联合建模更具可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06269 2026-07-10 cs.AI cs.CL 新提交 62%

From Application-Layer Simulation to Native Meta-Architecture: Structural Tension as an Endogenous Driver for Heterogeneous AI Evolution

从应用层模拟到原生元架构:结构张力作为异构人工智能进化的内生驱动因素

Heting Mao

机构 * Shanghai Lixin University of Accounting and Finance(上海立信会计金融大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型无状态需应用层模拟的问题,提出理论框架,引入结构张力、离线循环回路、推理时可塑性三种机制,使模型实例能演化出不同拓扑结构,构成异构智能生态,重新定位治理为架构智能主要标准。

Comments 17 pages, 1 equation, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05163 2026-07-07 cs.CY cs.AI 新提交 62%

Open Problems in AI Incident Governance

AI事件治理中的开放问题

Harleen Kaur Sidhu, Rebecca Scholefield, Nour Annan, Kevin Hernandez, Isabel Nieh Hou, Abdulrahman Alshaikhi, Ze Shen Chin, Rokas Gipiškis

机构 * Independent(独立) Sorbonne University(索邦大学) Rice University(里奇大学) Columbia University(哥伦比亚大学) AI Standards Lab(人工智能标准实验室) Vilnius University(维尔纽斯大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 针对部署后AI系统的未预期故障,该研究梳理现有AI事件治理框架,发现其在定义、分类等方面缺乏一致性,为后续相关规范完善提供参考。

Comments Accepted to ICML Technical AI Governance Research workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03510 2026-07-07 cs.SE cs.AI cs.CY 新提交 62%

CAGE-1: Control, Assurance, and Governance Evaluation for Enterprise Agentic AI

CAGE-1:企业智能代理人工智能的控制、保证和治理评估

Roopam W. Sure

机构 * Independent technical report(独立技术报告)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究企业人工智能从实验转向运营工作流带来的评估问题,介绍CAGE-1评估框架,评估多方面内容,引入预绑定保证,用于判断企业代理是否可部署。

Comments 17 pages, 3 figures; independent technical report

详情

展开后加载摘要…

URL PDF HTML 收藏