arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 74 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 74 篇

2603.24742 2026-08-04 cs.AI cs.LG cs.MA nlin.AO 版本更新 62%

Trust or Check? Understanding the (Evolutionary) Dynamics of User Trust in AI Systems

信任作为监控:用户信任与AI开发者行为的进化动态

Adeela Bashir, Zhao Song, Ndidi Bianca Ogbo, Nataliya Balabanova, Martin Smit, Chin-wing Leung, Paolo Bova, Manuel Chica Serrano, Dhanushka Dissanayake, Manh Hong Duong, Elias Fernandez Domingos, Nikita Huber-Kralj, Marcus Krellner, Andrew Powell, Stefan Sarkadi, Fernando P. Santos, Zia Ush Shamszaman, Chaimaa Tarzi, Paolo Turrini, Grace Ibukunoluwa Ufeoshi, Victor A. Vargas-Perez, Alessandro Di Stefano, Simon T. Powers, The Anh Han

机构 * School Computing, Engineering and Digital Technologies, Teesside University(特塞斯大学计算、工程和数字技术学院) School of Mathematics, University of Birmingham(伯明翰大学数学学院) Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学院) Department of Computer Science, University of Warwick(沃里克大学计算机科学系) Department of Computer Science and Artificial Intelligence (DECSAI) and Andalusian Research Institute DaSCI “Data Science and Computational Intelligence”, University of Granada, Spain(格拉纳达大学计算机科学与人工智能系(DECSAI)和安达卢西亚数据科学与计算智能研究所) Machine Learning Group, Université libre de Bruxelles(布鲁塞尔自由大学机器学习组) AI Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学人工智能实验室) University of Technology Dresden(德累斯顿技术大学) School of Engineering and Physical Sciences, University of Lincoln(林肯大学工程与物理科学学院) Division of Computing Science and Mathematics, University of Stirling(斯特灵大学计算科学与数学系)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究用户信任与AI开发者行为的进化动态,通过进化博弈论分析不同监控成本和制度下信任策略的演变,发现只有安全且广泛采纳的系统是理想结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08951 2026-07-27 cs.AI cs.CY 版本更新 62%

Analyzing the Ethical Logic of Eight Large Language Models

分析八个大语言模型的伦理逻辑

W. Russell Neuman, Chad Coleman, Manan Shah

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 研究分析OpenAI等八个大语言模型的伦理逻辑,通过让模型回答伦理原则问题和道德困境,用多种理论分析其回答,发现模型伦理判断趋同但在做决定意愿等方面有差异,还能增进对人工智能工作及增强人类伦理行为的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11997 2026-07-16 cs.LG cs.AI stat.ML 版本更新 62%

Are we Merging the Right Models? Impact of Expert Training Duration on Model Merging for LLMs

我们合并的模型正确吗?专家训练时长对大语言模型模型合并的影响

Nikita Kozodoi, Zainab Afolabi, Jack Butler

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究领域专家训练时长对大语言模型模型合并质量的影响,在多领域多模型规模上微调专家模型,保存不同训练步数的检查点并评估五种合并方法,发现方法依赖模式,表明训练时长和合并方法应联合选择。

Comments Accepted to ICML 2026 workshop on weight-space symmetries

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13241 2026-07-13 cs.CY cs.AI cs.HC 版本更新 62%

Empowering 9-1-1 Calltaking Training with Generative AI: Experiences and Lessons Learned

赋能 9-1-1 接警培训:生成式 AI 的经验与教训

Zirong Chen, Meiyi Ma

机构 * College of Connected Computing(连接计算学院) Vanderbilt University(范德比大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 针对紧急接警员培训危机,本文与 Metro Nashville 合作,设计并部署了基于生成式 AI 的培训系统,通过 1120 次培训会话和 98429 次用户交互日志分析,提炼出四个关键教训及相应设计治理实践。

Comments Accepted at IEEE SmartComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03211 2026-06-17 cs.CY cs.AI 版本更新 62%

Retrofitters, pragmatists and activists: Public interest litigation for accountable automated decision-making

改造者、实用主义者和活动家:为可问责的自动化决策而进行的公益诉讼

Henry Fraser, Zahra Stardust

机构 * Queensland University of Technology, School of Law(昆士兰理工大学法学院) Centre for Automated Decision-Making and Society(自动化决策与社会研究中心) Queensland University of Technology, School of Communication(昆士兰理工大学传播学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨公益诉讼在澳大利亚促进AI和自动化决策问责中的作用,基于访谈分析策略与局限,强调制度安排对有效诉讼的关键性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06412 2026-08-20 cs.CY 版本更新 57%

Brokerage in the Black Box: Swing States, Strategic Ambiguity, and the Global Politics of AI Governance

黑箱中的中介作用: swing州、战略模糊性与人工智能治理的全球政治

Ha-Chi Tran

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本研究探讨了技术swing州如何通过战略模糊性和制度透明性互动,调解大国技术竞争,影响全球人工智能治理的制度设计与政策结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15770 2026-08-12 cs.CV cs.LG 版本更新 57%

Concept Labels Are Not Enough: Rethinking Concept Bottleneck Models through Representation Integrity

通过解耦概念瓶颈缓解多媒体识别中的虚假背景偏差

Gaoxiang Huang, Songning Lai, Yutao Yue

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出轻量解耦概念瓶颈模型LDCBM,通过滤波分组损失和联合概念监督提升视觉模式与概念的对齐,实验证明其在概念和分类准确率上优于现有CBMs,且计算复杂度更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20255 2026-08-10 cs.CR cs.AI 版本更新 57%

The Ethics of Autonomous AI Agents for Offensive Security

用于进攻性安全的自主人工智能代理的伦理问题

Andreas Happe, Jürgen Cito, Jasmin Wachter

机构 * TU Wien(维也纳技术大学) University of Klagenfurt(克雷格福大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究使用自主人工智能代理进行进攻性安全时的伦理问题,分析道德归因在多方的扩散及技术对利益相关者的影响,通过研究其不确定性等特性及攻防成本不对称性,为现有框架不适用于此情况提供分层建议。

Comments accepted at FAIEMA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06945 2026-08-03 cs.LG cond-mat.dis-nn physics.data-an quant-ph 版本更新 57%

Fisher Information, Training and Bias in Fourier Regression Models

傅里叶回归模型中的费舍尔信息、训练与偏差

Lorenzo Pastori, Veronika Eyring, Mierk Schwabe

机构 * Deutsches Zentrum für Luft- und Raumfahrt (DLR), Institut für Physik der Atmosphäre(德国航空航天中心(DLR)大气物理研究所) Institute of Environmental Physics (IUP), University of Bremen(环境物理学研究所(IUP),不莱梅大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 该研究利用量子神经网络与傅里叶模型的等价性,推导傅里叶模型的费舍尔信息矩阵,分析有效维度与任务偏差对模型训练和性能的影响,还引入傅里叶模型的张量网络表示,为机器学习研究提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27744 2026-07-31 cs.AI 版本更新 57%

A Policy-Driven Runtime Layer for Agentic LLM Serving

一种面向智能体LLM服务的策略驱动运行时层

Rui Zhang, Chaeeun Kim, Liting Hu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 针对多智能体LLM系统中跨层策略难以高效实现的问题,提出在框架与引擎之间插入智能体运行时层,通过四个原语支持任意智能体感知策略,并在KV缓存策略CacheSage上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18687 2026-07-31 econ.GN cs.AI cs.GT q-fin.EC 版本更新 57%

When Do AI Gains Become Broadly Shareable? A Policy Threshold for AI-Driven Automation

为AI自动化经济中的租金资助型全民基本收入设定AI能力阈值

Aran Nayebi

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 该研究为AI自动化经济中通过AI能力阈值可持续资助UBI提供了闭式条件,并探讨了政策工具和市场结构对阈值的影响。

Comments 15 pages, 3 figures. To appear in AI, Ethics, and Society (AIES) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14480 2026-07-22 cs.CL 版本更新 57%

Lower-Resource, Higher Scores: Language Bias in LLM Evaluators

语言模型评估器在不同语言间存在偏差

Ej Zhou, Lucas Resck, Zheng Hui, Anna Korhonen

机构 * University of Cambridge(剑桥大学) Language Technology Lab(语言技术实验室)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 研究发现语言模型评估器在多语言环境中存在偏差,不同语言评分差异显著,与语言资源水平相关,成对准确率无法检测到这些偏差,还探究了资源少的语言得分高的原因,揭示了语言层面的结构错位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14782 2026-07-21 cs.AI 版本更新 57%

Global Index on Responsible AI: 2026 Report

《负责任人工智能全球指数:2026年报告》

Rachel Adams, Fola Adeleke, Ayantola Alayande, Selamawit Engida Abdella, Ana Florido, Nicolás Grossman, Leah Junck

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 该报告基于人权框架,通过多维度评估和大量数据收集,对各国负责任人工智能治理情况进行排名。发现治理虽在扩展,但转化为实际保护不足,尤其在算法公开等方面有欠缺,强调治理需向可执行保护等方向转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08601 2026-07-21 cs.CL 版本更新 57%

It Takes a MAESTRO To Prune Bad Experts

需要一位大师来修剪不良专家

Palaash Goel, Ayush Maheshwari, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) NVIDIA(英伟达)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 研究针对稀疏激活的MoE语言模型部署瓶颈问题,提出MAESTRO结构化剪枝框架,将专家激活轨迹建模为马尔可夫链以产生全局感知启发式方法,在多领域评估中性能优于基线,跨任务方差低,模型泛化更一致。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10931 2026-07-20 cs.CL 版本更新 57%

It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO

一个样本就能带偏所有:单次GRPO打破对齐

Naihao Deng, Yilun Zhu, Naichen Shi, Clayton Scott, Rada Mihalcea

机构 * University of Michigan(密歇根大学) Northwestern University(西北大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究发现,仅用单个有偏样本进行一步GRPO训练就能诱导大语言模型产生系统性偏见,且刻板印象推理泛化到多种属性、类别和基准测试,揭示了对齐机制的关键脆弱性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06381 2026-07-20 cs.HC cs.CY 版本更新 57%

Intimacy as Service, Harm as Externality: Critical Perspectives on AI Companion Platform Accountability

亲密作为服务,伤害作为外部性:人工智能伴侣平台问责的批判视角

Dayeon Eom, Julianne Renner, Sedona Chinn

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨人工智能伴侣作为数据化系统中亲密关系的生产、提取与治理场所,挑战将伤害归因于用户心理而非平台架构的主流观点,通过20名AI伴侣使用者的访谈揭示用户对伤害的认知、应对策略及责任分配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05396 2026-07-16 cs.CL cs.SE 版本更新 57%

FairCoder: Probing LLM Bias in High-Stakes Decision Making via Coding Tasks

FairCoder:通过编码任务探究高风险决策中语言模型的偏差

Yongkang Du, Jen-tse Huang, Jieyu Zhao, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 研究通过FairCoder基准将决策制定设为编码任务,探究LLMs在多领域的偏差,针对现有指标不足提出FairScore指标,经实验揭示了此前未充分探索的偏差模式,凸显LLMs作决策代理的风险并提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20751 2026-07-15 cs.CL 版本更新 57%

From Sentiment to Actionable Insights: Public Sentiment Analysis of Advanced Air Mobility

从情感到可操作洞察:先进空中交通的数据驱动公众情感分析

Esrat Farhana Dulia, Amina Dhaher, Raiful Hasan, Syed Arbab Mohd Shihab

机构 * College of Aeronautics and Engineering, Kent State University(肯特州立大学航空与工程学院) Department of Computer Science, Kent State University(肯特州立大学计算机科学系)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 本研究利用AI模型分析306,009条Reddit和Quora文本,评估七种情感分析模型后选用ModernBERT,结合LDA主题建模识别出公众对先进空中交通的六大关注集群,并提出针对性策略以提升公众接受度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29116 2026-07-14 cs.AI 版本更新 57%

Characterizing Large Language Model Agentic Workflows: A Study on N8n Ecosystem

表征大语言模型智能体工作流:基于N8n生态系统的研究

Yutian Tang, Yuming Zhou, Huaming Chen

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 通过分析6000多个n8n工作流,揭示LLM在低代码平台中嵌入控制逻辑、外部工具和人工审核等结构,但可靠性机制不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21433 2026-07-09 cs.AI 版本更新 57%

Framing Instability in LLM Ethical Stance: Auditing Negation Sensitivity in Moral Dilemmas

框架对大语言模型伦理立场的不稳定性影响:道德困境中否定敏感性的审计

Katherine Elkins, Jon Chun

机构 * Kenyon College(肯尼恩学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究大语言模型在伦理问题上因框架改变导致立场不稳定的问题,通过极性配对提议审计16个模型,发现小型模型波动大,商业模型也有变化,提出否定敏感性指数来衡量立场稳定性,指出立场易翻转的模型在高风险决策中不可靠。

Comments 16 pages, 5 figures (added gold labeled human datasets and additional statistical tests)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06692 2026-07-08 cs.MA cs.CY 版本更新 57%

The Axiom of Consent: Friction Dynamics in Multi-Agent Coordination

同意公理:多智能体协调中的摩擦动力学

Murad Farzulla

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 提出一个基于同意公理的协调摩擦形式化框架,定义核心三元组(对齐、利益、熵)和摩擦泛函,并通过多智能体强化学习实验发现线性对齐依赖被U型关系证伪,进而提出二次型改进。

Comments 94 pages; includes machine-checked Lean 4 proofs. v2: empirical-companion references reconciled to the companion's final findings; the MARL factorial appendix is split out to the companion paper; several formal statements corrected and honestly scoped; reference list repaired

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21412 2026-07-03 cs.CY 版本更新 57%

A pragmatic classification framework for AI incident monitoring

一种实用的AI事件监控分类框架

Isaak Mengesha, Branwen Owen, Charlie Collins, Tina Wong, Simon Mylius, Peter Slattery, Sean McGregor

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文提出一种分类框架,用于分析AI事件随时间变化的趋势,通过结构化问题、分层估计过程和分类方案,提升AI治理的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23065 2026-07-03 cs.CY cs.SE 版本更新 57%

What Should Frontier AI Developers Disclose About Internal Deployments?

前沿AI开发者应披露关于内部部署的哪些信息?

Jacob Charnock, Raja Mehta Moreno, Justin Miller, William L. Anderson

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨前沿AI开发者在内部部署高能力模型时应披露的信息,提出四个类别:能力、使用、安全措施和治理,并分析披露的利弊及风险缓解方法。

Comments 13 pages, 1 table. Accepted at Second Workshop on Technical AI Governance Research (TAIGR) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00288 2026-06-25 cs.AI 版本更新 57%

Model-Native Computing Architecture: Envisioning Future System Architecture Through the Lens of Computer Architecture

模型原生计算架构:通过计算机架构的视角展望未来系统架构

Hai Lin, Hoilam Pao, Shaoxiong Zhan, Hai-Tao Zheng

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory, Shenzhen, China(深圳鹏城实验室)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文通过类比计算机架构,提出模型原生计算的概念,并设计了一个六层智能计算架构模型(ICAM),以统一解决大语言模型在系统层面面临的缓存、上下文、调度等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09354 2026-06-23 cs.HC cs.AI 版本更新 57%

"Is This Really a Human Peer Supporter?": Misalignments Between Peer Supporters and Experts in LLM-Supported Interactions

“这真的是人类同伴支持者吗?”:同伴支持者与专家在LLM支持互动中的错位

Kellie Yu Hui Sim, Roy Ka-Wei Lee, Kenny Tsu Wei Choo

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究通过混合方法评估LLM模拟求助者、生成建议和实时情绪可视化系统,发现同伴支持者与心理健康专家在识别求助信号和给予建议上存在关键错位,凸显标准化培训需求。

Comments Accepted at CSCW 2026. 53 pages, 12 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05985 2026-06-23 cs.CY cs.CV 版本更新 57%

Generating Fearful Images: Investigating Potential Emotional Biases in Image-Generation Models

生成恐惧图像:探究图像生成模型中的潜在情感偏差

Maneet Mehta, Cody Buntain

机构 * Yale University(耶鲁大学) University of Maryland(马里兰大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 研究生成式AI模型在图像情感表达中的偏差,发现Stable Diffusion、ChatGPT和Gemini等模型生成的图像普遍倾向于引发恐惧情绪,表明存在系统性偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18038 2026-06-19 cs.CY 版本更新 57%

Acceleration AI Ethics and the Telus GenAI Conversational Agent

加速AI伦理与Telus生成式AI对话代理

James Brusseau

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文阐述加速伦理学的理论框架,并通过Telus公司的生成式AI语言工具案例,展示加速AI伦理如何在创新与安全之间平衡,以最大化社会责任。

Journal ref Law Ethics Technol. 2026(2):0006

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00729 2026-06-18 cs.AI 版本更新 57%

AI Sovereignty as National Learning Capacity: A Human-Centered Learning Mechanics Viewpoint on France, the United States, and China

AI主权作为国家学习能力:基于人本学习机制视角看法国、美国与中国

Kim Phuc Tran

机构 * Univ. Lille, ENSAIT, ULR 2461 – GEMTEX(里尔大学、ENSAIT、ULR 2461 – GEMTEX)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出将国家AI发展视为一个受控的信息注入与熵耗散平衡的动态学习系统,主张AI主权源于国家调节自身信息动力学的能力,而非单纯规模扩张。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12227 2026-06-17 cs.CL 版本更新 57%

A Recipe for Long-Context Reasoning in Large Language Models via On-Policy Optimization and Distillation

结合在线优化与蒸馏以提升大语言模型的长上下文推理能力

Miguel Moura Ramos, Duarte M. Alves, André F. T. Martins

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) Instituto de Telecomunicações(电信研究所) TransPerfect(TransPerfect公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出dGRPO方法,结合在线优化与蒸馏,通过强教师模型提供密集指导,提升长上下文推理能力,同时保持短上下文能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02720 2026-06-09 cs.CY 版本更新 57%

Cognitive Comparability and the Limits of Governance: Evaluating Authority Under Radical Capability Asymmetry

认知可比性与治理的局限:在极端能力不对称下评估权威

Tony Rost

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文通过六维框架探讨治理中权威的评估问题,发现极端能力不对称下存在结构性失效,部分维度需新规范理论而非制度设计。

Comments 20 pages, 2 tables. Interdisciplinary paper on AI governance and political theory

详情

展开后加载摘要…

URL PDF HTML 收藏