arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1847 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1847 篇

2607.07663 2026-07-09 cs.AI 新提交 57%

Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops

人工智能中的递归自我改进:从有界自我优化到自主研究循环

Mingguang Chen, Licheng Wang, Bo Qu

机构 * University of California, Riverside (UCR)(加州大学河滨分校) AlphaAvatar(阿尔法阿凡达) Illinois Institute of Technology (IIT)(伊利诺伊理工学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究人工智能系统自身改进,通过对1250篇论文调查区分有界自我优化与开放式递归自我改进(RSI),考察评估器设计空间并排序信号,发现自我改进强度与层次相关,失败模式源于违规,指出治理级测量是薄弱环节。

Comments 42 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21433 2026-07-09 cs.AI 版本更新 57%

Framing Instability in LLM Ethical Stance: Auditing Negation Sensitivity in Moral Dilemmas

框架对大语言模型伦理立场的不稳定性影响:道德困境中否定敏感性的审计

Katherine Elkins, Jon Chun

机构 * Kenyon College(肯尼恩学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究大语言模型在伦理问题上因框架改变导致立场不稳定的问题,通过极性配对提议审计16个模型,发现小型模型波动大,商业模型也有变化,提出否定敏感性指数来衡量立场稳定性,指出立场易翻转的模型在高风险决策中不可靠。

Comments 16 pages, 5 figures (added gold labeled human datasets and additional statistical tests)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06692 2026-07-08 cs.MA cs.CY 版本更新 57%

The Axiom of Consent: Friction Dynamics in Multi-Agent Coordination

同意公理:多智能体协调中的摩擦动力学

Murad Farzulla

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 提出一个基于同意公理的协调摩擦形式化框架,定义核心三元组(对齐、利益、熵)和摩擦泛函,并通过多智能体强化学习实验发现线性对齐依赖被U型关系证伪,进而提出二次型改进。

Comments 94 pages; includes machine-checked Lean 4 proofs. v2: empirical-companion references reconciled to the companion's final findings; the MARL factorial appendix is split out to the companion paper; several formal statements corrected and honestly scoped; reference list repaired

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14730 2026-07-08 cs.CY 57%

Funhouse Mirror or Echo Chamber? A Methodological Approach to Teaching Critical AI Literacy Through Metaphors

镜中回音还是回音室?通过隐喻教学批判性AI素养的方法论方法

Jasper Roe, Leon Furze, Mike Perkins

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文通过隐喻教学方法,提出四种隐喻帮助学生理解AI特性,促进批判性AI素养教育。

Journal ref Journal of Interactive Media in Education 2025(1) (2025) 18, 1-15

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03542 2026-07-07 cs.CY 新提交 57%

Macro-Prudential AI Governance: A Two-Layer Early Warning and Response System for Frontier AI

宏观审慎人工智能治理:前沿人工智能的双层预警与响应系统

Pranav Mehta

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 针对前沿人工智能治理问题,借鉴巴塞尔协议III框架等,提出宏观审慎预警与响应系统。通过A层特定流程和B层定量指标校准控制,能检测风险积累并设应对途径。

Comments 14 pages, 1 figure, 1 table. Accepted at the Second Workshop on Technical AI Governance Research (TAIGR 2026) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12502 2026-07-07 physics.soc-ph cs.AI 新提交 57%

A Mathematical Theory of Value: a synthesis on goal-directed agency under resource constraints

价值的数学理论:资源约束下目标导向行为的综合

Cheng Qian

机构 * Cheng Qian(陈倩)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出价值是目标导向主体在资源约束下转化资源为目标进度的速率,通过尺度不变性公理导出对数度量,并推导出价值编码定理,实现价值与信息论的统一。

Comments Also available at https://doi.org/10.5281/zenodo.20487041 (v6). v2: the pre-registered continuation-gate experiment has been run -- prediction (i) confirmed on real frontier agents; prediction (ii) retired to mathematical scope. Code, pre-registrations, and raw run records: https://github.com/macrokit/value

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30970 2026-07-03 cs.AI 新提交 57%

Behavioral Governance for Autonomous AI Agents: The AgentBound Framework

AgentBound: 自主AI智能体的可验证行为治理

Anuj Kaul, Qianlong Lan, Pranay Gupta

机构 * eBay Inc.(eBay公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 提出AgentBound框架,通过委托授权、行为宪法和站点行动合同三权独立评估,结合形式化决策模型实现AI智能体行为的可验证治理,并生成加密可验证的治理收据以支持独立重放验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21412 2026-07-03 cs.CY 版本更新 57%

A pragmatic classification framework for AI incident monitoring

一种实用的AI事件监控分类框架

Isaak Mengesha, Branwen Owen, Charlie Collins, Tina Wong, Simon Mylius, Peter Slattery, Sean McGregor

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文提出一种分类框架,用于分析AI事件随时间变化的趋势,通过结构化问题、分层估计过程和分类方案,提升AI治理的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23065 2026-07-03 cs.CY cs.SE 版本更新 57%

What Should Frontier AI Developers Disclose About Internal Deployments?

前沿AI开发者应披露关于内部部署的哪些信息?

Jacob Charnock, Raja Mehta Moreno, Justin Miller, William L. Anderson

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨前沿AI开发者在内部部署高能力模型时应披露的信息,提出四个类别:能力、使用、安全措施和治理,并分析披露的利弊及风险缓解方法。

Comments 13 pages, 1 table. Accepted at Second Workshop on Technical AI Governance Research (TAIGR) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00423 2026-07-02 cs.CL 新提交 57%

Selective Test-Time Debiasing for CLIP via Reward Gating

通过奖励门控实现CLIP的选择性测试时去偏

Jaeho Han, Jisoo Yang, Hyeondong Woo, Mingyu Jeon, Sunjae Yoon, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(中央大学人工智能系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 提出基于强化学习的测试时自适应框架RG-TTA,根据输入对偏见的敏感性选择性应用去偏,在减少偏见的同时保持零样本性能。

Comments 15 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24340 2026-07-01 cs.AI 57%

humancompatible.detect: a Python Toolkit for Detecting Bias in AI Models

humancompatible.detect: 一个用于检测AI模型偏见的Python工具包

German M. Matilla, Jiri Nemecek, Illia Kryvoviaz, Jakub Marecek

机构 * Faculty of Electrical Engineering, Czech Technical University in Prague(布拉格捷克理工大学电气工程学院)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出humancompatible.detect工具包,通过最大子组差异和子采样∞距离方法解决传统方法在可扩展性和可计算性上的挑战,提供易用的API和多个示例。

Comments 6 pages, 5 figures

Journal ref SoftwareX 35, 102827 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30085 2026-06-30 cs.CL econ.GN q-fin.EC 57%

Not-quite-human tastes: the stylized omnivorousness of LLM survey surrogates

非完全人类品味:LLM调查替代者的程式化杂食性

Xiangyu Ma, Mengmi Zhang, Shannon Ang, Minne Chen

机构 * Nanyang Technological University Singapore(新加坡南洋理工大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本研究使用多个大型语言模型生成大量调查替代者,发现其品味存在系统性正向偏差、丧失真实品味结构的复杂关系,且扭曲了品味与社会空间的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26595 2026-06-26 cs.AI 新提交 57%

LLM-based Models for Detecting Emerging Topics in Service Feedback

基于LLM的服务反馈中新兴主题检测模型

Mahsa Tavakoli, Ruth Bankey, Cristián Bravo

机构 * Department of Statistical and Actuarial Sciences, The University of Western Ontario(西安大略大学统计与精算科学系) Canada Revenue Agency(加拿大税务局)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 提出一种结合大语言模型、统计技术和人机协作的方法,用于检测服务反馈中的新兴质量主题,并揭示潜在服务不公,经税务专家评估优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25012 2026-06-25 cs.LG 新提交 57%

Bias-Controlled Primal-Dual Natural Actor-Critic: Optimal Rates for Constrained Multi-Objective Average-Reward RL

偏置控制的原对偶自然演员-评论家:约束多目标平均奖励强化学习的最优速率

Ankur Naskar, Swetha Ganesh, Vaneet Aggarwal

机构 * Indian Institute of Science, Bengaluru, India(印度科学研究所,班加罗尔,印度) Purdue University, USA(普渡大学,美国)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 针对平均奖励设置下的约束多目标强化学习,提出基于MLMC的原对偶自然演员-评论家算法,控制标量化目标、约束评估和演员-评论家估计中的偏置,实现最优全局收敛和约束违反率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00288 2026-06-25 cs.AI 版本更新 57%

Model-Native Computing Architecture: Envisioning Future System Architecture Through the Lens of Computer Architecture

模型原生计算架构:通过计算机架构的视角展望未来系统架构

Hai Lin, Hoilam Pao, Shaoxiong Zhan, Hai-Tao Zheng

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory, Shenzhen, China(深圳鹏城实验室)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文通过类比计算机架构,提出模型原生计算的概念,并设计了一个六层智能计算架构模型(ICAM),以统一解决大语言模型在系统层面面临的缓存、上下文、调度等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24585 2026-06-24 cs.AI 新提交 57%

LLMs Prompted for Legal Context Object More: Overrefusal from Small On-Premises LLMs in Criminal Legal Context

LLMs在刑事法律语境中被提示为法律上下文对象:小型本地LLM的过度拒绝

Anastasiia Kucherenko, François Brouchoud, Dimitri Percia David, Andrei Kucharavy

机构 * IEM, HEG, HES-SO Valais-Wallis(瓦莱州-瓦利斯高等专业学院,管理与工程学院,经济与酒店管理学院)

专题命中 AI治理与伦理 :jailbreak(abstract);分类 cs.AI

AI总结 研究小型本地LLM在法律提示中的过度拒绝现象,发现权威性前缀(如“国家最高法院助理”)使拒绝率提高2-20倍,而角色扮演前缀效果不一,表明模型在真实机构用户可能引入的上下文框架下不稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23860 2026-06-24 cs.CY 新提交 57%

World Artificial Intelligence Cooperation Organization (WAICO): Mapping an Emerging Institution in the Global AI Governance Regime Complex

世界人工智能合作组织(WAICO):全球人工智能治理体制复合体中一个新兴机构的映射

William Guey, Pierrick Bougault, Wei Zhang, Vitor D. de Moura, José O. Gomes

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文通过编码15项国际AI治理文书和机构,分析中国提议的世界人工智能合作组织(WAICO)的设计特征,发现其结合了成员国开放、无价值观测试和发展优先议程,构成全球AI治理中基于主权与发展的第二极。

Comments 13 pages, 2 figures, 1 table. Data and code: https://github.com/williamguey/waico-ai-governance

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09354 2026-06-23 cs.HC cs.AI 版本更新 57%

"Is This Really a Human Peer Supporter?": Misalignments Between Peer Supporters and Experts in LLM-Supported Interactions

“这真的是人类同伴支持者吗?”:同伴支持者与专家在LLM支持互动中的错位

Kellie Yu Hui Sim, Roy Ka-Wei Lee, Kenny Tsu Wei Choo

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究通过混合方法评估LLM模拟求助者、生成建议和实时情绪可视化系统,发现同伴支持者与心理健康专家在识别求助信号和给予建议上存在关键错位,凸显标准化培训需求。

Comments Accepted at CSCW 2026. 53 pages, 12 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05985 2026-06-23 cs.CY cs.CV 版本更新 57%

Generating Fearful Images: Investigating Potential Emotional Biases in Image-Generation Models

生成恐惧图像:探究图像生成模型中的潜在情感偏差

Maneet Mehta, Cody Buntain

机构 * Yale University(耶鲁大学) University of Maryland(马里兰大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 研究生成式AI模型在图像情感表达中的偏差,发现Stable Diffusion、ChatGPT和Gemini等模型生成的图像普遍倾向于引发恐惧情绪,表明存在系统性偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19816 2026-06-19 cs.CY 新提交 57%

Challenges to Grassroots Organization Engagement with AI Policy

基层组织开展AI政策参与的挑战

Carter Buckner, Jennifer Mickel, Nandhini Swaminathan, William Agnew, Jacob Hobbs, Sarthak Arora, Michelle Lin, Yanan Long, B. V. Alaka

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文通过案例研究,探讨基层组织和边缘化社区在参与AI政策制定中面临的挑战,并提出基于参与式设计的建议。

Comments To appear at ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19668 2026-06-19 cs.CL 新提交 57%

Code-Switching Reveals Language Anchoring in Multilingual LLMs

代码切换揭示多语言大模型中的语言锚定

Jeonghyun Park, Seunghyun Yoon, Yonghyun Jun, Hwanhee Lee

机构 * Chung-Ang University(中央大学) Adobe Research(Adobe研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 通过语法强制代码切换诊断多语言大模型中的语言锚定现象,提出锚定偏差度量并设计CANVAS干预方法,有效缓解代码切换导致的问答性能下降。

Comments 36 pages, 13 figures, 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18038 2026-06-19 cs.CY 版本更新 57%

Acceleration AI Ethics and the Telus GenAI Conversational Agent

加速AI伦理与Telus生成式AI对话代理

James Brusseau

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文阐述加速伦理学的理论框架,并通过Telus公司的生成式AI语言工具案例,展示加速AI伦理如何在创新与安全之间平衡,以最大化社会责任。

Journal ref Law Ethics Technol. 2026(2):0006

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18537 2026-06-18 cs.LG 新提交 57%

Do as the Romans Do: Learning Universal Behaviors from Heterogeneous Agents

入乡随俗:从异构智能体学习通用行为

Caleb Chang, Davin Win Kyi, Natasha Jaques, Karen Leung

机构 * University of Washington(华盛顿大学) NVIDIA(英伟达)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 提出GRID方法,从追求不同目标的异构示范者中提取通用奖励,训练通用智能体以学习环境通用能力,避免模式平均偏差,提升下游任务微调效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18506 2026-06-18 cs.LG eess.SP stat.AP 新提交 57%

Beyond AHI: An Interpretable Causal-Discovery-Guided Framework for Sleep Recovery in Connected Health

超越AHI:一种可解释的因果发现引导的睡眠恢复框架在互联健康中的应用

Saba A. Farahani, Elahe Khatibi, Manoj Vishwanath, Amir M. Rahmani, Hung Cao

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 提出一种可解释的因果发现引导框架,从多模态PSG中推导层次化睡眠恢复评分(SRS),在两大队列中SRS与感知恢复的关联强度是AHI的2.5倍。

Comments 6 pages, 2 figures, 2 tables. Accepted at the 2nd Workshop on Sensing and Computing for Smart and Connected Health (SCH), co-located with IEEE/ACM CHASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00729 2026-06-18 cs.AI 版本更新 57%

AI Sovereignty as National Learning Capacity: A Human-Centered Learning Mechanics Viewpoint on France, the United States, and China

AI主权作为国家学习能力:基于人本学习机制视角看法国、美国与中国

Kim Phuc Tran

机构 * Univ. Lille, ENSAIT, ULR 2461 – GEMTEX(里尔大学、ENSAIT、ULR 2461 – GEMTEX)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出将国家AI发展视为一个受控的信息注入与熵耗散平衡的动态学习系统,主张AI主权源于国家调节自身信息动力学的能力,而非单纯规模扩张。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17637 2026-06-18 cs.CY cs.HC 57%

Scaling Laws for Moral Machine Judgment in Large Language Models

大语言模型中道德机器判断的扩展规律

Kazuhiro Takemoto

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 研究通过评估75种大语言模型配置,发现模型规模与人类偏好距离呈幂律关系,扩展推理模型在较小规模时表现更优,为价值判断的扩展规律研究提供依据。

Comments 12 pages, 4 figures, 3 tables

Journal ref R Soc Open Sci. (2026) 13 (6): 260202

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17506 2026-06-17 cs.CL 新提交 57%

Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement

通过认知权利评估大语言模型的二阶偏见

Ramaravind Kommiya Mothilal, Terry Jingchen Zhang, Raiyan Ahmed, Zhijing Jin, Shion Guha, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) EuroSafeAI Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所(德国图宾根))

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 提出基于认知权利理论的逻辑推理任务,评估LLM在判断偏见内容时表现出的二阶偏见,发现模型判断存在系统性偏差且能规避安全护栏。

Comments 20 pages, 13 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12227 2026-06-17 cs.CL 版本更新 57%

A Recipe for Long-Context Reasoning in Large Language Models via On-Policy Optimization and Distillation

结合在线优化与蒸馏以提升大语言模型的长上下文推理能力

Miguel Moura Ramos, Duarte M. Alves, André F. T. Martins

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) Instituto de Telecomunicações(电信研究所) TransPerfect(TransPerfect公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出dGRPO方法,结合在线优化与蒸馏,通过强教师模型提供密集指导,提升长上下文推理能力,同时保持短上下文能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11835 2026-06-11 cs.HC cs.AI 新提交 57%

Designing AI-Supported Focus Groups: A Role x Modality Playbook

设计AI支持的焦点小组:角色×模态剧本

Zhiqing Wang, Steven Dow

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 针对焦点小组资源密集且对引导高度敏感的问题,提出按AI角色(工具、联合主持、主持)和模态(文本、语音、具身)组织的剧本,并分析交互权衡与开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09414 2026-06-09 cs.HC cs.AI 新提交 57%

AI Assurance in UK Defence: Challenges in Operationalising JSP 936

英国国防中的人工智能保证:JSP 936 操作化的挑战

Callum Cockburn, Sam Farrow

机构 * Synoptix

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文通过结构化解释性审查,识别了英国国防中实施JSP 936进行AI保证的八大挑战,并指出其依赖未解决的技术、组织和保证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏