arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 144 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 144 篇

2607.02245 2026-07-03 cs.AI cs.CY cs.HC 新提交 62%

Copewell: A Multi-Agent Swarm Architecture for Equitable Mental Wellness Support

Copewell: 一种用于公平心理健康支持的多智能体群体架构

Seren Yenikent, Jack Vinijtrongjit, Katherine Ng

机构 * Copewell

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 提出Copewell多智能体群体系统,通过多源评估、情感映射和双模式干预,扩大心理健康支持的可及性,并融入隐私优先和伦理监督设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00415 2026-07-02 cs.CL cs.LG 新提交 62%

A Mechanistic View of Authority Hierarchy in LLM Sycophancy

LLM 谄媚中权威层级的机制性视角

Emil Joswin, Srujananjali Medicherla, Priyanka Mary Mammen

机构 * Independent Research(独立研究)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.LG

AI总结 通过受控医疗QA实验,发现LLM按感知权威程度分级响应,机制是特定后期层中正确答案表征被权威信号主动擦除,且该擦除与权威水平成比例、抵抗均值向量干预、仅部分可逆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30657 2026-07-01 cs.CY cs.AI 新提交 62%

AI for Quality Assurance in the Operating Room

手术室中用于质量保证的人工智能

Pietro Mascagni, Lalith Sharan, Deepak Alapatt, Nicolas Padoy

机构 * Fondazione Policlinico Universitario Agostino Gemelli IRCCS(阿戈斯蒂诺·杰梅利大学综合医院基金会IRCCS) Institute of Image-Guided Surgery, HU-Strasbourg(斯特拉斯堡大学医院图像引导外科研究所) University of Strasbourg, CNRS, INSERM, ICube, UMR7357(斯特拉斯堡大学,法国国家科学研究中心,法国国家健康与医学研究院,ICube实验室,UMR7357) Scialytics SAS(Scialytics SAS公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出AI赋能的手术质量保证框架,利用手术视频数据实现术中质量持续评估与改进,并讨论了关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26203 2026-06-26 cs.AI cs.CY cs.MA cs.SI 新提交 62%

Agentic Analysis for Agentic Infrastructure: An LLM-Powered Pipeline for Comparative Governance of DAO and Corporate AI Protocols

面向代理基础设施的代理分析:基于LLM的DAO与企业AI协议比较治理管道

Yutian Wang, Luyao Zhang

机构 * Duke Kunshan University(昆山杜克大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 提出LLM驱动的比较分析管道,结合自动标注、神经主题建模和多层网络分析,研究DAO与企业AI协议的治理结构,发现开放治理促进主题收敛但参与不平等普遍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22097 2026-06-23 cs.CL cs.AI 新提交 62%

Plurification in/of language technology -- The integration of culture in next-generation AI

语言技术中的/对语言技术的净化——下一代AI中的文化整合

Gertraud Koch, Fausto Giunchiglia

机构 * University of Hamburg(汉堡大学) University of Trento(特伦托大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨如何在自然语言处理中操作化“文化”,提出文化对齐需要多元认识论,而非仅添加“其他文化”示例,并通过技术活动五层模型分析现有方法,指出多数方法仅停留在输出或表征层面,需转向反思性多元社会技术路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20699 2026-06-23 cs.MA cs.AI cs.CY 新提交 62%

Structural Distinguishability of Static and Adaptive Policy Regimes in Agent-Based Regulatory Simulation

基于智能体的监管模拟中静态与自适应政策机制的结构可区分性

Roberto Garrone

机构 * Open University of Cyprus(塞浦路斯开放大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文通过可配置的排放监管ABM基准,比较四种政策-智能体机制,揭示自适应政策与智能体交互导致监管结论差异,提出机制可区分性评估方法。

Comments 19 pages, 4 figures, 9 tables. Simulation-based methodological study

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18649 2026-06-19 cs.MA cs.CL cs.CY 新提交 62%

Gender Bias in LLM Hiring Decisions: Evidence from a Japanese Context and Evaluation of Mitigation Strategies

LLM招聘决策中的性别偏见:来自日本语境的证据及缓解策略评估

Serena A. Hoffstedde, Machiko Hirota, Akshara Nadayanur Sathis Kanna, Rihito Kotani, Ujwal Kumar, Gabriele Trovato, Phan Xuan Tan

机构 * Shibaura Institute of Technology, Tokyo, Japan(Shibaura技术学院,东京,日本) Amsterdam University of Applied Sciences, Amsterdam, Netherlands(阿姆斯特丹应用科学大学,阿姆斯特丹,荷兰) University of Pennsylvania, Philadelphia, USA(宾夕法尼亚大学,费城,美国) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学,匹兹堡,美国) Keio University, Tokyo, Japan(庆应大学,东京,日本)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.CY

AI总结 本研究通过60份日本履历书格式的简历和5个先进LLM,发现所有模型均存在显著的亲女性偏见,且简单的提示指令无法缓解,而移除姓名几乎完全消除该偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16407 2026-06-16 cs.CL cs.LG 新提交 62%

A Mechanistic Understanding of Pronoun Fidelity in LLMs

对大型语言模型中代词忠实性的机制理解

Katharina Trinley, Jesujoba O. Alabi, Dietrich Klakow, Vagrant Gautam

机构 * Saarland University(萨尔大学) Heidelberg Institute for Theoretical Studies(海德堡理论研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 通过因果分析发现,代词忠实性由组实体绑定、近因偏差和刻板印象偏差三种因果子空间共同作用,解释了91-99.5%的行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13693 2026-06-16 cs.CY cs.AI 新提交 62%

Limited Marginal Benefit of Reasoning-Heavy LLM Deployment in ESG Narrative Scoring: A 4-Model Consensus Study on Japanese Listed Firms

ESG叙述评分中重度推理LLM部署的有限边际收益:一项关于日本上市公司的4模型共识研究

Hiroyuki Kokubu

机构 * Kansai University(关西大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 通过4模型共识设计,研究在ESG叙述评分中,重度推理模型相比非推理模型是否带来显著收益,发现其边际收益有限且成本高昂。

Comments 12 pages. Earlier version available on SSRN, Abstract ID 6683303

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12420 2026-06-12 cs.CY cs.AI 新提交 62%

Eigenism: Ethics for a Human-AI Future

Eigenism:人类与人工智能未来的伦理学

Dan Hendrycks

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 提出Eigenism伦理框架,将身份视为分级分布的信息模式,通过加权求和评估AI的福祉,并推广至人类,为AI对齐提供“身份工程”新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11218 2026-06-11 cs.CY cs.AI 新提交 62%

An Ethical eValuation Agent (EeVA): Results of a Proof-of-Concept Test on a Prototype Agentic-like Workflow to Assist Ethical Deliberations

伦理评估代理(EeVA):在原型类代理工作流中辅助伦理审议的概念验证测试结果

Stephen Milford, B. Zara Malgir, Miguel Vazquez

机构 * Institute for Biomedical Ethics, Basel University(伦理研究所,巴塞尔大学) North-West University(北开普大学) Barcelona Supercomputing Center(巴塞罗那超级计算中心)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 提出基于LLM的类代理工作流EeVA,通过10种伦理框架评估用例,生成结构化评估与综合,促进伦理反思而非给出绝对答案,在三个案例中验证了可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11198 2026-06-11 cs.CL cs.AI 新提交 62%

The Structural Attention Tax: How Retrieval Format Hijacks In-Context Learning Independent of Content

结构注意力税:检索格式如何劫持上下文学习而与内容无关

Yuqi Zhang, Di Zhang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究发现知识图谱三元组因其格式结构比自然语言吸引2-3倍注意力,压缩演示注意力达42%,并提出了分解注意力为语义与结构成分的框架及缓解策略。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06533 2026-06-08 cs.AI cs.CL 新提交 62%

Position: Don't Just "Fix it in Post": A Science of AI Must Study Training Dynamics

立场:不要仅仅“在后期修复它”:AI科学必须研究训练动态

Stella Biderman, Mohammad Aflah Khan, Niloofar Mireshghallah, Catherine Arnett, Fazl Barez, Naomi Saphra

机构 * Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) Harvard University(哈佛大学) University of Oxford, Martian(牛津大学,火星) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文主张AI科学应超越事后分析,研究训练动态以预测、干预和设计模型行为,并指出当前在可解释性、公平性等领域的进展及开放问题。

Comments Accepted as an oral to the ICML: https://icml.cc/virtual/2026/poster/67142

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18774 2026-08-20 cs.CV cs.LG 新提交 57%

MIFR: A Modality-Invariant and Fair Representation Framework for Skin Disease Classification

MIFR:用于皮肤病分类的模态不变公平表示框架

Asonyu Senge Njih, Yvan Guifo Fodjo, Vianney Kengne Tchendji, Jerry Lacmou Zeutouo, Kerol Djoumessi

机构 * University of Dschang(德昌大学) Université Paris-Panthéon-Assas(巴黎先贤祠-阿萨斯大学) Université de Picardie Jules Verne(儒勒·凡尔纳皮卡第大学) Hertie Institute for AI in Brain Health, University of Tübingen(蒂宾根大学赫蒂脑健康人工智能研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本研究提出MIFR框架,通过配对临床与皮肤镜图像的多目标损失训练,实现皮肤病分类的模态不变性与公平性,在多数据集上验证了其预测性能与公平性。

Comments Accepted for publication at the First Workshop on Advancing African Medical AI through Global Integration (AFRICAI)-MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17516 2026-08-19 cs.CL 新提交 57%

Effects of Answer Format Variation on Gender Bias in Large Language Models

答案格式变化对大型语言模型中性别偏见的影响

Ksenia Merzlyakova, Sebastian Padó, Franziska Weeber

机构 * Institute for Natural Language Processing, University of Stuttgart(斯图加特大学自然语言处理研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 该研究探讨答案格式变化对LLMs性别偏见测量的影响,通过评估三种指令微调模型在不同格式下的表现,发现格式会显著改变测量结果,强调需将答案格式纳入LLM评估。

Comments 6th Workshop on Computational Linguistics for the Political and Social Sciences (CPSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16394 2026-08-18 cs.AI cs.IR 新提交 57%

Think Inside the Chunk: RegulaRAG for Regulation-Compliant Scenario Generation using LLMs: A Case Study of UN Regulation No. 152

在块内思考:使用大语言模型生成符合法规的场景的RegulaRAG——以联合国第152号法规为例

Vahid Zolfaghari, Nenad Petrovic, AndrÉ Schamschurko, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 针对LLMs难以结合冗长分层标准的问题,提出RegulaRAG流水线,经实验其在UN R152数据集上元分数最高且鲁棒性强,优于基线系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15354 2026-08-18 cs.AI 新提交 57%

Incoherent by Design? On the Moral Self-Consistency of LLMs

天生不连贯?大型语言模型的道德自我一致性研究

Pegah Nokhiz, Aravinda Kanchana Ruwanpathirana, Helen Nissenbaum

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技学院) Nanyang Technological University(南洋理工大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本研究针对GPT、Mistral、Llama等LLM,在义务论等三大伦理框架下,发现其道德推理存在最高78%的矛盾率,内部不连贯是AI对齐的必要前提。

Comments 88 pages; pages 16 to 88 are the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12669 2026-08-14 cs.CY 新提交 57%

From Fair Representation to Just Recognition in Generative AI

从生成式AI中的公平表征到公正承认

Severin Engelmann, Daniel Susser

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 该研究针对生成式AI的公平挑战,指出现有表征公平策略存在局限,提出借鉴参与平等理论,从表征公平转向承认正义以解决相关问题。

Comments Accepted for publication at the 2026 AAAI/ACM Conference on AI, Ethics, and Society (AIES)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11207 2026-08-13 cs.AI 新提交 57%

Dynamic Governance of Multi-LLM Agent Systems for Collaborative Conversational Outcomes

用于实现协作式对话结果的多大型语言模型智能体系统的动态管控

Alexander Liss, Nicholas Desmond, Santiago Gil Gallego

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文针对多LLM智能体对话崩溃问题,提出体验编排器EO管控层,通过三种机制提升顾问联系率,在6万次模拟中取得显著效果,为多智能体协作提供新方案。

Comments 13 pages, 3 figures, 3 tables. Submitted to AI Engineer World's Fair 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09857 2026-08-11 cs.RO cs.AI 新提交 57%

Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy

智能体 harness:面向机器人自主的大语言模型驱动验证层

Rohan Bhagra, Mahantesh Halapannavar, Uddhav Bhattarai

机构 * Carnegie Mellon University(卡内基梅隆大学) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 针对机器人规划模型的安全与伦理风险,提出LLM驱动的验证层作为中间件管控计划,实现近85%的类别准确率、97%的对抗性攻击遏制率,为机器人自主提供可靠保障。

Comments 7 pages. Not yet finalized for conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08284 2026-08-11 cs.AI 新提交 57%

Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders

表面上公平?对LLM推荐器的隐藏输出公平性差距进行基准测试

Chan Aristella Lu, Arya Fayyazi, Junhao Zhang, Saeid Shokoufa, Yue Xing, Zhen Xiang, Kyu Hyung Lee, Mehdi Kamal, Massoud Pedram

机构 * University of Georgia(佐治亚大学) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Michigan State University(密歇根州立大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 该研究提出首个联合评估LLM推荐器可观测输出与隐藏表示公平性的基准FairGap,发现二者存在根本张力,现有框架无法诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08220 2026-08-11 cs.AI 新提交 57%

Metanormative Theory for RL-Based Moral Agents

基于强化学习的道德智能体的元规范理论

Aleks Knoks, Marija Slavkovik

机构 * University of Luxembourg(卢森堡大学) University of Bergen(卑尔根大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文针对强化学习(RL)道德智能体设计中哲学文献被边缘化的问题,提炼元规范理论的相关理念审视RL架构,以明确RL智能体道德行为的判定标准,为评估相关RL方法奠定基础。

Comments The 14th International Workshop on Engineering Multi-Agent Systems (EMAS 2026) held May 25-26, 2026 Co-located with AAMAS 2026 Paphos, Cyprus

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07515 2026-08-11 cs.CY 新提交 57%

Bridging AI Risk Frameworks: Reconciling ISO/IEC 42001, the NIST AI Risk Management Framework, and the EU AI Act into a Uni ed Governance Taxonomy

衔接AI风险框架:将ISO/IEC 42001、美国国家标准与技术研究院AI风险管理框架(NIST AI RMF 1.0)及欧盟AI法案整合为统一治理分类体系

Vinod Dhiman

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

AI总结 本文整合ISO/IEC 42001、NIST AI RMF和欧盟AI法案,构建统一AI治理分类体系,提出实施模型与示例,助力组织同时满足三者要求且无需重复付出。

Comments 17 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07477 2026-08-11 cs.HC cs.AI 新提交 57%

Designing for Ethical AI: HCI Feature Considerations to Improve Fairness and User Experience in AutoML use for Human Resources

面向伦理人工智能的设计:用于人力资源的自动机器学习(AutoML)中提升公平性与用户体验的人机交互(HCI)功能考量

Sundaraparipurnan Narayanan

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 该论文结合多视角研究AutoML在人力资源招聘中的公平性,发现现有平台存在缺陷,提出五维度HCI公平评估框架,建议将公平性嵌入AutoML设计以提升伦理可持续性。

Comments 295 pages; Doctoral Thesis;28 figures; 42 tables; 248 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06353 2026-08-07 cs.GT cs.AI cs.MA 新提交 57%

Resourced Authority A Mechanism-Design Model for Participatory Governance of Deployed AI Agents

资源权威:部署AI代理参与式治理的机制设计模型

Praphul Chandra, Sujit Gujar, Ganesh Ghalme

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本研究提出资源权威机制设计模型,用于通过计算预算使授权自我执行,实现对已部署AI代理的参与式治理,同时指出被治理代理操纵治理 electorate 是核心开放问题。

Comments 22 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06246 2026-08-07 cs.LG 新提交 57%

A Six-Dimensional Taxonomy of Post-Training Adaptation Techniques with Applications in AI Governance

用于人工智能治理的后训练适应技术的六维分类法

Fardin Afdideh, Fernando Seoane, Farhad Abtahi

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本综述构建了后训练适应技术的六维分类法,梳理技术间关系,为AI治理提供术语支持,并指出该领域的开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06115 2026-08-07 cs.AI 新提交 57%

Mind the Gaps: Mixture-of-Minds for Human Simulation

关注差距:用于人类模拟的思维混合模型

Pranav Dahiya

机构 * Semilattice(半格)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出Anacreon受众模拟模型,基于Gemma 4 12B构建思维混合模型,通过聚类个体、情感链等技术,在个体层面序数对齐达0.775,缩小了群体与个体模拟的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04382 2026-08-06 cs.LG stat.ML 新提交 57%

Non-asymptotic implicit bias of logistic regression at early-stage gradient descent dynamics

早期梯度下降动力学下逻辑回归的非渐近隐式偏置

Han Bao

机构 * The Institute of Statistical Mathematics(统计数理研究所) Tohoku University(东北大学) RIKEN AIP(理化学研究所人工智能项目)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本研究揭示早期梯度下降动力学中逻辑回归参数向量与最大间隔方向弱对齐的机制,给出对齐迭代次数的紧上界,为理解训练时长与泛化性能的关联提供理论支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03670 2026-08-05 cs.CY 新提交 57%

Accountability Asymmetry and Structural Trust in Autonomous AI Systems

自主AI系统中的问责不对称性与结构性信任

Nathan DeBardeleben

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文针对自主AI系统中问责不对称导致的信任问题,提出将其治理视为基础设施可靠性问题,通过工程异质性方案,即独立监测审查补充流程,解决该问题。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02685 2026-08-05 cs.SE cs.AI 新提交 57%

BulkPR-Bench: Benchmarking Queue-Level Governance of Interacting Pull Requests

BulkPR-Bench:针对交互拉取请求的队列级治理基准

Zetong Xiong, Qiao Zhao, Jun Zhang, Xueying Lyu, Zhi Li, Yixiang Tu, Xiaowen Yang, Yunjie Zhang, Yufeng Wang, Zhe Zhang, Kaize Yu, Hanwen Du, Zhongkai Sun, Zhuoxin Liu, Zekun Lin, Jianwen Yang, Ruining Chen, Ying Zhang, Tingxuan Pan, Ke Chen, Shubin Han, Chuanhao Sun, Yehua Yang

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 该研究推出BulkPR-Bench基准,针对交互PR队列治理,实验显示现有模型在该任务上表现优于顺序基准,但仍存在较大提升空间。

Comments 12 pages, 5 figures. Artifact: https://github.com/Eureka246/BulkPR-Bench-Release ; archived artifact: https://doi.org/10.5281/zenodo.21717780

详情

展开后加载摘要…

URL PDF HTML 收藏