arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-03 至 2026-02-03 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 6 篇

2602.01942 2026-02-03 cs.CR cs.AI 70%

Human Society-Inspired Approaches to Agentic AI Security: The 4C Framework

面向代理AI安全的人类社会启发方法:4C框架

Alsharif Abuadbba, Nazatul Sultan, Surya Nepal, Sanjay Jha

机构 * University of New South Wales, Sydney(新南威尔士大学悉尼分校)

专题命中 AI治理与伦理 :prompt injection(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出4C框架,通过人类社会治理理念,为代理AI安全提供多维度保护,强调行为完整性和意图,构建可信可控的AI系统。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00751 2026-02-03 cs.AI cs.SE 70%

Engineering AI Agents for Clinical Workflows: A Case Study in Architecture,MLOps, and Governance

为临床工作流程工程AI代理:架构、MLOps和治理的案例研究

Cláudio Lúcio do Val Lopes, João Marcus Pitta, Fabiano Belém, Gildson Alves, Flávio Vinícius Cruzeiro Martins

机构 * A3Data CEFET-MG

专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过整合四个工程支柱构建可信临床AI系统,展示Maria平台在架构、MLOps和治理方面的创新实践。

Comments 9 pages, 5 figures 2026 IEEE/ACM 5th International Conference on AI Engineering - Software Engineering for AI}{April 12--13, 2026}{Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08855 2026-02-03 cs.CL cs.AI cs.LG 67%

BiasGym: A Simple and Generalizable Framework for Analyzing and Removing Biases through Elicitation

BiasGym: 一个简单且通用的框架,用于通过诱发分析和去除偏见

Sekh Mainul Islam, Nadav Borenstein, Siddhesh Milind Pawar, Haeun Yu, Arnav Arora, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BiasGym通过安全注入和分析偏见,提供了一种简单且通用的方法来减少大语言模型中的偏见和刻板印象。

Comments Under review. Title updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02170 2026-02-03 cs.MA cs.AI 57%

Self-Evolving Coordination Protocol in Multi-Agent AI Systems: An Exploratory Systems Feasibility Study

多智能体AI系统中的自演化协调协议:一种探索性系统可行性研究

Jose Manuel de la Chica Rodriguez, Juan Manuel Vera Díaz

机构 * AI Lab, Grupo Santander Madrid, Spain(西班牙桑坦德集团AI实验室)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本研究探讨了自演化协调协议在多智能体系统中的可行性,通过实验展示有限自我修改在满足形式约束下的技术实现可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00816 2026-02-03 stat.ML cs.LG 57%

Hessian Spectral Analysis at Foundation Model Scale

基础模型规模下的Hessian谱分析

Diego Granziol, Khurshid Juarev

机构 * Mathematical Institute, University of Oxford, UK(牛津大学数学研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本研究在大规模基础模型上实现了Hessian谱的准确分析,揭示了块对角曲率近似在中等规模LLM中的失效问题,展示了谱探测的计算效率与实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00300 2026-02-03 cs.CL 57%

Faithful-Patchscopes: Understanding and Mitigating Model Bias in Hidden Representations Explanation of Large Language Models

Faithful-Patchscopes: 理解和缓解大语言模型隐藏表示解释中的模型偏差

Xilin Gong, Shu Yang, Zehua Cao, Lynne Billard, Di Wang

机构 * University of Georgia(佐治亚大学) King Abdullah University of Science(国王阿卜杜勒-阿齐兹大学) Hong Kong Center for Construction Robotics(香港建筑机器人中心)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出BALOR方法,通过logit校准缓解大语言模型隐藏表示解释中的模型偏差,提升解释的忠实度和上下文信息的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏