arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-29 至 2025-12-29 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2512.21775 2025-12-29 cs.AI cs.CY cs.DB 62%

Compliance Rating Scheme: A Data Provenance Framework for Generative AI Datasets

合规评分方案:一种面向生成式人工智能数据集的数据溯源框架

Matyas Bohacek, Ignacio Vilanova Echavarri

机构 * Stanford University(斯坦福大学) Imperial College London(帝国理工学院伦敦分校)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出合规评分方案,用于评估生成式人工智能数据集的透明度、问责制和安全性,同时提供开源库以实现数据溯源,促进负责任的数据集构建与管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13540 2025-12-29 cs.LG cs.CY 62%

Fairness-Aware Graph Representation Learning with Limited Demographic Information

带有有限人口信息的公平图表示学习

Zichong Wang, Zhipeng Yin, Liping Yang, Jun Zhuang, Rui Yu, Qingzhao Kong, Wenbin Zhang

机构 * Florida International University(佛罗里达国际大学) University of New Mexico(新墨西哥大学) Boise State University(博伊西州立大学) University of Louisville(路易斯维尔大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY、cs.LG

AI总结 本文提出FairGLite框架,在有限人口信息下减轻图学习中的偏见,通过生成人口信息代理和自适应置信度策略,实现公平性和效用的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21699 2025-12-29 cs.AI 57%

Towards Responsible and Explainable AI Agents with Consensus-Driven Reasoning

迈向负责任和可解释的AI代理:基于共识驱动的推理

Eranga Bandara, Tharaka Hewa, Ross Gore, Sachin Shetty, Ravi Mukkamala, Peter Foytik, Abdul Rahman, Safdar H. Bouk, Xueping Liang, Amin Hass, Sachini Rajapakse, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University, Norfolk, VA, USA(老奥本大学) Center for Wireless Communications, University of Oulu, Finland(无线通信中心,奥卢大学) Florida International University, USA(佛罗里达国际大学) Nanyang Technological University, Singapore(南洋理工大学) University of Colombo, Sri Lanka(科伦坡大学) Accenture Technology Labs, Arlington, VA, USA(Accenture技术实验室)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于多模型共识和推理层治理的负责任和可解释的AI代理架构,通过结构化整合不同模型的输出以提升系统鲁棒性、透明度和责任性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04489 2025-12-29 cs.CY 57%

The Decision Path to Control AI Risks Completely: Fundamental Control Mechanisms for AI Governance

完全控制AI风险的决策路径:AI治理的基本控制机制

Yong Tao

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文提出通过五支柱和六种控制机制,构建AI治理架构,以全面控制AI风险并减少潜在威胁。

Comments Added 1 paragraph to Ackowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏