arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-29 至 2026-01-29 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 2 篇

2601.20604 2026-01-29 cs.AI 79%

Dialogical Reasoning Across AI Architectures: A Multi-Model Framework for Testing AI Alignment Strategies

跨AI架构的对话推理:一种多模型框架用于测试AI对齐策略

Gray Cox

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出一种多模型框架,通过对话推理测试AI对齐策略,展示不同AI模型在处理复杂对齐框架时的表现及新兴见解。

Comments 23 pages, 5 tables, 5 appendices. Code and data: https://github.com/jgraycox-coa/vcw-multi-ai-dialogue

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20449 2026-01-29 cs.LG cs.AI 62%

Fair Recourse for All: Ensuring Individual and Group Fairness in Counterfactual Explanations

公平的 recourse 为所有:在反事实解释中确保个体和群体公平性

Fatima Ezzeddine, Obaida Ammar, Silvia Giordano, Omran Ayoub

机构 * University of Applied Sciences and Arts of Southern Switzerland(瑞士南方应用科学与艺术大学) Università della Svizzera italiana(瑞士意大利大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于强化学习的方法,生成同时满足个体和群体公平性的反事实解释,以提升XAI的公平性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏