arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-11 至 2026-02-11 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2403.04202 2026-02-11 cs.MA cs.AI cs.CY cs.LG 75%

Dynamics of Moral Behavior in Heterogeneous Populations of Learning Agents

学习代理异质群体中道德行为的动力学

Elizaveta Tennant, Stephen Hailes, Mirco Musolesi

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文研究了在社会困境环境中,道德异质群体的学习动态,探讨了不同道德类型代理之间的相互作用及对群体行为的影响。

Comments Presented at AIES 2024 (7th AAAI/ACM Conference on AI, Ethics, and Society - San Jose, CA, USA) - see https://ojs.aaai.org/index.php/AIES/article/view/31736

Journal ref Proceedings of the 7th AAAI/ACM Conference on AI, Ethics, and Society (AIES), vol. 7, (2024), pp 1444-1454

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09590 2026-02-11 cs.CL cs.AI 62%

Context-Aware Counterfactual Data Augmentation for Gender Bias Mitigation in Language Models

面向上下文的反事实数据增强用于语言模型中的性别偏见缓解

Shweta Parihar, Liu Guangliang, Natalie Parde, Lu Cheng

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Context-CDA方法,通过增强上下文和过滤低质量反事实,有效缓解语言模型中的性别偏见,同时保持语言建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06218 2026-02-11 cs.CV cs.LG 57%

Cross-Modal Redundancy and the Geometry of Vision-Language Embeddings

跨模态冗余与视觉-语言嵌入的几何学

Grégoire Dhimoïla, Thomas Fel, Victor Boutin, Agustin Picard

机构 * Brown University(布朗大学) ENS Paris Saclay(巴黎萨克雷大学) IRT Saint Exupéry(IRT圣埃克苏佩里) Kempner Institute, Harvard University(哈佛大学凯姆纳研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文通过等能假设和对齐稀疏自编码器,揭示了视觉-语言模型中跨模态对齐的几何结构,发现稀疏双模态原子承载了跨模态对齐信号,单模态原子解释了模态差距,去除单模态原子可消除差距而不影响性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19186 2026-02-11 stat.ML cs.LG 57%

Double Fairness Policy Learning: Integrating Action Fairness and Outcome Fairness in Decision-making

双公平性政策学习:在决策中整合行动公平性与结果公平性

Zeyu Bian, Lan Wang, Chengchun Shi, Zhengling Qi

机构 * Department of Statistics(统计系) Florida State University(佛罗里达州立大学) Department of Management Science(管理科学系) University of Miami(迈阿密大学) London School of Economics and Political Science(伦敦政治经济学院) Department of Decision Sciences(决策科学系) George Washington University(乔治华盛顿大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出双公平性学习框架,通过整合行动公平与结果公平,提升决策中的公平性并最小化价值损失。

详情

展开后加载摘要…

URL PDF HTML 收藏