arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-12 至 2026-02-12 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2601.23001 2026-02-12 cs.CL cs.AI 62%

Bias Beyond Borders: Political Ideology Evaluation and Steering in Multilingual LLMs

偏见超越国界:多语言大语言模型中的政治意识形态评估与引导

Afrozah Nadeem, Agrima Seth, Mehwish Nasim, Usman Naseem

机构 * School of Computing, Macquarie University, Australia(麦考瑞大学计算机学院) Microsoft, USA(微软公司) University of Western Australia, Australia(西澳大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出跨语言对齐引导框架,用于评估和减轻多语言LLM中的政治偏见,通过跨语言对齐意识形态表示以实现公平性与多样性的平衡。

Comments PrePrint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08193 2026-02-12 cs.AI 57%

Measuring What Matters: The AI Pluralism Index

衡量重要性:AI多元主义指数

Rashid Mushkani

机构 * Université de Montréal(蒙特利尔大学) Mila – Québec AI Institute(魁北克人工智能研究所)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出AI多元主义指数,用于衡量人工智能系统在治理、包容性和透明度方面的多元实践,旨在引导激励向多元主义方向发展。

Comments Proceedings of the International Association for Safe & Ethical AI (IASEAI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12365 2026-02-12 cs.CL cs.DB 57%

Advances in LLMs with Focus on Reasoning, Adaptability, Efficiency and Ethics

大语言模型的进展:聚焦推理、适应性、效率和伦理

Asifullah Khan, Muhammad Zaeem Khan, Aleesha Zainab, Saleha Jamshed, Sadia Ahmad, Kaynat Khatib, Faria Bibi, Abdul Rehman

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文综述了大语言模型在推理、适应性、效率和伦理方面的进展,探讨了关键技术和挑战,提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏