arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-14 至 2026-01-14 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2505.13565 2026-01-14 cs.CY cs.AI cs.HC 81%

Aligning Trustworthy AI with Democracy: A Dual Taxonomy of Opportunities and Risks

将可信AI与民主对齐:机会与风险的双重分类

Oier Mentxaka, Natalia Díaz-Rodríguez, Mark Coeckelbergh, Marcos López de Prado, Emilia Gómez, David Fernández Llorca, Enrique Herrera-Viedma, Francisco Herrera

机构 * Dept. of Computer Science and Artificial Intelligence, DaSCI, University of Granada, Spain(计算机科学与人工智能系,DaSCI,格拉纳达大学) Dept. of Philosophy, University of Vienna, Vienna, Austria(哲学系,维也纳大学) School of Engineering, Cornell University, Ithaca, NY, United States(工程学院,康奈尔大学) Dept. of Mathematics, Khalifa University of Science and Technology, Abu Dhabi, UAE(数学系,科学与技术大学,阿布扎赫德,阿联酋) ADIA Lab, Al Maryah Island, Abu Dhabi, UAE(ADIA实验室,阿布扎赫德,阿联酋) Joint Research Centre, European Commission, Seville, Spain(联合研究中心,欧洲委员会,塞维利亚,西班牙) Computer Engineering Dept., University of Alcalá, Alcalá de Henares, Spain(计算机工程系,阿尔卡拉大学)

专题命中 AI治理与伦理 :trustworthy(title,abstract);分类 cs.AI、cs.CY

AI总结 本文提出双重分类框架,评估AI对民主的风险与机遇,为可信民主AI的发展提供规范性指导。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09114 2026-01-14 cs.AI cs.CY 62%

AI TIPS 2.0: A Comprehensive Framework for Operationalizing AI Governance

AI TIPS 2.0: 一个全面的AI治理实施框架

Pamela Gupta

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 AI TIPS 2.0是一个全面的AI治理实施框架,旨在解决AI部署中的三个关键治理挑战,通过提供定制化的治理方法和可操作的控制措施,提升AI系统的可信度和合规性。

Comments We have adjustments to make for higher effectiveness

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07954 2026-01-14 cs.CL 57%

A Human-Centric Pipeline for Aligning Large Language Models with Chinese Medical Ethics

面向中文医疗伦理的以人为本的大型语言模型对齐流水线

Haoan Jin, Han Ying, Jiacheng Ji, Hanhui Xu, Mengyue Wu

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出MedES基准和 guardian-in-the-loop 框架,通过监督微调和偏好优化,实现中文医疗伦理场景下的LLM对齐,提升伦理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏