arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-05 至 2025-12-05 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 5 篇

2512.04354 2025-12-05 cs.LG cs.HC 70%

SmartAlert: Implementing Machine Learning-Driven Clinical Decision Support for Inpatient Lab Utilization Reduction

SmartAlert:基于机器学习的临床决策支持系统用于住院患者实验室利用减少

April S. Liang, Fatemeh Amrollahi, Yixing Jiang, Conor K. Corbin, Grace Y. E. Kim, David Mui, Trevor Crowell, Aakash Acharya, Sreedevi Mony, Soumya Punnathanam, Jack McKeown, Margaret Smith, Steven Lin, Arnold Milstein, Kevin Schulman, Jason Hom, Michael A. Pfeffer, Tho D. Pham, David Svec, Weihan Chu, Lisa Shieh, Christopher Sharp, Stephen P. Ma, Jonathan H. Chen

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 SmartAlert通过机器学习驱动的临床决策支持系统,减少住院患者重复实验室检测,实现15%的检测减少率。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04691 2025-12-05 cs.AI cs.CL cs.MA 62%

Towards Ethical Multi-Agent Systems of Large Language Models: A Mechanistic Interpretability Perspective

迈向伦理化的大型语言模型多智能体系统:从机制可解释性视角出发

Jae Hee Lee, Anne Lauscher, Stefano V. Albrecht

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文从机制可解释性视角出发,提出确保大型语言模型多智能体系统伦理行为的研究议程,聚焦于伦理评估框架、内部机制解析及参数高效对齐技术。

Comments Accepted to LaMAS 2026@AAAI'26 (https://sites.google.com/view/lamas2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22037 2025-12-05 cs.CY 61%

What AI Speaks for Your Community: Polling AI Agents for Public Opinion on Data Center Projects

人工智能为你的社区发声:通过AI代理收集数据中心项目公众意见

Zhifeng Wu, Yuelin Han, Shaolei Ren

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY;trustworthy(comments)

AI总结 本文提出AI代理调查框架,利用大型语言模型评估社区对数据中心项目的意见,以指导负责任的AI发展。

Comments 35 Pages. Accepted to NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04408 2025-12-05 cs.AI 57%

Executable Governance for AI: Translating Policies into Rules Using LLMs

可执行治理 for AI:利用 LLMs 将政策翻译成规则

Gautam Varma Datla, Anudeep Vurity, Tejaswani Dash, Tazeem Ahmad, Mohd Adnan, Saima Rafi

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 利用 LLMs 将 AI 政策转化为可执行规则,通过 P2T 框架实现标准化表示,提升政策执行的自动化与安全性。

Comments Accepted to AAAI-26 AI Governance Workshop (in-person presentation); 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04232 2025-12-05 q-bio.PE cs.CY 57%

Decentralized Social Media and Artificial Intelligence in Digital Public Health Monitoring

去中心化的社交媒体与人工智能在数字公共卫生监测中的应用

Marcel Salathé, Sharada P. Mohanty

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文探讨了去中心化社交媒体与人工智能在数字公共卫生监测中的应用,分析了数据获取与AI技术之间的矛盾,并提出了适应性策略。

详情

展开后加载摘要…

URL PDF HTML 收藏