arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-28 至 2025-10-28 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 5 篇

2506.10192 2025-10-28 cs.AI 83%

Towards Responsible AI: Advances in Safety, Fairness, and Accountability of Autonomous Systems

Filip Cano

专题命中 AI治理与伦理 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

Comments 204 pages, 38 figures, PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23245 2025-10-28 cs.HC cs.MA 71%

Multi-Stakeholder Alignment in LLM-Powered Collaborative AI Systems: A Multi-Agent Framework for Intelligent Tutoring

Alexandre P Uchoa, Carlo E T Oliveira, Claudia L R Motta, Daniel Schneider

专题命中 AI治理与伦理 :alignment(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22823 2025-10-28 cs.CL cs.AI 62%

Cross-Lingual Stability and Bias in Instruction-Tuned Language Models for Humanitarian NLP

Poli Nemkova, Amrit Adhikari, Matthew Pearson, Vamsi Krishna Sadu, Mark V. Albert

机构 * University of North Texas(北卡罗来纳大学达顿分校) Davidson College(戴维森学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22286 2025-10-28 cs.CY 57%

Hybrid Instructor Ai Assessment In Academic Projects: Efficiency, Equity, And Methodological Lessons

Hugo Roger Paz

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

Comments 12 pages, in Spanish language, 0 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21967 2025-10-28 cs.HC cs.CY 57%

We Need Accountability in Human-AI Agent Relationships

Benjamin Lange, Geoff Keeling, Arianna Manzini, Amanda McCroskery

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏