arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-12 至 2025-12-12 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2512.10058 2025-12-12 cs.AI cs.CY cs.HC cs.SI 90%

Mind the Gap! Pathways Towards Unifying AI Safety and Ethics Research

注意差距!迈向统一人工智能安全与伦理研究的路径

Dani Roytburg, Beck Miller

机构 * Department of Machine Learning(机器学习系) Carnegie Mellon University(卡内基梅隆大学) Department of Computer Science(计算机科学系) Emory University(埃默里大学)

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过文献计量学分析揭示人工智能安全与伦理研究的结构性分裂,并提出通过共享基准、跨机构平台和混合方法整合两者以构建更公正的人工智能系统。

Comments Accepted for presentation at IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18156 2025-12-12 cs.AI 77%

AI Through the Human Lens: Investigating Cognitive Theories in Machine Psychology

通过人类之眼审视人工智能:在机器心理学中探究认知理论

Akash Kundu, Rishika Goswami

机构 * Heritage Institute of Technology(赫里蒂奇理工学院)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文通过四个心理学框架研究LLMs的认知模式,发现其在叙述生成、框架偏差、道德判断和自我矛盾等方面表现出与人类相似但受训练数据影响的行为特征。

Comments Accepted to IJCNLP-AACL 2025 Student Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16069 2025-12-12 cs.CY cs.AI 62%

Human or AI? Comparing Design Thinking Assessments by Teaching Assistants and Bots

人类还是人工智能?教学助教与机器人的设计思维评估比较

Sumbul Khan, Wei Ting Liow, Lay Kee Ang

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究比较了教学助教与AI在评估设计思维教育学生海报中的表现,发现教师更偏好助教评分,但AI在一致性与反馈效率上具有一定优势。

Comments to be published in IEEE TALE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏