arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-03 至 2025-12-03 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 5 篇

2504.16148 2025-12-03 cs.CY cs.AI 62%

Towards responsible AI for education: Hybrid human-AI to confront the Elephant in the room

迈向负责任的教育AI:混合人类-人工智能以应对教育领域的关键问题

Danial Hooshyar, Gustav Šír, Yeongwook Yang, Eve Kikas, Raija Hämäläinen, Tommi Kärkkäinen, Dragan Gašević, Roger Azevedo

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨教育AI中的关键问题,提出神经符号AI作为解决这些问题的混合方法,以实现负责任的AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02265 2025-12-03 cs.LG cs.CY 62%

The Effect of Enforcing Fairness on Reshaping Explanations in Machine Learning Models

在机器学习模型中强制公平性对解释重塑的影响

Joshua Wolff Anderson, Shyam Visweswaran

机构 * Intelligent Systems Program, University of Pittsburgh(1 智能系统计划,匹兹堡大学) Department of Biomedical Informatics, University of Pittsburgh(2 生物医学信息学系,匹兹堡大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY、cs.LG

AI总结 本研究探讨了在医疗机器学习中通过偏见缓解技术提高公平性如何影响基于Shapley的特征排名,发现公平性提升可能改变特征重要性排名,强调了在模型评估中需综合考虑准确性、公平性和可解释性。

Comments 10 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02058 2025-12-03 cs.CY cs.CL 62%

Misalignment of LLM-Generated Personas with Human Perceptions in Low-Resource Settings

在低资源环境下,LLM生成的人设与人类感知的错位

Tabia Tanzin Prama, Christopher M. Danforth, Peter Sheridan Dodds

机构 * Computational Story Lab(计算故事实验室) Vermont Complex Systems Institute(佛罗里达复杂系统研究所) Vermont Advanced Computing Center(佛罗里达高级计算中心) Department of Mathematics and Statistics(数学与统计学系) Department of Computer Science University of Vermont(佛罗里达大学计算机科学系) Santa Fe Institute(圣菲研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本研究发现,在低资源环境中,LLM生成的人设在共情和可信度方面显著劣于人类,需通过现实数据验证以确保其可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02508 2025-12-03 cs.LG 57%

Water Quality Estimation Through Machine Learning Multivariate Analysis

通过机器学习多变量分析估计水质

Marco Cardia, Stefano Chessa, Alessio Micheli, Antonella Giuliana Luminare, Francesca Gambineri

机构 * University of Pisa(比萨大学) ARCHA S.R.L.(ARCHA公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文通过结合紫外-可见光谱与机器学习,提出了一种用于水质评估的多变量分析方法,以实现快速、准确且可解释的水质参数检测。

Comments The paper has been accepted at Italian Workshop on Neural Networks (WIRN) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02562 2025-12-03 eess.SY cs.SY 50%

Intervention Strategies for Fairness and Efficiency at Autonomous Single-Intersection Traffic Flows

自主单交叉口交通流的公平性与效率干预策略

Salman Ghori, Ania Adil, Melkior Ornik, Eric Feron

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出了一种基于混合整数线性规划的干预策略,用于在无信号灯的交叉口上优化自主代理的公平性与效率,通过仿真验证早干预和公平性意识控制的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏