arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-24 至 2025-12-24 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2504.11671 2025-12-24 cs.AI cs.CY cs.LG econ.GN q-fin.EC 67%

Computational Basis of LLM's Decision Making in Social Simulation

大语言模型在社会模拟中的决策机制计算基础

Ji Ma

机构 * LBJ School of Public Affairs, University of Texas at Austin(德克萨斯大学奥斯汀分校公共事务学院LBJ学院) Gradel Institute of Charity, New College, University of Oxford(牛津大学格拉德尔慈善研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本研究通过独裁者游戏探索LLM内部表示的变量变化,揭示社会概念在Transformer模型中的编码机制,为社会模拟和AI对齐提供新方法。

Comments Forthcoming: Sociological Methodology; USPTO patent pending

Journal ref Sociological Methodology, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19950 2025-12-24 cs.CL cs.HC 57%

Bias Beneath the Tone: Empirical Characterisation of Tone Bias in LLM-Driven UX Systems

音调下的偏见:LLM驱动的UX系统中音调偏见的实证刻画

Heet Bodara, Md Masum Mushfiq, Isma Farah Siddiqui

机构 * Faculty of Information Technology, Monash University(信息技术学院,莫纳什大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CL

AI总结 本文研究了LLM驱动UX系统中的音调偏见问题,通过合成数据集和弱监督方法,揭示了模型在对话中存在系统性的音调偏差,为设计公平可信的对话AI提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17180 2025-12-24 cs.RO cs.AI 57%

Conservative Bias in Multi-Teacher Learning: Why Agents Prefer Low-Reward Advisors

多教师学习中的保守偏见:为什么智能体更偏好低奖励顾问

Maher Mesto, Francisco Cruz

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) Escuela de Ingeniería, Universidad Central de Chile(智利中央大学工程学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文揭示了多教师学习中智能体偏好保守低奖励顾问的现象,发现其受保守偏见主导,并在特定阈值下失效,同时在概念漂移情况下显著优于基线Q学习。

Comments 10 pages, 5 figures. Accepted at ACRA 2025 (Australasian Conference on Robotics and Automation)

详情

展开后加载摘要…

URL PDF HTML 收藏