arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-07-07 至 2026-07-07 共收录 3
2603.22730 2026-07-07 cs.CL cs.CY 版本更新

How Utilitarian Are OpenAI's Models Really? Replicating and Reinterpreting Pfeffer, Krügel, and Uhl (2025)

OpenAI模型真的那么功利主义吗?复制并重新解读Pfeffer、Krügel和Uhl(2025)

Johannes Himmelreich

机构 * OpenAI

AI总结 研究通过复制和扩展实验,发现OpenAI模型在不同提示下表现出功利主义倾向,但存在提示偏差影响结果,强调需多提示测试以验证LLM道德推理的可靠性。

Comments 20 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15199 2026-07-07 cs.LG stat.ML 版本更新

Interpretability and Generalization Bounds for Learning Spatial Physics

学习空间物理的可解释性与泛化界

Alejandro Francisco Queiruga, Theo Gutman-Solo, Shuai Jiang

机构 * OpenAI Google(谷歌) Sandia National Laboratories(桑迪亚国家实验室)

AI总结 利用数值分析技术,严格量化了应用于线性微分方程的机器学习模型在参数发现或求解中的准确性、收敛率和泛化界,并基于格林函数表示引入科学模型的可解释性视角。

Comments To appear in ICML 2026. 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20203 2026-07-07 cs.AI 版本更新

Shutdownable Agents through POST-Agency

通过后代理实现可关闭的智能体

Elliott Thornley

机构 * OpenAI

AI总结 提出后代理建议,训练智能体满足仅在等长轨迹间的偏好,证明此与其他条件蕴含中立性+,使智能体可关闭且有用。

详情

展开后加载摘要…

URL PDF HTML 收藏