arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-09 至 2026-02-09 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 2 篇

2305.02748 2026-02-09 cs.AI cs.CY cs.MA 62%

A computational framework for human values

人类价值观的计算框架

Nardine Osman, Mark d'Inverno

机构 * Artificial Intelligence Research Institute (IIIA-CSIC)(人工智能研究 institute (IIIA-CSIC))

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一个基于社会科学的正式框架,用于系统研究如何通过人类价值观设计伦理人工智能。

Journal ref Proceedings of the 23rd International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2024), pp. 1531-1539

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06107 2026-02-09 cs.AI 57%

Jackpot: Optimal Budgeted Rejection Sampling for Extreme Actor-Policy Mismatch Reinforcement Learning

Jackpot: 为极端演员-策略不匹配强化学习的最优预算拒绝采样

Zhuoming Chen, Hongyi Liu, Yang Zhou, Haizhong Zheng, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 Jackpot通过最优预算拒绝采样方法,有效减少rollout模型与策略之间的分布差异,提升大语言模型强化学习的训练稳定性与效率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏