arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-07 至 2026-01-07 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 2 篇

2512.10675 2026-01-07 cs.RO cs.AI cs.CV cs.LG 73%

Evaluating Gemini Robotics Policies in a Veo World Simulator

在Veo世界模拟器中评估Gemini机器人策略

Gemini Robotics Team, Krzysztof Choromanski, Coline Devin, Yilun Du, Debidatta Dwibedi, Ruiqi Gao, Abhishek Jindal, Thomas Kipf, Sean Kirmani, Isabel Leal, Fangchen Liu, Anirudha Majumdar, Andrew Marmon, Carolina Parada, Yulia Rubanova, Dhruv Shah, Vikas Sindhwani, Jie Tan, Fei Xia, Ted Xiao, Sherry Yang, Wenhao Yu, Allan Zhou

机构 * Gemini Robotics Team(Gemini机器人团队) Google DeepMind(谷歌DeepMind)

专题命中 红队测试 :safety(abstract);red teaming(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于Veo视频模型的生成式评估系统,用于在Veo世界模拟器中全面评估Gemini机器人策略的性能,包括名义性能、分布外泛化及安全约束测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00042 2026-01-07 cs.CR cs.AI cs.LG 62%

Large Empirical Case Study: Go-Explore adapted for AI Red Team Testing

大规模实证研究:为AI红队测试适应的Go-Explore

Manish Bhatt, Adrian Wood, Idan Habler, Ammar Al-Kahfah

机构 * Amazon(亚马逊公司) Dropbox(Dropbox公司) Cisco(思科公司)

专题命中 红队测试 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究通过Go-Explore评估GPT-4o-mini的安全性,发现种子方差和领域知识对测试结果影响显著,单种子比较不可靠,多种子平均能降低方差,奖励塑造导致探索崩溃和假阳性。

详情

展开后加载摘要…

URL PDF HTML 收藏