arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-18 至 2025-12-18 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 2 篇

2507.10532 2025-12-18 cs.LG cs.AI cs.CL 67%

Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination

推理还是记忆?由于数据污染导致强化学习不可靠的结果

Mingqi Wu, Zhihao Zhang, Qiaole Dong, Zhiheng Xi, Jun Zhao, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Huijie Lv, Ming Zhang, Yanwei Fu, Qin Liu, Songyang Zhang, Qi Zhang

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现Qwen2.5系列模型易受数据污染影响,通过生成清洁算术问题验证了准确奖励信号对数学推理性能的提升作用

Comments 28 pages, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03338 2025-12-18 cs.CV cs.AI cs.CY 62%

Safer Prompts: Reducing Risks from Memorization in Visual Generative AI

更安全的提示:减少视觉生成AI中记忆化风险

Lena Reissinger, Yuanyuan Li, Anna-Carolina Haensch, Neeraj Sarna

机构 * Ludwig Maximilian University of Munich(慕尼黑路易斯·马克西米利安大学) Munich RE(慕尼黑RE)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出通过提示工程技术减少视觉生成AI中因记忆训练数据导致的安全风险,提升生成图像与训练数据的相似性降低,同时保持输出的相关性和美观性。

详情

展开后加载摘要…

URL PDF HTML 收藏