arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-06 至 2026-02-06 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 6 篇

2508.01151 2026-02-06 cs.CV cs.AI 88%

Personalized Safety Alignment for Text-to-Image Diffusion Models

面向文本到图像扩散模型的个性化安全对齐

Yu Lei, Jinbin Bai, Qingyu Shi, Aosong Feng, Hongcheng Gao, Xiao Zhang, Rex Ying

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) Yale University(耶鲁大学) Collov Labs(Collov实验室)

专题命中 其他安全 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文提出个性化安全对齐框架PSA,通过用户条件适应提升文本到图像扩散模型的安全性与生成质量,实现安全与质量的动态平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20741 2026-02-06 cs.HC cs.AI cs.CY cs.LG 67%

In defence of post-hoc explanations in medical AI

为医疗AI中的事后解释辩护

Joshua Hatherley, Lauritz Munch, Jens Christian Bjerring

机构 * Center for the Philosophy of AI(哲学人工智能中心) University of Copenhagen(哥本哈根大学) Department of Philosophy and History of Ideas(哲学与思想史系) Aarhus University(奥胡斯大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文为医疗AI中的事后解释辩护,指出其虽无法完全复制黑盒推理过程,但能提升用户理解、提高临床团队准确性并辅助医生决策。

Journal ref 2026. Hastings Center Report 56(1): 40-46

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05176 2026-02-06 cs.CL 57%

Among Us: Measuring and Mitigating Malicious Contributions in Model Collaboration Systems

Among Us: 在模型协作系统中衡量并减轻恶意贡献

Ziyuan Yang, Wenxuan Ding, Shangbin Feng, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) New York University(纽约大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 研究针对模型协作系统中的恶意贡献问题,通过实验评估恶意模型的影响,并提出外部监督策略以缓解其影响。

Comments 19 pages, 15 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04929 2026-02-06 cs.LG 57%

TurboBoA: Faster and Exact Attention-aware Quantization without Backpropagation

TurboBoA: 更快且精确的注意力感知量化无需反向传播

Junhan Kim, Yeo Jeong Park, Seungwoo Son, Chungman Lee, Ho-young Kim, Joonyoung Kim, Yongkweon Jeon

机构 * Samsung Research(三星研究院) SNU.ac.kr(首尔国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 TurboBoA是一种无需反向传播的高效PTQ算法,通过联合量化和误差补偿提升精度与速度,实现比BoA更快的量化过程。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04903 2026-02-06 cs.LG 57%

Mind the Performance Gap: Capability-Behavior Trade-offs in Feature Steering

注意性能差距:特征引导中的能力-行为权衡

Eitan Sprejer, Oscar Agustín Stanchi, María Victoria Carro, Denise Alejandra Mester, Iván Arcuschin

机构 * BAISH, Universidad de Buenos Aires, Argentina(BAISH,布宜诺斯艾利斯大学,阿根廷) AISAR, AI Safety Argentina(AISAR,人工智能安全阿根廷) Instituto de Investigación en Informática LIDI, Universidad Nacional de La Plata, Argentina(信息研究所LIDI,拉普拉塔国立大学,阿根廷) FAIR, IALAB UBA, Universidad de Buenos Aires, Argentina(FAIR,IALAB UBA,布宜诺斯艾利斯大学,阿根廷) Università degli Studi di Genova, Italy(热那亚大学,意大利)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 研究发现特征引导方法在控制行为时显著降低模型性能,揭示了能力与行为之间的权衡问题。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05701 2026-02-06 cs.LG 57%

Statistically Valid Post-Deployment Monitoring Should Be Standard for AI-Based Digital Health

基于AI的数字健康应将统计上有效的部署后监控作为标准

Pavel Dolin, Weizhi Li, Gautam Dasarathy, Visar Berisha

机构 * Arizona State University(亚利桑那州立大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文主张基于AI的数字健康应采用统计上有效的部署后监控作为标准,提出统计有效且标签效率高的测试框架以确保现实部署的可靠性和安全性。

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏