arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-29 至 2026-01-29 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 2 篇

2501.19180 2026-01-29 cs.CR cs.AI 85%

Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning

通过主动安全推理增强模型对劫持的防御

Xianglin Yang, Gelei Deng, Jieming Shi, Tianwei Zhang, Jin Song Dong

机构 * School of Computing(计算学院) National University of Singapore(新加坡国立大学) School of Computer Science and Engineering(计算机科学与工程学院) Nanyang Technological University(南洋理工大学) Department of Computing(计算系) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出SCoT方法,通过主动安全推理提升模型对劫持的防御能力,有效减少对分布外问题和对抗操纵的易感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19750 2026-01-29 cs.MM cs.CV cs.IR 50%

Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues

在电子商务目录中评估多模态大语言模型用于缺失模态补全

Junchen Fu, Wenhao Deng, Kaiwen Zheng, Ioannis Arapakis, Yu Ye, Yongxin Ni, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Telefónica Scientific Research(电信科研机构) National University of Singapore(新加坡国立大学) Shandong University(山东大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文研究了多模态大语言模型在电子商务目录中补全缺失模态的能力,通过MMPCBench基准测试发现MLLMs在细粒度对齐上存在不足,并探索了GRPO方法以提升补全效果。

详情

展开后加载摘要…

URL PDF HTML 收藏