arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-23 至 2026-01-23 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2601.15698 2026-01-23 cs.CV cs.AI 85%

Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs

超越视觉安全:通过语义无关输入对多模态大语言模型进行有害图像生成的劫持

Mingyu Yu, Lana Liu, Zhehao Zhao, Wei Wang, Sujuan Qin

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) School of Cyberspace Security, Beijing University of Posts and Telecommunications(网络安全学院,北京邮电大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出BVS框架,通过语义无关输入对多模态大语言模型进行有害图像生成的劫持,揭示其视觉安全边界的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01747 2026-01-23 cs.CR cs.AI cs.CV cs.LG 73%

Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization

为大型视觉-语言模型设计对抗输入使用黑盒优化

Jiwei Guan, Haibo Jin, Haohan Wang

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院) School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于零阶优化的黑盒劫持攻击方法,针对大型视觉-语言模型实现高成功率的对抗性攻击,揭示了当前模型安全机制的不足。

Comments EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15331 2026-01-23 cs.CL cs.AI cs.CR cs.LG 67%

RECAP: A Resource-Efficient Method for Adversarial Prompting in Large Language Models

RECAP:一种资源高效的对抗性提示方法用于大型语言模型

Rishit Chugh

机构 * Rishit Chugh(独立研究者)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RECAP提出一种无需重新训练的高效对抗性提示方法,通过匹配预训练对抗性提示数据库,降低计算成本并提升攻击成功率。

Comments Code for RECAP is available at: https://github.com/R-C101/RECAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15786 2026-01-23 cs.CE 50%

Endowing Molecular Language with Geometry Perception via Modality Compensation for High-Throughput Quantum Hamiltonian Prediction

通过模态补偿赋予分子语言几何感知能力以实现高通量量子哈密顿量预测

Zhenzhong Wang, Yongjie Hou, Chenggong Huang, Yuxuan Du, Dacheng Tao, Min Jiang

专题命中 越狱攻击 :alignment(abstract)

AI总结 通过模态补偿赋予分子语言几何感知能力,利用 SMILES 实现高通量量子哈密顿量预测,提高计算效率与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏