arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-27 至 2026-01-27 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 5 篇

2505.21184 2026-01-27 cs.LG cs.AI cs.CL 85%

Jailbreak-as-a-Service++: Unveiling Distributed AI-Driven Malicious Information Campaigns Powered by LLM Crowdsourcing

Jailbreak-as-a-Service++:揭示由LLM众包驱动的分布式恶意信息活动

Yu Yan, Sheng Sun, Mingfeng Li, Yunlong Song, Xingzhou Zhang, Linran Lu, Zhifei Zheng, Min Liu, Qi Li

机构 * Institute of Computing Technology, CAS(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) China People’s Public Security University(中国人民公安大学) Tongji University(同济大学) South China Normal University(华南师范大学) Tsing Hua University(清华大学)

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Jailbreak-as-a-Service++研究通过LLM众包技术揭示分布式恶意信息活动,提出PoisonSwarm方法提升恶意任务生成效率并提出生态系统级防御需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15801 2026-01-27 cs.LG cs.CR 83%

Attributing and Exploiting Safety Vectors through Global Optimization in Large Language Models

通过全局优化在大语言模型中归因和利用安全向量

Fengheng Chu, Jiahao Chen, Yuhong Wang, Jun Wang, Zhihui Fu, Shouling Ji, Songze Li

机构 * Southeast University(东南大学) Zhejiang University(浙江大学) OPPO Research Institute(OPPO研究院)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 通过全局优化方法识别大语言模型中的安全向量,揭示安全机制的协作交互,并提出新的白盒劫持方法提升攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03495 2026-01-27 eess.SY cs.AI cs.SY 57%

Cyberattack Detection in Virtualized Microgrids Using LightGBM and Knowledge-Distilled Classifiers

在虚拟微电网中利用LightGBM和知识蒸馏分类器进行网络攻击检测

Osasumwen Cedric Ogiesoba-Eguakun, Suman Rath

机构 * The University of Tulsa(塔尔萨大学) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于LightGBM和知识蒸馏的轻量级机器学习方法,用于在虚拟微电网中高效检测网络攻击。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21155 2026-01-27 cs.CL 57%

Learning the Wrong Lessons: Syntactic-Domain Spurious Correlations in Language Models

学习错误的教训:语言模型中的语法-领域虚假相关性

Chantal Shaib, Vinith M. Suriyakumar, Levent Sagun, Byron C. Wallace, Marzyeh Ghassemi

机构 * Northeastern University(东北大学) MIT(麻省理工学院) Meta

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 研究揭示了语言模型中语法与领域之间的虚假相关性问题,指出训练数据中语法模板可能影响模型性能,并提出需测试此类相关性及确保训练数据多样性以防止错误学习。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19327 2026-01-27 cs.CV cs.AI 57%

DeepInsert: Early Layer Bypass for Efficient and Performant Multimodal Understanding

DeepInsert: 早期层绕过以实现高效且高性能的多模态理解

Moulik Choraria, Xinbo Wu, Akhil Bhimaraju, Nitesh Sekhar, Yue Wu, Xu Zhang, Prateek Singhal, Lav R. Varshney

机构 * UIUC(伊利诺伊大学) Amazon(亚马逊) Capital One Apple(苹果) Stony Brook University(石溪大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 DeepInsert通过将多模态令牌插入模型中间层以绕过早期层,从而在降低训练和推理成本的同时保持或提升多模态语言模型的性能。

Comments To be presented at EACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏