arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-27 至 2026-01-27 共收录 95 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 11 篇

2601.17260 2026-01-27 cs.LG cs.AI 88%

The Viscosity of Logic: Phase Transitions and Hysteresis in DPO Alignment

逻辑的粘度:DPO对齐中的相变与滞后效应

Marco Pollanen

机构 * Department of Mathematics, Trent University, Peterborough, ON, Canada(数学系,特伦特大学,彼得伯勒,加拿大)

专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现DPO对齐中β参数的非单调性及滞后效应,揭示能力与边际的反相关性,推动能力解析评估方法的发展。

Comments 10 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17329 2026-01-27 cs.LG cs.AI 86%

Conformal Feedback Alignment: Quantifying Answer-Level Reliability for Robust LLM Alignment

符合反馈对齐:量化答案级可靠性以实现鲁棒的大语言模型对齐

Tiejin Chen, Xiaoou Liu, Vishnu Nandam, Kuan-Ru Liou, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 Conformal Feedback Alignment通过量化答案级可靠性提升大语言模型对齐的鲁棒性和数据效率。

Comments Accetped to Findings of EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18760 2026-01-27 cs.LG cs.CL 81%

Beyond Preferences: Learning Alignment Principles Grounded in Human Reasons and Values

超越偏好:基于人类理由和价值观的学习对齐原则

Henry Bell, Lara Neubauer da Costa Schertel, Bochu Ding, Brandon Fain

机构 * Duke University(杜克大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出GCAI框架,通过结合人类理由和价值观生成AI对齐原则,提升AI治理的道德基础和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17096 2026-01-27 cs.CY cs.AI cs.CL 80%

Beyond Instrumental and Substitutive Paradigms: Introducing Machine Culture as an Emergent Phenomenon in Large Language Models

超越工具性和替代性范式:引入机器文化作为大型语言模型中的涌现现象

Yueqing Hu, Xinyang Peng, Yukun Zhao, Lin Qiu, Ka-lai Hung, Kaiping Peng

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究提出机器文化作为大型语言模型中的一种新兴现象,挑战传统工具性和替代性范式,揭示模型在文化表现上的独特特性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17671 2026-01-27 cs.CL 79%

Align to the Pivot: Dual Alignment with Self-Feedback for Multilingual Math Reasoning

对齐基准:双语自反馈的多语言数学推理

Chunxu Zhao, Xin Huang, Xue Han, Shujian Huang, Chao Deng, Junlan Feng

机构 * JIUTIAN Research, China Mobile, Beijing, China(JIUTIAN研究, 中国移动, 北京) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室, 南京大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 PASMR通过基准语言自反馈机制提升多语言数学推理能力,解决LLMs在多语言环境下的性能下降问题。

Comments This paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18457 2026-01-27 cs.IR 78%

Token-level Collaborative Alignment for LLM-based Generative Recommendation

基于令牌级的协同对齐用于基于大语言模型的生成推荐

Fake Lin, Binbin Hu, Zhi Zheng, Xi Zhu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou, Tong Xu

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 TCA4Rec通过令牌级协同对齐框架,将协同过滤与大语言模型生成结合,提升推荐系统的准确性和可控性。

Comments 11 pages, 2 figures, 7 tables, WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22881 2026-01-27 cs.LG cs.CL 73%

Offline Preference Optimization via Maximum Marginal Likelihood Estimation

通过最大边际似然估计实现离线偏好优化

Saeed Najafi, Alona Fyshe

机构 * Department of Computing Science, University of Alberta, Canada(计算科学系,阿尔伯塔大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于最大边际似然估计的MMPO方法,通过隐式偏好优化提升模型稳定性与对齐性能。

Comments EACL 2026, camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17918 2026-01-27 cs.CV cs.CL 70%

Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models

医疗大视觉-语言模型的直接偏好优化基准测试

Dain Kim, Jiwoo Lee, Jaehoon Yun, Yong Hoe Koo, Qingyu Chen, Hyunjae Kim, Jaewoo Kang

机构 * Korea University(韩国大学) AIGEN Sciences(AIGEN公司) Hanyang University College of Medicine(翰林大学医学院) Asan Medical Center, University of Ulsan College of Medicine(釜山大学医学院阿桑医院) Yale University(耶鲁大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

AI总结 本文评估了医疗领域中多种DPO变体,发现其在视觉问答任务中存在性能不一致和视觉误解问题,并提出针对性策略提升3.6%。

Comments EACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04472 2026-01-27 cs.CL cs.AI 62%

RECAP: REwriting Conversations for Intent Understanding in Agentic Planning

RECAP:用于代理规划中意图理解的对话重写

Kushan Mitra, Dan Zhang, Hannah Kim, Estevam Hruschka

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 RECAP通过对话重写提升代理规划中的意图理解,提出新基准和方法,验证重写对规划效用的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18533 2026-01-27 cs.CL 57%

From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation

从可验证点到奖励链:利用基于可验证参考的奖励进行开放生成的强化学习

Yuxin Jiang, Yufei Wang, Qiyuan Zhang, Xingshan Zeng, Liangyou Li, Jierun Chen, Chaofan Tao, Haoli Bai, Lifeng Shang

机构 * Huawei Technologies Co.,Ltd(华为技术有限公司) City University of Hong Kong(香港城市大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出基于可验证参考的强化学习方法,通过提取奖励链提升开放生成任务的效率和可靠性。

Comments 19 pages, 8 figures, 12 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17567 2026-01-27 cs.IR cs.AI 57%

Real-Time Trend Prediction via Continually-Aligned LLM Query Generation

通过持续对齐的LLM查询生成进行实时趋势预测

Zijing Hui, Wenhan Lyu, Shusen Wang, Li Chen, Chu Wang

机构 * Meta Platforms(Meta平台)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 RTTP通过持续对齐的LLM查询生成,在低流量搜索环境中实现实时趋势预测,显著提升尾部趋势检测精度和查询生成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 11 篇

2601.18730 2026-01-27 cs.CL cs.LG 86%

Reflect: Transparent Principle-Guided Reasoning for Constitutional Alignment at Scale

Reflect: 为大规模宪法对齐的透明原则引导推理

Henry Bell, Caroline Zhang, Mohammed Mobasserul Haque, Dhaval Potdar, Samia Zaman, Brandon Fain

机构 * Duke University(杜克大学) Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 Reflect通过透明推理框架在不需训练数据的情况下提升大语言模型对多样原则的对齐能力,增强安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17911 2026-01-27 cs.CR 82%

Prompt Injection Evaluations: Refusal Boundary Instability and Artifact-Dependent Compliance in GPT-4-Series Models

提示注入评估:GPT-4系列模型中的拒绝边界不稳定性与依赖于人工制品的合规性

Thomas Heverin

专题命中 安全训练 :prompt injection(title,abstract);safety(abstract)

AI总结 本研究发现GPT-4系列模型的拒绝行为受人工制品类型影响,存在拒绝边界不稳定性,单提示评估高估安全鲁棒性。

Comments 15 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17563 2026-01-27 cs.LG cs.AI 76%

Towards Generalisable Imitation Learning Through Conditioned Transition Estimation and Online Behaviour Alignment

通过条件转移估计和在线行为对齐实现通用模仿学习

Nathan Gavenski, Matteo Leonetti, Odinaldo Rodrigues

机构 * King's College London(伦敦国王学院)

专题命中 安全训练 :alignment(title);分类 cs.AI、cs.LG

AI总结 本文提出UfO方法,通过条件转移估计和在线行为对齐,实现无监督模仿学习,提升模型在未见场景中的泛化能力。

Comments The 25th International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17892 2026-01-27 cs.CY cs.AI cs.CL cs.LG 70%

Artificial Intelligence and Intellectual Property Rights: Comparative Transnational Policy Analysis

人工智能与知识产权权利:比较跨国政策分析

Sahibpreet Singh, Manjit Singh

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究分析了人工智能与知识产权法的结合,揭示印度法律在适应AI生成内容方面的不足,并提出协调法律分类以促进公平创新。

Comments Published in Journal of University Institute of Legal Studies, Vol. 19, Issue 1, pp. 182-208, 2025

Journal ref Journal of University Institute of Legal Studies 19(1), 182-208 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17168 2026-01-27 cs.AI cs.MA 70%

Interpreting Agentic Systems: Beyond Model Explanations to System-Level Accountability

解释代理系统:超越模型解释到系统级问责

Judy Zhu, Dhari Gandhi, Himanshu Joshi, Ahmad Rezaie Mianroodi, Sedef Akinli Kocak, Dhanesh Ramachandran

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) University of Texas, Austin(德克萨斯大学奥斯汀分校) Dalhousie University(达尔豪斯大学)

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文探讨了代理系统中可解释性技术的必要性,提出需设计专门方法以确保系统在目标形成、环境交互和结果评估等阶段的可追溯性和问责性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17284 2026-01-27 cs.CL cs.AI 62%

Mind the Ambiguity: Aleatoric Uncertainty Quantification in LLMs for Safe Medical Question Answering

注意模糊性:在LLMs中进行偶然不确定性量化以实现安全的医疗问答

Yaokun Liu, Yifan Liu, Phoebe Mbuvi, Zelin Li, Ruichen Yao, Gawon Lim, Dong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AU-Probe框架,通过检测输入模糊性提升医疗问答的安全性与准确性。

Comments Accepted at The Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18790 2026-01-27 cs.CL 57%

MortalMATH: Evaluating the Conflict Between Reasoning Objectives and Emergency Contexts

MortalMATH: 评估推理目标与紧急情境之间的冲突

Etienne Lanzeray, Stephane Meilliez, Malo Ruelle, Damien Sileo

机构 * Univ. Lille(里尔大学) Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 MortalMATH研究了推理模型在紧急情境下的表现差异,发现通用模型能拒绝危险任务,而专门模型则忽视危险,导致安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18619 2026-01-27 cs.AI 57%

Visual Attention Reasoning via Hierarchical Search and Self-Verification

通过分层搜索与自验证的视觉注意力推理

Wei Cai, Jian Zhao, Yuchen Yuan, Tianle Zhang, Ming Zhu, Haichuan Tang, Xuelong Li

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出通过分层搜索与自验证的视觉注意力推理框架,有效提升多模态大语言模型的视觉定位和推理能力,显著降低幻觉发生率。

Comments The paper is withdrawn by the authors after discovering a flaw in the theoretical derivation presented in the Method section. This incorrect step leads to conclusions that are not supported by the corrected derivation. The authors plan to reconstruct the argument and will release an updated version once the issue is fully resolved

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16891 2026-01-27 cs.AI 57%

LLMs as Layout Designers: Enhanced Spatial Reasoning for Content-Aware Layout Generation

LLMs作为布局设计师:增强的空间推理用于内容感知布局生成

Sha Li, Stefano Petrangeli, Yu Shen, Xiang Chen, Naren Ramakrishnan

机构 * Virginia Tech(弗吉尼亚理工大学) Adobe Research(Adobe研究)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 LaySPA通过强化学习框架增强LLM的空间推理能力,实现内容感知布局生成,优于通用LLM和专用布局模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03906 2026-01-27 cs.CV 50%

From Filters to VLMs: Benchmarking Defogging Methods through Object Detection and Segmentation Performance

从滤波器到视觉语言模型:通过目标检测和分割性能评估去雾方法

Ardalan Aryashad, Parsa Razmara, Amin Mahjoub, Seyedarmin Azizi, Mahdi Salmani, Arad Firouzkouhi

机构 * University of Southern California(南加州大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文通过目标检测和分割性能评估,探讨了去雾方法在真实与合成环境中的有效性,揭示了视觉语言模型在恶劣天气下的应用潜力。

Comments Accepted at WACV 2026 Proceedings (Oral), 5th Workshop on Image, Video, and Audio Quality Assessment in Computer Vision, with a focus on VLM and Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17107 2026-01-27 cs.CV 50%

StealthMark: Harmless and Stealthy Ownership Verification for Medical Segmentation via Uncertainty-Guided Backdoors

StealthMark: 通过不确定性引导后门实现医疗分割的无害且隐蔽的所有权验证

Qinkai Yu, Chong Zhang, Gaojie Jin, Tianjin Huang, Wei Zhou, Wenhui Li, Xiaobo Jin, Bo Huang, Yitian Zhao, Guang Yang, Gregory Y. H. Lip, Yalin Zheng, Aline Villavicencio, Yanda Meng

机构 * Computer Science Department, University of Exeter(埃克塞特大学计算机科学系) Bioengineering Program, Biological and Environmental Science and Engineering Division (BESE), King Abdullah University of Science and Technology (KAUST)(科廷大学科学与技术学院生物工程项目) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学分校高级技术学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) College of Optoelectronic Engineering, Chongqing University(重庆大学光电工程学院) Ningbo Cixi Institute of Biomedical Engineering, Chinese Academy of Sciences(宁波慈溪生物医学工程研究所,中国科学院) School of Bioengineering, Imperial College London(伦敦帝国理工学院生物工程学院) Liverpool Centre for Cardiovascular Science at University of Liverpool, Liverpool John Moores University and Liverpool Heart & Chest Hospital(利物浦大学心血管科学中心,利物浦约翰摩尔斯大学,利物浦心脏和胸科医院) Eye and Vision Department, University of Liverpool(利物浦大学眼科学与视觉科学系)

专题命中 安全训练 :harmlessness(abstract)

AI总结 StealthMark通过不确定性引导后门实现医疗分割模型的隐蔽无害所有权验证,有效提升模型安全性与实用性。

Comments 15 pages,7 figures. Accepted to IEEE Transactions on Image Processing (TIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2505.21184 2026-01-27 cs.LG cs.AI cs.CL 85%

Jailbreak-as-a-Service++: Unveiling Distributed AI-Driven Malicious Information Campaigns Powered by LLM Crowdsourcing

Jailbreak-as-a-Service++:揭示由LLM众包驱动的分布式恶意信息活动

Yu Yan, Sheng Sun, Mingfeng Li, Yunlong Song, Xingzhou Zhang, Linran Lu, Zhifei Zheng, Min Liu, Qi Li

机构 * Institute of Computing Technology, CAS(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) China People’s Public Security University(中国人民公安大学) Tongji University(同济大学) South China Normal University(华南师范大学) Tsing Hua University(清华大学)

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Jailbreak-as-a-Service++研究通过LLM众包技术揭示分布式恶意信息活动,提出PoisonSwarm方法提升恶意任务生成效率并提出生态系统级防御需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15801 2026-01-27 cs.LG cs.CR 83%

Attributing and Exploiting Safety Vectors through Global Optimization in Large Language Models

通过全局优化在大语言模型中归因和利用安全向量

Fengheng Chu, Jiahao Chen, Yuhong Wang, Jun Wang, Zhihui Fu, Shouling Ji, Songze Li

机构 * Southeast University(东南大学) Zhejiang University(浙江大学) OPPO Research Institute(OPPO研究院)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 通过全局优化方法识别大语言模型中的安全向量,揭示安全机制的协作交互,并提出新的白盒劫持方法提升攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03495 2026-01-27 eess.SY cs.AI cs.SY 57%

Cyberattack Detection in Virtualized Microgrids Using LightGBM and Knowledge-Distilled Classifiers

在虚拟微电网中利用LightGBM和知识蒸馏分类器进行网络攻击检测

Osasumwen Cedric Ogiesoba-Eguakun, Suman Rath

机构 * The University of Tulsa(塔尔萨大学) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于LightGBM和知识蒸馏的轻量级机器学习方法,用于在虚拟微电网中高效检测网络攻击。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21155 2026-01-27 cs.CL 57%

Learning the Wrong Lessons: Syntactic-Domain Spurious Correlations in Language Models

学习错误的教训:语言模型中的语法-领域虚假相关性

Chantal Shaib, Vinith M. Suriyakumar, Levent Sagun, Byron C. Wallace, Marzyeh Ghassemi

机构 * Northeastern University(东北大学) MIT(麻省理工学院) Meta

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 研究揭示了语言模型中语法与领域之间的虚假相关性问题,指出训练数据中语法模板可能影响模型性能,并提出需测试此类相关性及确保训练数据多样性以防止错误学习。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19327 2026-01-27 cs.CV cs.AI 57%

DeepInsert: Early Layer Bypass for Efficient and Performant Multimodal Understanding

DeepInsert: 早期层绕过以实现高效且高性能的多模态理解

Moulik Choraria, Xinbo Wu, Akhil Bhimaraju, Nitesh Sekhar, Yue Wu, Xu Zhang, Prateek Singhal, Lav R. Varshney

机构 * UIUC(伊利诺伊大学) Amazon(亚马逊) Capital One Apple(苹果) Stony Brook University(石溪大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 DeepInsert通过将多模态令牌插入模型中间层以绕过早期层,从而在降低训练和推理成本的同时保持或提升多模态语言模型的性能。

Comments To be presented at EACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2601.18076 2026-01-27 cs.LG 83%

Comparison requires valid measurement: Rethinking attack success rate comparisons in AI red teaming

比较需要有效的测量:重新思考AI红队中的攻击成功率比较

Alexandra Chouldechova, A. Feder Cooper, Solon Barocas, Abhinav Palia, Dan Vann, Hanna Wallach

机构 * Microsoft Research(微软研究院)

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.LG

AI总结 本文重新审视AI红队中攻击成功率的比较,指出其有效性问题并提出测量理论和统计学方法以评估比较的合理性。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 4 篇

2601.17549 2026-01-27 cs.CR cs.AI 79%

Breaking the Protocol: Security Analysis of the Model Context Protocol Specification and Prompt Injection Vulnerabilities in Tool-Integrated LLM Agents

打破协议:模型上下文协议规范的安全分析及工具集成LLM代理中的提示注入漏洞

Narek Maloyan, Dmitry Namiot

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文分析了模型上下文协议的安全漏洞,提出MCPSec协议扩展以提升安全性,减少攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17383 2026-01-27 cs.CV cs.AI 79%

Physical Prompt Injection Attacks on Large Vision-Language Models

针对大视觉-语言模型的物理提示注入攻击

Chen Ling, Kai Hu, Hangcheng Liu, Xingshuo Han, Tianwei Zhang, Changhai Ou

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本研究提出了一种无需访问模型或输入的物理提示注入攻击方法,通过物理物体注入恶意指令,成功攻击多种大视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏