arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-26 至 2025-11-26 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 3 篇

2511.19483 2025-11-26 cs.SE cs.AI 70%

Z-Space: A Multi-Agent Tool Orchestration Framework for Enterprise-Grade LLM Automation

Z-Space:面向企业级LLM自动化的一种多智能体工具协调框架

Qingsong He, Jing Nan, Jiayu Jiao, Liangjie Tang, Xiaodong Xu, Mengmeng Sun, Qingyao Wang, Minghui Yan

机构 * Rajax Network Technology (ele.me)(Rajax网络技术(ele.me))

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 Z-Space通过多智能体协作框架提升企业级LLM自动化工具调用效率与准确性

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19727 2025-11-26 cs.CR cs.AI 57%

Prompt Fencing: A Cryptographic Approach to Establishing Security Boundaries in Large Language Model Prompts

提示围栏:一种通过密码学建立大语言模型提示安全边界的方案

Steven Peh

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 Prompt Fencing通过密码学方法在LLM提示中建立安全边界,有效防止提示注入攻击。

Comments 44 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19569 2025-11-26 cs.LG 57%

An Invariant Latent Space Perspective on Language Model Inversion

语言模型反向的不变潜在空间视角

Wentao Ye, Jiaqi Hu, Haobo Wang, Xinpeng Ti, Zhiqing Xiao, Hao Chen, Liyao Li, Lei Feng, Sai Wu, Junbo Zhao

专题命中 提示注入 :alignment(abstract);分类 cs.LG

AI总结 本文提出Inv^2A方法,通过不变潜在空间假设提升语言模型反向性能,有效对抗隐私和安全威胁。

Comments The Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏