Protecting Context and Prompts: Deterministic Security for Non-Deterministic AI
保护上下文和提示:非确定性AI的确定性安全
机构 * MACAW Security, Inc.(MACAW安全公司)
专题命中 安全训练 :prompt injection(abstract);分类 cs.AI
AI总结 本研究提出认证提示和上下文技术,通过加密验证和策略代数实现LLM的预防性安全,有效防止提示注入和上下文操纵攻击。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
保护上下文和提示:非确定性AI的确定性安全
机构 * MACAW Security, Inc.(MACAW安全公司)
专题命中 安全训练 :prompt injection(abstract);分类 cs.AI
AI总结 本研究提出认证提示和上下文技术,通过加密验证和策略代数实现LLM的预防性安全,有效防止提示注入和上下文操纵攻击。
聊天机器人之死:探索并设计人类与AI关系的心理安全结束
机构 * MIT Media Lab(MIT媒体实验室)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文探讨了人类与AI伴侣关系终止的心理安全设计,提出四个设计原则和工具,帮助平台提供闭合并促进人类连接。
难度估计策略优化
机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商务) ; School of Software Technology, Dalian University of Technology(大连理工大学软件学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 DEPO通过动态难度估计器优化推理对齐的效率和鲁棒性,减少回放成本并提升模型性能。
HyPlan:在不确定环境下通过混合学习辅助规划实现安全自动驾驶
机构 * Saarland University, Computer Science Dept.(萨尔兰大学计算机科学系) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) ; French National Centre for Scientific Research (CNRS)(法国国家科学研究中心)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 HyPlan通过结合多智能体行为预测、深度强化学习和POMDP规划,实现安全且高效的自动驾驶导航
学习上下文很重要:在基于LLM的教学设计中测量和诊断个性化差距
专题命中 安全训练 :alignment(abstract);分类 cs.CY
AI总结 本文提出了一种框架,用于测量和诊断学习上下文对基于LLM教学系统的影响,发现提供学习上下文能改善LLM的教学策略,但尚未实现可靠的个性化。
在KL正则化零和马尔可夫博弈中实现对数遗憾
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 本文提出OMG和SOMG算法,在KL正则化下实现对数遗憾,提升样本效率。
为多智能体协调演化可解释的宪法
机构 * College of Engineering Shibaura Institute of Technology(Shibaura Institute of Technology 工程学院) ; Faculty of Arts and Sciences The University of Tokyo(东京大学 文理学部) ; Department of EECS University of California, Berkeley(加州大学伯克利分校 电子工程与计算机科学系) ; Department of Informatics Università degli Studi di Milano-Bicocca(米兰-比科卡大学 信息学系)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 本文提出通过进化算法自动发现多智能体协调的可解释宪法,通过实验展示进化宪法在提升社会稳定性方面的有效性。
Comments 23 pages, 4 figures
Co2PO:多智能体强化学习中的协调约束策略优化
机构 * Rutgers University, New Brunswick, NJ(罗杰斯大学,新不伦瑞克,新泽西) ; Carnegie Mellon University, Pittsburgh, PA(卡内基梅隆大学,匹兹堡,宾夕法尼亚)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 Co2PO通过引入共享黑板架构和风险预测机制,实现多智能体强化学习中的协调安全优化,提升探索效率并减少保守性。
大型语言模型中拒绝行为远不止单一方向
机构 * Qatar Computing Research Institute(卡塔尔计算研究所) ; HBKU(哈比卜大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 研究揭示大型语言模型中拒绝行为由多种几何方向控制,不同方向影响拒绝方式而非是否拒绝
MindGuard: 多轮心理健康支持中的防护分类器
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 MindGuard通过临床验证的危险分类法,提升多轮心理健康对话中的安全性和准确性。
FedMOA: 基于异质奖励的联邦GRPO用于个性化推理大语言模型
机构 * University of Maryland, College Park(马里兰大学 College Park 分校) ; Cisco Research(思科研究)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 FedMOA是一种联邦GRPO框架,用于在异质奖励下实现个性化推理大语言模型的多目标对齐,通过自适应加权机制和任务感知聚合策略提升性能和个性化效果。
具有时间延迟的控制系统强化学习:全面综述
机构 * Department of Electronics Eng. (DELT), UFMG(电子工程系(DELT),联邦大学米纳斯吉拉斯州分校)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本文综述了针对控制系统中时间延迟的强化学习方法,分析了不同方法的优缺点,并提出了未来研究方向。
Comments 30 pages
无需裁剪的策略优化用于大语言模型
机构 * KUIS AI Center, Koç University, Istanbul, Türkiye(Koç大学) ; Koç University, Istanbul, Türkiye(Koç大学) ; University of California, Berkeley, CA, USA(加州大学伯克利分校)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 CFPO通过凸二次惩罚替代裁剪机制,实现稳定策略优化,适用于大语言模型的训练。
Comments 23 pages, 10 tables, 8 figures
通过在线强化学习将大语言模型接地于交互环境
机构 * Inria (Flowers)(Inria(Flowers)) ; University of Bordeaux(波尔多大学) ; Hugging Face ; Univ Angers, LERIA, SFR MATHSTIC(昂热大学,LERIA,SFR MATHSTIC) ; Sorbonne Université(索邦大学)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 本文提出GLAM方法,通过在线强化学习将大语言模型接地于交互环境,以提升样本效率和泛化能力,并探讨在线学习的影响。
Comments The associated code can be found at https://github.com/flowersteam/Grounding_LLMs_with_online_RL. This is an extended version of the paper published at ICML 2023: https://proceedings.mlr.press/v202/carta23a
Journal ref PMLR 202 (2023):3676-3713
MortalMATH: 评估推理目标与紧急情境之间的冲突
机构 * Univ. Lille(里尔大学) ; Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 MortalMATH研究了推理模型在紧急情境下的表现差异,发现通用模型能拒绝危险任务,而专门模型则忽视危险,导致安全风险。
通过分层搜索与自验证的视觉注意力推理
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出通过分层搜索与自验证的视觉注意力推理框架,有效提升多模态大语言模型的视觉定位和推理能力,显著降低幻觉发生率。
Comments The paper is withdrawn by the authors after discovering a flaw in the theoretical derivation presented in the Method section. This incorrect step leads to conclusions that are not supported by the corrected derivation. The authors plan to reconstruct the argument and will release an updated version once the issue is fully resolved
LLMs作为布局设计师:增强的空间推理用于内容感知布局生成
机构 * Virginia Tech(弗吉尼亚理工大学) ; Adobe Research(Adobe研究)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 LaySPA通过强化学习框架增强LLM的空间推理能力,实现内容感知布局生成,优于通用LLM和专用布局模型。
CORD:通过加权在线跨模态蒸馏弥合音频-文本推理差距
机构 * ERNIE Team, Baidu(百度ERNIE团队) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 CORD通过加权在线跨模态蒸馏方法,有效弥合音频与文本推理之间的差距,提升音频条件推理能力。
Comments 13 pages, 4 figures
基于注意力机制的离线强化学习与聚类用于可解释的脓毒症治疗
机构 * Department of Computer Science(计算机科学系) ; Engineering University at Buffalo Buffalo, New York, USA(布法罗大学工程学院)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本文提出基于注意力机制的离线强化学习与聚类方法,用于可解释的脓毒症治疗决策支持,通过多模块整合提升治疗准确性和可解释性。
Comments 8 pages, 6 figures, Conference: IEEE International Conference on Machine Learning and Applications 2025 (ICMLA 2025): https://www.icmla-conference.org/icmla25/
MirrorGuard:通过模拟到现实推理校正实现安全的计算机使用代理
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 安全训练 :prompt injection(abstract);分类 cs.AI
AI总结 MirrorGuard通过模拟到现实推理校正提升计算机使用代理的安全性,有效降低系统风险并保持代理实用性
UniMo: 基于推理链的统一运动生成与理解
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 UniMo通过整合运动-语言信息和可解释的推理链,提升3D人体运动生成与理解的性能和可解释性。
极值政策优化用于安全强化学习
机构 * Shanghai Jiao Tong University, Shanghai, China.(上海交通大学)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本文提出极值政策优化算法,通过极值理论建模和极值优先机制,有效减少约束违反并提升安全强化学习性能。
Comments Published in the 42nd International Conference on Machine Learning (ICML 2025)
SD-RAG:一种抗提示注入的框架,用于检索增强生成中的选择性披露
机构 * Department of Electrical, Computer and Biomedical Engineering(电气、计算机与生物医学工程系) ; University of Pavia(帕维亚大学)
专题命中 安全训练 :prompt injection(abstract);分类 cs.AI
AI总结 SD-RAG通过在检索阶段应用净化和披露控制,提升检索增强生成中的隐私保护和抗提示注入能力。
现实课程强化学习用于自主可持续海洋船舶导航
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本文提出基于现实课程强化学习的框架,结合数据驱动的海洋模拟和机器学习预测模块,以实现自主且可持续的船舶导航。
Comments Present in The 40th Annual AAAI Conference on Artificial Intelligence (AAAI-26)
视觉-语言模型能理解建筑工人吗?一项探索性研究
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; Villanova University(维拉诺瓦大学) ; Department of Computing Sciences(计算科学系) ; Department of Civil and Environmental Engineering(土木与环境工程系)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本研究评估了三种视觉-语言模型在识别建筑工人行为和情绪方面的性能,发现GPT-4o表现最佳,但需进一步改进以提高实际应用可靠性。
在医疗领域监控已部署的AI系统
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出了一种用于医疗领域已部署AI系统监控的框架,围绕系统完整性、性能和影响三个原则,提供监控计划的指导和实施挑战分析。
Comments 36 pages, 3 figures
STELP: 保障LLM生成程序的编译与执行
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 STELP通过安全编译和执行LLM生成的代码,解决生产环境中的安全性和可靠性问题,提升代码执行的安全性与准确性。
基于神经网络引导的蒙特卡罗树搜索用于无车道自动驾驶
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出了一种基于神经网络引导的蒙特卡罗树搜索方法,用于无车道环境下的自动驾驶,旨在提高交通流率并优化安全性和效率。
Prompting4Debugging: 通过寻找问题性提示对文本到图像扩散模型进行红队测试
机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Hsinchu, Taiwan(国家阳明交通大学计算机科学系) ; IBM Research, NY 10598, USA(IBM研究院)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 Prompting4Debugging通过寻找问题性提示揭示文本到图像扩散模型的安全漏洞,表明现有安全机制存在重大缺陷。
Comments ICML 2024 main conference paper. The source code is available at https://github.com/zhiyichin/P4D
分析大型语言模型在仇恨言论净化中的虚假拒绝行为偏见
机构 * TU Dresden(德累斯顿理工大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 研究分析了大型语言模型在仇恨言论净化中的虚假拒绝偏见,并提出通过中英互译策略减少此类拒绝行为。