When Harmless Words Harm: A New Threat to LLM Safety via Conceptual Triggers
有害词语的危害:通过概念触发器对LLM安全性的新威胁
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL
AI总结 本文提出MICM方法,通过概念触发器针对LLM的价值结构进行劫持,揭示了现有安全机制对隐含价值观操控的脆弱性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
有害词语的危害:通过概念触发器对LLM安全性的新威胁
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL
AI总结 本文提出MICM方法,通过概念触发器针对LLM的价值结构进行劫持,揭示了现有安全机制对隐含价值观操控的脆弱性。
LLMs是安全代理还是宣传引擎?
机构 * SMU ; University of Trieste(特里este大学) ; AREA Science Park(AREA科学园) ; CMU(卡内基梅隆大学) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; MPI for Intelligent Systems(智能系统研究所) ; University of Michigan(密歇根大学)
专题命中 安全训练 :safety(title,abstract);prompt injection(abstract);分类 cs.CL
AI总结 本文通过PSP数据集研究LLMs在政治敏感内容上的拒绝行为,发现大多数模型存在审查倾向,并分析了影响拒绝分布的关键因素。
Comments 15 pages, 7 tables, 4 figures
ShieldAgent: 通过可验证的安全策略推理实现安全代理
机构 * University of Chicago, Chicago IL, USA(芝加哥大学) ; University of Illinois at Urbana-Champaign, Champaign IL, USA(伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
AI总结 ShieldAgent通过逻辑推理实现对代理动作轨迹的安全策略合规性,有效提升代理防护性能。
SafeHumanoid: 通过VLM-RAG驱动的人形机器人上半身阻抗控制
机构 * Skolkovo Institute of Science and Technology(斯克洛尔沃科学与技术研究所)
专题命中 安全训练 :safety(abstract);trustworthy(abstract)
AI总结 SafeHumanoid通过VLM-RAG结合自身视觉,实现人形机器人上半身阻抗控制,提升人机交互的安全性与任务成功率。
迈向自动安全驾驶指令:一种大规模视觉语言模型方法
机构 * Nara Institute of Science and Technology(奈良科学技术研究所) ; Teatis inc.(Teatis公司) ; Queensland university of technology(昆士兰理工大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种大规模视觉语言模型方法,用于生成安全驾驶指令,通过构建数据集并评估模型性能,展示了微调模型在自动驾驶安全中的应用与挑战。
Comments Accepted to MMLoSo 2025
独立多智能体强化学习中的涌现协调与相结构
机构 * School of Physics and Astronomy University of Edinburgh(物理与天文学学院 英格兰爱丁堡大学)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 该研究通过分析独立多智能体强化学习中的协调与相结构,揭示了规模、密度和内核漂移之间的相互作用对多智能体学习系统动态的影响。
Comments 22 pages, 19 figures
面向高速公路汇入车道的抗观测扰动多智能体强化学习故障容错方法
机构 * Department of Automation, Tsinghua University(自动化系,清华大学) ; Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(北京信息科学与技术国家研究中心(BNRist),清华大学)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本文提出了一种面向高速公路汇入车道的抗观测扰动多智能体强化学习故障容错方法,通过对抗性扰动生成和故障容忍智能体设计,提升协同驾驶系统的安全性和效率。
具有残疾和神经多样性个体的代理AI框架:一个用于健康饮食、日常习惯和包容性福祉的多代理系统
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出一种多代理系统,通过个性化营养、适应性调度、食品指导和生理监测等代理,为残疾和神经多样性个体提供健康饮食、日常习惯和包容性福祉的AI框架。
Comments Presented at International Conference on Business and Digital Technology, Bahrain, Springer Nature, 27 November 2025
标记级边际化用于多标签LLM分类器
机构 * ServiceNow
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 本文提出三种标记级概率估计方法,提升生成模型在多标签内容安全分类中的可解释性和准确性。
Monet: 在图像和语言之外的潜在视觉空间推理
机构 * Peking University(北京大学) ; Kling Team(Kling团队) ; Amazon AGI SF Lab(Amazon AGI SF实验室) ; MIT(麻省理工学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 Monet通过在潜在视觉空间中直接推理,提升多模态大语言模型的视觉推理能力,解决了潜在-视觉对齐和嵌入监督不足的问题,展示了在现实世界和抽象视觉任务中的优越表现。
MG-Nav:基于稀疏空间记忆的双尺度视觉导航
机构 * The University of Hong Kong(香港大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 安全训练 :alignment(abstract)
AI总结 MG-Nav通过稀疏空间记忆图和VGGT-adapter模块实现双尺度视觉导航,结合全局规划与局部控制,实现零样本导航的高鲁棒性与高性能。
Comments 10pages, 5 figures
TinyRS-R1:用于遥感的紧凑多模态语言模型
机构 * Center for the Image Analysis (OGAM) and Department of Electrical and Electronics Engineering of Middle East Technical University (METU)(图像分析中心(OGAM)和中欧技术大学(METU)电子与电气工程系)
专题命中 安全训练 :alignment(abstract)
AI总结 TinyRS-R1是一种专为遥感设计的紧凑多模态语言模型,通过四阶段训练实现高效性能,兼具推理增强与低资源消耗。
Comments Accepted to IEEE Geoscience and Remote Sensing Letters (GRSL). Code, models, and the captions for datasets are available at https://github.com/aybora/TinyRS