Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment
通过推拉分布对齐保障大语言模型微调安全
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 SOT通过推拉分布对齐机制提升大语言模型微调的安全性与效用平衡
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
通过推拉分布对齐保障大语言模型微调安全
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 SOT通过推拉分布对齐机制提升大语言模型微调的安全性与效用平衡
剔除恶意:一种全局子空间方法用于LLM去毒化
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Dalian University of Technology(大连理工大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出GLOSS方法,通过识别并消除LLM参数中的全局子空间来实现去毒化,有效提升模型安全性。
通过不安全权重操作实现安全的视觉-语言模型
机构 * University of Trento(特伦托大学) ; NVIDIA(NVIDIA公司) ; Georgia Tech(佐治亚理工学院)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出UWM方法,通过不训练的方式提升视觉-语言模型在不安全查询上的安全性,同时在安全输入上表现更优。
Comments WACV 2026
具有临床医生的交互式报告生成用于慢性病依从性
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出一种具有临床医生的交互式报告生成系统,通过AI生成与医生审查的分工,提高慢性病依从性报告的效率和准确性,同时确保问责制。
Comments 5 pages, 3 figures. Accepted at the AAAI 2026 Workshop on AI for Healthy Aging and Longevity
梦境并非bug:一种基于荣格思想的多智能体LLM伴侣的梦境层
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出一种基于荣格思想的梦境层,通过离线生成梦境叙事来增强多智能体LLM伴侣的学习与关系建立能力,将幻觉转化为资源而非bug。
Comments Preprint, 35 pages (5 pages of appendix), 2 figures, 3 tables. Conceptual and architectural proposal with preliminary simulation results
在不确定障碍动态下使用控制屏障函数和约束凸生成器的安全导航
专题命中 安全训练 :safety(abstract)
AI总结 本文提出利用控制屏障函数和约束凸生成器实现安全导航,通过凸优化问题转换障碍物流为CBF,适用于不确定障碍动态的代理导航。