arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-13 至 2026-01-13 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 6 篇

2601.07200 2026-01-13 cs.LG cs.AI 84%

Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment

通过推拉分布对齐保障大语言模型微调安全

Haozhong Wang, Zhuo Li, Yibo Yang, He Zhao, Hongyuan Zha, Dandan Guo

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 SOT通过推拉分布对齐机制提升大语言模型微调的安全性与效用平衡

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06226 2026-01-13 cs.LG cs.AI 62%

Projecting Out the Malice: A Global Subspace Approach to LLM Detoxification

剔除恶意:一种全局子空间方法用于LLM去毒化

Zenghao Duan, Zhiyi Yin, Zhichao Shi, Liang Pang, Shaoling Jing, Zihe Huang, Jiayi Wu, Yu Yan, Jingcheng Deng, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GLOSS方法,通过识别并消除LLM参数中的全局子空间来实现去毒化,有效提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11742 2026-01-13 cs.CV cs.AI 57%

Safe Vision-Language Models via Unsafe Weights Manipulation

通过不安全权重操作实现安全的视觉-语言模型

Moreno D'Incà, Elia Peruzzo, Xingqian Xu, Humphrey Shi, Nicu Sebe, Massimiliano Mancini

机构 * University of Trento(特伦托大学) NVIDIA(NVIDIA公司) Georgia Tech(佐治亚理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出UWM方法,通过不训练的方式提升视觉-语言模型在不安全查询上的安全性,同时在安全输入上表现更优。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06364 2026-01-13 cs.HC cs.AI 57%

Human-in-the-Loop Interactive Report Generation for Chronic Disease Adherence

具有临床医生的交互式报告生成用于慢性病依从性

Xiaotian Zhang, Jinhong Yu, Pengwei Yan, Le Jiang, Xingyi Shen, Mumo Cheng, Xiaozhong Liu

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种具有临床医生的交互式报告生成系统,通过AI生成与医生审查的分工,提高慢性病依从性报告的效率和准确性,同时确保问责制。

Comments 5 pages, 3 figures. Accepted at the AAAI 2026 Workshop on AI for Healthy Aging and Longevity

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06115 2026-01-13 cs.AI 57%

Dreaming Is Not a Bug: A Jung-Inspired Dream Layer for Multi-Agent LLM Companions

梦境并非bug:一种基于荣格思想的多智能体LLM伴侣的梦境层

V. Cheung

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于荣格思想的梦境层,通过离线生成梦境叙事来增强多智能体LLM伴侣的学习与关系建立能力,将幻觉转化为资源而非bug。

Comments Preprint, 35 pages (5 pages of appendix), 2 figures, 3 tables. Conceptual and architectural proposal with preliminary simulation results

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07715 2026-01-13 eess.SY cs.SY 50%

Safe Navigation under Uncertain Obstacle Dynamics using Control Barrier Functions and Constrained Convex Generators

在不确定障碍动态下使用控制屏障函数和约束凸生成器的安全导航

Hugo Matias, Daniel Silvestre

专题命中 安全训练 :safety(abstract)

AI总结 本文提出利用控制屏障函数和约束凸生成器实现安全导航,通过凸优化问题转换障碍物流为CBF,适用于不确定障碍动态的代理导航。

详情

展开后加载摘要…

URL PDF HTML 收藏