An Embarrassingly Simple Defense Against LLM Abliteration Attacks
机构 * King Abdullah University of Science and Technology(卡布斯大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments preprint - under review
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * King Abdullah University of Science and Technology(卡布斯大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments preprint - under review
机构 * Université de Montréal(蒙特利尔大学) ; Mila(Mila研究所) ; Technical University of Munich(慕尼黑技术大学) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 安全训练 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 15 pages, 6 figures
机构 * Stanford University(斯坦福大学) ; Apple(苹果公司) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments UIST 2025
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG
机构 * Independent(独立研究者) ; Northeastern University(东北大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Luxembourg Tech School A.s.b.l.(卢森堡技术学校)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
机构 * The Chinese University of Hong Kong(香港中文大学) ; Bytedance(字节跳动) ; Stanford University(斯坦福大学)
专题命中 安全训练 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted by The 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)
机构 * Princeton University(普林斯顿大学) ; NVIDIA(英伟达)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 安全训练 :safety(abstract);red teaming(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Website: https://www.tamper-resistant-safeguards.com
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2024
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 23 pages; 1 figure and 10 supplementary figures; Accepted (spotlight presentation) at NeurIPS 2024 SoLaR workshop
专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 15 pages
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICML 2024
专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 30 pages, 7 figures, NeurIPS camera-ready
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG
大语言模型人格测量中的持久不稳定性:规模、推理和对话历史的影响
专题命中 安全训练 :alignment(abstract,comments);safety(abstract);分类 cs.CL、cs.AI
AI总结 研究发现大语言模型在人格测量中存在持续不稳定性,规模扩大、推理和对话历史等干预措施未能有效提升稳定性。
Comments Accepted at AAAI 2026, Track on AI Alignment
安全与资源约束下的多时间尺度干预学习
专题命中 安全训练 :safety(title);分类 cs.LG
AI总结 该研究提出MINT模型,通过增强干预状态与结构化策略处理多时间尺度干预,在三类基准测试中表现优异,尤其在T1DM场景下大幅提升血糖控制效果。
你会投票给谁?大型语言模型(LLM)的政治立场审计:意大利案例研究
机构 * Revelis s.r.l.(雷维利斯有限责任公司)
专题命中 安全训练 :alignment(title);分类 cs.CL
AI总结 本文以意大利为案例,提出系统可复现的LLM政治立场审计框架,分析多模型对意政党及领导人的评价行为、差异等,探究模型政治偏好相关问题。
X³-OPD:通过策略对齐将推理能力提炼到大型音频-语言模型中
机构 * Tencent Hunyuan(腾讯混元) ; Zhejiang University(浙江大学)
专题命中 安全训练 :alignment(title);分类 cs.LG
AI总结 针对大型音频-语言模型逻辑推理能力不足,提出X³-OPD跨模态策略蒸馏框架,借助教师模型指导与构建的三层对称语料库训练学生模型,实验证明该方法能提升音频推理及思维链质量,还能保留模型域转移下的能力。
评估两用生物学环境中的校准拒绝和安全有用性
机构 * American Wetware(美国湿科公司) ; LatchBio
专题命中 安全训练 :alignment(title);分类 cs.AI
AI总结 研究针对人工智能用于生命科学工作流可能导致滥用的问题,提出BioSecBench-Refusal基准,将常规与红队任务配对,测试16种配置下模型拒绝率,发现多数配置对常规工作拒绝率高,有推理空间的模型能识别更多威胁,为开发者提供校准工具。
MGUP:一种用于随机优化的动量-梯度对齐更新策略
机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Pengcheng Laboratory(鹏城实验室) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 安全训练 :alignment(title);分类 cs.LG
AI总结 提出MGUP机制,通过按固定比例选择参数施加大步长、其余参数用小步长,增强动量优化器,理论保证收敛,实验表明提升训练效率与稳定性。
Comments Published in NeurIPS 2025
FineVLA:面向可操控视觉-语言-动作策略的细粒度指令对齐
机构 * XLANG Lab, The University of Hong Kong(XLANG实验室,香港大学) ; Qwen Team, Alibaba Inc.(通义团队,阿里巴巴公司)
专题命中 安全训练 :alignment(title);分类 cs.AI
AI总结 提出FineVLA框架,通过构建细粒度数据集和训练策略,在保持任务成功率的同时实现机器人动作的细粒度可控性。
Comments 26 pages, 7 figures, 25 tables
Safe-FedLLM:深入探究联邦大语言模型的安全性
机构 * Hainan University(海南大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 安全训练 :safety(title);分类 cs.AI
AI总结 本文提出Safe-FedLLM,一种基于探针的防御框架,通过三级防御(步骤级、客户端级和阴影级)利用轻量级分类器区分恶意与良性LoRA更新,以增强联邦大语言模型对恶意客户端的鲁棒性。
教师-学生表征对齐用于强化学习驱动的模仿学习
机构 * Department of Computer Science(计算机科学系) ; Örebro University(奥雷布罗大学)
专题命中 安全训练 :alignment(title);分类 cs.LG
AI总结 提出一种通过自监督对比学习构建共享嵌入空间的方法,以减小教师和学生策略之间的不可模仿差距,从而提升学生策略性能。
Comments 6 pages, 5 figures. Accepted as an oral presentation at the RL4IL Workshop at ICRA 2026