arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-02 至 2026-02-02 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2507.00665 2026-02-02 cs.CL cs.AI 86%

SAFER: Probing Safety in Reward Models with Sparse Autoencoder

SAFER: 通过稀疏自动编码器探索奖励模型的安全性

Wei Shi, Ziyuan Xie, Sihang Li, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 SAFER通过稀疏自动编码器探索奖励模型的安全性,揭示可解释特征并改进安全性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22385 2026-02-02 cs.CL cs.AI cs.LG 85%

SP^2DPO: An LLM-assisted Semantic Per-Pair DPO Generalization

SP^2DPO: 一种基于大语言模型的语义逐对DPO泛化

Chaoyue He, Xin Zhou, Di Wang, Hong Xu, Wei Liu, Chunyan Miao

机构 * Alibaba--NTU Global e-Sustainability CorpLab (ANGEL), Singapore(阿里-NTU全球可持续性公司实验室(ANGEL),新加坡) Alibaba Group, China(阿里集团,中国)

专题命中 偏好对齐 :DPO(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SP^2DPO通过语义逐对DPO泛化提升AlpacaEval 2.0的长度控制胜率,避免每模型beta扫描。

Comments 39 pages, 15 figures, 16 tables, 60 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20433 2026-02-02 cs.CV 82%

MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models

MARE: 多模态对齐与强化学习用于通过视觉-语言模型的可解释深度伪造检测

Wenbo Xu, Wei Lu, Xiangyang Luo, Jiantao Zhou

机构 * School of Computer Science and Engineering, MoE Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-sen University, Guangzhou 510006, China(计算机科学与工程学院,信息技术MOE实验室,广东省信息安全技术重点实验室,中山大学,广州510006,中国) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Department of Computer and Information Science, University of Macau.(计算机与信息科学系,澳门大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract)

AI总结 MARE通过多模态对齐和强化学习提升视觉-语言模型在深度伪造检测中的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19299 2026-02-02 cs.AI 70%

Helios: A Foundational Language Model for Smart Energy Knowledge Reasoning and Application

Helios:一种面向智能能源知识推理与应用的基础语言模型

Haoyu Jiang, Fanjie Zeng, Boan Qu, Xiaojie Lin, Wei Zhong

机构 * College of Energy Engineering, Zhejiang University(浙江大学能源工程学院) Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海研究院)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI

AI总结 Helios是一种专为智能能源领域设计的基础语言模型,通过构建多智能体协作框架和相关数据集,提升领域知识、任务执行准确性和与人类偏好的对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25801 2026-02-02 cs.LG cs.AI cs.CL cs.CV 67%

Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start

Metis-SPECS: 通过基于偏好自我蒸馏的冷启动解耦多模态学习

Kun Chen, Peng Shi, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao, Lin Ma

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Metis-SPECS通过基于偏好的自我蒸馏冷启动框架解耦多模态学习,提升泛化能力和下游RL表现。

Comments Published as a conference paper at ICLR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22432 2026-02-02 cs.LG cs.CL 62%

ReNCE: Learning to Reason by Noise Contrastive Estimation

ReNCE: 通过噪声对比估计学习推理

Wenzheng Zhang, Karl Stratos

机构 * Rutgers University(罗杰斯大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

AI总结 ReNCE通过噪声对比估计学习提升大语言模型的推理能力,采用显式对比学习方法在数学基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23161 2026-02-02 cs.SD cs.CL 57%

DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding

DIFFA-2:一种实用的扩散大型语言模型用于通用音频理解

Jiaming Zhou, Xuxin Cheng, Shiwan Zhao, Yuhang Jia, Cao Liu, Ke Zeng, Xunliang Cai, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Meituan LongCat Interaction Team(美团LongCat交互团队)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 DIFFA-2是一种基于扩散模型的实用大型音频语言模型,通过升级语音编码器和双适配器提升音频理解性能,且在实际训练预算下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01458 2026-02-02 cs.LG 57%

How Well Can Preference Optimization Generalize Under Noisy Feedback?

在有噪声反馈下,偏好优化能有多好?

Shawn Im, Sharon Li

机构 * Department of Computer Sciences(计算机科学系) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 本文研究了在噪声反馈下偏好优化的一般化能力,分析了不同噪声类型和强度对模型性能的影响,并验证了其在实际LLM训练中的有效性。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15172 2026-02-02 cs.AI 57%

Self-Improvement of Language Models by Post-Training on Multi-Agent Debate

通过多智能体辩论进行语言模型的自改进

Ankur Samanta, Akshayaa Magesh, Runzhe Wu, Ayush Jain, Youliang Yu, Daniel Jiang, Boris Vidolov, Paul Sajda, Yonathan Efroni, Kaveh Hassani

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 通过多智能体辩论和强化学习提升语言模型的自我改进能力,实现推理准确性、自洽性和泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏