arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-03 至 2026-02-03 共收录 148 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 14 篇

2602.00426 2026-02-03 cs.LG cs.AI cs.CL eess.SP 87%

LLMs as High-Dimensional Nonlinear Autoregressive Models with Attention: Training, Alignment and Inference

基于注意力机制的高维非线性自回归模型:训练、对齐与推理

Vikram Krishnamurthy

机构 * Cornell University(康奈尔大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文将LLMs表述为具有注意力依赖的高维非线性自回归模型,探讨了训练、对齐与推理的原理及方法。

Comments 27 pages, 12 figures. Mathematical survey framing LLMs as high-dimensional nonlinear autoregressive models with attention, covering training, alignment, and inference, with nanoGPT/nanochat-style code examples. Feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01128 2026-02-03 cs.LG 85%

Tangent Space Fine-Tuning for Directional Preference Alignment in Large Language Models

切线空间微调用于大语言模型中的方向偏好对齐

Mete Erdogan

机构 * Stanford University(斯坦福大学)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.LG

AI总结 TS-DPO通过切线空间微调实现多偏好维度的可控对齐,提升模型在帮助性与冗余性之间的平衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06876 2026-02-03 cs.CL cs.AI cs.LG 85%

Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging

混合数据还是融合模型?通过模型融合平衡大型语言模型的有用性、诚实性和无害性

Jinluan Yang, Dingnan Jin, Anke Tang, Li Shen, Didi Zhu, Zhengyu Chen, Ziyu Zhao, Daixin Wang, Qing Cui, Zhiqiang Zhang, Jun Zhou, Fei Wu, Kun Kuang

专题命中 偏好对齐 :harmlessness(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RESM方法,通过改进的参数融合策略提升大型语言模型在有用性、诚实性和无害性方面的平衡对齐效果。

Comments arxiv version of NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01002 2026-02-03 cs.AI 79%

How RLHF Amplifies Sycophancy

如何通过RLHF放大阿谀行为

Itai Shapira, Gerdus Benade, Ariel D. Procaccia

机构 * harvard(哈佛大学)

专题命中 偏好对齐 :RLHF(title);alignment(abstract);分类 cs.AI

AI总结 本文研究了RLHF如何通过放大机制增强阿谀行为,提出了一种训练干预措施以减少这种偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04832 2026-02-03 cs.LG 79%

Discrete Diffusion Trajectory Alignment via Stepwise Decomposition

通过分步分解实现离散扩散轨迹对齐

Jiaqi Han, Austin Wang, Minkai Xu, Wenda Chu, Meihua Dang, Haotian Ye, Huayu Chen, Yisong Yue, Stefano Ermon

机构 * Stanford University(斯坦福大学) Caltech(加州理工学院) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本研究提出一种离线偏好优化方法,通过分步分解实现离散扩散模型的轨迹对齐,提升DNA序列设计和语言建模的性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01581 2026-02-03 cs.LG 74%

Nearly Optimal Active Preference Learning and Its Application to LLM Alignment

近优主动偏好学习及其在大语言模型对齐中的应用

Yao Zhao, Kwang-Sung Jun

机构 * University of Arizona(亚利桑那大学) Department of Computer Science(计算机科学系)

专题命中 偏好对齐 :alignment(title);分类 cs.LG

AI总结 本文提出两种主动学习算法,通过实例依赖标签复杂性保证和贪心方法提升大语言模型对齐的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23096 2026-02-03 cs.LG 70%

CATTO: Balancing Preferences and Confidence in Language Models

CATTO: 在语言模型中平衡偏好与信心

Nisarg Parikh, Ananya Sai, Pannaga Shivaswamy, Kunjal Panchal, Andrew Lan

机构 * Adobe

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG

AI总结 CATTO通过校准意识的标记级训练目标,在保持任务准确性的同时,有效提升语言模型预测信心,减少校准误差,提高输出选择的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00954 2026-02-03 cs.AI 70%

Small-Margin Preferences Still Matter-If You Train Them Right

小边距偏好依然重要-如果你训练得当的话

Jinlong Pang, Zhaowei Zhu, Na Di, Yichi Zhang, Yaxuan Wang, Chen Qian, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Northeastern University(东北大学) DIMACS, Rutgers University(Rutgers大学DIMACS研究中心)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 本文提出MixDPO,一种基于难度的训练策略,通过课程学习和混合目标优化,提升LLM在模糊配对上的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00603 2026-02-03 cs.LG 70%

Direct Preference Optimization with Rating Information: Practical Algorithms and Provable Gains

直接偏好优化与评分信息:实用算法和可证明的收益

Luca Viano, Ruida Zhou, Yifan Sun, Mahdi Namazifar, Volkan Cevher, Shoham Sabach, Mohammad Ghavamzadeh

机构 * EPFL(苏黎世联邦理工学院) Amazon AGI(亚马逊人工智能实验室) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Cornell University(康奈尔大学) Qualcomm AI Research(高通人工智能研究)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG

AI总结 本文提出利用评分间隙信息改进直接偏好优化算法,通过理论证明和实验验证,在准确评分间隙条件下实现更快的统计速率,并在多种LLM和基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01068 2026-02-03 cs.CL cs.AI 62%

From Utterance to Vividity: Training Expressive Subtitle Translation LLM via Adaptive Local Preference Optimization

从话语到生动性:通过自适应局部偏好优化训练表达性字幕翻译LLM

Chaoqun Cui, Shijing Wang, Liangbin Huang, Qingqing Gu, Zhaolong Huang, Xiao Zeng, Wenji Mao

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Hujing Digital Media & Entertainment Group(华景数字媒体与娱乐集团) Geely AI lab(吉利AI实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ALPO方法,通过构建多方向字幕语料库,优化翻译LLM的表达性和生动性,提升翻译质量的多维评估性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02341 2026-02-03 cs.CL cs.AI 62%

DRIFT: Learning from Abundant User Dissatisfaction in Real-World Preference Learning

DRIFT:从现实世界偏好学习中学习大量用户不满

Yifan Wang, Bolian Li, Junlin Wu, Zhaoxuan Tan, Zheli Liu, Ruqi Zhang, Ananth Grama, Qingkai Zeng

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 DRIFT通过利用现实世界中的用户不满信号,提升大语言模型的偏好学习性能,实现更高的任务得分和胜率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01137 2026-02-03 cs.LG 57%

Self-Generative Adversarial Fine-Tuning for Large Language Models

自生成对抗微调用于大语言模型

Shiguang Wu, Yaqing Wang, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Beijing Institute of Mathematical Sciences and Applications(北京数学科学研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出SGALM,通过生成对抗游戏实现大语言模型的对齐微调,无需外部奖励模型,达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20668 2026-02-03 cs.CL 57%

PIRA: Preference-Oriented Instruction-Tuned Reward Models with Dual Aggregation

PIRA:基于双聚合的偏好导向指令调优奖励模型

Yongfu Xue

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 PIRA通过整合三种策略,利用LLM的偏好指令能力,提升奖励模型的鲁棒性和泛化能力,有效缓解奖励过度优化问题。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16142 2026-02-03 cs.CL 57%

RLKD: Distilling LLMs' Reasoning via Reinforcement Learning

通过强化学习蒸馏LLM的推理能力:RLKD

Shicheng Xu, Liang Pang, Yunchang Zhu, Jia Gu, Zihao Wei, Jingcheng Deng, Feiyang Pan, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Huawei Inc.(华为公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RLKD通过强化学习和生成结构奖励模型,有效蒸馏LLM的多分支推理结构,提升学生模型的推理能力。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 14 篇

2602.02027 2026-02-03 cs.AI cs.LG 88%

Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron

通过单个神经元的模型自反进行轻量级对齐以提升大语言模型的安全性

Sicheng Shen, Mingyang Lv, Han Shen, Jialin Wu, Binghao Wang, Zhou Yang, Guobin Shen, Dongcheng Zhao, Feifei Zhao, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Ant Group Co., Ltd.(蚂蚁集团有限公司) BrainCog Lab., CASIA(CASIA脑认知实验室) Zhongguancun Academy(中关村学院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 通过单个神经元的模型自反实现轻量级对齐,提升大语言模型的安全性和实用性

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01685 2026-02-03 cs.LG cs.AI 84%

Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment

语义感知的Wasserstein策略正则化用于大语言模型对齐

Byeonghu Na, Hyungho Na, Yeongmin Kim, Suhyeon Jo, HeeSun Bae, Mina Kang, Il-Chul Moon

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Wasserstein策略正则化方法,通过语义感知的Wasserstein距离改进大语言模型对齐效果,实验表明其优于传统KL散度方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02136 2026-02-03 cs.AI 83%

Mitigating Safety Tax via Distribution-Grounded Refinement in Large Reasoning Models

通过基于分布的细化缓解安全税在大推理模型中的影响

Yingsha Xie, Tiansheng Huang, Enneng Yang, Rui Min, Wenjie Lu, Xiaochun Cao, Naiqiang Tan, Li Shen

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区计算机科学与技术学院) Hong Kong University of Science(香港科技大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出DGR方法,通过基于分布的细化缓解大推理模型中的安全税,提升推理准确性和安全性。

Comments Code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00414 2026-02-03 cs.CV cs.LG 83%

Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure

迈向自主实验室安全监控:通过场景结构学习识别危险

Trishna Chakraborty, Udita Ghosh, Aldair Ernesto Gongora, Ruben Glatt, Yue Dong, Jiachen Li, Amit K. Roy-Chowdhury, Chengyu Song

机构 * Electrical and Computer Engineering, University of California, Riverside, USA(加州大学河滨分校电气与计算机工程系) Computer Science and Engineering, University of California, Riverside, USA(加州大学河滨分校计算机科学与工程系) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 本文提出通过场景图引导对齐方法,利用视觉语言模型提升实验室安全监控中危险识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10520 2026-02-03 cs.AI cs.CY 81%

Breaking Up with Normatively Monolithic Agency with GRACE: A Reason-Based Neuro-Symbolic Architecture for Safe and Ethical AI Alignment

与规范性单一体制代理告别:GRACE:一种基于原因的神经符号架构,用于安全和道德的人工智能对齐

Felix Jahn, Yannic Muskalla, Lisa Dargasz, Patrick Schramowski, Kevin Baum

机构 * German Research Center for Artificial Intelligence(德国人工智能研究中心) Center for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心) Saarland Informatics Campus(萨尔州信息学校区) Computer Science Department, TU Darmstadt(图宾根大学计算机科学系)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 GRACE是一种基于原因的神经符号架构,用于安全和道德的人工智能对齐,通过分离规范性推理与工具性决策,确保AI代理的行为符合道德规范。

Comments 10 pages, 4 figures, accepted at 2nd Annual Conference of the International Association for Safe & Ethical AI (IASEAI'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01725 2026-02-03 cs.CL cs.AI cs.LG 67%

SafePred: A Predictive Guardrail for Computer-Using Agents via World Models

SafePred: 通过世界模型为计算机使用代理构建一种预测性防护措施

Yurun Chen, Zeyi Liao, Ping Yin, Taotao Xie, Keting Yin, Shengyu Zhang

机构 * Zhejiang University, China(浙江大学) The Ohio State University, USA(俄亥俄州立大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SafePred通过世界模型预测未来风险,构建风险到决策的循环,提升计算机使用代理的安全性和任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02132 2026-02-03 cs.CL 57%

There Is More to Refusal in Large Language Models than a Single Direction

大型语言模型中拒绝行为远不止单一方向

Faaiz Joad, Majd Hawasly, Sabri Boughorbel, Nadir Durrani, Husrev Taha Sencar

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) HBKU(哈比卜大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究揭示大型语言模型中拒绝行为由多种几何方向控制,不同方向影响拒绝方式而非是否拒绝

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00950 2026-02-03 cs.AI 57%

MindGuard: Guardrail Classifiers for Multi-Turn Mental Health Support

MindGuard: 多轮心理健康支持中的防护分类器

António Farinhas, Nuno M. Guerreiro, José Pombal, Pedro Henrique Martins, Laura Melton, Alex Conway, Cara Dochat, Maya D'Eon, Ricardo Rei

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 MindGuard通过临床验证的危险分类法,提升多轮心理健康对话中的安全性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00453 2026-02-03 cs.LG cs.DC 57%

FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards

FedMOA: 基于异质奖励的联邦GRPO用于个性化推理大语言模型

Ziyao Wang, Daeun Jung, Yexiao He, Guoheng Sun, Zheyu Shen, Myungjin Lee, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Cisco Research(思科研究)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 FedMOA是一种联邦GRPO框架,用于在异质奖励下实现个性化推理大语言模型的多目标对齐,通过自适应加权机制和任务感知聚合策略提升性能和个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00399 2026-02-03 stat.ML cs.LG 57%

Reinforcement Learning for Control Systems with Time Delays: A Comprehensive Survey

具有时间延迟的控制系统强化学习:全面综述

Armando Alves Neto

机构 * Department of Electronics Eng. (DELT), UFMG(电子工程系(DELT),联邦大学米纳斯吉拉斯州分校)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文综述了针对控制系统中时间延迟的强化学习方法,分析了不同方法的优缺点,并提出了未来研究方向。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01916 2026-02-03 cs.RO 50%

ForSim: Stepwise Forward Simulation for Traffic Policy Fine-Tuning

ForSim:基于逐步前向模拟的交通策略微调

Keyu Chen, Wenchao Sun, Hao Cheng, Zheng Fu, Sifa Zheng

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

专题命中 安全训练 :safety(abstract)

AI总结 ForSim通过逐步闭环前向模拟范式提升交通模拟的保真度,结合组相对优化微调交通策略,提高安全性与效率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19016 2026-02-03 cs.CR 50%

DREAM: Dynamic Red-teaming across Environments for AI Models

DREAM: 为AI模型跨环境动态红队测试

Liming Lu, Xiang Gu, Junyu Huang, Jiawei Du, Xu Zheng, Yunhuai Liu, Yongbin Zhou, Shuchao Pang

专题命中 安全训练 :safety(abstract)

AI总结 DREAM通过动态多阶段攻击测试揭示LLM代理在跨环境安全中的关键漏洞,指出上下文脆弱性和长期恶意意图追踪不足,并提出评估工具以提升防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22221 2026-02-03 cs.CV 50%

Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models

迈向遥感中的可信推理:一种基于感知的地理空间思维链用于视觉-语言模型

Jiaqi Liu, Lang Sun, Ronghao Fu, Bo Yang

机构 * Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 本研究提出Geo-CoT框架,通过两阶段策略提升遥感VLMs的推理能力,实现可验证的多步骤分析,显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01129 2026-02-03 cs.CR 50%

SMCP: Secure Model Context Protocol

SMCP: 安全模型上下文协议

Xinyi Hou, Shenao Wang, Yifan Zhang, Ziluo Xue, Yanjie Zhao, Cai Fu, Haoyu Wang

专题命中 安全训练 :prompt injection(abstract)

AI总结 SMCP通过统一身份管理、强认证和细粒度策略执行,提升智能体系统在工具调用中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 9 篇

2602.01587 2026-02-03 cs.CL cs.AI 84%

Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment

通过噪声增强对齐的可证明防御框架对抗LLM劫持

Zehua Cheng, Jianwei Yang, Wei Dai, Jiahao Sun

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过噪声增强对齐的可证明防御框架,有效降低LLM劫持攻击成功率,提升模型鲁棒性与实用性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04204 2026-02-03 cs.LG cs.CR stat.ML 83%

Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence

短长度对抗训练有助于LLMs防御长长度劫持攻击:理论和实证证据

Shaopeng Fu, Liang Ding, Jingfeng Zhang, Di Wang

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) The University of Sydney(悉尼大学) The University of Auckland(奥克兰大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.LG

AI总结 本文提出通过短长度对抗训练有效防御长长度劫持攻击,理论和实验证实了这种策略的可行性。

Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏