arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-13 至 2026-02-13 共收录 56 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2510.05703 2026-02-13 cs.LG 89%

Provably Convergent Primal-Dual DPO for Constrained LLM Alignment

可证明收敛的约束语言模型对齐的对偶直接偏好优化

Yihan Du, Seo Taek Kong, R. Srikant

机构 * SUTD ESD(新加坡科技设计大学电子与计算机工程系) UIUC ECE(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系)

专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);safety(abstract);分类 cs.LG

AI总结 本文提出了一种可证明收敛的约束LLM对齐方法,通过改进的DPO技术减少训练模型数量和内存消耗,同时保证约束条件和优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12158 2026-02-13 cs.LG 88%

SafeNeuron: Neuron-Level Safety Alignment for Large Language Models

SafeNeuron: 大语言模型的神经层面安全对齐

Zhaoxin Wang, Jiaming Liang, Fengbin Zhu, Weixiang Zhao, Junfeng Fang, Jiayi Ji, Handing Wang, Tat-Seng Chua

机构 * Xidian University, Xi'an, China(西安电子科技大学) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) National University of Singapore,Singapore(新加坡国立大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 SafeNeuron通过神经层面安全对齐框架提升模型鲁棒性,减少攻击风险并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11180 2026-02-13 cs.CL 83%

Mechanistic Interpretability for Large Language Model Alignment: Progress, Challenges, and Future Directions

大语言模型对齐的机制可解释性:进展、挑战与未来方向

Usman Naseem

机构 * Macquarie University(麦考瑞大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型对齐中机制可解释性的进展与挑战,提出未来研究方向,包括自动化可解释性、跨模型泛化和可解释性驱动的对齐技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12180 2026-02-13 cs.LG cs.GT 79%

How Sampling Shapes LLM Alignment: From One-Shot Optima to Iterative Dynamics

采样如何塑造大语言模型对齐:从单次最优到迭代动态

Yurong Chen, Yu He, Michael I. Jordan, Fan Yao

机构 * Inria(法国国家信息与自动化研究所) École Normale Supérieure(巴黎高等师范学校) PSL Research University(巴黎综合理工研究所) Northwestern University(西北大学) University of California, Berkeley(加州大学伯克利分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 研究探讨了采样对大语言模型对齐的影响,发现适当采样可提升排序保证,而偏向采样可能导致集中问题,并分析了迭代动态中的稳定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11753 2026-02-13 cs.HC 78%

Building Intelligent User Interfaces for Human-AI Alignment

构建智能用户界面以实现人机对齐

Danqing Shi

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文提出参考模型,通过分析用户界面改进人机对齐,展示两个案例研究和六个界面的初步调查,强调人机交互对对齐的促进作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11902 2026-02-13 cs.LG cs.AI 73%

Mitigating Mismatch within Reference-based Preference Optimization

缓解基于参考的偏好优化中的不匹配

Suqin Yuan, Xingrui Yu, Jiyang Zheng, Lei Feng, Dadong Wang, Ivor Tsang, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) CFAR, A*STAR(CFAR,A*STAR) CSIRO, Data61(CSIRO,Data61) Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 HyPO通过有条件地去偏参考信号缓解基于参考的偏好优化中的不匹配问题,提升推理对齐性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01511 2026-02-13 cs.CL cs.LG 62%

Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training

交替强化学习用于非可验证大语言模型后训练的评分标准建模

Ran Xu, Tianci Liu, Zihan Dong, Tony Yu, Ilgee Hong, Carl Yang, Linjun Zhang, Tao Zhao, Haoyu Wang

机构 * Emory University(埃默里大学) Purdue University(普渡大学) Rutgers University(罗格斯大学) Georgia Institute of Technology(佐治亚理工学院) University at Albany(阿尔巴尼大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 Rubric-ARM通过交替强化学习优化评分标准生成与评判,提升非可验证领域大语言模型后训练的响应质量评估与策略对齐性能。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12116 2026-02-13 cs.CL 57%

P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling

P-GenRM:具有测试时用户基于缩放的个性化生成奖励模型

Pinyi Zhang, Ting-En Lin, Yuchuan Wu, Jingyang Chen, Zongqi Wang, Hua Yang, Ze Xu, Fei Huang, Kai Zhang, Yongbin Li

机构 * Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 P-GenRM通过测试时用户基于缩放机制,实现个性化生成奖励模型,提升用户偏好适应性和泛化能力。

Comments Accepted as ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 10 篇

2506.19054 2026-02-13 cs.CR 82%

Poly-Guard: Massive Multi-Domain Safety Policy-Grounded Guardrail Dataset

Poly-Guard: 大规模多领域安全政策导向的防护数据集

Mintong Kang, Zhaorun Chen, Chejian Xu, Jiawei Zhang, Chengquan Guo, Minzhou Pan, Ivan Revilla, Yu Sun, Bo Li

专题命中 安全训练 :safety(title,abstract);alignment(abstract)

AI总结 Poly-Guard是一个大规模多领域安全政策导向的防护数据集,旨在提升防护系统的安全性和领域适应性。

Comments NeurIPS 2025 Dataset & Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11729 2026-02-13 cs.AI cs.LG cs.SE 73%

Cross-Architecture Model Diffing with Crosscoders: Unsupervised Discovery of Differences Between LLMs

跨架构模型差异分析与Crosscoders:无监督发现不同LLM之间的差异

Thomas Jiralerspong, Trenton Bricken

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Dedicated Feature Crosscoders,通过无监督方法发现不同LLM之间的行为差异,如中国共产党一致性、美国例外论和版权拒绝机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09660 2026-02-13 cs.CL cs.LG 73%

Steering MoE LLMs via Expert (De)Activation

通过专家(去)激活引导MoE LLMs

Mohsen Fayyaz, Ali Modarressi, Hanieh Deilamsalehy, Franck Dernoncourt, Ryan Rossi, Trung Bui, Hinrich Schütze, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Adobe Research(Adobe研究) CIS, LMU Munich(慕尼黑大学计算机学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 SteerMoE通过激活或去激活特定专家,在不微调的情况下提升LLM的安全性和忠实性,同时揭示了MoE模型的潜在漏洞。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11220 2026-02-13 cs.LG cs.CL 62%

Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT

修补分布不匹配:用于稳定离策略SFT的RL重写代理

Jiacheng Wang, Ping Jian, Zhen Yang, Zirong Chen, Keren Liao, Zhongbin Guo

机构 * School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于强化学习的RL重写代理,通过优化分布对齐和多样性,提升下游SFT效果并减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11159 2026-02-13 cs.AI cs.HC cs.LG 62%

Explaining AI Without Code: A User Study on Explainable AI

无需代码解释AI:可解释AI的用户研究

Natalia Abarca, Andrés Carvallo, Claudia López Moncada, Felipe Bravo-Marquez

机构 * Department of Computer Science, University of Chile(智利大学计算机科学系) CENIA – National Center for Artificial Intelligence(人工智能国家研究中心) Universidad Técnica Federico Santa María(弗朗西斯科·桑塔玛利亚技术大学) IMFD - Millennium Institute for Foundational Research on Data(数据基础研究千年研究所)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DashAI平台中的可解释AI模块,通过整合PDP、PFI和KernelSHAP技术,提升无代码ML中解释的可访问性和详细性。

Comments LatinX in AI Workshop @ NeurIPS-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12530 2026-02-13 cs.CL cs.LG 62%

Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations

将策略翻译为语言:通过生成连续归一化流生成的奖励用于LLM解释

Xinyi Yang, Liang Zeng, Heng Dong, Chao Yu, Xiaoran Wu, Huazhong Yang, Yu Wang, Milind Tambe, Tonghan Wang

机构 * AIPD, Tencent, Shenzhen, China(腾讯人工智能与大数据研究院,深圳,中国) IIIS, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) EE, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国) CS, Tsinghua University, Beijing, China(清华大学计算机系,北京,中国) SEAS, Harvard University, Cambridge, USA(哈佛大学工程学院,剑桥,美国) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国)

专题命中 安全训练 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过生成连续归一化流生成奖励,训练LLM生成更准确、逻辑严谨且认知负担更低的解释,以提升智能体与人类共存的可靠性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12004 2026-02-13 cs.AI 57%

CSEval: A Framework for Evaluating Clinical Semantics in Text-to-Image Generation

CSEval: 一个用于评估文本到图像生成中临床语义的框架

Robert Cronshaw, Konstantinos Vilouras, Junyu Yan, Yuning Du, Feng Chen, Steven McDonagh, Sotirios A. Tsaftaris

机构 * School of Engineering, University of Edinburgh, United Kingdom(爱丁堡大学工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 CSEval通过语言模型评估文本到图像生成中临床语义的一致性,弥补现有方法在临床相关性评估上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11829 2026-02-13 cs.LG cs.GT 57%

Towards Sustainable Investment Policies Informed by Opponent Shaping

面向可持续投资政策的对手塑造驱动的投资策略

Juan Agustin Duque, Razvan Ciuca, Ayoub Echchahed, Hugo Larochelle, Aaron Courville

机构 * University of Montreal and MILA(蒙特利尔大学和MILA)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过对手塑造算法优化投资策略,以解决可持续发展中的社会困境问题。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11780 2026-02-13 cs.AI 57%

RELATE: A Reinforcement Learning-Enhanced LLM Framework for Advertising Text Generation

RELATE: 一种增强强化学习的大型语言模型框架用于广告文本生成

Jinfang Wang, Jiajie Liu, Jianwei Wu, Ziqin Luo, Zhen Chen, Chunlei Li, Biao Han, Tao Deng, Yi Li, Shuanglong Li, Lin Liu

机构 * Baidu Inc.(百度公司)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 RELAITE通过整合性能和合规性目标到生成过程中,提升广告文本的转化效果和实际应用效果。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11651 2026-02-13 cs.CR cs.AI 57%

DMind-3: A Sovereign Edge--Local--Cloud AI System with Controlled Deliberation and Correction-Based Tuning for Safe, Low-Latency Transaction Execution

DMind-3:一种主权边缘-本地-云AI系统,具备受控推理与基于纠正的调优,用于安全低延迟交易执行

Enhao Huang, Frank Li, Tony Lin, Lowes Yang

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 DMind-3通过边缘-本地-云三层架构,结合受控推理与纠正调优,实现安全低延迟的交易执行,提升金融执行的可靠性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2602.11211 2026-02-13 cs.CR 78%

TRACE: Timely Retrieval and Alignment for Cybersecurity Knowledge Graph Construction and Expansion

TRACE: 信息安全知识图谱构建与扩展中的及时检索与对齐

Zijing Xu, Ziwei Ning, Tiancheng Hu, Jianwei Zhuge, Yangyang Wang, Jiahao Cao, Mingwei Xu

专题命中 越狱攻击 :alignment(title,abstract)

AI总结 TRACE通过整合结构化和非结构化数据,利用LLMs提升网络安全知识图谱的实时更新与实体对齐效率,实现节点覆盖和提取精度的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22871 2026-02-13 cs.CY cs.AI cs.CL cs.HC 67%

Eroding the Truth-Default: A Causal Analysis of Human Susceptibility to Foundation Model Hallucinations and Disinformation in the Wild

消解事实默认:对人类在真实世界中对基础模型幻觉和虚假信息易感性的因果分析

Alexander Loth, Martin Kappes, Marc-Oliver Pahl

机构 * Frankfurt University of Applied Sciences(法兰克福应用科学大学)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过双轴框架分析人类对基础模型幻觉和虚假信息的易感性,发现假新闻熟悉度是关键中介,提出应通过提升认知来源监控来确保信息可信。

Comments Accepted at ACM TheWebConf '26 Companion

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2602.11416 2026-02-13 cs.CR cs.LG 57%

Optimizing Agent Planning for Security and Autonomy

优化安全与自主性的智能体规划

Aashish Kolluri, Rishi Sharma, Manuel Costa, Boris Köpf, Tobias Nießen, Mark Russinovich, Shruti Tople, Santiago Zanella-Béguelin

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 本文提出了一种安全意识智能体,通过增强人工监督交互和规划任务进展与政策合规性,提高自主性并减少对人工监督的依赖。

Comments 33 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 5 篇

2602.11176 2026-02-13 cs.CL cs.AI cs.CE cs.LG 67%

Evaluating Few-Shot Temporal Reasoning of LLMs for Human Activity Prediction in Smart Environments

评估LLM在智能环境中的少样本时间推理用于人类活动预测

Maral Doctorarastoo, Katherine A. Flanigan, Mario Bergés, Christopher McComb

机构 * organization= Department of Civil \& Environmental Engineering, Carnegie Mellon University , addressline= 5000 Forbes Ave , city= Pittsburgh , state= PA , postcode= 15213 , country= USA organization= Department of Mechanical Engineering, Carnegie Mellon University , addressline= 5000 Forbes Ave , city= Pittsburgh , state= PA , postcode= 15213 , country= USA

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了预训练语言模型在智能环境中的少样本时间推理能力,通过评估其在人类活动预测中的表现,发现其在低数据环境下具备强大的时间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11388 2026-02-13 cs.LG cs.CL 62%

Sparse Semantic Dimension as a Generalization Certificate for LLMs

稀疏语义维度作为大语言模型的泛化证书

Dibyanayan Bandyopadhyay, Asif Ekbal

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

AI总结 通过稀疏语义维度理论,揭示大语言模型泛化能力源于内部表示的稀疏结构而非参数数量。

Comments Work in progress (17 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08520 2026-02-13 cs.AI cs.LG 62%

Reinforcement Inference: Leveraging Uncertainty for Self-Correcting Language Model Reasoning

强化推断:利用不确定性进行自我修正的语言模型推理

Xinhai Sun

机构 * Programme of Management Engineering, Politecnico di Milano(米兰理工学院管理工程项目)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出强化推断方法,通过利用模型不确定性进行自我修正推理,提升语言模型在零样本设置下的准确性,同时减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11217 2026-02-13 cs.LG 57%

The Magic Correlations: Understanding Knowledge Transfer from Pretraining to Supervised Fine-Tuning

魔法相关性:从预训练到监督微调的知识转移理解

Simin Fan, Dimitris Paparas, Natasha Noy, Binbin Xiong, Noveen Sachdeva, Berivan Isik

机构 * Google Research(谷歌研究) EPFL(瑞士联邦理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究通过分析预训练到监督微调的知识转移,揭示了不同能力类别、基准测试和模型规模间转移可靠性的差异,为模型开发和数据整理提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05578 2026-02-13 cs.CV 50%

LoGoSeg: Integrating Local and Global Features for Open-Vocabulary Semantic Segmentation

LoGoSeg:整合局部和全局特征以实现开放词汇语义分割

Junyang Chen, Xiangbo Lv, Zhiqiang Kou, Xingdong Sheng, Ning Xu, Yiguo Qiao

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 LoGoSeg通过整合局部和全局特征,提升开放词汇语义分割的精度与效率,减少幻觉和漏检问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2602.11223 2026-02-13 cs.SE cs.HC 50%

Patient Digital Twins for Chronic Care: Technical Hurdles, Lessons Learned, and the Road Ahead

慢性病护理中的患者数字双胞胎:技术障碍、经验教训与未来之路

Micheal P. Papazoglou, Bernd J. Krämer, Mira Raheem, Amal Elgammal

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 本文探讨了患者医疗数字双胞胎在慢性病护理中的技术挑战与未来发展方向,提出了基于本体驱动建模和联邦分析的实施方法,并强调了标准对齐、隐私治理和多模态推理等关键技术。

Comments Feature Article, Patient Medical Digital Twins, Under Review in IEEE SOftware

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 18 篇

2602.12092 2026-02-13 cs.CL cs.AI cs.CR cs.CV 84%

DeepSight: An All-in-One LM Safety Toolkit

DeepSight: 一个全方位的大型模型安全工具包

Bo Zhang, Jiaxuan Guo, Lijun Li, Dongrui Liu, Sujin Chen, Guanxu Chen, Zhijie Zheng, Qihao Lin, Lewen Yan, Chen Qian, Yijin Zhou, Yuyao Wu, Shaoxiong Guo, Tianyi Du, Jingyi Yang, Xuhao Hu, Ziqi Miao, Xiaoya Lu, Jing Shao, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 DeepSight是一个开源工具包,旨在通过整合安全评估与诊断,提升大型模型的安全性与可解释性。

Comments Technical report, 29 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11444 2026-02-13 cs.CL cs.AI 84%

Towards Reliable Machine Translation: Scaling LLMs for Critical Error Detection and Safety

迈向可靠的机器翻译:扩展LLMs以检测关键错误和安全

Muskaan Chopra, Lorenz Sparrenberg, Rafet Sifa

机构 * Rheinische Friedrich-Wilhelms-Universität Bonn, Bonn, Germany(莱茵-威斯巴登大学波恩分校) Fraunhofer IAIS, Sankt Augustin, Germany(弗劳恩霍夫人工智能研究所) Lamarr Institute for Machine Learning(拉马尔人工智能与机器学习研究所)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文通过扩展LLMs检测关键错误,提升机器翻译的安全性和可靠性,减少虚假信息和语言伤害风险。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11472 2026-02-13 cs.CR cs.DC 82%

Future Mining: Learning for Safety and Security

未来采矿:安全与安全的学习

Md Sazedur Rahman, Mizanur Rahman Jewel, Sanjay Madria

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract)

AI总结 本文提出了一种统一的智能安全和安全架构,整合多模态感知、安全联邦学习、强化学习、DTN通信和能量感知传感,以提升采矿环境中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏