arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-02 至 2026-02-02 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 6 篇

2601.23094 2026-02-02 cs.CL cs.LG 62%

Safer Policy Compliance with Dynamic Epistemic Fallback

动态认知回退:更安全的政策合规性

Joseph Marvin Imperial, Harish Tayyar Madabushi

机构 * University of Bath, UK(巴斯大学) National University Philippines(菲律宾国家大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出动态认知回退机制,通过文本提示提升LLM对抗恶意扰动政策文本的检测与拒绝能力,DeepSeek-R1在特定设置中实现100%检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22801 2026-02-02 cs.LG 57%

Clipping-Free Policy Optimization for Large Language Models

无需裁剪的策略优化用于大语言模型

Ömer Veysel Çağatan, Barış Akgün, Gözde Gül Şahin, Xuandong Zhao

机构 * KUIS AI Center, Koç University, Istanbul, Türkiye(Koç大学) Koç University, Istanbul, Türkiye(Koç大学) University of California, Berkeley, CA, USA(加州大学伯克利分校)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 CFPO通过凸二次惩罚替代裁剪机制,实现稳定策略优化,适用于大语言模型的训练。

Comments 23 pages, 10 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02662 2026-02-02 cs.LG 57%

Grounding Large Language Models in Interactive Environments with Online Reinforcement Learning

通过在线强化学习将大语言模型接地于交互环境

Thomas Carta, Clément Romac, Thomas Wolf, Sylvain Lamprier, Olivier Sigaud, Pierre-Yves Oudeyer

机构 * Inria (Flowers)(Inria(Flowers)) University of Bordeaux(波尔多大学) Hugging Face Univ Angers, LERIA, SFR MATHSTIC(昂热大学,LERIA,SFR MATHSTIC) Sorbonne Université(索邦大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出GLAM方法,通过在线强化学习将大语言模型接地于交互环境,以提升样本效率和泛化能力,并探讨在线学习的影响。

Comments The associated code can be found at https://github.com/flowersteam/Grounding_LLMs_with_online_RL. This is an extended version of the paper published at ICML 2023: https://proceedings.mlr.press/v202/carta23a

Journal ref PMLR 202 (2023):3676-3713

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15587 2026-02-02 cond-mat.soft cs.MA physics.bio-ph 50%

Learning to flock in open space by avoiding collisions and staying together

在开放空间中通过避障和保持在一起学习群体运动

Martino Brambati, Antonio Celani, Marco Gherardi, Francesco Ginelli

专题命中 安全训练 :alignment(abstract)

AI总结 该研究通过多智能体强化学习框架,在开放空间中实现群体协同运动,通过避障和保持在一起的策略,产生高极性秩序的集体运动。

Comments 13 pages + appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22680 2026-02-02 cs.CV 50%

Visual Personalization Turing Test

视觉个性化图灵测试

Rameen Abdal, James Burgess, Sergey Tulyakov, Kuan-Chieh Jackson Wang

机构 * Snap Research(Snap研究)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出视觉个性化图灵测试,通过感知不可区分性评估个性化生成模型,引入VPTT框架和评分指标,验证其在人类和VLM判断中的可靠性。

Comments Webpage: https://snap-research.github.io/vptt

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22295 2026-02-02 math.OC 50%

Operating Imperfect AI: Reliability Drift and Human Congestion

操作不完美的AI:可靠性漂移与人类拥堵

Ziyao Wang, Svetlozar T Rachev

专题命中 安全训练 :safety(abstract)

AI总结 本文提出动态排队控制方法,解决算法可靠性漂移与人类接管能力稀缺之间的矛盾,通过容量影子价格驱动最优策略,建立拥堵缓解与安全缓冲机制,并识别容量相变临界点。

详情

展开后加载摘要…

URL PDF HTML 收藏