arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-10 至 2026-02-10 共收录 109 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 10 篇

2602.08259 2026-02-10 stat.ML cs.LG 83%

A Statistical Framework for Alignment with Biased AI Feedback

带有偏见AI反馈的统计框架

Xintao Xia, Zhiqiu Xia, Linjun Zhang, Zhanrui Cai

机构 * Center for Data Science, Zhejiang University(浙江大学数据科学中心) Department of Electrical and Computer Engineering, Rutgers University(罗格斯大学电气与计算机工程系) Department of Statistics, Rutgers University(罗格斯大学统计学系) Faculty of Business and Economics, The University of Hong Kong(香港大学商学院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.LG

AI总结 本文提出两种去偏对齐方法,DDPO通过残差修正和密度比重加权提升效率,DIPO直接估计人类偏好概率,实验证明其在情感生成、摘要和对话任务中提升了对齐效率并接近全人类标注数据性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23126 2026-02-10 cs.AI cs.LG 73%

InSPO: Unlocking Intrinsic Self-Reflection for LLM Preference Optimization

InSPO:解锁LLM偏好优化的内在自反思

Yu Li, Tian Lan, Zhengling Qi

机构 * George Washington University(乔治·华盛顿大学)

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 InSPO通过解锁LLM的内在自反思能力,提升偏好优化的鲁棒性和人类对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07422 2026-02-10 cs.CR cs.AI cs.CL 73%

Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model

通过在线强化学习与漏洞奖励模型实现安全代码生成

Tianyi Wu, Mingzhe Du, Yue Liu, Chengran Yang, Terry Yue Zhuo, Jiaheng Zhang, See-Kiong Ng

机构 * National University of Singapore(国立新加坡大学) Singapore Management University(新加坡管理学院) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 SecCoderX通过在线强化学习与漏洞奖励模型提升代码安全性,实现功能与安全性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08092 2026-02-10 cs.AI cs.ET 70%

Objective Decoupling in Social Reinforcement Learning: Recovering Ground Truth from Sycophantic Majorities

社会强化学习中的目标解耦:从趋炎附势的多数中恢复真实目标

Majid Ghasemi, Mark Crowley

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出Epistemic Source Alignment(ESA)方法,解决社会强化学习中因多数评估者偏见导致的目标解耦问题,通过判断反馈来源而非信号本身,确保收敛到真实目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08829 2026-02-10 cs.CL cs.AI 62%

WildReward: Learning Reward Models from In-the-Wild Human Interactions

WildReward: 从真实世界的人类交互中学习奖励模型

Hao Peng, Yunjia Qi, Xiaozhi Wang, Zijun Yao, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WildReward,通过真实世界用户交互直接学习奖励模型,无需偏好对,实现更优的校准和一致性,并在多种任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12844 2026-02-10 cs.AI cs.LG 62%

Towards Reinforcement Learning from Neural Feedback: Mapping fNIRS Signals to Agent Performance

迈向基于神经反馈的强化学习:将fNIRS信号映射到智能体表现

Julia Santaniello, Matthew Russell, Benson Jiang, Donatello Sassaroli, Robert Jacob, Jivko Sinapov

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过fNIRS信号预测智能体表现,利用分类器和回归器提升RLHF性能,并验证了跨受试者泛化能力。

Comments Accepted to the Association for the Advancement of Artificial Intelligence (AAAI) 2026. To appear in the AAAI 2026 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12281 2026-02-10 cs.CL 57%

Legal$Δ$: Enhancing Legal Reasoning in LLMs via Reinforcement Learning with Chain-of-Thought Guided Information Gain

Legal$Δ$: 通过强化学习与链式思维引导信息增益提升大语言模型的法律推理

Xin Dai, Buqiang Xu, Zhenghao Liu, Yukun Yan, Huiyuan Xie, Xiaoyuan Yi, Shuo Wang, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University(清华大学人工智能研究院计算机科学与技术系) Microsoft Research Asia(微软亚洲研究院)

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.CL

AI总结 Legal$Δ$通过强化学习与链式思维引导信息增益提升法律推理的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07054 2026-02-10 cs.LG cs.CV cs.HC 57%

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

AVERE: 通过偏好优化提升音频视觉情感推理

Ashutosh Chaubey, Jiacheng Pang, Maksim Siniukov, Mohammad Soleymani

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 AVERE通过偏好优化技术提升音频视觉情感推理性能,解决情感与无关线索的虚假关联和幻觉问题,提升多模态模型在情感理解中的表现。

Comments Accepted as a conference paper at ICLR 2026. Project page: https://avere-iclr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13885 2026-02-10 cs.IR 50%

Retrieval-GRPO: A Multi-Objective Reinforcement Learning Framework for Dense Retrieval in Taobao Search

检索-GRPO:面向淘宝搜索密集检索的多目标强化学习框架

Xingxian Liu, Dongshuai Li, Jiahui Wan, Tao Wen, Gui Ling, Yuliang Yan, Fuyu Lv, Dan Ou, Haihong Tang, Bo Zheng

专题命中 偏好对齐 :alignment(abstract)

AI总结 Retrieval-GRPO通过多目标强化学习框架解决密集检索中的硬负样本依赖和跷跷板效应问题,提升复杂长尾查询的语义泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08127 2026-02-10 cs.CV 50%

TIPO: Text to Image with Text Presampling for Prompt Optimization

TIPO: 文本到图像的文本预采样用于提示优化

Shih-Ying Yeh, Yi Li, Sang-Hyun Park, Giyeong Oh, Xuehai Wang, Min Song, Youngjae Yu, Shang-Hong Lai

专题命中 偏好对齐 :alignment(abstract)

AI总结 TIPO通过文本预采样优化提示,提升文本到图像生成的视觉质量和人类偏好度。

Comments 50 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 13 篇

2602.06981 2026-02-10 cs.CY cs.AI cs.HC 87%

What is Safety? Corporate Discourse, Power, and the Politics of Generative AI Safety

什么是安全?企业话语、权力与生成式人工智能安全的政治

Ankolika De, Gabriel Lima, Yixin Zou

机构 * College of Information Sciences and Technology, The Pennsylvania State University(信息科学与技术学院,宾夕法尼亚州立大学) Max Planck Institute for Security and Privacy(安全与隐私研究所)

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY

AI总结 本文通过批判性话语分析,探讨生成式人工智能公司如何构建安全概念,揭示企业话语对安全治理的影响,并呼吁关注问责、公平与正义。

Comments 18 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14185 2026-02-10 cs.LG cs.AI cs.CL 85%

Safety Subspaces are Not Linearly Distinct: A Fine-Tuning Case Study

安全子空间并非线性区分:一项微调案例研究

Kaustubh Ponkshe, Shaan Shah, Raghav Singhal, Praneeth Vepakomma

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) University of California San Diego(加州大学圣地亚哥分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过微调案例发现,安全行为与通用学习组件高度交织,基于子空间的防御策略存在根本限制。

Comments ICLR 2026. Kaustubh Ponkshe, Shaan Shah, and Raghav Singhal contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07381 2026-02-10 cs.CL 83%

When the Model Said 'No Comment', We Knew Helpfulness Was Dead, Honesty Was Alive, and Safety Was Terrified

当模型说'无话可说'时,我们得知有帮助性已死,诚实仍活着,安全性却感到害怕

Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University(计算学院,麦考瑞大学)

专题命中 安全训练 :safety(title,abstract);harmlessness(abstract);分类 cs.CL

AI总结 AlignX通过两阶段框架解决LLM多目标对齐问题,提升有帮助性、无害性和诚实性,同时减少延迟和内存使用。

Comments Accepted at EACL Mains 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08621 2026-02-10 cs.LG cs.AI cs.CR 81%

Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs

稀疏模型,稀疏安全:混合专家大语言模型中的不安全路线

Yukun Jiang, Hai Huang, Mingjie Li, Yage Zhang, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全研究中心)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究揭示了混合专家大语言模型中的不安全路由问题,提出RoSais评分和F-SOUR框架以量化和发现安全风险,通过实验展示了高ASR的攻击效果,并提出防御策略以提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01952 2026-02-10 cs.CV cs.AI cs.LG cs.RO 81%

GrndCtrl: Grounding World Models via Self-Supervised Reward Alignment

GrndCtrl: 通过自监督奖励对齐实现世界模型的 grounding

Haoyang He, Jay Patrikar, Dong-Ki Kim, Max Smith, Daniel McGann, Ali-akbar Agha-mohammadi, Shayegan Omidshafiei, Sebastian Scherer

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 GrndCtrl通过自监督奖励对齐提升世界模型的几何 grounding,实现更稳定的空间一致性与导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07007 2026-02-10 cs.RO 78%

ARGOS: Automated Functional Safety Requirement Synthesis for Embodied AI via Attribute-Guided Combinatorial Reasoning

ARGOS:通过属性引导的组合推理实现具身AI的自动功能安全需求合成

Dongsheng Chen, Yuxuan Li, Yi Lin, Guanhua Chen, Jiaxin Zhang, Xiangyu Zhao, Lei Ma, Xin Yao, Xuetao Wei

机构 * Southern University of Science and Technology, Shenzhen, China(南方科技大学, 深圳, 中国) City University of Hong Kong, Hong Kong, China(香港城市大学, 香港, 中国) The University of Tokyo, Tokyo, Japan(东京大学, 东京, 日本) Lingnan University, Hong Kong, China(岭南大学, 香港, 中国)

专题命中 安全训练 :safety(title,abstract)

AI总结 ARGOS通过属性引导的组合推理,实现具身AI自动功能安全需求生成,提升开放环境中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17420 2026-02-10 cs.LG cs.AI cs.CL 75%

The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence

大语言模型中的拒绝几何学:概念锥与表征独立性

Tom Wollschläger, Jannes Elstner, Simon Geisler, Vincent Cohen-Addad, Stephan Günnemann, Johannes Gasteiger

机构 * School of Computation, Information \& Technology Munich Data Science Institute, Technical University of Munich Google Research Now at Google Research

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出基于梯度的表征工程方法,揭示大语言模型拒绝行为的复杂空间结构及多维概念锥,证明多个独立机制驱动拒绝行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07022 2026-02-10 cs.LG cs.AI cs.CR 73%

AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint

AlphaSteer: 通过原理性零空间约束学习拒绝引导

Leheng Sheng, Changshuo Shen, Weixiang Zhao, Junfeng Fang, Xiaohao Liu, Zhenkai Liang, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 AlphaSteer 通过原理性零空间约束学习拒绝引导,提升大语言模型的安全性与效用平衡。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07013 2026-02-10 cs.CV cs.AI cs.LG 73%

Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models

转向说不:通过激活转向实现可配置拒绝在视觉语言模型中

Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee

机构 * The Pennsylvania State University, USA(宾夕法尼亚州立大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CR-VLM,通过激活转向实现视觉语言模型中的可配置拒绝,解决现有拒绝策略无法适应多样化需求的问题,提升模型的安全性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10566 2026-02-10 cs.LG 70%

ASIDE: Architectural Separation of Instructions and Data in Language Models

ASIDE: 语言模型中指令与数据的架构分离

Egor Zverev, Evgenii Kortukov, Alexander Panfilov, Alexandra Volkova, Soroush Tabesh, Sebastian Lapuschkin, Wojciech Samek, Christoph H. Lampert

机构 * Institute of Science and Technology Austria (ISTA)(奥地利科学与技术研究所) Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) Centre of eXplainable Artificial Intelligence(可解释人工智能中心) Technische Universität Berlin(柏林技术大学) Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所)

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.LG

AI总结 ASIDE通过在令牌嵌入层面实现指令与数据的分离,提升了语言模型的安全性和性能

Comments ICLR 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08082 2026-02-10 cs.LG cs.AI eess.SP 62%

Spectral Guardrails for Agents in the Wild: Detecting Tool Use Hallucinations via Attention Topology

野生环境中代理的频谱护栏:通过注意力拓扑检测工具使用幻觉

Valentin Noël

机构 * Devoteam

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过分析注意力拓扑谱,提出一种无需训练数据的防护方法,有效检测代理幻觉,揭示模型错误时注意力噪声特征。

Comments 32 pages, 2 fgures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07960 2026-02-10 cs.CV 50%

D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning

D-ORCA:面向鲁棒音频视觉描述的对话中心优化

Changli Tang, Tianyi Wang, Fengyun Rao, Jing Lyu, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 D-ORCA通过对话中心优化,提升音频视觉描述的鲁棒性和准确性,填补开源生态关键空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06971 2026-02-10 cs.RO 50%

Formal Methods in Robot Policy Learning and Verification: A Survey on Current Techniques and Future Directions

机器人策略学习与验证中的形式方法:对当前技术与未来方向的综述

Anastasios Manganaris, Vittorio Giammarino, Ahmed H. Qureshi, Suresh Jagannathan

专题命中 安全训练 :safety(abstract)

AI总结 本文综述了形式方法在机器人策略学习与验证中的应用,探讨了当前技术及未来发展方向,旨在提升机器人系统的安全性和正确性。

Comments 19 Pages. 6 Figures. Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 8 篇

2508.04039 2026-02-10 cs.CL cs.AI cs.CR 86%

Large Reasoning Models Are Autonomous Jailbreak Agents

大推理模型是自主的越狱代理

Thilo Hagendorff, Erik Derner, Nuria Oliver

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 大推理模型能自主执行越狱攻击,研究揭示其对安全机制的威胁,强调需加强模型对齐以防止被利用

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11195 2026-02-10 cs.CR 78%

SoK: The Security-Safety Continuum of Multimodal Foundation Models through Information Flow and Global Game-Theoretic Analysis of Asymmetric Threats

SoK:通过信息流和不对称威胁的全局博弈论分析,多模态基础模型的安全-安全性连续体

Ruoxi Sun, Jiamin Chang, Hammond Pearce, Chaowei Xiao, Bo Li, Qi Wu, Surya Nepal, Minhui Xue

专题命中 越狱攻击 :safety(title,abstract)

AI总结 本文通过信息流和博弈论分析,探讨多模态基础模型的安全与安全性连续体,提出系统级防护优于模型级防护,并定义自我破坏阈值以触发终止机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08062 2026-02-10 cs.LG cs.CR 77%

Efficient and Adaptable Detection of Malicious LLM Prompts via Bootstrap Aggregation

通过Bootstrap聚合实现高效且适应性强的恶意LLM提示检测

Shayan Ali Hassan, Tao Ni, Zafar Ayyub Qazi, Marco Canini

机构 * KAUST(卡塔尔人工智能研究所在线中心)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.LG

AI总结 BAGEL通过Bootstrap聚合和专家混合方法,实现高效且适应性强的恶意LLM提示检测,以高F1得分超越现有大参数模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08741 2026-02-10 cs.CR 75%

Large Language Lobotomy: Jailbreaking Mixture-of-Experts via Expert Silencing

大语言模型的脑部手术:通过专家沉默进行混合专家模型的劫持

Jona te Lintelo, Lichao Wu, Stjepan Picek

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 通过专家沉默技术,L$^3$攻击显著提高了MoE LLMs的劫持成功率,揭示了效率与安全之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07517 2026-02-10 cs.CR cs.AI cs.CL cs.DB 73%

MemPot: Defending Against Memory Extraction Attack with Optimized Honeypots

MemPot:通过优化的陷阱来防御内存提取攻击

Yuhao Wang, Shengfang Zhai, Guanghao Jin, Yinpeng Dong, Linyi Yang, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Southern University of Science and technology(南方科技大学)

专题命中 越狱攻击 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 MemPot通过优化陷阱文档和理论验证,有效防御内存提取攻击,提升检测性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20162 2026-02-10 cs.AI cs.CL cs.CR cs.LG 67%

Capability-Based Scaling Trends for LLM-Based Red-Teaming

基于能力的LLM红队测试规模趋势

Alexander Panfilov, Paul Kassianik, Maksym Andriushchenko, Jonas Geiping

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) Foundation AI – Cisco Systems Inc.(AI基础研究机构——思科系统公司) EPFL(苏黎世联邦理工学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过分析攻击者与目标模型能力差距,揭示了红队测试中攻击成功率随模型能力变化的趋势,提出jailbreaking scaling曲线以预测攻击效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06973 2026-02-10 cs.CL cs.AI cs.LG 67%

Does Visual Rendering Bypass Tokenization? Investigating Script-Tokenizer Misalignment in Pixel-Based Language Models

视觉渲染能否绕过分词?探究基于像素的语言模型中脚本-分词器不一致问题

Lucky Susanto, Musa Izzanardi Wijanarko, Khumaisa Nur'aini, Farid Adilazuarda, Alham Fikri Aji, Derry Tanti Wijaya

机构 * Monash University Indonesia(墨尔本大学印尼分校) MBZUAI Boston University(波士顿大学) University of Edinburgh(爱丁堡大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了基于像素的语言模型中视觉渲染是否能绕过分词约束,发现重新引入文本分词器加剧了分词不一致问题,自定义分词器在性能上表现更优。

Comments Submitted to ARR January

详情

展开后加载摘要…

URL PDF HTML 收藏