arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-16 至 2025-12-16 共收录 73 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 11 篇

2512.11838 2025-12-16 cs.LG 88%

D-STEER - Preference Alignment Techniques Learn to Behave, not to Believe -- Beneath the Surface, DPO as Steering Vector Perturbation in Activation Space

D-STEER - 通过偏好对齐技术学习行为而非信念 -- 在表象之下,DPO作为激活空间中的低秩引导机制

Samarth Raina, Saksham Aggarwal, Aman Chadha, Vinija Jain, Amitava Das

机构 * IIIT Delhi(印度理工学院德里分校) Microsoft(微软) Apple (USA)(苹果(美国)) Google (USA)(谷歌(美国)) Pragya Lab, BITS Pilani, K. K. Birla Goa Campus(普拉吉亚实验室,比斯科大学,K.K. 布尔拉果阿校区)

专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);分类 cs.LG

AI总结 D-STEER研究揭示DPO通过引导激活空间中的低秩机制实现行为对齐,而非改变模型内部信念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13240 2025-12-16 cs.AI cs.LG 86%

Reflective Preference Optimization (RPO): Enhancing On-Policy Alignment via Hint-Guided Reflection

反射偏好优化(RPO):通过提示引导的反思增强策略对齐

Zihui Zhao, Zechang Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 RPO通过提示引导的反思增强策略对齐,减少幻觉并提升多模态基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11998 2025-12-16 cs.CL 83%

Direct Confidence Alignment: Aligning Verbalized Confidence with Internal Confidence In Large Language Models

直接置信对齐:将 verbalized 置信度与内部置信度对齐于大语言模型

Glenn Zhang, Treasure Mayowa, Jason Fan, Yicheng Fu, Aaron Sandoval, Sean O'Brien, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 偏好对齐 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出直接置信对齐方法,通过优化使LLM的 verbalized 置信度与内部置信度对齐,提升模型透明度和可靠性。

Comments Accepted at ACL 2025 SRW, 5 pages body, 14 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15811 2025-12-16 cs.CL cs.AI 81%

From Clicks to Preference: A Multi-stage Alignment Framework for Generative Query Suggestion in Conversational System

从点击到偏好:一种多阶段对齐框架用于对话系统中的生成查询建议

Junhao Yin, Haolin Wang, Peng Bao, Ju Xu, Yongliang Wang

机构 * Bytedance Shanghai China(字节跳动上海中国) Bytedance Beijing China(字节跳动北京中国)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种多阶段对齐框架,通过提示工程、知识蒸馏和高斯奖励模型,提升生成式查询建议的用户偏好对齐效果,实验显示在自动和人工评估中均优于基线,并提高用户参与度34%

Comments Accepted by SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13426 2025-12-16 cs.CL cs.AI 81%

ALIGN: Word Association Learning for Cultural Alignment in Large Language Models

ALIGN: 用于大语言模型中文化对齐的词关联学习

Chunhua Liu, Kabir Manandhar Shrestha, Sukai Huang

机构 * School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学) Melbourne Data Analytics Platform, The University of Melbourne(墨尔本数据分析平台,墨尔本大学) Faculty of Information Technology, Monash University(信息技术学院,墨尔本大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 ALIGN通过微调大语言模型以学习母语使用者的词关联规范,显著提升文化对齐效果,无需昂贵重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19700 2025-12-16 cs.CL cs.AI 81%

Leveraging Importance Sampling to Detach Alignment Modules from Large Language Models

利用重要性采样将对齐模块从大语言模型中分离出来

Yi Liu, Dianqing Liu, Mingye Zhu, Junbo Guo, Yongdong Zhang, Zhendong Mao

机构 * State Key Laboratory of Communication Content Cognition, People’s Daily Online(通信内容认知国家重点实验室,人民在线) University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出残差对齐模型(RAM),通过重要性采样将对齐模块与大语言模型分离,提升灵活性和可扩展性,并在多种任务上优于基线模型。

Comments Accepted by NeurIPS 2025, 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23188 2025-12-16 cs.CL 70%

Diagnose, Localize, Align: A Full-Stack Framework for Reliable LLM Multi-Agent Systems under Instruction Conflicts

诊断、定位、对齐:一种用于在指令冲突下可靠LLM多智能体系统的全栈框架

Guancheng Wan, Leixin Sun, Longxu Dou, Zitong Shi, Fang Wu, Eric Hanchen Jiang, Wenke Huang, Guibin Zhang, Hejia Geng, Xiangru Tang, Zhenfei Yin, Yizhou Sun, Wei Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Sea AI Lab(Sea AI 实验室) Stanford University(斯坦福大学) University of Oxford(牛津大学) Yale University(耶鲁大学) NTU(南洋理工大学) NUS(新加坡国立大学) Boston University(波士顿大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

AI总结 本文提出了一种全栈框架,通过诊断、定位和对齐三个阶段提升LLM多智能体系统在指令冲突下的可靠性。

Comments Upon further review, we realized that the version submitted to arXiv was not the final draft and omits crucial results and discussion. To avoid confusion and ensure the integrity of the record, we request withdrawal and will resubmit once the complete work is ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24850 2025-12-16 cs.LG cs.AI cs.CL 67%

Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning

利用负信号:从教师数据中进行强化蒸馏以提升大语言模型推理能力

Shuyao Xu, Cheng Peng, Jiangxuan Long, Weidi Xu, Wei Chu, Yuan Qi

机构 * National University of Singapore(国立新加坡大学) INF AI

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过强化蒸馏利用正负推理轨迹提升LLM推理性能,实验表明在少量数据下可达到与大量数据训练模型相当的性能。

Comments 22 pages, 10 figures. Code available at https://github.com/Tim-Siu/reinforcement-distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12337 2025-12-16 cs.CL cs.AI 62%

SCIR: A Self-Correcting Iterative Refinement Framework for Enhanced Information Extraction Based on Schema

SCIR: 一种基于模式的增强信息提取的自校正迭代细化框架

Yushen Fang, Jianjun Li, Mingqian Ding, Chang Liu, Xinchi Zou, Wenqi Yang

机构 * Yushen Fang, Jianjun Li, Mingqian Ding, Chang Liu, Xinchi Zou, Wenqi Yang(作者)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SCIR框架通过自校正迭代细化方法,有效降低信息提取的训练成本并提升准确性,实现跨任务的高效信息提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13678 2025-12-16 cs.CV cs.AI 57%

Feedforward 3D Editing via Text-Steerable Image-to-3D

通过文本可控的图像到3D进行前馈编辑

Ziqi Ma, Hongqiao Chen, Yisong Yue, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 Steer3D通过文本可控的图像到3D生成方法,实现高效且准确的3D资产编辑,速度提升显著。

Comments https://glab-caltech.github.io/steer3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16763 2025-12-16 cs.CV 50%

Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation

自奖励的大型视觉-语言模型用于优化文本到图像生成中的提示

Hongji Yang, Yucheng Zhou, Wencheng Han, Jianbing Shen

机构 * University of Macau(澳门大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出了一种自奖励的大型视觉-语言模型框架,用于优化文本到图像生成中的提示,通过统一求解器和奖励模型实现自我改进,实验表明其优于其他方法。

Comments Accepted by ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2406.16743 2025-12-16 cs.CL 89%

Safety Alignment of Large Language Models via Contrasting Safe and Harmful Distributions

通过对比安全与有害分布实现大语言模型的安全对齐

Xiaoyun Zhang, Zhengyue Zhao, Wenxuan Shi, Kaidi Xu, Di Huang, Xing Hu

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出ACD方法,通过生成安全与对抗性提示,实现大语言模型的安全对齐,提升安全性的同时保持生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12901 2025-12-16 cs.LG 79%

Predicted-occupancy grids for vehicle safety applications based on autoencoders and the Random Forest algorithm

基于自编码器和随机森林算法的预测占用网格用于车辆安全应用

Parthasarathy Nadarajan, Michael Botsch, Sebastian Sardina

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出基于自编码器和随机森林算法的预测占用网格方法,用于复杂交通场景中的车辆安全应用,通过降维和分类提高预测准确性。

Comments 2017 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12387 2025-12-16 cs.LG 79%

Anchoring Values in Temporal and Group Dimensions for Flow Matching Model Alignment

在时间和群体维度上锚定值以实现流匹配模型对齐

Yawen Shao, Jie Xiao, Kai Zhu, Yu Liu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab(通义实验室)

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

AI总结 VGPO通过在时间和群体维度上锚定值,改进流匹配模型对齐,提升图像生成质量与任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13561 2025-12-16 cs.RO 78%

Near-Field Perception for Safety Enhancement of Autonomous Mobile Robots in Manufacturing Environments

近场感知用于制造环境中自主移动机器人的安全增强

Li-Wei Shih, Ruo-Syuan Mei, Jesse Heidrich, Hui-Ping Wang, Joel Hooton, Joshua Solomon, Jorge Arinez, Guangze Li, Chenhui Shao

机构 * Department of Mechanical Engineering, University of Michigan, MI 48109, USA Materials \& Manufacturing Systems Research, General Motors R \& D, Warren, MI 48092, USA

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出三级近场感知框架,通过光断续检测、光位移测量和计算机视觉分类,提升自主移动机器人在制造环境中的安全性能。

Comments Submitted to the 54th SME North American Manufacturing Research Conference (NAMRC 54)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13080 2025-12-16 cs.RO 78%

Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos

通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练

Yicheng Feng, Wanpeng Zhang, Ye Wang, Hao Luo, Haoqi Yuan, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 安全训练 :alignment(title,abstract)

AI总结 通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练,提升机器人任务的稳健性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12692 2025-12-16 cs.AI cs.CL cs.LG 67%

WebOperator: Action-Aware Tree Search for Autonomous Agents in Web Environment

WebOperator: 基于动作意识的树搜索用于网络环境中的自主代理

Mahir Labib Dihan, Tanzima Hashem, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bangladesh University of Engineering and Technology (BUET)(孟加拉工程与技术大学) Faculty of Information Technology(信息技术学院) Monash University(莫纳什大学) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 WebOperator通过引入树搜索框架,实现可靠的回溯和战略探索,提升自主代理在网页环境中的任务成功率。

Comments Under review at ICLR 2026. Project page: https://kagnlp.github.io/WebOperator/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12806 2025-12-16 cs.AI 57%

Fault-Tolerant Sandboxing for AI Coding Agents: A Transactional Approach to Safe Autonomous Execution

面向AI编码代理的容错沙盒:一种用于安全自主执行的事务方法

Boyang Yan

机构 * University of Virginia(弗吉尼亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于事务的容错沙盒框架,通过事务性文件系统快照和策略拦截层,实现对AI编码代理自主执行的安全保障,显著降低延迟并提高安全性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13276 2025-12-16 cs.CV 50%

CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing

CogniEdit: 密集梯度流优化用于细粒度图像编辑

Yan Li, Lin Liu, Xiaopeng Zhang, Wei Xue, Wenhan Luo, Yike Guo, Qi Tian

机构 * Hongkong University of Science and Technology(香港科学与技术大学) Huawei Company(华为公司)

专题命中 安全训练 :alignment(abstract)

AI总结 CogniEdit通过密集梯度流优化实现细粒度图像编辑,结合多模态推理与动态令牌焦点重新定位,提升指令遵循与视觉质量的平衡

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 9 篇

2508.16325 2025-12-16 cs.CL cs.AI cs.SC 90%

ConceptGuard: Neuro-Symbolic Safety Guardrails via Sparse Interpretable Jailbreak Concepts

ConceptGuard: 通过稀疏可解释的禁用概念实现神经符号安全防护

Darpan Aswal, Céline Hudelot

机构 * Department of Computer Science, Université Paris-Saclay(巴黎萨克雷大学计算机科学系) MICS, CentraleSupélec, Université Paris-Saclay(巴黎萨克雷大学MICS)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 ConceptGuard通过稀疏自编码器识别可解释概念,构建可解释且可推广的安全防护,提升LLM对抗禁用攻击的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12921 2025-12-16 cs.CR cs.AI 85%

Cisco Integrated AI Security and Safety Framework Report

思科集成AI安全与安全框架报告

Amy Chang, Tiffany Saade, Sanket Mendapara, Adam Swanda, Ankit Garg

机构 * Cisco AI Threat and Security Research(思科人工智能威胁与安全研究)

专题命中 越狱攻击 :safety(title,abstract);prompt injection(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出思科集成AI安全与安全框架,旨在统一分类和操作化AI风险,涵盖安全与安全,适用于威胁识别、风险优先级排序等,具有全面性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09321 2025-12-16 cs.CR 78%

ObliInjection: Order-Oblivious Prompt Injection Attack to LLM Agents with Multi-source Data

ObliInjection: 面向多源数据LLM代理的顺序无关提示注入攻击

Reachal Wang, Yuqi Jia, Neil Zhenqiang Gong

专题命中 越狱攻击 :prompt injection(title,abstract)

AI总结 ObliInjection是一种针对多源数据LLM代理的新型提示注入攻击,通过顺序无关损失和顺序GCG算法有效污染输入数据以误导模型执行攻击者指定任务。

Comments To appear in NDSS 2026. For slides, see https://people.duke.edu/~zg70/code/PromptInjection.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16689 2025-12-16 cs.CL cs.AI 62%

Concept-Based Interpretability for Toxicity Detection

基于概念的可解释性用于毒性检测

Samarth Garg, Divya Singh, Deeksha Varshney, Mamta

机构 * ABV–IIITM(ABV-IIITM) IIT Patna(印度帕纳大学) IIT Jodhpur(印度朱道普尔大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于概念梯度的方法,通过分析有毒语言的归因机制,改进毒性检测的可解释性和准确性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17904 2025-12-16 cs.CR cs.AI cs.CL 62%

BreakFun: Jailbreaking LLMs via Schema Exploitation

BreakFun: 通过模式利用对LLM进行劫持

Amirkia Rafiei Oskooei, Mehmet S. Aktas

机构 * Department of Computer Engineering, Yildiz Technical University(计算机工程系,伊兹密尔技术大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 BreakFun通过利用LLM对结构模式的遵守能力,揭示了其在劫持攻击中的脆弱性,并提出对抗性提示解构作为缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11986 2025-12-16 cs.LG 57%

Learning to Extract Context for Context-Aware LLM Inference

学习提取上下文以实现上下文感知的LLM推理

Minseon Kim, Lucas Caccia, Zhengyan Shi, Matheus Pereira, Marc-Alexandre Côté, Xingdi Yuan, Alessandro Sordoni

机构 * Microsoft Research(微软研究院)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文提出通过提取上下文信息提升LLM推理的安全性,减少有害输出并提高合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23453 2025-12-16 cs.CR cs.CL 57%

Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems

对抗性评估用于基于大语言模型的评估系统的盲攻击检测

Lijia Liu, Takumi Kondo, Kyohei Atarashi, Koh Takeuchi, Jiyi Li, Shigeru Saito, Hisashi Kashima

机构 * Kyoto University(京都大学) Hokkaido University(北海道大学) SIGNATE, Inc.(SIGNATE公司)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL

AI总结 本文提出SE+CFE框架,通过反事实评估提升基于大语言模型的评估系统对盲攻击的检测能力,同时保持性能稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17248 2025-12-16 cs.LG cs.CR 57%

Backdoors in DRL: Four Environments Focusing on In-distribution Triggers

DRL中的后门:聚焦于分布内触发器的四个环境

Chace Ashcraft, Ted Staley, Josh Carney, Cameron Hickert, Derek Juba, Kiran Karra, Nathan Drenkow

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文针对深度强化学习中的后门攻击,通过四个环境探讨分布内触发器的特性与影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19312 2025-12-16 cs.HC 50%

Human-AI Teaming Under Deception: An Implicit BCI Safeguards Drone Team Performance in Virtual Reality

人类与人工智能协同工作中的欺骗:一种隐式脑机接口保护虚拟现实中的无人机团队性能

Christopher Baker, Stephen Hinton, Akashdeep Nijjar, Riccardo Poli, Caterina Cinel, Tom Reed, Stephen Fairclough

专题命中 越狱攻击 :safety(abstract)

AI总结 隐式脑机接口通过解耦神经信号与行为,提升虚拟现实无人机团队在AI欺骗下的鲁棒性与安全性。

Comments 30 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2512.11949 2025-12-16 cs.LG 70%

Neural Chameleons: Language Models Can Learn to Hide Their Thoughts from Unseen Activation Monitors

神经变色龙:语言模型可以学习隐藏其思想以逃避未见的激活监控

Max McGuinness, Alex Serrano, Luke Bailey, Scott Emmons

专题命中 红队测试 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 语言模型通过微调可学习逃避未见的激活监控,展示出零样本泛化能力,揭示模型在对抗威胁下的鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 4 篇

2512.08290 2025-12-16 cs.CR cs.AI 85%

Systematization of Knowledge: Security and Safety in the Model Context Protocol Ecosystem

知识体系化:模型上下文协议生态系统中的安全与安全

Shiva Gaire, Srijan Gyawali, Saroj Mishra, Suman Niroula, Dilip Thakur, Umesh Yadav

机构 * Tribhuvan University(特里布文大学) University of North Dakota(北达科他大学) Youngstown State University(亚当斯州立大学) University of Missouri(密苏里大学) University of Toledo(托莱多大学)

专题命中 提示注入 :safety(title,abstract);alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文系统化分析了模型上下文协议生态系统中的安全与安全风险,提出了全面的风险分类,并探讨了从对话聊天机器人到自主代理操作系统安全过渡的路线图。

Comments All authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏