arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3302 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3302 篇

2605.07021 2026-05-21 cs.AI 74%

Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through Oversight

行为线索推理:通过监督提高推理的效率和安全性

Christopher Z. Cui, Taylor W. Killian, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Brigham Young University

专题命中 安全训练 :safety(title);分类 cs.AI

AI总结 该研究提出行为线索推理方法,通过引入行为线索来增强大语言模型的可控性和可监控性,从而在复杂数学问题解决中减少50%的无效推理token,并在安全行动恢复方面将成功率从46%提升至96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18843 2026-05-20 cs.LG 74%

TEMPO: Temporal Enforcement via Mode-Separated Policy Optimization for Trustworthy LLM Backtesting

TEMPO: 通过模式分离策略优化实现可信大语言模型回测的时序执行

Zeyu Zhang, Bradly C. Stadie

机构 * Department of Statistic and Data Science(统计与数据科学系)

专题命中 安全训练 :trustworthy(title);分类 cs.LG

AI总结 本文提出TEMPO方法,通过模式分离策略优化,解决大语言模型回测中因泄露后截止日期知识导致的评估不准确问题,核心贡献是引入双模式奖励和基于GRPO的训练流程,有效减少知识泄露并提升任务性能。

Comments 9 pages in main context

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04214 2026-04-30 cs.CL 74%

Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards

教LLM变得有说服力:来自异质奖励的强化学习后训练政策优化

Xia Zeng, Yihan Chen, Luhui Liu, Chao Luo, Ye Chen, Zhuoran Zhuang

机构 * Fliggy Alibaba(飞猪阿里)

专题命中 安全训练 :alignment(title);分类 cs.CL

AI总结 本文提出REPO方法,通过结合偏好训练奖励模型、LLM作为判断者和规则奖励函数,提升在线旅行社的价格谈判对话质量,实验显示在对话评分、优秀回应比例和坏案例修复率上均有显著提升。

Comments accepted by ACL 2026 indusry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17843 2026-04-21 cs.HC cs.AI 74%

Learning from AVA: Early Lessons from a Curated and Trustworthy Generative AI for Policy and Development Research

从AVA学习:为政策与发展研究构建的可信生成式AI的早期经验

Nimisha Karnatak, Mohamad Chatila, Daniel Alejandro Pinzón Hernández, Reza Yazdanfar, Michelle Dugas, Renos Vakis

机构 * University of Oxford(牛津大学) Nouswise, Inc.(Nouswise公司)

专题命中 安全训练 :trustworthy(title);分类 cs.AI

AI总结 AVA通过多代理流程为政策研究提供证据合成,通过引用可验证性和合理回避机制实现认知谦逊,实验证明其能节省用户时间,为专用AI设计提供指导。

Comments Accepted at ACM CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21985 2026-01-30 cs.LG 74%

Elign: Equivariant Diffusion Model Alignment from Foundational Machine Learning Force Fields

Elign:从基础机器学习力场中等效扩散模型对齐

Yunyang Li, Lin Huang, Luojia Xia, Wenhe Zhang, Mark Gerstein

机构 * Department of Computer Science, Yale University, New Haven, USA(计算机科学系,耶鲁大学,新 Haven,USA) Program in Computational Biology and Biomedical Informatics, Yale University, New Haven, USA(计算生物学与生物医学信息学项目,耶鲁大学,新 Haven,USA) IQuestLab

专题命中 安全训练 :alignment(title);分类 cs.LG

AI总结 Elign通过结合基础机器学习力场和强化学习优化,实现了等效扩散模型的对齐,提升分子构象生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12759 2025-05-20 cs.LG 74%

Your Offline Policy is Not Trustworthy: Bilevel Reinforcement Learning for Sequential Portfolio Optimization

Haochen Yuan, Minting Pan, Yunbo Wang, Siyu Gao, Philip S. Yu, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University, China(人工智能教育部重点实验室、人工智能研究院、上海交通大学) Department of Computer Science, University of Illinois Chicago, USA(计算机科学系、伊利诺伊大学芝加哥分校)

专题命中 安全训练 :trustworthy(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01828 2025-05-05 cs.RO cs.LG 74%

From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment

Yilin Wu, Ran Tian, Gokul Swamy, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(伯克利大学)

专题命中 安全训练 :alignment(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08162 2025-03-12 cs.RO cs.CL 74%

FASIONAD++ : Integrating High-Level Instruction and Information Bottleneck in FAt-Slow fusION Systems for Enhanced Safety in Autonomous Driving with Adaptive Feedback

Kangan Qian, Ziang Luo, Sicong Jiang, Zilin Huang, Jinyu Miao, Zhikun Ma, Tianze Zhu, Jiayin Li, Yangfan He, Zheng Fu, Yining Shi, Boyue Wang, Hezhe Lin, Ziyu Chen, Jiangbo Yu, Xinyu Jiao, Mengmeng Yang, Kun Jiang, Diange Yang

专题命中 安全训练 :safety(title);分类 cs.CL

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03984 2024-05-01 cs.MA cs.LG cs.SY eess.SY 74%

ROMA-iQSS: An Objective Alignment Approach via State-Based Value Learning and ROund-Robin Multi-Agent Scheduling

Chi-Hui Lin, Joewie J. Koh, Alessandro Roncone, Lijun Chen

专题命中 安全训练 :alignment(title);分类 cs.LG

Comments 10 pages, 3 figures, extended version of our 2024 American Control Conference publication

Journal ref Proceedings of the 2024 American Control Conference (ACC), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09878 2023-11-17 cs.LG 74%

Safety Aware Autonomous Path Planning Using Model Predictive Reinforcement Learning for Inland Waterways

Astrid Vanneste, Simon Vanneste, Olivier Vasseur, Robin Janssens, Mattias Billast, Ali Anwar, Kevin Mets, Tom De Schepper, Siegfried Mercelis, Peter Hellinckx

专题命中 安全训练 :safety(title);分类 cs.LG

Comments \c{opyright} 2022 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13991 2023-11-13 cs.LG cs.CV 74%

TrustGAN: Training safe and trustworthy deep learning models through generative adversarial networks

Hélion du Mas des Bourboux

专题命中 安全训练 :trustworthy(title);分类 cs.LG

Comments 8 pages, 6 figures, 1 table, presented at CAID 2022: Conference on Artificial Intelligence for Defence

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01446 2023-11-03 cs.RO cs.CV cs.LG 74%

Adv3D: Generating Safety-Critical 3D Objects through Closed-Loop Simulation

Jay Sarva, Jingkang Wang, James Tu, Yuwen Xiong, Sivabalan Manivasagam, Raquel Urtasun

专题命中 安全训练 :safety(title);分类 cs.LG

Comments CoRL 2023. Project page: https://waabi.ai/adv3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.08060 2021-07-01 cs.AI 74%

Safe Option-Critic: Learning Safety in the Option-Critic Architecture

Arushi Jain, Khimya Khetarpal, Doina Precup

专题命中 安全训练 :safety(title);分类 cs.AI

Comments To appear at The Knowledge Engineering Review (KER), 2021. Previous draft appeared in Adaptive Learning Agents (ALA) 2018 workshop held at ICML, AAMAS in Stockholm. Corrected typos, added references and added extra figures

Journal ref The Knowledge Engineering Review 36 (2021) e4

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18136 2026-08-20 cs.AI cs.LG 新提交 73%

FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud

FraudBench:针对自适应欺诈的基于政策的银行智能体压力测试

Dheeraj Mohandas Pai, Lu Xian

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 研究人员推出基于τ²-bench框架和τ-Knowledge环境的可执行基准FraudBench,测试银行智能体应对自适应欺诈的安全性,评估发现4款智能体攻击安全性为49%-65%,资金骡和第一方欺诈是主要薄弱点。

Comments 9 Pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18093 2026-08-20 cs.CL cs.AI cs.CR 新提交 73%

Abliteration Mitigation via Refusal Aliases

通过拒绝别名缓解删除(Abliteration)攻击

Nathan Truong

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型的删除(Abliteration)攻击,提出AMRA权重编辑防御方法,在Llama-3-8B和Gemma-2-9B上有效提升删除后的拒绝能力,同时控制了性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14684 2026-08-18 cs.LG cs.AI 新提交 73%

Mitigating Rubric Interference in LLM Judges via On-Policy Self-Distillation

通过策略内自蒸馏缓解大语言模型评审员中的评分标准干扰

Dingyao Yu, Tong Zhang, Yutao Mou, Yunxiao Zhang, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Weixin Al, Tencent Inc(腾讯公司微信智能)

专题命中 安全训练 :alignment(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究针对LLM评审员多评分标准评估时的干扰问题,提出SARA方法,通过策略内自蒸馏提升评估一致性,且该一致性可跨数据集迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03089 2026-08-14 cs.LG cs.AI 版本更新 73%

Constitutional On-Policy Safe Distillation

宪法性在策略安全蒸馏

Ming Wen, Yuxuan Liu, Kun Yang, Yunhao Feng, Zhuoer Xu, Yuhao Sun, Shiwen Cui, Xiang Zheng, Yi Liu, Xingjun Ma, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 针对在策略自蒸馏在安全对齐中因宪法条件导致教师分布收缩、表达能力下降的问题,提出宪法性在策略安全蒸馏(COPSD),通过交叉SFT冷启动校准教师分布,再进行宪法条件在策略蒸馏,在12个基准上实现了更优的安全-有用性权衡并降低安全税。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11178 2026-07-30 cs.AI cs.CL cs.MM cs.SI 版本更新 73%

TANDEM: Temporal-Aware Neural Detection for Multimodal Hate Speech

TANDEM: 面向多模态仇恨言论的时间感知神经检测

Girish A. Koushik, Helen Treharne, Diptesh Kanojia

机构 * Nature-Inspired Computing & Engineering, University of Surrey(Surrey大学自然启发计算与工程系) Surrey Centre for Cyber Security, University of Surrey(Surrey大学网络安全中心)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出TANDEM统一框架,通过串联强化学习策略联合优化视觉-语言和音频-语言模型,将音频-视觉仇恨检测转化为结构化推理问题,在HateMM上目标识别F1达0.73(提升30%),并保持精确时间定位。

Comments Accepted to AAAI-ICWSM 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04846 2026-07-07 cs.LG cs.AI 新提交 73%

Pretraining Curricula Enable Selective Fine-tuning

预训练课程实现选择性微调

Sebastian A. Bruijns, Jirko Rubruck, Mia H. Whitefield, Kai J. Sandbrink, Fazl Barez, Christopher Summerfield

机构 * University of Oxford(牛津大学)

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 研究预训练课程如何影响学习、泛化和微调选择性,对比平衡与不平衡预训练方式,发现不平衡预训练促进上下文学习并提高拒绝微调选择性,还扩展到合成语言学习任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05786 2026-06-30 cs.CR cs.AI cs.CL 73%

Proof-of-Guardrail in AI Agents and What (Not) to Trust from It

AI代理中的证明-护栏以及从其中(不)应信任什么

Xisen Jin, Michael Duan, Qin Lin, Aaron Chan, Zhenglun Chen, Junyi Du, Xiang Ren

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出proof-of-guardrail系统,通过可信执行环境生成加密证明,确保代理在特定开源护栏后生成响应,同时保护开发者隐私,但指出恶意开发者可能欺骗安全措施的风险。

Comments AI4GOOD Workshop at ICML'26. Code: https://github.com/SaharaLabsAI/Verifiable-ClawGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08497 2026-06-09 cs.AI cs.CL 新提交 73%

Explaining Black-Box Language Models: Learning to Optimize Linguistically-Structured Word Subsets

解释黑盒语言模型:学习优化语言结构化的单词子集

Minyoung Hwang, Seokhyun Lee, Changhee Lee

机构 * Korea University(高丽大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对黑盒语言模型解释的三个关键需求(推理效率、黑盒兼容性、语言结构可解释性),提出一种通过强化学习选择信息性单词子集的方法,实现高效、无梯度且语言连贯的解释。

Comments KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05748 2026-06-05 cs.MM cs.AI cs.CL 73%

UNIVID: Unified Vision-Language Model for Video Moderation

UNIVID:用于视频审核的统一视觉语言模型

Kejuan Yang, Yizhuo Zhang, Mingyuan Du, Yue Zhang, Dixin Zheng, Kaili Zhao, Yang Xiao, Hanzhong Liang, Kenan Xiao

机构 * Bytedance(字节跳动)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出UNIVID统一视觉语言模型,通过生成可解释的策略感知字幕,实现端到端视频审核,减少违规泄露42.7%和过度审核率37.0%。

Comments 7 pages, 3 figures. Accepted to ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04160 2026-06-04 cs.CL cs.LG 73%

Expert-Aware Refusal Steering

专家感知的拒绝引导

Anna C. Marbut, Daniel R. Olson, Travis J. Wheeler

机构 * Department of Interdisciplinary Studies(交叉学科研究部) University of Montana(蒙大拿大学) Department of Pharmacy Practice & Science(药学与科学系) University of Arizona(亚利桑那大学) European Bioinformatics Institute(欧洲生物信息研究所) European Molecular Biology Laboratory(欧洲分子生物学实验室) Wellcome Genome Campus(沃氏基因组校园)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 研究在混合专家(MoE)大语言模型中,通过专家感知的引导向量抑制拒绝行为,发现单个专家输出即可有效引导,且注意力机制在MoE拒绝行为中起重要作用。

Comments Under review for COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17952 2026-06-02 cs.CL cs.AI 73%

A Monosemantic Attribution Framework for Stable Interpretability in Clinical Neuroscience Transformer-Based Language Models

面向临床神经科学中基于Transformer的语言模型的稳定可解释性的单语义归因框架

Michail Mamalakis, Tiago Azevedo, Cristian Cosentino, Chiara D'Ercoli, Subati Abulikemu, Zhongtian Sun, Richard Bethlehem, Pietro Lio

机构 * Department of Computer Science and Technology(计算机科学与技术系) Cancer Research UK(癌症研究英国公司) Cambridge Institute(剑桥研究所) University of Cambridge(剑桥大学) United Kingdom(英国) DIMES(迪梅斯) University of Calabria(卡拉布里亚大学) Italy(意大利) Department of Computer Automatic and Management Engineering (DIAG)(计算机自动与管理工程系) Sapienza Università di Roma(罗马大学萨皮恩扎) Department of Psychiatry(精神病学系) School of Computing(计算学院) University of Kent(肯特大学) Department of Psychology(心理学系)

专题命中 安全训练 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 提出一种通过单语义特征提取整合归因与机制视角的统一可解释性框架,生成稳定的输入级重要性分数,促进语言模型在认知健康和神经退行性疾病中的安全应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12487 2026-06-02 cs.NE cs.AI cs.CL 73%

ToxSearch: Evolving Prompts for Toxicity Search in Large Language Models

ToxSearch: 面向大型语言模型毒性搜索的提示演化

Onkar Shelar, Travis Desell

机构 * Rochester Institute of Technology(罗切斯特技术研究所)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出ToxSearch,一种黑盒演化框架,通过同步稳态循环演化提示来测试大型语言模型的安全性,并分析不同操作符的行为及跨模型迁移性。

Comments 16 pages

Journal ref In: García-Sánchez, P., Díaz Álvarez, J., Murphy, A. (eds) Applications of Evolutionary Computation. EvoApplications 2026. Lecture Notes in Computer Science, vol 16525. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23565 2026-05-25 cs.LG cs.AI 73%

Safe Reinforcement Learning with Preference-based Constraint Inference

基于偏好的约束推断的安全强化学习

Chenglin Li, Grant Ruan, Hua Geng

机构 * Department of Automation, Tsinghua University, Beijing, China Laboratory for Information \& Decision Systems, Massachusetts Institute of Technology, Cambridge, MA, USA

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出偏好约束强化学习(PbCRL),通过引入死区机制和信噪比损失,从人类偏好中推断安全约束,实现更好的约束对齐和策略学习。

Comments Accepted by the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05630 2026-05-13 cs.CL cs.AI cs.CR 73%

One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue

一念之差:多轮对话中针对隐藏恶意意图的响应感知防御

Xinjie Shen, Rongzhe Wei, Peizhi Niu, Haoyu Wang, Ruihan Wu, Eli Chien, Bo Li, Pin-Yu Chen, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UCSD(加州大学圣地亚哥分校) National Taiwan University(台湾大学) IBM Research(IBM研究院) Virtue AI

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TurnGate,通过检测最早使交互达到有害行为阈值的轮次,提升多轮对话中恶意意图检测效果,同时保持低拒绝率。

Comments Project Website: https://turn-gate.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08765 2026-05-12 cs.LG cs.AI 73%

Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning

无法学习者可以撒谎:评估和改进LLM去学习中的诚实性

Renjie Gu, Jiazhen Du, Yihua Zhang, Sijia Liu

机构 * Fudan University(复旦大学) Central South University(中南大学) Michigan State University(密歇根州立大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文评估并改进LLM去学习中的诚实性,提出正式定义并引入评估指标,实验显示现有方法无法满足标准,提出ReVa方法提升去学习效果和诚实性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01569 2026-05-11 cs.AI cs.CL 73%

InvThink: Premortem Reasoning for Safer Language Models

InvThink:用于更安全语言模型的预mortem推理

Yubin Kim, Taehan Kim, Eugene Park, Chunjong Park, Cynthia Breazeal, Daniel McDuff, Hae Won Park

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Samsung Research(三星研究)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 InvThink通过预mortem推理框架提升语言模型安全性,通过枚举、分析和约束潜在故障来生成响应,相比现有方法在安全性和减少有害行为方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01356 2026-05-05 cs.LG cs.AI 73%

Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data

基于模型的主动成本生成:用于在有限违规数据下学习安全策略

Ruiqi Xue, Lei Yuan, Kainuo Cheng, Jing-Wen Yang, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Polixir Technologies Nanjing, China(南京Polixir科技有限公司) Tencent Game AI Center Shenzhen, China(腾讯深圳游戏AI中心)

专题命中 安全训练 :safety(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出PROCO框架,利用大语言模型整合自然语言知识,通过构建保守成本函数和模型基于的模拟,减少约束违规并提升安全性,适用于离线数据中极少或无违规样本的高风险场景。

详情

展开后加载摘要…

URL PDF HTML 收藏