arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3302 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3302 篇

2301.13816 2023-07-21 cs.LG cs.AI cs.CL cs.PL 67%

Execution-based Code Generation using Deep Reinforcement Learning

Parshin Shojaee, Aneesh Jain, Sindhu Tipirneni, Chandan K. Reddy

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published in Transactions on Machine Learning Research (TMLR), 2023

Journal ref Transactions on Machine Learning Research (TMLR), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06609 2023-03-07 cs.RO 67%

TrafficGen: Learning to Generate Diverse and Realistic Traffic Scenarios

Lan Feng, Quanyi Li, Zhenghao Peng, Shuhan Tan, Bolei Zhou

专题命中 安全训练 :safety(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.07495 2020-06-16 cs.NE 67%

Open Questions in Creating Safe Open-ended AI: Tensions Between Control and Creativity

Adrien Ecoffet, Jeff Clune, Joel Lehman

专题命中 安全训练 :safety(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20792 2025-09-26 cs.CV cs.AI cs.LG 66%

DAC-LoRA: Dynamic Adversarial Curriculum for Efficient and Robust Few-Shot Adaptation

Ved Umrajkar

机构 * Indian Institute of Technology, Roorkee(印度理工学院拉胡尔分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG;trustworthy(comments)

Comments Accepted at ICCV2025 Workshop on Safe and Trustworthy Multimodal AI Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04867 2025-08-28 cs.AI cs.LG 66%

Think Smart, Act SMARL! Analyzing Probabilistic Logic Shields for Multi-Agent Reinforcement Learning

Satchit Chatterji, Erman Acar

机构 * IvI \& ILLC, University of Amsterdam

专题命中 安全训练 :safety(abstract,comments);分类 cs.AI、cs.LG

Comments Accepted to the 28th European Conference on Artificial Intelligence (ECAI 2025) --- 21 pages, 15 figures, Earlier title: "Analyzing Probabilistic Logic Driven Safety in Multi-Agent Reinforcement Learning"; (changed for specificity and clarity)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14110 2024-10-30 cs.LG cs.AI 66%

When is Off-Policy Evaluation (Reward Modeling) Useful in Contextual Bandits? A Data-Centric Perspective

Hao Sun, Alex J. Chan, Nabeel Seedat, Alihan Hüyük, Mihaela van der Schaar

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG;RLHF(comments)

Comments Reward Modeling, Large Language Models, RLHF, Off-Policy Evaluation, Data-Centric AI, Data-Centric Reinforcement Learning, Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16209 2024-10-29 cs.LG cs.AI 66%

C-MCTS: Safe Planning with Monte Carlo Tree Search

Dinesh Parthasarathy, Georgios Kontes, Axel Plinge, Christopher Mutschler

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG;trustworthy(comments)

Comments Workshop on Safe & Trustworthy Agents @NeurIPS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09976 2024-07-02 cs.LG cs.AI 66%

Robust Model-Based Reinforcement Learning with an Adversarial Auxiliary Model

Siemen Herremans, Ali Anwar, Siegfried Mercelis

专题命中 安全训练 :safety(abstract,comments);分类 cs.AI、cs.LG

Comments Will be presented at the RL Safety Workshop at RLC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.04472 2019-12-11 cs.LG cs.AI stat.ML 66%

Deep Bayesian Reward Learning from Preferences

Daniel S. Brown, Scott Niekum

专题命中 安全训练 :safety(abstract,comments);分类 cs.AI、cs.LG

Comments Workshop on Safety and Robustness in Decision Making at the 33rd Conference on Neural Information Processing Systems (NeurIPS) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23034 2026-08-25 cs.LG cs.CL 新提交 62%

ST$^2$U: Stateful Test-Time Unlearning via Restricted Knowledge Boundary Control

ST$^2$U:通过受限知识边界控制实现的有状态测试时遗忘

Xunlei Chen, Qinghui Gong, Ruini Xue, Yaodong Hu, Tian Lan, Wenhong Tian

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出ST$^2$U方法,将测试时遗忘转化为全轨迹范围的受限知识边界控制,在三个基准和三个模型系列上,该方法比测试时基线大幅减少受限知识重新进入,实现了保留与遗忘的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22894 2026-08-25 cs.CL cs.AI 新提交 62%

AraDetox: A Multi-Dialect Arabic Detoxification Dataset

AraDetox:多方言阿拉伯语解毒数据集

Mo El-Haj

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多方言阿拉伯语解毒数据集AraDetox,基于GPT-5和Gemini 2.5 Flash生成海量解毒文本,经评估验证其可有效去除有害语言并保留原意,为相关研究提供公开资源。

Comments 15 pages, 6 figures

Journal ref ArabicNLP 2026 at EMNLP 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22284 2026-08-25 cs.SE cs.AI cs.LG 新提交 62%

Learning from the Test: Self-Referential Differential Testing for Deep RL Agents

从测试中学习:深度强化学习智能体的自引用差异测试

Junda He, Jieke Shi, Zhou Yang, Mingfei Cheng, David Lo

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对深度强化学习智能体的最优性评估缺口,提出Delta框架,通过两阶段差异测试,结合离线RL算法,在5个环境中平均发现2518个最优性缺陷,效果优于基线方法50.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10279 2026-08-25 cs.CR cs.AI cs.CL 版本更新 62%

Withholding the Completing Chunk: Exact Release-Boundary Equivalence for Production Streaming Guardrails

withhold the Completing Chunk: 面向流式大语言模型输出的确定性配对完成护栏

Christopher M. Frost

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出流式LLM输出的确定性配对完成护栏,通过扫描前缀扣留配对完成块,实验验证其效果,表明它是小型固定策略的精确发布边界后盾。

Comments 9 pages, 2 figures, 4 tables. Substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28900 2026-08-25 cs.RO cs.AI cs.LG cs.SY eess.SY 版本更新 62%

Robust Multi-Agent Reinforcement Learning for Small UAS Separation Assurance under GPS Degradation and Spoofing

针对GPS退化和欺骗的鲁棒多智能体强化学习用于小型无人机分离保障

Alex Zongo, Filippos Fotiadis, Ufuk Topcu, Peng Wei

机构 * George Washington University(乔治华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过多智能体强化学习解决小型无人机在GPS退化和欺骗下的鲁棒分离保障问题,提出闭式表达式对抗扰动,实现线性时间评估,并在高密度无人机模拟中取得近零碰撞率。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18492 2026-08-25 cs.DB cs.AI cs.CL cs.SE 版本更新 62%

Vibe Coding on Trial: Operating Characteristics of Unanimous LLM Juries

Vibe Coding on Trial: Unanimous LLM Juries的运行特性

Muhammad Aziz Ullah, Abdul Serwadda

机构 * Texas Tech University(德克萨斯农工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了使用多数LLM陪审团在代码审查中减少假接受的同时保持高准确率的方法,通过基准测试和实验验证了委员会大小和组成对安全性的影响。

Comments Submitted to IEEE International Conference on Semantic Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16386 2026-08-24 cs.CL cs.LG 版本更新 62%

Mint-Agent: Introducing Finance-Native Agentic Foundation Models

Mint-Agent:引入金融原生智能体基础模型

Agent Team, Kun Wang, Gavin Zhang, Yaze Geng, Lei Tang, Yaoyang Yi, Zonghan Wu, Yifan Hu, Qingsong Wen, Yilei Shao

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出金融原生智能体模型Mint-Agent,通过三大支柱开发出Mint-Cu(9B)和Mint-Ag(27B),在多个金融基准测试中展现出优异的可靠性与可执行性,为可信金融智能提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19836 2026-08-21 cs.LG cs.AI cs.LO 新提交 62%

Adaptive Probabilistic Shielding by Learning MDPs for Safe Reinforcement Learning

通过学习马尔可夫决策过程(MDP)实现自适应概率屏蔽用于安全强化学习

Astrid Horn Brorholt, Maris F. L. Galesloot, Nils Jansen, Kim Guldstrand Larsen, Christian Schilling

机构 * Aalborg University(奥尔堡大学) Radboud University(拉德堡德大学) Ruhr University Bochum(波鸿鲁尔大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文针对已知MDP转移图但转移概率未知的场景,提出将概率屏蔽与在线模型学习结合的自适应方法,通过实验验证其在安全强化学习中的有效性。

Comments 19 pages, 3 figures, 3 tables. To be published in the proceedings of RV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02196 2026-08-20 cs.AI cs.LG math.ST stat.ML stat.TH 版本更新 62%

Conformal Policy Control

符合性策略控制

Drew Prinster, Clara Fannjiang, Ji Won Park, Kyunghyun Cho, Anqi Liu, Suchi Saria, Samuel Stanton

机构 * Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于安全参考策略的符合性校准方法,用于在不违反安全约束的前提下,使优化但未测试的策略能够安全地进行探索,并在有限样本下提供理论保证。

Comments International Conference on Machine Learning (ICML), 2026. v4: Revised CPC theory to (a) show enforced smoothness for likelihood-ratio control parameter and (b) for general control parameter, assume smoothness only of constrained policy $π_t^{(β)}$ w.r.t. $β$ (rather than of $(l_i - α)\cdotπ_t^{(β)}$ or of conformal weights)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05819 2026-08-19 cs.LG cs.AI 版本更新 62%

Diffusion Models for Smarter UAVs: Decision-Making and Modeling

用于更智能无人机的扩散模型:决策与建模

Yousef Emami, Hao Zhou, Luis Almeida, Kai Li

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文探索将扩散模型(DMs)与强化学习(RL)、数字孪生(DT)集成,通过仿真验证其在四无人机集群协同任务中生成邻居速度估计值的有效性,助力智能无人机的决策与建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15673 2026-08-18 cs.LG cs.AI 新提交 62%

PL-Guard: Probabilistic Logic Reasoning for LLM Guardrails

PL-Guard:面向大语言模型安全护栏的概率逻辑推理

Satchit Chatterji, Shihan Wang, Giovanni Sileno, Erman Acar

机构 * University of Amsterdam(阿姆斯特丹大学) Utrecht University(乌得勒支大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出神经符号安全护栏架构PL-Guard,通过分离神经落地与概率符号推理,在XSTest基准上大幅降低大语言模型的不安全依从率,虽过度拒绝率略高,但提升了推理可审计性。

Comments Preliminary version of this paper was presented at the IJCAI 2026 Workshop on Logical and Symbolic Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13160 2026-08-14 cs.CL cs.AI 新提交 62%

Better Decomposition, Free Aggregation: A Synthesizer-Folding Framework for Multilingual Multi-Hop Question Answering

更好的分解,自由聚合:面向多语言多跳问答的合成器折叠框架

Yilin Wang, Yuchun Fan, Weidong Bao, Zili Wei, Shi Feng, Tong Xiao, Zhengtao Yu, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Kunming University of Science and Technology(昆明理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对多语言多跳问答中现有方法的翻译噪声与错误放大问题,提出Syfer框架,通过推迟翻译、格式受限分解与质量检查实现性能与成本的良好平衡。

Comments Accepted by NLPCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06564 2026-08-14 cs.LG cs.CL 版本更新 62%

Which Decisions Low-Bit Quantization Breaks, and How to Predict Them

量化损伤是乘法性的,而非加法性的

Zekun Wu, Swati Dhiman, Adriano Koshiyama

机构 * Holistic AI(霍利斯提克人工智能公司) University College London(伦敦大学学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现大型语言模型的量化损伤是乘法性的,而非加法性的,提出边际收缩概念,拟合关系可准确预测决策翻转率,增加1位是修复损伤最廉价的方式。

Comments 18 pages, 9 figures, 8 tables. Under review at the Third Workshop on Uncertainty-Aware NLP (UncertaiNLP), EMNLP 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11658 2026-08-13 cs.LG cs.AI cs.MA 新提交 62%

Is Per-Agent Policy Composition Safe? Rethinking Successor-Feature Transfer in Cooperative Multi-Agent Reinforcement Learning

智能体策略组合是否安全?重新思考合作多智能体强化学习中的后继特征迁移

Zijian Zhao, Sen Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对多智能体强化学习中独立策略组合不安全的问题,提出MA-USFA分层方法,兼顾策略组合的安全性与灵活性,无需任务适配即可部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11505 2026-08-11 cs.LG cs.AI 版本更新 62%

Proxy OPD: On-Policy Distillation with Transferable Relative Proxy Update

代理探索与可重用引导:基于代理引导更新信号的模块化大语言模型训练后范式

Daocheng Fu, Rong Wu, Yu Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Xuemeng Yang, Yong Liu, Botian Shi, Yu Qiao

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型训练后优化信号耦合问题,提出PUST框架,通过代理模型探索、提取并传输相对改进信号,解耦更新信号探索与分布对齐,减少计算开销,支持异步处理与跨模型转移,提升训练后范式的模块化、可重用性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07901 2026-08-11 cs.GT cs.AI cs.CY cs.MA econ.TH 版本更新 62%

The Theory of Strategic Evolution: Games with Endogenous Players and the Seven Laws of Strategic Replicators

战略进化理论:具有内生参与者和战略复制者的博弈

Kevin Vallier

机构 * Institute of American Constitutional Thought and Leadership(美国宪法思想与领导力研究所) University of Toledo(托莱多大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出战略进化理论,引入具有内生参与者的博弈,定义进化稳定智能分布,通过跨层增益矩阵构建战略层层次结构,证明相关封闭性及定理,可用于分析人工智能部署动态等,揭示人格工程问题及稳定多智能体系统的宪法约束。

Comments 171 pages. Formalized in Lean 4 with Mathlib: 240 theorems in the elaborated environment, 141 audited headline results, cold-compiling from a clean checkout with zero custom axioms. Source, theorem-by-theorem contract, and reproducible axiom audit: https://github.com/selfreferencing/TSE_Formal. Companion to Agentic Capital

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07418 2026-08-10 cs.AI cs.CL 新提交 62%

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

ResidencyRL:在模拟临床环境中开展的强化学习

Valentin Liévin, Samuel Schmidgall, Tim Strother, Alex Bijamov, Akshay Goel, Anil Palepu, Chunjong Park, Vahid Balazadeh, Min Woo Sun, Marius Guerard, Justin Chen, Dave Steiner, Vikram Dhillon, Ibrahim Azar, Akhil Mehta, Nicholas Spetsieris, Shilpan Shah, Maen Abdelrahim, Amit Dahiya, Yun Liu, Katherine Chou, Yossi Matias, Avinatan Hassidim, Dale R. Webster, Quoc V. Le, Raia Hadsell, Joelle Barral, Carey Radebaugh, Aleksandra Faust, Shekoofeh Azizi, Mike Schaekermann, Po-Hsuan Cameron Chen, Tao Tu, David Racz, Lin Yang

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院) Houston Methodist Hospital(休斯顿卫理公会医院) Trinity Health Group(三一健康集团) Stanford Oncology Partners(斯坦福肿瘤学伙伴) St. Luke Hospital(圣卢克医院)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出 ResidencyRL,通过多轮强化学习训练临床 AI 智能体,在模拟临床环境中提升诊断准确性、降低漏报率,且能力可迁移至多个医学基准测试,为临床 AI 发展提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05158 2026-08-07 cs.CL cs.LG cs.NE 新提交 62%

Safe Evolution with Circuit Anchors

基于回路锚点的安全进化

Yan Liu, Jie Fu, Tsung-Yi Ho

机构 * Chinese University of Hong Kong(香港中文大学) IQuest Research(艾奎斯特研究院)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 受生物发育约束启发,提出回路锚定进化(CAE)方法,通过锚定占比不足2%的安全回路,在极小能力损失下实现更优的安全保留,性能优于显式奖励约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03873 2026-08-07 cs.LG cs.CL 版本更新 62%

SODA: Semi On-Policy Black-Box Distillation for Large Language Models

SODA:大语言模型的半在线盒式知识蒸馏

Xiwen Chen, Jingjing Wang, Wenhui Zhu, Peijie Qiu, Xuanzhao Dong, Yueyue Deng, Hejian Sang, Zhipeng Wang, Alborz Geramifard, Feng Luo

机构 * Clemson University(克莱姆森大学) LinkedIn(领英) Washington University in St. Louis(圣路易斯华盛顿大学) Arizona State University(亚利桑那州立大学) Columbia University(哥伦比亚大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SODA,一种高效的半在线盒式知识蒸馏方法,通过对比教师最优响应与学生静态输出,实现高质量分布对齐,无需动态回放和对抗平衡,提升蒸馏效率和稳定性。

Comments Efficient Reasoning@COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05045 2026-08-06 cs.CR cs.AI cs.CL 新提交 62%

Gradient Immunity: Null-Space Resistance to Malicious Fine-Tuning

梯度免疫:对恶意微调的零空间抗性

Yuxuan Huang, Xingyu Zeng, Tianhang Zheng, Chaochao Lu

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 针对部分保护开放权重(PPOW)发布场景的大型语言模型,提出单向安全门(USG)防御,可抑制恶意微调的有害梯度,提升恶意下游适应的成本且无需下游用户配合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04289 2026-08-06 cs.AI cs.CL 新提交 62%

SafeCommit: Certifying When Memory-Grounded Agents May Safely Act

SafeCommit:验证基于记忆的智能体何时可以安全行动

Mayur Akewar, Ravi Ranjan

机构 * Florida International University(佛罗里达国际大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 针对长程智能体过早承诺的问题,提出SafeCommit风险控制层,通过构建合理潜在世界、共形动作证书等实现安全行动决策,还展示了安全-效用权衡。

Comments 14 pages, 6 tables, and 1 figure, target NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏