arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-24 至 2026-02-24 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 7 篇

2602.19844 2026-02-24 cs.CR cs.AI cs.SE 70%

LLM-enabled Applications Require System-Level Threat Monitoring

依赖大语言模型的应用需要系统级威胁监控

Yedi Zhang, Haoyu Wang, Xianglin Yang, Jin Song Dong, Jun Sun

机构 * Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理学院计算机与信息系统学院)

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文主张对依赖大语言模型的应用进行系统级威胁监控,以应对由此带来的安全挑战和确保可靠操作。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08104 2026-02-24 cs.AI cs.LG cs.MA 62%

Interpretable Failure Analysis in Multi-Agent Reinforcement Learning Systems

多智能体强化学习系统中的可解释性故障分析

Risal Shahriar Shefin, Debashis Gupta, Thai Le, Sarra Alqahtani

机构 * Wake Forest University(威克森林大学) Indiana University(印第安纳大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种两阶段梯度框架,用于多智能体强化学习系统中可解释的故障检测与归因分析,通过几何分析和敏感性分析提高故障诊断的透明度和准确性。

Comments Accepted to the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18492 2026-02-24 cs.DB cs.AI cs.CL cs.SE 62%

Vibe Coding on Trial: Operating Characteristics of Unanimous LLM Juries

Vibe Coding on Trial: Unanimous LLM Juries的运行特性

Muhammad Aziz Ullah, Abdul Serwadda

机构 * Texas Tech University(德克萨斯农工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了使用多数LLM陪审团在代码审查中减少假接受的同时保持高准确率的方法,通过基准测试和实验验证了委员会大小和组成对安全性的影响。

Comments Submitted to IEEE International Conference on Semantic Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04446 2026-02-24 cs.LG 57%

Sampling-aware Adversarial Attacks Against Large Language Models

针对大语言模型的采样感知对抗攻击

Tim Beyer, Yan Scholten, Leo Schwinn, Stephan Günnemann

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于采样感知的对抗攻击方法,通过优化与采样资源分配提升攻击成功率和效率,揭示了采样在评估大语言模型安全性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19110 2026-02-24 physics.plasm-ph 50%

Machine learning prediction of plasma behavior from discharge configurations on WEST

基于WEST磁约束装置放电配置的机器学习预测等离子体行为

Chenguang Wan, Feda Almuhisen, Philippe Moreau, Remy Nouailletas, Zhisong Qu, Youngwoo Cho, Robin Varennes, Kyungtak Lim, Kunpeng Li, Jia Huang, Weidong Chen, Jiangang Li, Xavier Garbet

专题命中 安全训练 :safety(abstract)

AI总结 本研究提出基于变换器的机器学习模型,用于预测WEST托卡马克的关键等离子体参数,实现快速放电规划与实时控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11995 2026-02-24 cs.MA 50%

Compositionally Safe Construction of Autonomous Driving Systems

基于组成安全性的自动驾驶系统构建

Marius Bozga, Joseph Sifakis

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于组成安全性的自动驾驶系统构建方法,通过协调执行驾驶操作来确保安全,采用分阶段控制策略,涵盖主要驾驶任务。

Comments 34 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18967 2026-02-24 cs.RO 50%

TactEx: An Explainable Multimodal Robotic Interaction Framework for Human-Like Touch and Hardness Estimation

TactEx:一种可解释的多模态机器人交互框架,用于类人触觉和硬度估计

Felix Verstraete, Lan Wei, Wen Fan, Dandan Zhang

专题命中 安全训练 :alignment(abstract)

AI总结 TactEx通过融合视觉、触觉和语言模态,实现类人触觉和硬度估计,展示了在水果成熟度评估中的高任务成功率和可解释性。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏