arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-05 至 2026-02-05 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 6 篇

2602.04056 2026-02-05 eess.SY cs.RO cs.SY 82%

Modular Safety Guardrails Are Necessary for Foundation-Model-Enabled Robots in the Real World

模块化安全护栏是现实世界中由基础模型赋能的机器人所必需的

Joonkyung Kim, Wenxi Chen, Davood Soleymanzadeh, Yi Ding, Xiangbo Gao, Zhengzhong Tu, Ruqi Zhang, Fan Fei, Sushant Veer, Yiwei Lyu, Minghui Zheng, Yan Gu

机构 * Purdue University(普渡大学) Amazon(亚马逊公司) NVIDIA(英伟达公司)

专题命中 安全训练 :safety(title,abstract);alignment(abstract)

AI总结 本文提出模块化安全护栏以解决现实世界中由基础模型赋能的机器人在开放、长尾和随时间适应的环境中的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04801 2026-02-05 eess.SY cs.SY 67%

SQP-Based Cable-Tension Allocation for Multi-Drone Load Transport

基于SQP的多无人机负载运输电缆张力分配

Lamberto Vazquez-Soqui, Fatima Oliva-Palomo, Diego Mercado-Ravell, Pedro Castillo

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本文提出基于SQP算法的多无人机负载运输电缆张力分配方法,通过实时优化提升负载运输的安全性和能耗平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04581 2026-02-05 cs.CL cs.AI cs.DC cs.LG 67%

Trust The Typical

信任典型

Debargha Ganguly, Sreehari Sankar, Biyao Zhang, Vikash Singh, Kanan Gupta, Harshini Kavuru, Alan Luo, Weicong Chen, Warren Morningstar, Raghu Machiraju, Vipin Chaudhary

机构 * Case Western Reserve University(凯斯西储大学) University of Pittsburgh(匹兹堡大学) The Ohio State University(俄亥俄州立大学) Google Research(谷歌研究)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Trust The Typical通过将安全性视为分布外检测问题,在无需有害示例训练的情况下,实现了在多个安全基准测试中的高性能表现,显著降低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04821 2026-02-05 cs.LG cs.AI 62%

Safe Urban Traffic Control via Uncertainty-Aware Conformal Prediction and World-Model Reinforcement Learning

通过不确定性感知的置信区间预测和世界模型强化学习实现安全的城市交通控制

Joydeep Chandra, Satyam Kumar Navneet, Aleksandr Algazinov, Yong Zhang

机构 * Dept. of CST, BNRIST, Tsinghua University, Beijing, China(计算机科学与技术系,北京理工大学,北京,中国) Dept. of CST, Tsinghua University, Beijing, China(计算机科学与技术系,清华大学,北京,中国) Independent Researcher, Bihar, India(独立研究者,印度比哈尔)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 STREAM-RL通过不确定性感知的置信区间预测和世界模型强化学习,实现安全的城市交通控制,提升安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13060 2026-02-05 cs.LG cs.GT math.OC stat.ML 57%

Achieving Logarithmic Regret in KL-Regularized Zero-Sum Markov Games

在KL正则化零和马尔可夫博弈中实现对数遗憾

Anupam Nayak, Tong Yang, Osman Yagan, Gauri Joshi, Yuejie Chi

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出OMG和SOMG算法,在KL正则化下实现对数遗憾,提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04803 2026-02-05 eess.SP 50%

Safe-NEureka: a Hybrid Modular Redundant DNN Accelerator for On-board Satellite AI Processing

Safe-NEureka: 一种用于卫星 onboard AI 处理的混合模块冗余 DNN 加速器

Riccardo Tedeschi, Luigi Ghionda, Alessandro Nadalini, Yvan Tortorella, Arpan Suravi Prasad, Luca Benini, Davide Rossi, Francesco Conti

专题命中 安全训练 :safety(abstract)

AI总结 Safe-NEureka 是一种用于卫星 onboard AI 处理的混合模块冗余 DNN 加速器,结合冗余保护与性能优化,适用于安全关键和性能关键任务。

Comments 22 pages, 13 figures, ACM journal format

详情

展开后加载摘要…

URL PDF HTML 收藏