arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-12 至 2025-08-12 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 12 篇

2412.16633 2025-08-12 cs.RO cs.AI cs.CY 82%

POEX: Towards Policy Executable Jailbreak Attacks Against the LLM-based Robots

Xuancun Lu, Zhengxian Huang, Xinfeng Li, Chi Zhang, Xiaoyu ji, Wenyuan Xu

专题命中 安全训练 :jailbreak(title,abstract);分类 cs.AI、cs.CY

Comments Homepage: https://poex-jailbreak.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13774 2025-08-12 cs.AI cs.CY cs.MA 73%

Personalized Constitutionally-Aligned Agentic Superego: Secure AI Behavior Aligned to Diverse Human Values

Nell Watson, Ahmed Amer, Evan Harris, Preeti Ravindra, Shujun Zhang

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

Comments 42 pages, 6 figures

Journal ref Information 2025, 16(8), 651

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07651 2025-08-12 eess.SP 71%

Remote ID Based UAV Collision Avoidance Optimization for Low-Altitude Airspace Safety

Ziye Jia, Yian Zhu, Qihui Wu, Lei Zhang, Sen Yang, Zhu Han

专题命中 安全训练 :safety(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07172 2025-08-12 cs.CL 70%

Gradient Surgery for Safe LLM Fine-Tuning

Biao Yi, Jiahao Li, Baolei Zhang, Lihai Nie, Tong Li, Tiansheng Huang, Zheli Liu

机构 * Nankai University(南开大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17130 2025-08-12 cs.CL cs.CR cs.CY 62%

Steering the CensorShip: Uncovering Representation Vectors for LLM "Thought" Control

Hannah Cyberey, David Evans

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.CY

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07075 2025-08-12 cs.LG cs.AI 62%

Surgical Knowledge Rewrite in Compact LLMs: An 'Unlearn-then-Learn' Strategy with ($IA^3$) for Localized Factual Modulation and Catastrophic Forgetting Mitigation

Stanley Ngugi

机构 * Stanley Ngugi(独立研究者)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 2 visual aids

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19250 2025-08-12 cs.LG cs.AI 62%

Robust Behavior Cloning Via Global Lipschitz Regularization

Shili Wu, Yizhao Jin, Puhua Niu, Aniruddha Datta, Sean B. Andersson

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07096 2025-08-12 cs.AI 57%

Rejecting Hallucinated State Targets during Planning

Mingde Zhao, Tristan Sylvain, Romain Laroche, Doina Precup, Yoshua Bengio

机构 * McGill University(麦吉尔大学) Mila (Quebec AI Institute)(蒙特利尔AI研究所) Google Deepmind(谷歌DeepMind)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments [20250810]: ICML 2025 Camera Ready, https://github.com/mila-iqia/delusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06754 2025-08-12 cs.AI 57%

A Fuzzy Logic Prompting Framework for Large Language Models in Adaptive and Uncertain Tasks

Vanessa Figueiredo

专题命中 安全训练 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00352 2025-08-12 cs.AI cs.MA cs.RO 57%

A Differentiated Reward Method for Reinforcement Learning based Multi-Vehicle Cooperative Decision-Making Algorithms

Ye Han, Lijun Zhang, Dejian Meng, Zhuang Zhang

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22792 2025-08-12 cs.CV 50%

Rhetorical Text-to-Image Generation via Two-layer Diffusion Policy Optimization

Yuxi Zhang, Yueting Li, Xinyu Du, Sibo Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全训练 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24152 2025-08-12 cs.RO 50%

Language-Driven Policy Distillation for Cooperative Driving in Multi-Agent Reinforcement Learning

Jiaqi Liu, Chengkai Xu, Peng Hang, Jian Sun, Wei Zhan, Masayoshi Tomizuka, Mingyu Ding

机构 * Department of Computer Science at University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) College of Transportation and Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(同济大学交通学院及交通工程教育部重点实验室) Department of Mechanical Engineering at the University of California, Berkeley(加州大学伯克利分校机械工程系)

专题命中 安全训练 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏