arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-15 至 2025-12-15 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3 篇

2508.15066 2025-12-15 cs.MA cs.IR 78%

Osprey: Production-Ready Agentic AI for Safety-Critical Control Systems

Osprey:面向安全关键控制系统的生产级代理AI

Thorsten Hellert, João Montenegro, Antonin Sulc

专题命中 安全训练 :safety(title,abstract)

AI总结 Osprey通过四种机制解决安全关键控制系统的协调与安全问题,展示在先进光源中的生产应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07462 2025-12-15 cs.MA cs.AI cs.GT cs.LG math.DS 73%

Understanding LLM Agent Behaviours via Game Theory: Strategy Recognition, Biases and Multi-Agent Dynamics

通过博弈论理解LLM代理行为:策略识别、偏差与多代理动态

Trung-Kiet Huynh, Duy-Minh Dao-Sy, Thanh-Bang Cao, Phong-Hao Le, Hong-Dan Nguyen, Phu-Quy Nguyen-Lam, Minh-Luan Nguyen-Vo, Hong-Phat Pham, Phu-Hoa Pham, Thien-Kim Than, Chi-Nguyen Tran, Huy Tran, Gia-Thoai Tran-Le, Alessio Buscemi, Le Hong Trang, The Anh Han

机构 * Faculty of Information and Technology, Ho Chi Minh City University of Science (HCMUS), Vietnam(信息科技学院,胡志明市科学大学(HCMUS)) Vietnam National University - Ho Chi Minh City (VNU-HCM), Vietnam(越南国家大学-胡志明市(VNU-HCM)) Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Vietnam(计算机科学与工程学院,胡志明市技术大学(HCMUT))

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过扩展FAIRGAME框架,系统评估LLM在重复社会困境中的行为,揭示其策略识别、偏差及多代理动态,为AI治理和安全多代理系统设计提供方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11270 2025-12-15 cs.AI 57%

A-LAMP: Agentic LLM-Based Framework for Automated MDP Modeling and Policy Generation

A-LAMP:基于代理的大型语言模型框架用于自动马尔可夫决策过程建模与策略生成

Hong Je-Gal, Chan-Bin Yi, Hyun-Suk Lee

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 A-LAMP通过基于代理的大型语言模型自动将自然语言任务描述转换为马尔可夫决策过程并生成策略,提升了自动化建模和策略生成的效率与准确性。

Comments NeurIPS 2025 Workshop: Multi-Turn Interactions in Large Language Models. 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏