arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-29 至 2025-12-29 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3 篇

2512.21673 2025-12-29 cs.CV cs.AI cs.LG 62%

Comparative Analysis of Deep Learning Models for Perception in Autonomous Vehicles

自动驾驶车辆感知中深度学习模型的比较分析

Jalal Khan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了YOLO-NAS和YOLOv8在自动驾驶车辆感知任务中的性能,发现YOLOv8在训练时间和检测精度上均优于YOLO-NAS。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12712 2025-12-29 cs.CL cs.AI 62%

Adaptive Focus Memory for Language Models

自适应聚焦记忆用于语言模型

Christopher Cruz

机构 * Purdue University(普渡大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 自适应聚焦记忆通过动态分配保真度级别,实现多轮对话中有效约束保持,无需修改模型权重或外部检索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13021 2025-12-29 eess.SY cs.SY 50%

Safe Control of Multi-Agent Systems with Minimal Communication

多智能体系统安全控制的最小通信

Mo Yang, Jing Yu, Necmiye Ozay

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种多智能体系统中最小化通信的控制器设计方法,通过秩最小化问题和系统级合成实现安全性和协调性的保障。

Comments to appear at 2025 IEEE Conference on Decision and Control (CDC)

详情

展开后加载摘要…

URL PDF HTML 收藏