arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-04 至 2025-12-04 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 2 篇

2512.03059 2025-12-04 cs.LG 57%

Safe and Sustainable Electric Bus Charging Scheduling with Constrained Hierarchical DRL

安全且可持续的电动巴士充电调度与受约束的分层深度强化学习

Jiaju Qi, Lei Lei, Thorsteinn Jonsson, Dusit Niyato

机构 * College of Engineering, University of Guelph(圭尔夫大学工程学院) EthicalAI College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种安全且可持续的电动巴士充电调度方法,采用受约束的分层深度强化学习框架,通过整合拉格朗日松弛实现安全与成本的优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20412 2025-12-04 cs.MA cs.LG 57%

Structuring Collective Action with LLM-Guided Evolution: From Ill-Structured Problems to Executable Heuristics

利用LLM引导的进化结构化集体行动:从无序问题到可执行启发式方法

Kevin Bradley Dsouza, Graham Alexander Watt, Yuri Leonenko, Juan Moreno-Cruz

机构 * University of Waterloo(滑铁卢大学) Royal Bank of Canada(加拿大皇家银行)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 ECHO-MIMIC通过LLM引导的进化搜索,将无序问题转化为可执行的启发式方法,实现集体行动的结构化解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏