arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-18 至 2025-09-18 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3 篇

2509.13164 2025-09-18 cs.RO cs.SY eess.SY 78%

TeraSim-World: Worldwide Safety-Critical Data Synthesis for End-to-End Autonomous Driving

Jiawei Wang, Haowei Sun, Xintao Yan, Shuo Feng, Jun Gao, Henry X. Liu

机构 * University of Michigan(密歇根大学) SaferDrive AI The University of Hong Kong(香港大学) Tsinghua University(清华大学) NVIDIA(英伟达)

专题命中 安全训练 :safety(title,abstract)

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13760 2025-09-18 cs.CV 67%

Iterative Prompt Refinement for Safer Text-to-Image Generation

Jinwoo Jeon, JunHyeok Oh, Hayeong Lee, Byung-Jun Lee

机构 * Korea University(韩国大学)

专题命中 安全训练 :alignment(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14129 2025-09-18 cs.LG cs.CY 62%

Breaking the Cycle of Incarceration With Targeted Mental Health Outreach: A Case Study in Machine Learning for Public Policy

Kit T. Rodolfa, Erika Salomon, Jin Yao, Steve Yoder, Robert Sullivan, Kevin McGuire, Allie Dickinson, Rob MacDougall, Brian Seidler, Christina Sung, Claire Herdeman, Rayid Ghani

机构 * Machine Learning Department(机器学习部门) Heinz College of Public Policy(公共政策学院) Carnegie Mellon University(卡内基梅隆大学) Center for Data Science and Public Policy(数据科学与公共政策中心) University of Chicago(芝加哥大学)

专题命中 安全训练 :safety(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏