arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-19 至 2025-09-19 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3 篇

2509.15202 2025-09-19 cs.CR 89%

Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction

Yuanbo Xie, Yingjie Zhang, Tianyun Liu, Duohe Ma, Tingwen Liu

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract)

Comments Accepted by EMNLP2025 Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15154 2025-09-19 cs.CV 50%

MedFact-R1: Towards Factual Medical Reasoning via Pseudo-Label Augmentation

Gengliang Li, Rongyu Chen, Bin Li, Linlin Yang, Guodong Ding

机构 * Baosight(博思特) NUS(新加坡国立大学) SIAT(深圳先进技术研究院) CUC(中国科学技术大学) Microsoft(微软) ANU(澳大利亚国立大学)

专题命中 安全训练 :trustworthy(abstract)

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15099 2025-09-19 eess.SY cs.SY 50%

Digital Twin-based Cooperative Autonomous Driving in Smart Intersections: A Multi-Agent Reinforcement Learning Approach

Taoyuan Yu, Kui Wang, Zongdian Li, Tao Yu, Kei Sakaguchi, Walid Saad

专题命中 安全训练 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏