arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-03 至 2025-10-03 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 6 篇

2510.02194 2025-10-03 cs.AI cs.CR cs.LG 86%

UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models

Yuhao Sun, Zhuoer Xu, Shiwen Cui, Kun Yang, Lingyun Yu, Yongdong Zhang, Hongtao Xie

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01520 2025-10-03 cs.LG cs.AI 81%

Predictive Modeling and Explainable AI for Veterinary Safety Profiles, Residue Assessment, and Health Outcomes Using Real-World Data and Physicochemical Properties

Hossein Sholehrasa, Xuan Xu, Doina Caragea, Jim E. Riviere, Majid Jaberi-Douraki

机构 * DATA Consortium and FARAD Program, Kansas State University, Olathe, KS, USA(1DATA Consortium和FARAD计划,堪萨斯州立大学) Department of Computer Science, Kansas State University, Manhattan, KS, USA(计算机科学系,堪萨斯州立大学) Department of Statistics, Kansas State University, Manhattan, KS, USA(统计学系,堪萨斯州立大学) Department of Mathematics, Kansas State University, Olathe, KS, USA(数学系,堪萨斯州立大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01259 2025-10-03 cs.CL cs.AI cs.CR 62%

In AI Sweet Harmony: Sociopragmatic Guardrail Bypasses and Evaluation-Awareness in OpenAI gpt-oss-20b

Nils Durner

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments 27 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15254 2025-10-03 cs.SE cs.CL cs.LG 62%

CRUST-Bench: A Comprehensive Benchmark for C-to-safe-Rust Transpilation

Anirudh Khatry, Robert Zhang, Jia Pan, Ziteng Wang, Qiaochu Chen, Greg Durrett, Isil Dillig

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

Comments To be published at COLM, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01995 2025-10-03 cs.CL 57%

LLM-Based Multi-Task Bangla Hate Speech Detection: Type, Severity, and Target

Md Arid Hasan, Firoj Alam, Md Fahad Hossain, Usman Naseem, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) Qatar Computing Research Institute(卡塔尔计算研究院) Daffodil International University(达芙妮国际大学) Macquarie University(麦考瑞大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01623 2025-10-03 cs.CV cs.RO 50%

VLA-R1: Enhancing Reasoning in Vision-Language-Action Models

Angen Ye, Zeyu Zhang, Boyuan Wang, Xiaofeng Wang, Dapeng Zhang, Zheng Zhu

机构 * GigaAI CASIA Tsinghua University(清华大学)

专题命中 安全训练 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏