arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-03 至 2025-09-03 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 4 篇

2509.00654 2025-09-03 cs.SD cs.AI cs.LG cs.MM eess.AS 62%

The Name-Free Gap: Policy-Aware Stylistic Control in Music Generation

Ashwin Nagarajan, Hao-Wen Dong

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Michigan(密歇根大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01379 2025-09-03 cs.CL 57%

WATCHED: A Web AI Agent Tool for Combating Hate Speech by Expanding Data

Paloma Piot, Diego Sánchez, Javier Parapar

机构 * IRLab, CITIC, Universidade da Coruña, Spain(IR实验室、CITIC、科鲁纳大学、西班牙)

专题命中 安全训练 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15144 2025-09-03 cs.AI 57%

Mobile-Agent-v3: Fundamental Agents for GUI Automation

Jiabo Ye, Xi Zhang, Haiyang Xu, Haowei Liu, Junyang Wang, Zhaoqing Zhu, Ziwei Zheng, Feiyu Gao, Junjie Cao, Zhengxi Lu, Jitong Liao, Qi Zheng, Fei Huang, Jingren Zhou, Ming Yan

专题命中 安全训练 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00918 2025-09-03 cs.CR 50%

PREE: Towards Harmless and Adaptive Fingerprint Editing in Large Language Models via Knowledge Prefix Enhancement

Xubin Yue, Zhenhua Xu, Wenpeng Xing, Jiahui Yu, Mohan Li, Meng Han

专题命中 安全训练 :harmlessness(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏