arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-15 至 2025-10-15 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 6 篇

2509.01909 2025-10-15 cs.AI cs.CL cs.CY cs.HC cs.SC 90%

Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models

Ranjie Duan, Jiexi Liu, Xiaojun Jia, Shiji Zhao, Ruoxi Cheng, Fengxiang Wang, Cheng Wei, Yong Xie, Chang Liu, Defeng Li, Yinpeng Dong, Yichi Zhang, Yuefeng Chen, Chongwen Wang, Xingjun Ma, Xingxing Wei, Yang Liu, Hang Su, Jun Zhu, Xinfeng Li, Yitong Sun, Jie Zhang, Jinzhao Hu, Sha Xu, Wenchao Yang, Yitong Yang, Xingyao Zhang, Yingshui Tan, Jialing Tao, Hui Xue

机构 * Alibaba AAIG(阿里巴巴AAIG)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Technical Report Code & Model weights available: https://github.com/Alibaba-AAIG/Oyster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12083 2025-10-15 cs.CL cs.AI 81%

An AI-Based Behavioral Health Safety Filter and Dataset for Identifying Mental Health Crises in Text-Based Conversations

Benjamin W. Nelson, Celeste Wong, Matthew T. Silvestrini, Sooyoon Shin, Alanna Robinson, Jessica Lee, Eric Yang, John Torous, Andrew Trister

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

Comments Main Text: 2943; Abstract: 256; Tables and Figures: 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07961 2025-10-15 cs.RO cs.AI 79%

BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models

Peiyan Li, Yixiang Chen, Hongtao Wu, Xiao Ma, Xiangnan Wu, Yan Huang, Liang Wang, Tao Kong, Tieniu Tan

机构 * CASIA(中国科学院自动化研究所) ByteDance Seed(字节跳动种子实验室) UCAS(中国科学院大学) FiveAges NJU(南京大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23441 2025-10-15 cs.CL 70%

Cognition-of-Thought Elicits Social-Aligned Reasoning in Large Language Models

Xuanming Zhang, Yuxuan Chen, Samuel Yeh, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12428 2025-10-15 cs.AI 57%

Biased-Attention Guided Risk Prediction for Safe Decision-Making at Unsignalized Intersections

Chengyang Dong, Nan Guo

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12477 2025-10-15 cs.RO 50%

A Task-Efficient Reinforcement Learning Task-Motion Planner for Safe Human-Robot Cooperation

Gaoyuan Liu, Joris de Winter, Kelly Merckaert, Denis Steckelmacher, Ann Nowe, Bram Vanderborght

机构 * Department of Mechanical Engineering, Vrije Universiteit Brussel(布鲁塞尔自由大学机械工程系) imec Flanders Make(弗拉芒制造) Artificial Intelligence (AI) Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学人工智能实验室)

专题命中 安全训练 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏