arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-14 至 2025-08-14 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 11 篇

2508.09762 2025-08-14 cs.AI cs.CY cs.HC 86%

The PacifAIst Benchmark:Would an Artificial Intelligence Choose to Sacrifice Itself for Human Safety?

Manuel Herrador

机构 * Polytechnic School of Jaen, University of Jaen(耶尼大学多技术学院)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.AI、cs.CY

Comments 10 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05148 2025-08-14 cs.RO cs.AI 79%

Chemist Eye: A Visual Language Model-Powered System for Safety Monitoring and Robot Decision-Making in Self-Driving Laboratories

Francisco Munguia-Galeano, Zhengxue Zhou, Satheeshkumar Veeramani, Hatem Fakhruldeen, Louis Longley, Rob Clowes, Andrew I. Cooper

机构 * Cooper Group, Department of Chemistry, University of Liverpool(Cooper集团,化学系,利物浦大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23486 2025-08-14 cs.CL 79%

A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains

Shirui Wang, Zhihui Tang, Huaxia Yang, Qiuhong Gong, Tiantian Gu, Hongyang Ma, Yongxin Wang, Wubin Sun, Zeliang Lian, Kehang Mao, Yinan Jiang, Zhicheng Huang, Lingyun Ma, Wenjie Shen, Yajie Ji, Yunhui Tan, Chunbo Wang, Yunlu Gao, Qianling Ye, Rui Lin, Mingyu Chen, Lijuan Niu, Zhihao Wang, Peng Yu, Mengran Lang, Yue Liu, Huimin Zhang, Haitao Shen, Long Chen, Qiguang Zhao, Si-Xuan Liu, Lina Zhou, Hua Gao, Dongqiang Ye, Lingmin Meng, Youtao Yu, Naixin Liang, Jianxiong Wu

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07866 2025-08-14 cs.AI 79%

System 2 Reasoning for Human-AI Alignment: Generality and Adaptivity via ARC-AGI

Sejin Kim, Sundong Kim

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09864 2025-08-14 cs.LG cs.AI cs.CL cs.CV 75%

LUMA: A Benchmark Dataset for Learning from Uncertain and Multimodal Data

Grigor Bezirganyan, Sana Sellami, Laure Berti-Équille, Sébastien Fournier

机构 * Aix Marseille Univ, CNRS, LIS(阿维尼翁-马赛大学、国家科学研究中心、LIS)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments SIGIR 2025

Journal ref Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06296 2025-08-14 cs.AI cs.LG 73%

LLM Robustness Leaderboard v1 --Technical report

Pierre Peigné - Lefebvre, Quentin Feuillade-Montixi, Tom David, Nicolas Miailhe

机构 * PRISM Eval(PRISM评估)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09987 2025-08-14 cs.CV cs.AI cs.CL 62%

Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation

Junyan Ye, Dongzhi Jiang, Zihao Wang, Leqi Zhu, Zhenghao Hu, Zilong Huang, Jun He, Zhiyuan Yan, Jinghua Yu, Hongsheng Li, Conghui He, Weijia Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) CUHK MMLab(香港中文大学多模态实验室) Peking University(北京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12867 2025-08-14 eess.AS cs.AI cs.CL 62%

EmoVoice: LLM-based Emotional Text-To-Speech Model with Freestyle Text Prompting

Guanrou Yang, Chen Yang, Qian Chen, Ziyang Ma, Wenxi Chen, Wen Wang, Tianrui Wang, Yifan Yang, Zhikang Niu, Wenrui Liu, Fan Yu, Zhihao Du, Zhifu Gao, ShiLiang Zhang, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Tongyi Speech Lab(通义语音实验室) Tianjin University(天津大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University, Shanghai Innovation Institute(上海交通大学上海创新研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted at ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09893 2025-08-14 cs.AI 57%

RAGulating Compliance: A Multi-Agent Knowledge Graph for Regulatory QA

Bhavik Agarwal, Hemant Sunil Jomraj, Simone Kaplunov, Jack Krolick, Viktoria Rojkova

机构 * MasterControl AI Research(MasterControl AI研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17609 2025-08-14 cs.AI 57%

Integrating Visual Interpretation and Linguistic Reasoning for Math Problem Solving

Zixian Guo, Ming Liu, Qilong Wang, Zhilong Ji, Jinfeng Bai, Lei Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨理工大学) The Hong Kong Polytechnic University(香港理工大学) Tianjin University(天津大学) Tomorrow Advancing Life(明天进步生命) Pazhou Lab, Guangzhou(广州琶洲实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09566 2025-08-14 cs.CV 50%

A Chain of Diagnosis Framework for Accurate and Explainable Radiology Report Generation

Haibo Jin, Haoxuan Che, Sunan He, Hao Chen

机构 * Department of Computer Science and Engineering, Hong Kong University of Science and Technology(计算机科学与工程系,香港科学理工大学)

专题命中 安全评测 :trustworthy(abstract)

Comments Accepted to IEEE TMI

详情

展开后加载摘要…

URL PDF HTML 收藏