arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-05 至 2025-11-05 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 8 篇

2511.02602 2025-11-05 quant-ph cs.AI 83%

Trustworthy Quantum Machine Learning: A Roadmap for Reliability, Robustness, and Security in the NISQ Era

Ferhat Ozgur Catak, Jungwon Seo, Umit Cali

机构 * Department of Electrical Engineering and Computer Science, University of Stavanger, Norway(斯瓦尔巴大学电气工程与计算机科学系) School of Physics, Engineering and Technology, University of York, UK(约克大学物理、工程与技术学院)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI

Comments 22 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00606 2025-11-05 cs.CL 74%

SpecDiff-2: Scaling Diffusion Drafter Alignment For Faster Speculative Decoding

Jameson Sandler, Jacob K. Christopher, Thomas Hartvigsen, Ferdinando Fioretto

专题命中 安全评测 :alignment(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02148 2025-11-05 cs.LG 74%

CFL: On the Use of Characteristic Function Loss for Domain Alignment in Machine Learning

Abdullah Almansour, Ozan Tonguz

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :alignment(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01805 2025-11-05 cs.CL cs.AI 73%

Accumulating Context Changes the Beliefs of Language Models

Jiayi Geng, Howard Chen, Ryan Liu, Manoel Horta Ribeiro, Robb Willer, Graham Neubig, Thomas L. Griffiths

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27195 2025-11-05 cs.CV cs.CL cs.SI 70%

Can MLLMs Read the Room? A Multimodal Benchmark for Verifying Truthfulness in Multi-Party Social Interactions

Caixin Kang, Yifei Huang, Liangyang Ouyang, Mingfang Zhang, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

Comments ICCV2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24414 2025-11-05 cs.CV 67%

A Quantitative Evaluation Framework for Explainable AI in Semantic Segmentation

Reem Hammoud, Abdul Karim Gizzini, Ali J. Ghandour

机构 * American University of Beirut(美国贝鲁特美国大学) SogetiLabs Research and Innovation(SogetiLabs研究与创新) National Center for Remote Sensing(远程 sensing 国家中心)

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02495 2025-11-05 cs.CV cs.CL 57%

DetectiumFire: A Comprehensive Multi-modal Dataset Bridging Vision and Language for Fire Understanding

Zixuan Liu, Siavash H. Khajavi, Guangkai Jiang

机构 * Department of Computer Science(计算机科学系) Tulane University(Tulane 大学) Department of Industrial Engineering and Management(工业工程与管理系) Aalto University(Aalto 大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments Advances in Neural Information Processing Systems 2025 (NeurIPS 2025), Poster, https://neurips.cc/virtual/2025/loc/san-diego/poster/121400

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02223 2025-11-05 physics.med-ph 50%

Quantitative Risk Assessment in Radiation Oncology via LLM-Powered Root Cause Analysis of Incident Reports

Yuntao Wang, Siamak P. Najad-Davarani, Elizabeth Bossart, Matthew T. Studenski, Mariluz De Ornelas, Yunze Yang

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏