arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-06 至 2025-08-06 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 16 篇

2409.19177 2025-08-06 cs.LG cs.CL cs.CY 85%

Evidence Is All You Need: Ordering Imaging Studies via Language Model Alignment with the ACR Appropriateness Criteria

Michael S. Yao, Allison Chae, Charles E. Kahn, Walter R. Witschey, James C. Gee, Hersh Sagreiya, Osbert Bastani

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.CY、cs.LG

Comments 15 pages main text, 4 figures, 1 table

Journal ref Commun Med 5, 332 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03117 2025-08-06 cs.AI 79%

Toward a Trustworthy Optimization Modeling Agent via Verifiable Synthetic Data Generation

Vinicius Lima, Dzung T. Phan, Jayant Kalagnanam, Dhaval Patel, Nianjun Zhou

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02994 2025-08-06 cs.AI 77%

When AIs Judge AIs: The Rise of Agent-as-a-Judge Evaluation for LLMs

Fangyi Yu

机构 * Fangyi Yu

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00159 2025-08-06 cs.AI cs.CY cs.LG econ.TH math.OC 75%

Model-Based Soft Maximization of Suitable Metrics of Long-Term Human Power

Jobst Heitzig, Ram Potham

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01263 2025-08-06 cs.CL cs.AI cs.LO 62%

Bridging LLMs and Symbolic Reasoning in Educational QA Systems: Insights from the XAI Challenge at IJCNN 2025

Long S. T. Nguyen, Khang H. N. Vo, Thu H. A. Nguyen, Tuan C. Bui, Duc Q. Nguyen, Thanh-Tung Tran, Anh D. Nguyen, Minh L. Nguyen, Fabien Baldacci, Thang H. Bui, Emanuel Di Nardo, Angelo Ciaramella, Son H. Le, Ihsan Ullah, Lorenzo Di Rocco, Tho T. Quan

机构 * URA Research Group, Ho Chi Minh City University of Technology (HCMUT), Vietnam Ho Chi Minh City International University (HCMIU), Vietnam University of South-Eastern Norway, Norway Japan Advanced Institute of Science Univ. Bordeaux, CNRS, Bordeaux INP, LaBRI, UMR 5800, F-33400 Talence, France University of Naples Parthenope, Italy VNU Information Technology Institute, Vietnam National University, Vietnam Visual Intelligence Lab, School of Computer Science \& Insight Center for Data Analyitcs, University of Galway, Ireland Sapienza University of Rome, Italy

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments The XAI Challenge @ TRNS-AI Workshop, IJCNN 2025: Explainable AI for Educational Question Answering. Website: https://sites.google.com/view/trns-ai/challenge/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14971 2025-08-06 cs.AI cs.CL cs.SD eess.AS 62%

BrainECHO: Semantic Brain Signal Decoding through Vector-Quantized Spectrogram Reconstruction for Whisper-Enhanced Text Generation

Jilong Li, Zhenxi Song, Jiaqi Wang, Meishan Zhang, Honghai Liu, Min Zhang, Zhiguo Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, China(鹏城实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 8 pages (excluding references), accepted by Findings of ACL 2025

Journal ref Findings of the Association for Computational Linguistics: ACL 2025, pages 2762-2778, July 2025, Vienna, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14961 2025-08-06 cs.LG cs.CR cs.LO 57%

Set-Based Training for Neural Network Verification

Lukas Koller, Tobias Ladner, Matthias Althoff

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments published at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02947 2025-08-06 cs.RO cs.AI 57%

AeroSafe: Mobile Indoor Air Purification using Aerosol Residence Time Analysis and Robotic Cough Emulator Testbed

M Tanjid Hasan Tonmoy, Rahath Malladi, Kaustubh Singh, Forsad Al Hossain, Rajesh Gupta, Andrés E. Tejada-Martínez, Tauhidur Rahman

机构 * University of California San Diego(加州大学圣地亚哥分校) Plaksha University(Plaksha大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of South Florida(佛罗里达州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Accepted at IEEE International Conference on Robotics and Automation (ICRA) 2025. Author Accepted Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02827 2025-08-06 cs.SE cs.AI 57%

Automated Validation of LLM-based Evaluators for Software Engineering Artifacts

Ora Nova Fandina, Eitan Farchi, Shmulik Froimovich, Rami Katan, Alice Podolsky, Orna Raz, Avi Ziv

机构 * IBM Research(IBM研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18905 2025-08-06 cs.CL cs.HC 57%

Large language models provide unsafe answers to patient-posed medical questions

Rachel L. Draelos, Samina Afreen, Barbara Blasko, Tiffany L. Brazile, Natasha Chase, Dimple Patel Desai, Jessica Evert, Heather L. Gardner, Lauren Herrmann, Aswathy Vaikom House, Stephanie Kass, Marianne Kavan, Kirshma Khemani, Amanda Koire, Lauren M. McDonald, Zahraa Rabeeah, Amy Shah

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05347 2025-08-06 cs.CL cs.MA 57%

GEMA-Score: Granular Explainable Multi-Agent Scoring Framework for Radiology Report Evaluation

Zhenxuan Zhang, Kinhei Lee, Peiyuan Jing, Weihang Deng, Huichi Zhou, Zihao Jin, Jiahao Huang, Zhifan Gao, Dominic C Marshall, Yingying Fang, Guang Yang

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20847 2025-08-06 cs.CY 57%

Who Should Run Advanced AI Evaluations -- AISIs?

Merlin Stein, Milan Gandhi, Theresa Kriecherbauer, Amin Oueslati, Robert Trager

专题命中 安全评测 :safety(abstract);分类 cs.CY

Comments Accepted to AIES 2024 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03374 2025-08-06 cs.CV 50%

GRASPing Anatomy to Improve Pathology Segmentation

Keyi Li, Alexander Jaus, Jens Kleesiek, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology, Karlsruhe, Germany(卡尔斯鲁厄理工学院) Helmholtz Information and Data Science School for Health, Germany(海德堡信息与数据科学健康学校) Department of Nuclear Medicine, University of Duisburg-Essen(杜伊斯堡-埃森大学核医学系) German Cancer Consortium (DKTK)- University Hospital Essen, Essen, Germany(德国癌症研究中心(DKTK)-埃森大学医院)

专题命中 安全评测 :alignment(abstract)

Comments Accepted at 16th MICCAI Workshop on Machine Learning in Medical Imaging (MLMI2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02962 2025-08-06 cs.RO 50%

Robot builds a robot's brain: AI generated drone command and control station hosted in the sky

Peter Burke

机构 * Department of Electrical Engineering and Computer Science, University of California, Irvine(电气工程与计算机科学系,加州大学伊文斯顿分校)

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22053 2025-08-06 cs.SD cs.MA cs.MM eess.AS 50%

AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation

Yan Rong, Jinting Wang, Guangzhi Lei, Shan Yang, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tencent AI Lab(腾讯人工智能实验室)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20466 2025-08-06 cs.CV 50%

LMME3DHF: Benchmarking and Evaluating Multimodal 3D Human Face Generation with LMMs

Woo Yi Yang, Jiarui Wang, Sijing Wu, Huiyu Duan, Yuxin Zhu, Liu Yang, Kang Fu, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏