arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-09 至 2025-09-09 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 16 篇

2509.05838 2025-09-09 cs.CY 79%

Towards an Automated Framework to Audit Youth Safety on TikTok

Linda Xue, Francesco Corso, Nicolo' Fontana, Geng Liu, Stefano Ceri, Francesco Pierri

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

Comments 7 pages, 3 figures, submitted to EMNLP 2025 and ECAT Research Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06838 2025-09-09 cs.CL cs.CR 77%

EPT Benchmark: Evaluation of Persian Trustworthiness in Large Language Models

Mohammad Reza Mirbagheri, Mohammad Mahdi Mirkamali, Zahra Motoshaker Arani, Ali Javeri, Amir Mahdi Sadeghzadeh, Rasool Jalili

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06902 2025-09-09 cs.CL cs.CR cs.DB cs.LG 76%

Proof-Carrying Numbers (PCN): A Protocol for Trustworthy Numeric Answers from LLMs via Claim Verification

Aivin V. Solatorio

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18827 2025-09-09 cs.SE cs.AI 74%

Test It Before You Trust It: Applying Software Testing for Trustworthy In-context Learning

Teeradaj Racharak, Chaiyong Ragkhitwetsagul, Chommakorn Sontesadisai, Thanwadee Sunetnanta

机构 * Advanced Institute of So-Go-Chi (Convergence Knowledge) Informatics(融合知识研究院) Tohoku University(东北大学) Japan Advanced Institute of Science and Technology(日本先进科学研究院) Faculty of Information and Communication Technology(信息与通信技术学院) Mahidol University(玛希敦大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

Journal ref Natural Language Processing and Information Systems (NLDB 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07992 2025-09-09 cs.CL cs.LG 73%

Concept Bottleneck Large Language Models

Chung-En Sun, Tuomas Oikarinen, Berk Ustun, Tsui-Wei Weng

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.LG

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04482 2025-09-09 cs.CL cs.AI 62%

Energy Landscapes Enable Reliable Abstention in Retrieval-Augmented Large Language Models for Healthcare

Ravi Shankar, Sheng Wong, Lin Li, Magdalena Bachmann, Alex Silverthorne, Beth Albert, Gabriel Davis Jones

机构 * Oxford Digital Health Labs(牛津数字健康实验室) Nuffield Department of Women’s and Reproductive Health(妇女与生殖健康尼富尔德部门) University of Oxford(牛津大学) OATML Department of Computer Science(计算机科学系)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05380 2025-09-09 cs.CY cs.AI cs.CR cs.RO 62%

Cumplimiento del Reglamento (UE) 2024/1689 en robótica y sistemas autónomos: una revisión sistemática de la literatura

Yoana Pita Lorenzo

机构 * Universidad de León(莱昂大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

Comments in Spanish language

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06409 2025-09-09 cs.AI 57%

Teaching AI Stepwise Diagnostic Reasoning with Report-Guided Chain-of-Thought Learning

Yihong Luo, Wenwu He, Zhuo-Xu Cui, Dong Liang

机构 * Fujian University of Technology(福建工程学院) Fujian Provincial Key Laboratory of Big Data Mining and Applications(福建省大数据挖掘与应用重点实验室) Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences(生物医学成像科学与系统重点实验室,中国科学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06330 2025-09-09 cs.LG 57%

Exploring approaches to computational representation and classification of user-generated meal logs

Guanlan Hu, Adit Anand, Pooja M. Desai, Iñigo Urteaga, Lena Mamykina

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06269 2025-09-09 cs.AI 57%

REMI: A Novel Causal Schema Memory Architecture for Personalized Lifestyle Recommendation Agents

Vishal Raman, Vijai Aravindh R, Abhijith Ragav

机构 * Radian Group Inc.(Radian集团) Sri Sivasubramaniya Nadar College Of Engineering(Sri Sivasubramaniya纳达尔工程学院) Amazon(亚马逊)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 8 pages, 2 figures, Accepted at the OARS Workshop, KDD 2025, Paper link: https://oars-workshop.github.io/papers/Raman2025.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05881 2025-09-09 cs.SE cs.AI 57%

GeoAnalystBench: A GeoAI benchmark for assessing large language models for spatial analysis workflow and code generation

Qianheng Zhang, Song Gao, Chen Wei, Yibo Zhao, Ying Nie, Ziru Chen, Shijie Chen, Yu Su, Huan Sun

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) The Ohio State University(俄亥根州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 34 pages, 8 figures

Journal ref Transactions in GIS, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05303 2025-09-09 cs.DC cs.AI 57%

Multi-IaC-Eval: Benchmarking Cloud Infrastructure as Code Across Multiple Formats

Sam Davidson, Li Sun, Bhavana Bhasker, Laurent Callot, Anoop Deoras

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06056 2025-09-09 cs.CL 57%

Synth-SBDH: A Synthetic Dataset of Social and Behavioral Determinants of Health for Clinical Text

Avijit Mitra, Zhichao Yang, Emily Druhl, Raelene Goodwin, Hong Yu

机构 * Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校信息与计算机科学学院) U.S. Department of Veterans Affairs(美国退伍军人事务部) Department of Medicine, University of Massachusetts Chan Medical School(马萨诸塞大学查恩医学院医学部) Miner School of Computer and Information Sciences, University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校米纳尔计算机与信息科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 (main) Github: https://github.com/avipartho/Synth-SBDH

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12928 2025-09-09 cs.DL cs.AI cs.CV 57%

A Literature Review of Literature Reviews in Pattern Analysis and Machine Intelligence

Penghai Zhao, Xin Zhang, Jiayue Cao, Ming-Ming Cheng, Jian Yang, Xiang Li

机构 * VCIP, CS, Nankai University, Tianjin 300000 , China(VCIP、计算机科学系、南开大学、天津)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments V2, V3, and V4 with incremental quality improvements. V5, V6 introduce major updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05946 2025-09-09 cs.NI 50%

Large Language Models for Next-Generation Wireless Network Management: A Survey and Tutorial

Bisheng Wei, Ruihong Jiang, Ruichen Zhang, Yinqiu Liu, Dusit Niyato, Yaohua Sun, Yang Lu, Yonghui Li, Shiwen Mao, Chau Yuen, Marco Di Renzo, Mugen Peng

专题命中 安全评测 :trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12543 2025-09-09 cs.CV 50%

REVEAL -- Reasoning and Evaluation of Visual Evidence through Aligned Language

Ipsita Praharaj, Yukta Butala, Badrikanath Praharaj, Yash Butala

机构 * Carnegie Mellon University(卡内基梅隆大学) VIT Bhopal(维捷商学院)

专题命中 安全评测 :alignment(abstract)

Comments 4 pages, 6 figures, International Conference on Computer Vision, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏