arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2510.11314 2025-10-14 cs.CL 79%

Template-Based Text-to-Image Alignment for Language Accessibility: A Study on Visualizing Text Simplifications

Belkiss Souayed, Sarah Ebling, Yingqiang Gao

机构 * University of Zurich(苏黎世大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10677 2025-10-14 cs.CL 79%

Unlocking LLM Safeguards for Low-Resource Languages via Reasoning and Alignment with Minimal Training Data

Zhuowei Chen, Bowei Zhang, Nankai Lin, Tian Hou, Lianxi Wang

机构 * Guangdong University of Foreign Studies(广东外语外贸大学) Guangzhou Key Laboratory of Multilingual Intelligent Processing(广州多语智能处理重点实验室) University of Pittsburgh(匹兹堡大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Accepted to MRL Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11885 2025-10-10 cs.CL 79%

Med-R$^2$: Crafting Trustworthy LLM Physicians via Retrieval and Reasoning of Evidence-Based Medicine

Keer Lu, Zheng Liang, Da Pan, Shusen Zhang, Guosheng Dong, Zhonghai Wu, Huang Leng, Bin Cui, Wentao Zhang

机构 * Center for Data Science, AAIS Peking University Beijing China(数据科学中心,北京大学北京中国) Baichuan Inc. Beijing China(北川公司北京中国) School of Computer Science Peking University Beijing China(计算机科学学院,北京大学北京中国) Peking University(北京大学) Baichuan Inc.(北川公司)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06093 2025-10-08 cs.AI 79%

Classical AI vs. LLMs for Decision-Maker Alignment in Health Insurance Choices

Mallika Mainali, Harsha Sureshbabu, Anik Sen, Christopher B. Rauch, Noah D. Reifsnyder, John Meyer, J. T. Turner, Michael W. Floyd, Matthew Molineaux, Rosina O. Weber

机构 * Information Science, Drexel University, Philadelphia, PA 19104 USA Parallax Advanced Research, 4035 Colonel Glenn Hwy, Beavercreek, OH 45431 USA Knexus Research, 174 Waterfront Street, Suite 310, National Harbor, Oxon Hill, MD 20745 USA Information Science \& Computer Science, Drexel University, Philadelphia, PA 19104 USA

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments 15 pages, 3 figures. Accepted at the Twelfth Annual Conference on Advances in Cognitive Systems (ACS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03309 2025-10-07 cs.LG q-bio.BM 79%

Thin Bridges for Drug Text Alignment: Lightweight Contrastive Learning for Target Specific Drug Retrieval

Mallikarjuna Tupakula

机构 * Rochester Institute of Technology(罗切斯特技术研究所)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00577 2025-10-03 cs.AI 79%

A Flexible Method for Behaviorally Measuring Alignment Between Human and Artificial Intelligence Using Representational Similarity Analysis

Mattson Ogg, Ritwik Bose, Jamie Scharf, Christopher Ratto, Michael Wolmetz

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26167 2025-10-01 cs.AI 79%

'Too much alignment; not enough culture': Re-balancing cultural alignment practices in LLMs

Eric J. W. Orlowski, Hakim Norhashim, Tristan Koh Ly Wey

机构 * AI Singapore, National University of Singapore(AI新加坡,国立新加坡大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments 8 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25885 2025-10-01 cs.AI 79%

SafeMind: Benchmarking and Mitigating Safety Risks in Embodied LLM Agents

Ruolin Chen, Yinqian Sun, Jihang Wang, Mingyang Lv, Qian Zhang, Yi Zeng

机构 * Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences(脑启发认知AI实验室,自动化研究所,中国科学院) Beijing Key Laboratory of Safe AI and Superalignment(北京安全AI与超对齐关键实验室) Beijing Institute of AI Safety and Governance(北京AI安全与治理研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Long-term AI(长期AI)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23783 2025-09-30 cs.AI 79%

Falcon: A Cross-Modal Evaluation Dataset for Comprehensive Safety Perception

Qi Xue, Minrui Jiang, Runjia Zhang, Xiurui Xie, Pei Ke, Guisong Liu

机构 * Laboratory of Intelligent Collaborative Computing University of Electronic Science and Technology of China(智能协同计算实验室 电子科技大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13577 2025-09-29 cs.SD cs.AI eess.AS 79%

VocalAgent: Large Language Models for Vocal Health Diagnostics with Safety-Aware Evaluation

Yubin Kim, Taehan Kim, Wonjune Kang, Eugene Park, Joonsik Yoon, Dongjae Lee, Xin Liu, Daniel McDuff, Hyeonhoon Lee, Cynthia Breazeal, Hae Won Park

机构 * Massachusetts Institute of Technology, USA(麻省理工学院, 美国) Seoul National University Hospital, South Korea(首尔国立大学医院, 韩国) Doctor Diary, South Korea(Doctor Diary, 韩国) Google Research, USA(谷歌研究, 美国) Independent Researcher(独立研究者)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments Accepted by Proceedings of Interspeech 2025; Website: https://han811.github.io/VocalAgent2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21368 2025-09-29 cs.CV cs.AI 79%

Safety Assessment of Scaffolding on Construction Site using AI

Sameer Prabhu, Amit Patwardhan, Ramin Karim

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01346 2025-09-24 cs.CV cs.CL 79%

Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability

Dong Shu, Haiyan Zhao, Jingyu Hu, Weiru Liu, Ali Payani, Lu Cheng, Mengnan Du

机构 * Northwestern University(西北大学) New Jersey Institute of Technology(新泽西理工学院) University of Bristol(布里斯托大学) Cisco Research(思科研究) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15260 2025-09-24 cs.CL 79%

Toxicity Red-Teaming: Benchmarking LLM Safety in Singapore's Low-Resource Languages

Yujia Hu, Ming Shan Hee, Preslav Nakov, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments 9 pages, EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16686 2025-09-23 cs.CL 79%

NILE: Internal Consistency Alignment in Large Language Models

Minda Hu, Qiyuan Zhang, Yufei Wang, Bowei He, Hongru Wang, Jingyan Zhou, Liangyou Li, Yasheng Wang, Chen Ma, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University of Edinburgh(爱丁堡大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments This work has been accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15541 2025-09-22 cs.AI 79%

Stress Testing Deliberative Alignment for Anti-Scheming Training

Bronson Schoen, Evgenia Nitishinskaya, Mikita Balesni, Axel Højmark, Felix Hofstätter, Jérémy Scheurer, Alexander Meinke, Jason Wolfe, Teun van der Weij, Alex Lloyd, Nicholas Goldowsky-Dill, Angela Fan, Andrei Matveiakin, Rusheb Shah, Marcus Williams, Amelia Glaese, Boaz Barak, Wojciech Zaremba, Marius Hobbhahn

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14956 2025-09-19 cs.AI cs.MA 79%

Sentinel Agents for Secure and Trustworthy Agentic AI in Multi-Agent Systems

Diego Gosmar, Deborah A. Dahl

机构 * Head of AI Tesisquare(Tesisquare人工智能负责人) Voiceinteroperability.ai Initiative Member(Voiceinteroperability.ai 创始成员) Linux Foundation AI & Data(Linux基金会人工智能与数据) AI & Data Torino, TO 10100, Italy(人工智能与数据Torino, TO 10100, Italy) Principal Conversational Technologies(对话技术首席专家) Plymouth Meeting, Pennsylvania, USA(美国宾夕法尼亚州Plymouth Meeting)

专题命中 安全评测 :trustworthy(title);prompt injection(abstract);分类 cs.AI

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13569 2025-09-18 cs.CL 79%

Overview of Dialog System Evaluation Track: Dimensionality, Language, Culture and Safety at DSTC 12

John Mendonça, Lining Zhang, Rahul Mallidi, Alon Lavie, Isabel Trancoso, Luis Fernando D'Haro, João Sedoc

机构 * INESC-ID Instituto Superior Técnico - University of Lisbon(理工学院 - 里斯本大学) Department of Technology, Operations, and Statistics, New York University(技术、运营与统计系,纽约大学) Speech Technology and Machine Learning Group - Universidad Politécnica de Madrid(语音技术与机器学习小组 - 马德里理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments DSTC12 Track 1 Overview Paper. https://chateval.org/dstc12

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13244 2025-09-17 cs.CL 79%

Evaluating LLM Alignment on Personality Inference from Real-World Interview Data

Jianfeng Zhu, Julina Maharjan, Xinyu Li, Karin G. Coifman, Ruoming Jin

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09303 2025-09-12 cs.CL 79%

From scratch to silver: Creating trustworthy training data for patent-SDG classification using Large Language Models

Grazia Sveva Ascione, Nicolò Tamagnone

机构 * Department of Industrial Engineering, Polytechnic University of Turin(工业工程系,都灵理工学院) Venice School of Management, Ca Foscari University of Venice(威尼斯管理学院,威尼斯福斯卡里大学)

专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08839 2025-09-12 cs.CY 79%

Evaluating the Clinical Safety of LLMs in Response to High-Risk Mental Health Disclosures

Siddharth Shah, Amit Gupta, Aarav Mann, Alexandre Vaz, Benjamin E. Caldwell, Robert Scholz, Peter Awad, Rocky Allemandi, Doug Faust, Harshita Banka, Tony Rousmaniere

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

Comments Previously posted as a preprint on Research Square (DOI: 10.21203/rs.3.rs-7364128/v1), under a CC BY 4.0 License

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05838 2025-09-09 cs.CY 79%

Towards an Automated Framework to Audit Youth Safety on TikTok

Linda Xue, Francesco Corso, Nicolo' Fontana, Geng Liu, Stefano Ceri, Francesco Pierri

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

Comments 7 pages, 3 figures, submitted to EMNLP 2025 and ECAT Research Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08613 2025-09-08 cs.CL 79%

Assessing the Sensitivity and Alignment of FOL Closeness Metrics

Ramya Keerthy Thatikonda, Wray Buntine, Ehsan Shareghi

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,莫纳什大学) College of Engineering and Computer Science, VinUniversity(工程与计算机科学学院,文大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04536 2025-09-08 cs.LG math.QA math.ST stat.TH 79%

Q-SafeML: Safety Assessment of Quantum Machine Learning via Quantum Distance Metrics

Oliver Dunn, Koorosh Aslansefat, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17695 2025-09-04 cs.AI cs.NI 79%

Symbiotic Agents: A Novel Paradigm for Trustworthy AGI-driven Networks

Ilias Chatzistefanidis, Navid Nikaein

机构 * Eurecom(埃鲁埃康)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments Submitted to Computer Networks AI for 6G

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11419 2025-09-03 cs.CL 79%

InsBank: Evolving Instruction Subset for Ongoing Alignment

Jiayi Shi, Yiwei Li, Shaoxiong Feng, Peiwen Yuan, Xinglin Wang, Yueqi Zhang, Chuyi Tan, Boyuan Pan, Huan Ren, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(计算机科学学院,北京理工大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16427 2025-09-03 cs.AI 79%

HAICOSYSTEM: An Ecosystem for Sandboxing Safety Risks in Human-AI Interactions

Xuhui Zhou, Hyunwoo Kim, Faeze Brahman, Liwei Jiang, Hao Zhu, Ximing Lu, Frank Xu, Bill Yuchen Lin, Yejin Choi, Niloofar Mireshghallah, Ronan Le Bras, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Allen Institute for AI(人工智能研究院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments Both the second and third authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19096 2025-08-27 cs.AI 79%

Trustworthy Agents for Electronic Health Records through Confidence Estimation

Yongwoo Song, Minbyul Jeong, Mujeen Sung

机构 * Kyung Hee University(庆熙大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11398 2025-08-26 cs.HC cs.AI cs.IR 79%

Trustworthy AI Psychotherapy: Multi-Agent LLM Workflow for Counseling and Explainable Mental Disorder Diagnosis

Mithat Can Ozgun, Jiahuan Pei, Koen Hindriks, Lucia Donatelli, Qingzhi Liu, Junxiao Wang

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Wageningen University and Research(瓦赫宁根大学和研究中心) Guangzhou University(广州大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments This paper has been accepted by CIKM 2025 as a full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16157 2025-08-25 cs.CV cs.AI 79%

Beyond Human-prompting: Adaptive Prompt Tuning with Semantic Alignment for Anomaly Detection

Pi-Wei Chen, Jerry Chun-Wei Lin, Wei-Han Chen, Jia Ji, Zih-Ching Chen, Feng-Hao Yeh, Chao-Chun Chen

机构 * Silesian University of Technology(西里西亚技术大学) National Cheng Kung University(国立成功大学) Nvidia AI Technology Center(Nvidia AI技术中心)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15588 2025-08-22 cs.AI 79%

A Dynamical Systems Framework for Reinforcement Learning Safety and Robustness Verification

Ahmed Nasir, Abdelhafid Zenati

机构 * Engineering Department, School of Science and Technology (SST), City University of London(伦敦城市大学科学与技术学院工程系)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏