arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-07 至 2025-11-07 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 14 篇

2511.04328 2025-11-07 cs.AI 83%

RxSafeBench: Identifying Medication Safety Issues of Large Language Models in Simulated Consultation

Jiahao Zhao, Luxin Xu, Minghuan Tan, Lichao Zhang, Ahmadreza Argha, Hamid Alinejad-Rokny, Min Yang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Electronic Science and Technology of China(电子科技大学) Shenzhen University of Advanced Technology(深圳大学) School of Biomedical Engineering, UNSW Sydney(生物医学工程学院,UNSW悉尼)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

Comments To appear in BIBM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07416 2025-11-07 cs.CV cs.CL cs.LG 81%

RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability

Jonggwon Park, Byungmu Yoon, Soobum Kim, Kyoyun Choi

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04312 2025-11-07 cs.AI 79%

Probing the Probes: Methods and Metrics for Concept Alignment

Jacob Lysnæs-Larsen, Marte Eggen, Inga Strümke

机构 * Department of Computer Science NTNU - Norwegian University of Science and Technology(计算机科学系挪威科学技术大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04184 2025-11-07 cs.CL cs.AI 76%

Trustworthy LLM-Mediated Communication: Evaluating Information Fidelity in LLM as a Communicator (LAAC) Framework in Multiple Application Domains

Mohammed Musthafa Rafi, Adarsh Krishnamurthy, Aditya Balu

机构 * Iowa State University(爱荷华州立大学)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

Comments 10 pages, 4 figures. Submitted to IEEE DISTILL 2025 (co-located with IEEE TPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04502 2025-11-07 cs.CL cs.AI 73%

RAGalyst: Automated Human-Aligned Agentic Evaluation for Domain-Specific RAG

Joshua Gao, Quoc Huy Pham, Subin Varghese, Silwal Saurav, Vedhus Hoskere

机构 * University of Houston(德克萨斯大学休斯敦分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04316 2025-11-07 cs.AI cs.SE 70%

AdversariaLLM: A Unified and Modular Toolbox for LLM Robustness Research

Tim Beyer, Jonas Dornbusch, Jakob Steimle, Moritz Ladenburger, Leo Schwinn, Stephan Günnemann

机构 * Department of Computer Science, Technical University of Munich, Germany(慕尼黑技术大学计算机科学系) Munich Data Science Institute, Germany(慕尼黑数据科学研究所)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03945 2025-11-07 cs.CL cs.AI 62%

Direct Semantic Communication Between Large Language Models via Vector Translation

Fu-Chun Yang, Jason Eshraghian

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04538 2025-11-07 cs.CL 57%

From Model to Breach: Towards Actionable LLM-Generated Vulnerabilities Reporting

Cyril Vallez, Alexander Sternfeld, Andrei Kucharavy, Ljiljana Dolamic

机构 * IEM, HES-SO Valais-Wallis(IEM,HES-SO瓦莱-达沃斯) II, HES-SO Valais-Wallis(II,HES-SO瓦莱-达沃斯) Cyber-Defence Campus, armasuisse(网络安全防御校区,armasuisse)

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06991 2025-11-07 cs.AI cs.GT cs.HC 57%

Evaluating LLM-Contaminated Crowdsourcing Data Without Ground Truth

Yichi Zhang, Jinlong Pang, Zhaowei Zhu, Yang Liu

机构 * DIMACS, Rutgers University(Rutgers大学DIMACS研究中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17793 2025-11-07 cs.CL 57%

Compression Hacking: A Supplementary Perspective on Informatics Properties of Language Models from Geometric Distortion

Jianxiang Zang, Meiling Ning, Yongda Wei, Shihan Dou, Jiazheng Zhang, Nijia Mo, Binhong Li, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Computation and Artificial Intelligence Innovative College, Fudan University(复旦大学计算与人工智能创新学院) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai University of International Business and Economics(上海国际商务经济学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05712 2025-11-07 cs.LG cs.CV q-bio.NC 57%

Scaling Laws for Task-Optimized Models of the Primate Visual Ventral Stream

Abdulkadir Gokce, Martin Schrimpf

机构 * EPFL(苏黎世联邦理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments Published at ICML25 as a spotlight paper - 9 pages for the main paper, 22 pages in total. 7 main figures and 7 supplementary figures. Code, model weights, and benchmark results can be accessed at https://github.com/epflneuroailab/scaling-primate-vvs

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13406 2025-11-07 cs.AI cs.CE cs.MA 57%

Collaboration Dynamics and Reliability Challenges of Multi-Agent LLM Systems in Finite Element Analysis

Chuan Tian, Yilei Zhang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04012 2025-11-07 cs.SE 50%

PSD2Code: Automated Front-End Code Generation from Design Files via Multimodal Large Language Models

Yongxi Chen, Lei Chen

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04267 2025-11-07 cs.SE 50%

A Tool for Benchmarking Large Language Models' Robustness in Assessing the Realism of Driving Scenarios

Jiahui Wu, Chengjie Lu, Aitor Arrieta, Shaukat Ali

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏