arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2604.00008 2026-04-02 cs.CL cs.AI 84%

How Trustworthy Are LLM-as-Judge Ratings for Interpretive Responses? Implications for Qualitative Research Workflows

大语言模型作为评判者对解释性回应的可信度如何?对定性研究工作流程的影响

Songhee Han, Jueun Shin, Jiyoon Han, Bung-Woo Jun, Hilal Ayan Karabatman

机构 * Florida State University(佛罗里达州立大学)

专题命中 安全评测 :trustworthy(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型作为评判者在解释性回应评估中的可信度,通过比较模型表现与人类评判,指出其在筛选模型时的有效性,但不适合替代人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23625 2026-03-26 cs.AI cs.CL 84%

Evaluating a Multi-Agent Voice-Enabled Smart Speaker for Care Homes: A Safety-Focused Framework

评估多智能体语音赋能的智能音箱在养老机构中的应用:以安全为导向的框架

Zeinab Dehghani, Rameez Raja Kureshi, Koorosh Aslansefat, Faezeh Alsadat Abedi, Dhavalkumar Thakker, Lisa Greaves, Bhupesh Kumar Mishra, Baseer Ahmad, Tanaya Maslekar

机构 * University of Hull, UK(赫尔大学) University of Southampton, UK(南安普顿大学) Connexin, Hull, UK(Connexin公司) Leeds Teaching Hospital NHS Trust, UK(利兹教学医院国家健康服务信托)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了语音赋能的养老机构智能音箱,通过结合语音识别与检索增强生成技术,验证其在居民识别、提醒提取和任务调度中的准确性,为安全导向的护理系统提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19273 2026-03-23 cs.CL cs.AI 84%

LSR: Linguistic Safety Robustness Benchmark for Low-Resource West African Languages

LSR:低资源西非语言的语言安全鲁棒性基准

Godwin Abuh Faruna

机构 * Fagmart Lab(法格马特实验室)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 LSR是首个评估跨语言拒绝退化现象的基准,针对西非语言中的有害意图表达,发现模型拒绝率从英语的90%降至35-55%,其中Igala语言退化最严重。

Comments 6 pages. Reference implementation: https://huggingface.co/spaces/Faruna01/lsr-dashboard. Dataset: https://huggingface.co/datasets/Faruna01/lsr-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06594 2026-03-17 cs.CL cs.AI 84%

A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness

安全性的硬币翻转:LLM裁判无法可靠地衡量对抗鲁棒性

Leo Schwinn, Moritz Ladenburger, Tim Beyer, Mehrnaz Mofakhami, Gauthier Gidel, Stephan Günnemann

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文指出现有LLM裁判框架在评估对抗鲁棒性时存在分布偏移问题,提出ReliableBench和JudgeStressTest以提升评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13292 2026-03-17 cs.LG cs.AI 84%

Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs

Pragma-VL:迈向多模态大语言模型中安全与助人的务实仲裁

Ming Wen, Kun Yang, Xin Chen, Jingyu Zhang, Dingding Han, Shiwen Cui, Yuedong Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) UCLA(加州大学洛杉矶分校) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 Pragma-VL通过引入一种端到端的对齐算法,解决了多模态大语言模型在安全与助人之间的平衡问题,通过增强视觉风险感知和理论保证的奖励模型,在多数多模态安全基准上提升了性能。

Comments 31 pages, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08275 2026-03-10 cs.CL cs.AI 84%

AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models

AdaCultureSafe: 基于文化知识的自适应文化安全大语言模型

Hankun Kang, Di Lin, Zhirong Liao, Pengfei Bai, Xinyi Zeng, Jiawei Jiang, Yuanyuan Zhu, Tieyun Qian

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 AdaCultureSafe通过整合文化知识与大语言模型,提升文化安全性和响应生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06485 2026-03-09 cs.CL cs.AI 84%

PONTE: Personalized Orchestration for Natural Language Trustworthy Explanations

PONTE:面向自然语言可信解释的个性化编排

Vittoria Vineis, Matteo Silvestri, Lorenzo Antonelli, Filippo Betello, Gabriele Tolomei

机构 * Sapienza University of Rome(罗马大学萨皮恩扎) Syllotips TellmewAI s.r.l.(TellmewAI公司)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 PONTE通过闭环验证和适应过程,实现自然语言可信解释的个性化生成,提升XAI的完整性和风格对齐性。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02482 2026-03-04 cs.LG cs.CL cs.CV cs.SD eess.AS 84%

MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models

MUSE:一种面向多模态统一安全评估的运行导向平台

Zhongxi Wang, Yueqian Lin, Jingyang Zhang, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学) Virtue AI

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

AI总结 MUSE提出一种多模态统一安全评估平台,通过多轮攻击和跨轮模态切换技术,评估大型语言模型在不同模态下的安全性能。

Comments Submitted to ACL 2026 System Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07680 2026-02-19 cs.CV cs.AI cs.LG cs.RO 84%

Vision and Language: Novel Representations and Artificial intelligence for Driving Scene Safety Assessment and Autonomous Vehicle Planning

视觉与语言:新颖的表示方法和人工智能用于驾驶场景安全评估与自动驾驶规划

Ross Greer, Maitrayee Keskar, Angel Martinez-Sanchez, Parthib Roy, Shashank Shriram, Mohan Trivedi

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉-语言表示在自动驾驶安全评估和规划中的应用,提出轻量级危险检测、轨迹规划框架整合及自然语言约束方法,强调表示-任务对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08449 2026-02-17 cs.AI cs.CR cs.LG 84%

When Evaluation Becomes a Side Channel: Regime Leakage and Structural Mitigations for Alignment Assessment

当评估成为侧信道:对齐评估中的制度泄漏与结构缓解

Igor Santos-Grueiro

机构 * International University of La Rioja(拉里奥ja国际大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究提出通过制度盲机制减少制度条件下的失败,但无法完全消除策略风险,需结合白盒诊断评估制度意识。

Comments Added results for Llama and new cross model analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12092 2026-02-13 cs.CL cs.AI cs.CR cs.CV 84%

DeepSight: An All-in-One LM Safety Toolkit

DeepSight: 一个全方位的大型模型安全工具包

Bo Zhang, Jiaxuan Guo, Lijun Li, Dongrui Liu, Sujin Chen, Guanxu Chen, Zhijie Zheng, Qihao Lin, Lewen Yan, Chen Qian, Yijin Zhou, Yuyao Wu, Shaoxiong Guo, Tianyi Du, Jingyi Yang, Xuhao Hu, Ziqi Miao, Xiaoya Lu, Jing Shao, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 DeepSight是一个开源工具包,旨在通过整合安全评估与诊断,提升大型模型的安全性与可解释性。

Comments Technical report, 29 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11444 2026-02-13 cs.CL cs.AI 84%

Towards Reliable Machine Translation: Scaling LLMs for Critical Error Detection and Safety

迈向可靠的机器翻译:扩展LLMs以检测关键错误和安全

Muskaan Chopra, Lorenz Sparrenberg, Rafet Sifa

机构 * Rheinische Friedrich-Wilhelms-Universität Bonn, Bonn, Germany(莱茵-威斯巴登大学波恩分校) Fraunhofer IAIS, Sankt Augustin, Germany(弗劳恩霍夫人工智能研究所) Lamarr Institute for Machine Learning(拉马尔人工智能与机器学习研究所)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文通过扩展LLMs检测关键错误,提升机器翻译的安全性和可靠性,减少虚假信息和语言伤害风险。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05980 2026-02-03 cs.CL cs.LG 84%

Lost in Localization: Building RabakBench with Human-in-the-Loop Validation to Measure Multilingual Safety Gaps

迷失于定位:通过人类在环验证构建RabakBench以衡量多语言安全差距

Gabriel Chua, Leanne Tan, Ziyu Ge, Roy Ka-Wei Lee

机构 * GovTech, Singapore(新加坡政府科技局) Singapore University of Technology and Design(新加坡科技与设计大学)

专题命中 安全评测 :safety(title,abstract);red teaming(abstract);分类 cs.CL、cs.LG

AI总结 RabakBench通过人类在环验证构建,用于衡量多语言安全差距,通过三阶段流程生成、标注和翻译数据,评估LLM在低资源语言中的安全性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17520 2026-01-28 cs.LG cs.CL 84%

MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control

MobileSafetyBench: 评估移动设备控制自主代理的安全性

Juyong Lee, Dongyoon Hahm, June Suk Choi, W. Bradley Knox, Kimin Lee

专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 MobileSafetyBench通过Android模拟器评估移动设备控制自主代理的安全性,揭示基于LLMs的代理在安全任务中存在缺陷,提出提示方法提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08843 2026-01-15 cs.CL cs.LG 84%

Rubric-Conditioned LLM Grading: Alignment, Uncertainty, and Robustness

基于评分标准的LLM评分:对齐、不确定性与鲁棒性

Haotian Deng, Chris Farber, Jiyoon Lee, David Tang

机构 * Purdue University(普渡大学)

专题命中 安全评测 :alignment(title,abstract);prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了基于评分标准的LLM评分的对齐性、不确定性与鲁棒性,发现评分标准粒度增加时对齐性下降,通过信任曲线分析发现过滤低置信度预测可提升准确性,同时模型对同义词替换敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11590 2025-11-19 cs.CY cs.AI cs.HC 84%

Embedding Explainable AI in NHS Clinical Safety: The Explainability-Enabled Clinical Safety Framework (ECSF)

Robert Gigiu

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12659 2025-11-18 cs.CY cs.AI 84%

The Hidden Risks of Large Reasoning Models: A Safety Assessment of R1

Kaiwen Zhou, Chengzhi Liu, Xuandong Zhao, Shreedhar Jangam, Jayanth Srinivasa, Gaowen Liu, Dawn Song, Xin Eric Wang

机构 * UC Santa Cruz(加州大学圣克ruz分校) UC Santa Barbara(加州大学圣芭芭拉分校) UC Berkeley(加州大学伯克利分校) Cisco Research(思科研究)

专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12814 2025-10-21 cs.CL cs.AI 84%

PsyMem: Fine-grained psychological alignment and Explicit Memory Control for Advanced Role-Playing LLMs

Xilong Cheng, Yunxiao Qin, Yuting Tan, Zhengnan Li, Ye Wang, Hongjiang Xiao, Yuan Zhang

机构 * Communication University of China(中国传媒大学) State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室)

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

Comments Pre-MIT Press publication version, has been accepted by TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12133 2025-10-15 cs.CL cs.AI 84%

SafeMT: Multi-turn Safety for Multimodal Language Models

Han Zhu, Juntao Dai, Jiaming Ji, Haoran Li, Chengkun Cai, Pengcheng Wen, Chi-Min Chan, Boyuan Chen, Yaodong Yang, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) Peking University(北京大学) University of Edinburgh(爱丁堡大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04320 2025-10-07 cs.CL cs.LG 84%

Read the Scene, Not the Script: Outcome-Aware Safety for LLMs

Rui Wu, Yihao Quan, Zeru Shi, Zhenting Wang, Yanshu Li, Ruixiang Tang

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16332 2025-09-23 cs.AI cs.CL 84%

Psychometric Personality Shaping Modulates Capabilities and Safety in Language Models

Stephen Fitz, Peter Romero, Steven Basart, Sipeng Chen, Jose Hernandez-Orallo

机构 * Keio University(keio大学) Universitat Politècnica de València(巴塞罗那理工大学) Center for AI Safety(人工智能安全中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18325 2025-09-18 cs.AI cs.LG 84%

Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary

Licheng Pan, Yongqi Tong, Xin Zhang, Xiaolu Zhang, Jun Zhou, Zhixuan Chu

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Language and Machine Intelligence Department, Ant Group(蚂蚁集团语言与机器智能部门)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17450 2025-09-10 cs.CL cs.CY 84%

Persuasion Dynamics in LLMs: Investigating Robustness and Adaptability in Knowledge and Safety with DuET-PD

Bryan Chen Zhengyu Tan, Daniel Wai Kit Chin, Zhengyuan Liu, Nancy F. Chen, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学) Institute for Infocomm Research (I2R), A*STAR, Singapore(信息通信研究院)

专题命中 安全评测 :safety(title,abstract);DPO(abstract);分类 cs.CL、cs.CY

Comments To appear at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12733 2025-08-28 cs.CL cs.AI 84%

LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models

Zhiyuan Ning, Tianle Gu, Jiaxin Song, Shixin Hong, Lingyu Li, Huacan Liu, Jie Li, Yixu Wang, Meng Lingyu, Yan Teng, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments 7pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21169 2025-07-30 cs.CY cs.AI 84%

Trustworthy AI: UK Air Traffic Control Revisited

Rob Procter, Mark Rouncefield

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09347 2025-07-10 cs.CL cs.AI 84%

Safer or Luckier? LLMs as Safety Evaluators Are Not Robust to Artifacts

Hongyu Chen, Seraphina Goldfarb-Tarrant

机构 * Cohere

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments 9 pages, ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17620 2025-06-24 cs.LG cs.CY 84%

Trustworthy Chronic Disease Risk Prediction For Self-Directed Preventive Care via Medical Literature Validation

Minh Le, Khoi Ton

机构 * Georgia Institute of Technology(佐治亚理工学院) University of South Florida(佛罗里达州立大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15481 2025-06-12 cs.AI cs.CL 84%

Code-Switching Red-Teaming: LLM Evaluation for Safety and Multilingual Understanding

Haneul Yoo, Yongjin Yang, Hwaran Lee

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments To appear in ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01252 2025-06-03 cs.CL cs.AI 84%

MTCMB: A Multi-Task Benchmark Framework for Evaluating LLMs on Knowledge, Reasoning, and Safety in Traditional Chinese Medicine

Shufeng Kong, Xingru Yang, Yuanyuan Wei, Zijie Wang, Hao Tang, Jiuqi Qin, Shuting Lan, Yingheng Wang, Junwen Bai, Zhuangbin Chen, Zibin Zheng, Caihua Liu, Hao Liang

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院) Institute of TCM Diagnostics, Hunan University of Chinese Medicine(湖南中医药大学中医诊断研究所) School of Artificial Intelligence, Guilin University of Electronic Technology(桂林电子科技大学人工智能学院) Department of Computer Science, Cornell University(康奈尔大学计算机科学系)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19939 2025-05-20 cs.CR cs.AI cs.CL cs.CV 84%

VLSBench: Unveiling Visual Leakage in Multimodal Safety

Xuhao Hu, Dongrui Liu, Hao Li, Xuanjing Huang, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Beihang University(北京航空航天大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments ACL2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏