arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-02 至 2026-02-02 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 11 篇

2109.09807 2026-02-02 cs.RO cs.AI cs.GT cs.MA 79%

I Know You Can't See Me: Dynamic Occlusion-Aware Safety Validation of Strategic Planners for Autonomous Vehicles Using Hypergames

我无法看到你:基于超游戏的动态遮挡感知的自动驾驶战略规划器安全验证

Maximilian Kahn, Atrisha Sarkar, Krzysztof Czarnecki

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出基于超游戏理论的动态遮挡风险度量方法和加速安全验证框架,用于提升自动驾驶战略规划器的安全性。

Comments This work is 6 pages long and contains 5 figures. For the supplementary video, see https://youtu.be/-crio3rA_IU

Journal ref 2022 International Conference on Robotics and Automation (ICRA). IEEE, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22696 2026-02-02 cs.CV cs.LG 79%

Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding

Bi-MCQ:重新表述视觉-语言对齐以理解否定

Tae Hun Kim, Hyun Gyu Lee

机构 * Department of Electrical and Computer Engineering, Inha University, Republic of Korea(电气与计算机工程系,印哈大学,大韩民国) College of Medicine, Inha University, Republic of Korea(医学学院,印哈大学,大韩民国)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 Bi-MCQ通过重新表述视觉-语言对齐为条件语义比较,提升医学VLM对否定理解的性能。

Comments 15 pages, 4 figures, Submitted to ICPR 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10691 2026-02-02 cs.CL cs.AI 79%

Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models

从温和到动态对抗的评估:一个大型语言模型的鱿鱼游戏

Zijian Chen, Wenjun Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出鱿鱼游戏,一个动态对抗性评估环境,用于评估大型语言模型的多方面能力,并揭示静态基准中可能存在的评估范式污染问题。

Comments 31 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22653 2026-02-02 cs.HC cs.AI cs.CR 74%

Human-Centered Explainability in AI-Enhanced UI Security Interfaces: Designing Trustworthy Copilots for Cybersecurity Analysts

面向AI增强的用户界面安全性的以人为本的可解释性:为网络安全分析师设计可信的copilot

Mona Rajhans

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文提出了一种面向AI增强用户界面安全性的以人为本的可解释性方法,通过设计可信的copilot,提升网络安全分析师对AI输出的信任和决策准确性。

Comments To appear in IEEE ICCA 2025 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22769 2026-02-02 cs.CY cs.AI 62%

Beyond Abstract Compliance: Operationalising trust in AI as a moral relationship

超越抽象合规:将人工智能中的信任视为一种道德关系

Lameck Mbangula Amugongo, Tutaleni Asino, Nicola J Bidwell

机构 * Boehringer Ingelheim Pharma GmbH \& Co. KG Birkendorfer Str. 65 Biberach an der Riss Germany 88400 Carnegie Mellon University Pittsburgh, PA USA Rhodes University Makhanda South Africa International University of Management Namibia Charles Darwin University Australia Boehringer Ingelheim Pharma GmbH \& Co. KG Carnegie Mellon University Rhodes University International University of Management Charles Darwin University

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出基于非洲关系伦理的信任原则,通过医疗和教育案例,探讨如何将AI信任视为动态关系,促进公平和情境敏感的AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01017 2026-02-02 cs.AI 57%

ChartAnchor: Chart Grounding with Structural-Semantic Fidelity

ChartAnchor: 图表接地与结构-语义保真

Xinhang Li, Jingbo Zhou, Pengfei Luo, Yixiong Xiao, Tong Xu

机构 * Baidu Research(百度研究) USTC

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 ChartAnchor提出一个综合图表接地基准测试,通过图表到代码生成和受控表格重建任务,评估模型在结构和数值层面的保真度,揭示MLLMs在数值精度和代码合成方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22702 2026-02-02 cs.LG 57%

Metric Hub: A metric library and practical selection workflow for use-case-driven data quality assessment in medical AI

Metric Hub: 一个用于医疗AI中以用例为导向的数据质量评估的度量库和实用选择流程

Katinka Becker, Maximilian P. Oppelt, Tobias S. Zech, Martin Seyferth, Sandie Cabon, Vanja Miskovic, Ivan Cimrak, Michal Kozubek, Giuseppe D'Avenio, Ilaria Campioni, Jana Fehr, Kanjar De, Ismail Mahmoudi, Emilio Dolgener Cantu, Laurenz Ottmann, Andreas Klaß, Galaad Altares, Jackie Ma, Alireza Salehi M., Nadine R. Lang-Richter, Tobias Schaeffter, Daniel Schwabe

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 Metric Hub提出一个医疗AI中以用例为导向的数据质量评估度量库和选择流程,通过度量卡片和决策树提升数据质量评估的实用性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22699 2026-02-02 cs.CL 57%

Models Know Models Best: Evaluation via Model-Preferred Formats

模型最擅长模型评估:通过模型偏好的格式进行评估

Joonhak Lee, Sungmok Jung, Jongyeon Park, Jaejin Lee

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Dept. of Computer Science and Engineering, Seoul National University(计算机科学与工程系,首尔国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种动态格式对齐策略,通过模型生成的信号确定最佳评估格式,提升零样本准确率,揭示模型潜在能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21337 2026-02-02 cs.CL cs.SD eess.AS 57%

Qwen3-ASR Technical Report

Qwen3-ASR 技术报告

Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang, Zishan Guo, Hongkun Hao, Yu Xi, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

机构 * Qwen Team(通义实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 Qwen3-ASR 提出两个端到端语音识别模型和非自回归强制对齐模型,实现多语言识别与高效转录,展示最佳准确率与效率平衡。

Comments https://github.com/QwenLM/Qwen3-ASR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22791 2026-02-02 cs.SE 50%

Understanding on the Edge: LLM-generated Boundary Test Explanations

对边界的理解:LLM生成的边界测试解释

Sabinakhon Akbarova, Felix Dobslaw, Robert Feldt

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文研究LLM生成的边界解释在软件测试中的有效性,通过调查和访谈发现,清晰结构、权威来源引用和可操作示例能提升解释质量,提出七项要求的检查表以指导未来工具设计。

Comments This is the author's accepted manuscript of a paper accepted for publication at AST 2026. The final version will appear in the ACM Digital Library

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17292 2026-02-02 cs.SE 50%

Risk-based test framework for LLM features in regulated software

基于风险的受监管软件中LLM功能测试框架

Zhiyin Zhou

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种针对受监管软件中LLM功能的风险测试框架,包含风险分类、分层测试策略及案例研究,以应对LLM在安全关键应用中的风险挑战。

Journal ref David C. Wyld et al. Eds CSML, AISCA, DNLP, SOEA, NET, BDHI, SIPO 2026 pp. 107-124, 2026. CS & IT CSCP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏