arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9419 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9419 篇

2505.20085 2026-03-18 cs.HC cs.AI 57%

Explanation User Interfaces: A Systematic Literature Review

解释用户界面:系统文献综述

Eleonora Cappuccio, Andrea Esposito, Francesco Greco, Giuseppe Desolda, Rosa Lanzilotti, Salvatore Rinzivillo

机构 * University of Pisa(比萨大学) University of Bari Aldo Moro(巴里阿尔多·莫罗大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文通过系统文献综述探讨了解释用户界面(XUIs)的设计与指南,提出HERMES平台以提升XUI的设计与评估效果。

Comments Second version

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19596 2026-03-18 eess.SP cs.LG 57%

Towards Robust Multimodal Physiological Foundation Models: Handling Arbitrary Missing Modalities

迈向稳健的多模态生理基础模型:处理任意缺失模态

Wei-Bang Jiang, Xi Fu, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出PhysioOmni模型,通过解耦多模态信号提取通用表示,解决现有方法在跨数据集泛化和缺失模态处理上的不足,实验显示其在情绪识别等任务中表现优异。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15672 2026-03-18 cs.AR cs.AI cs.SE 57%

DRCY: Agentic Hardware Design Reviews

DRCY:代理硬件设计审查

Kyle Dumont, Nicholas Herbert, Hayder Tirmazi, Shrikanth Upadhayaya

机构 * AllSpice Inc.(AllSpice公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 DRCY是首个生产级多代理LLM系统,通过自动获取元件数据表并进行引脚分析,提高硬件设计连接审查的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15457 2026-03-17 cs.CR cs.AI 57%

Evasive Intelligence: Lessons from Malware Analysis for Evaluating AI Agents

逃避式智能:从恶意软件分析中汲取的AI评估教训

Simone Aonzo, Merve Sahin, Aurélien Francillon, Daniele Perito

机构 * Eurecom SAP Labs(SAP实验室) Depthfirst

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文探讨了AI代理评估中因适应性行为导致的安全性误判问题,借鉴恶意软件沙盒逃避的研究,提出评估原则以应对潜在的对抗性环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15020 2026-03-17 cs.CV cs.CL 57%

MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal

MER-Bench:多模态表情包再解释的综合基准

Yiqi Nie, Fei Wang, Junjie Chen, Kun Li, Yudi Cai, Dan Guo, Chenglong Li, Meng Wang

机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息学院) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出MER-Bench,一个用于多模态表情包再解释的综合基准,通过多模态大语言模型评估结构保持、语义一致性和情感转换,揭示现有系统在约束满足上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14707 2026-03-17 cs.CV cs.CL 57%

Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents

视觉混淆代理:在计算机使用代理中利用和防御感知失败

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出了一种新的安全防护机制,通过双重通道对比分类来检测计算机使用代理中的视觉感知错误,以提高系统安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14257 2026-03-17 cs.CL 57%

Automatic Inter-document Multi-hop Scientific QA Generation

自动跨文档多跳科学问答生成

Seungmin Lee, Dongha Kim, Yuni Jeon, Junyoung Koh, Min Song

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出AIM-SciQA框架,通过大语言模型生成多文档多跳科学问答数据集,结合语义对齐和引用信息提升事实一致性,构建IM-SciQA数据集并验证其在检索增强推理中的有效性。

Comments 14 pages, 5 figures, 8 tables. Accepted to the 2026 International Conference on Language Resources and Evaluation (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14007 2026-03-17 cs.AI 57%

Formal Abductive Explanations for Navigating Mental Health Help-Seeking and Diversity in Tech Workplaces

形式归纳解释用于导航心理健康求助与科技职场多样性

Belona Sonna, Alain Momo, Alban Grastien

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出形式归纳解释框架,用于系统揭示AI对科技职场心理健康求助预测的合理性。通过计算模型输出的严谨解释,支持选择适合不同心理科目的模型,并确保伦理稳健的救济计划。同时,明确考察性别等敏感属性对模型决策的影响,以支持公平性评估。

Comments Appeared in the Proceedings of the Empowering Women of Colour in AI-Driven Mental Health Research at IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19647 2026-03-17 cs.RO cs.AI cs.SY eess.SY 57%

Fine-Tuning Hybrid Physics-Informed Neural Networks for Vehicle Dynamics Model Estimation

针对车辆动力学模型估计的混合物理信息神经网络微调

Shiming Fang, Kaiyan Yu

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出FTHD方法,结合监督和非监督PINNs,通过微调预训练的DDM,在减少数据量的情况下提升参数估计精度,并通过EKF-FTHD增强数据鲁棒性。

Journal ref Int. J. Intell. Robot. Appl., vol. 9, no. 4, pp. 1594-1610, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13799 2026-03-17 cs.LG 57%

Node Role-Guided LLMs for Dynamic Graph Clustering

基于节点角色的动态图聚类LLM

Dongyuan Li, Ying Zhang, Yaozu Wu, Renhe Jiang

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出DyG-RoLLM框架,通过可学习原型将连续图嵌入映射为离散语义概念,实现动态图聚类的可解释性与鲁棒性。

Comments The paper has been accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13562 2026-03-17 cs.LG 57%

Scalable Classification of Course Information Sheets Using Large Language Models: A Reusable Institutional Method for Academic Quality Assurance

利用大语言模型实现课程信息表的可扩展分类:一种用于学术质量保证的可重用机构方法

Brecht Verbeken, Joke Van den Broeck, Inge De Cleyn, Steven Van Luchene, Nadine Engels, Andres Algaba, Vincent Ginis

机构 * Vrije Universiteit Brussel(布鲁塞尔自由大学) Harvard University(哈佛大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种利用大语言模型对课程信息表进行大规模分类的方法,通过迭代优化和多模型比较,实现了对课程评估风险的识别与验证,为学术质量保证提供了可重用的机构方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13362 2026-03-17 cs.SD cs.AI eess.AS 57%

Patient-Level Multimodal Question Answering from Multi-Site Auscultation Recordings

多站点听诊录音的患者级多模态问答

Fan Wu, Tsai-Ning Wang, Nicolas Zumarraga, Ning Wang, Markus Kreft, Kevin O'Sullivan, Elgar Fleisch, Oliver Aalami, Paul Schmiedmayer, Robert Jakob, Patrick Langer

机构 * Agentic Systems Lab, ETH Zurich(伦理学院系统实验室,苏黎世联邦理工学院) Eindhoven University of Technology(埃因霍温理工大学) Centre for Digital Health Interventions, ETH Zurich(数字健康干预中心,苏黎世联邦理工学院) Centre for Digital Health Interventions, University of St. Gallen(数字健康干预中心,圣加尔登大学) Stanford Mussallem Center for Biodesign, Stanford University(斯坦福穆萨勒姆生物设计中心,斯坦福大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过门控交叉注意力将多站点听诊录音与冻结的大语言模型嵌入空间对齐,实现患者级评估,在CaReSound基准上取得SOTA结果,展示轻量领域特定编码器与多站点聚合的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13306 2026-03-17 cs.CV cs.LG 57%

Benchmarking Compact VLMs for Clip-Level Surveillance Anomaly Detection Under Weak Supervision

对弱监督条件下Clip级监控异常检测的紧凑视觉语言模型进行基准测试

Kirill Borodin, Kirill Kondrashov, Nikita Vasiliev, Ksenia Gladkova, Inna Larina, Mikhail Gorodnichev, Grach Mkrtchian

机构 * Faculty of Information Technology, Moscow Technical University of Communication

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文研究了在弱监督条件下,紧凑型视觉语言模型在Clip级监控异常检测中的性能,通过统一评估协议比较了参数高效适应的紧凑VLMs与无训练VLM流水线和弱监督基线,展示了在准确率和效率上的平衡。

Comments Published ad MDPI Journal of Imaging (see at https://www.mdpi.com/2313-433X/11/11/400)

Journal ref Journal of Imaging. 2025; 11(11):400

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13251 2026-03-17 cs.AI 57%

ManiBench: A Benchmark for Testing Visual-Logic Drift and Syntactic Hallucinations in Manim Code Generation

ManiBench:一个用于测试Manim代码生成中视觉-逻辑漂移和语法幻觉的基准测试

Nabin Oli

机构 * Sunway College Kathmandu(加德满都阳光学院) Birmingham City University(伯明翰城市大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 ManiBench旨在评估LLM在生成Manim CE代码时的性能,针对语法幻觉和视觉-逻辑漂移两种关键失败模式,包含150-200个问题,涵盖微积分、线性代数、概率、拓扑和AI等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04632 2026-03-17 cs.LG 57%

Risk-Sensitive Agent Compositions

风险敏感型代理组合

Guruprerana Shabadi, Rajeev Alur

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出一种风险最小化方法,用于在代理组合中平衡任务成功率与安全、公平和隐私要求,通过动态规划和联合界估算近优解。

Comments 19 pages, 6 figures. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12895 2026-03-16 cs.HC cs.AI cs.SE 57%

Human-Centered Evaluation of an LLM-Based Process Modeling Copilot: A Mixed-Methods Study with Domain Experts

面向人类的LLM过程建模助手评估:与领域专家的混合方法研究

Chantale Lauer, Peter Pfeiffer, Nijat Mehdiyev

机构 * Saarland University(萨尔兰大学) German Research Institute for Artificial Intelligence(德国人工智能研究所) Plus GmbH(5Plus公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文通过混合方法研究,评估了基于LLM的过程建模助手,发现可用性与信任度之间存在矛盾,提出需人类中心评估补充自动基准测试。

Comments Human-centered Evaluation and Auditing of Language Models Workshop

Journal ref Conference on Human Factors in Computing Systems (CHI2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12872 2026-03-16 cs.CL 57%

CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility

CLARIN-PT-LDB: 一个开放的大型语言模型排行榜用于葡萄牙语以评估语言、文化与礼貌

João Silva, Luís Gomes, António Branco

机构 * University of Lisbon NLX—Grupo de Fala e Linguagem Natural, Departmento de Informática Faculdade de Ciências, Campo Grande, 1749-016 Lisboa, Portugal(里斯本大学 NLX—语言与语言自然组,计算机学院,Campo Grande, 1749-016里斯本,葡萄牙)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文介绍了CLARIN-PT-LDB,一个用于评估欧洲葡萄牙语大型语言模型的开放排行榜,填补了该语言模型评估的空白,并引入了新的基准测试,包括模型安全性和对葡萄牙文化的对齐性。

Comments Accepted at PROPOR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12276 2026-03-16 cs.LG 57%

No More DeLuLu: Physics-Inspired Kernel Networks for Geometrically-Grounded Neural Computation

不再需要DeLuLu:受物理启发的核网络用于几何上扎根的神经计算

Taha Bouhsine

机构 * Taha Bouhsine(塔哈·布希内)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出 yat-product 核操作,结合二次对齐与反平方接近性,通过几何化操作简化神经网络架构,实现统一的核学习、梯度稳定性和信息几何,展示了 NMN 在图像和语言任务中的有效性。

Comments for more info check www.azetta.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06703 2026-03-16 cs.CR cs.LG 57%

On the (In)Security of Loading Machine Learning Models

关于加载机器学习模型的安全性(是否)

Gabriele Digregorio, Marco Di Gennaro, Stefano Zanero, Stefano Longari, Michele Carminati

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文评估了机器学习模型共享框架和枢纽的安全性,发现大多数仅部分应对安全风险,且存在0-day漏洞,表明安全加载仍非解决难题。

Comments Accepted to the 2026 IEEE Symposium on Security and Privacy (SP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11559 2026-03-13 cs.AI cs.HC 57%

AI Knows What's Wrong But Cannot Fix It: Helicoid Dynamics in Frontier LLMs Under High-Stakes Decisions

AI知错却无法修复:前沿大语言模型在高风险决策中的螺旋动态

Alejandro R Jadad

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 前沿大语言模型在高风险决策中表现出螺旋动态,即在错误中自我识别却无法修复,导致可靠性下降,需通过识别该模式以提升AI信任度。

Comments 22 pages, 2 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11266 2026-03-13 cs.AI 57%

The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning

消除幻觉:一种动态框架用于评估大语言模型的消除

Raj Sanjay Shah, Jing Huang, Keerthiram Murugesan, Nathalie Baracaldo, Diyi Yang

机构 * Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) IBM Research(IBM研究院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种动态框架,用于评估大语言模型消除方法的鲁棒性,通过复杂结构查询揭示消除技术在多跳设置中的脆弱性,并提供可扩展的评估方法。

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01716 2026-03-13 cs.CL 57%

Mechanistic Indicators of Steering Effectiveness in Large Language Models

大语言模型中转向效果的机制指标

Mehdi Jafari, Hao Xue, Flora Salim

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究通过分析大语言模型中转向效果的机制指标,探讨如何利用内部模型信号诊断转向可靠性,并提出新的评估基线以提升转向方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18395 2026-03-13 cs.CL 57%

NormGenesis: Multicultural Dialogue Generation via Exemplar-Guided Social Norm Modeling and Violation Recovery

NormGenesis: 通过实例引导的社会规范建模与违反恢复实现多文化对话生成

Minki Hong, Jangho Choi, Jihie Kim

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 NormGenesis通过实例引导的社会规范建模与违反恢复,实现多文化对话生成,提升对话自然度和文化适应性。

Comments 39 pages, 17 figures, EMNLP 2025 Main Conference, Senior Area Chair (SAC) Highlights Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03281 2026-03-12 cs.CV cs.LG 57%

CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance

CFG-Ctrl: 基于控制的分类器自由扩散引导

Hanyang Wang, Yiyang Liu, Jiawei Chi, Fangfu Liu, Ran Xue, Yueqi Duan

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 CFG-Ctrl通过引入滑模控制方法改进分类器自由扩散引导,提升语义对齐和鲁棒性。

Comments Accepted by CVPR 2026; Project Page: https://hanyang-21.github.io/CFG-Ctrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10764 2026-03-12 cs.CL 57%

HeartAgent: An Autonomous Agent System for Explainable Differential Diagnosis in Cardiology

HeartAgent:一种用于心血管疾病可解释性差分诊断的自主代理系统

Shuang Zhou, Kai Yu, Song Wang, Wenya Xie, Zaifu Zhan, Meng-Han Tsai, Yuen-Hei Chung, Shutong Hou, Huixue Zhou, Min Zeng, Bhavadharini Ramu, Lin Yee Chen, Feng Xie, Rui Zhang

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 HeartAgent通过整合定制工具和数据资源,提供可解释的差分诊断支持,显著提升心血管疾病诊断的准确性和解释质量。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10703 2026-03-12 cs.CV cs.CY 57%

WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation

WalkGPT: 基于深度感知的视觉语言对话用于行人导航

Rafi Ibn Sultan, Hui Zhu, Xiangyu Zhou, Chengyin Li, Prashant Khanduri, Marco Brocanelli, Dongxiao Zhu

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 WalkGPT通过结合视觉语言模型与深度感知分割技术,实现无障碍导航指导,提供精准的可访问性评估和深度估计。

Comments Accepted by CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10294 2026-03-12 eess.SY cs.AI cs.SY 57%

Simulation-in-the-Reasoning (SiR): A Conceptual Framework for Empirically Grounded AI in Autonomous Transportation

推理中的模拟(SiR):面向自主交通系统经验导向AI的概念框架

Wuping Xin

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 SiR通过将领域模拟器嵌入LLM推理循环,为自主交通系统提供经验导向的AI框架,提升策略验证与优化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09689 2026-03-12 cs.CV cs.AI 57%

AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering

AutoViVQA:一个大规模自动构建的数据集用于越南语视觉问答

Nguyen Anh Tuong, Phan Ba Duc, Nguyen Trung Quoc, Tran Dac Thinh, Dang Duy Lan, Nguyen Quoc Thinh, Tung Le

机构 * Faculty of Information Technology, University of Science, VNU-HCM(越南国家大学胡志明市分校信息科技学院) Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出AutoViVQA数据集,利用变压器架构进行越南语视觉问答,结合文本和视觉预训练,并在多语言环境下系统比较自动评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03507 2026-03-12 cs.LG cond-mat.dis-nn q-bio.NC stat.ML 57%

Solving adversarial examples requires solving exponential misalignment

解决对抗样本需要解决指数级不一致

Alessandro Salvatore, Stanislav Fort, Surya Ganguli

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 研究通过分析神经网络的感知流形维度,揭示对抗样本的起源与机器与人类感知的指数级不一致,并提出维度一致是提升对抗鲁棒性的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00353 2026-03-12 cs.AI cs.HC 57%

MHDash: An Online Platform for Benchmarking Mental Health-Aware AI Assistants

MHDash:一个用于评估心理健康意识AI助手的在线平台

Yihe Zhang, Cheyenne N Mohawk, Kaiying Han, Vijay Srinivas Tida, Manyu Li, Xiali Hei

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 MHDash是一个开源平台,用于评估心理健康意识AI助手的安全性和性能,揭示传统基准在心理健康领域不足的问题。

Comments Accepted for presentation at IEEE SoutheastCon 2026. This is the author version of an accepted paper. The final version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏