arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9378 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9378 篇

2510.17516 2026-04-14 cs.CL cs.AI cs.CY cs.LG 70%

SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors

SimBench:大型语言模型模拟人类行为能力的基准测试

Tiancheng Hu, Joachim Baumann, Lorenzo Lupo, Nigel Collier, Dirk Hovy, Paul Röttger

机构 * University of Cambridge(剑桥大学) Stanford University(斯坦福大学) Bocconi University(博科尼大学) University of Oxford(牛津大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 SimBench通过统一20个多样化的数据集,评估大型语言模型模拟人类行为的 fidelity,发现模型性能与模型大小呈对数线性关系,但与计算资源无关,且存在指令微调与模拟准确性之间的权衡。

Comments Accepted at ICLR 2026. Project Website: http://simbench.tiancheng.hu/ Data: https://huggingface.co/datasets/pitehu/SimBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15489 2026-04-14 cs.CV cs.CL cs.MM 70%

Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models

穿透欺骗:在多模态新闻中揭示误导性创作者意图

Jiaying Wu, Fanxiao Li, Zihang Fu, Min-Yen Kan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Yunnan University(云南大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出DeceptionDecoded基准数据集,通过意图引导模拟框架生成12000组图像-描述对,旨在揭示多模态虚假信息中的误导性意图,评估14种最新视觉-语言模型,发现其在意图推理上存在不足,提出系统合成数据以提升模型意图理解能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11070 2026-04-14 cs.AI 70%

PRISM Risk Signal Framework: Hierarchy-Based Red Lines for AI Behavioral Risk

PRISM风险信号框架:基于层级的AI行为风险红线

Seulki Lee

机构 * AI Integrity Organization (AIO)(AI诚信组织)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出基于层级的PRISM框架,定义27种行为风险信号,通过双重阈值原则评估,区分确认风险与预警信号,提升AI安全性的前瞻性、全面性和可测量性。

Comments 13 pages, 13 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06813 2026-04-14 cs.CL 70%

A Comparative Benchmark of Large Language Models for Labelling Wind Turbine Maintenance Logs

大型语言模型在风力涡轮机维护日志标注中的比较基准

Max Malyi, Jonathan Shek, Alasdair McDonald, Andre Biscaya

机构 * Institute for Energy Systems, School of Engineering, The University of Edinburgh(爱丁堡大学工程学院能源系统研究所) Nadara

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出一种可复现的框架,用于评估大型语言模型在分类复杂工业记录任务中的性能,通过对比不同模型的可靠性、效率和校准能力,发现最佳模型需结合人类在循环系统提升数据标注质量。

Comments Associated GitHub repository: https://github.com/mvmalyi/wind-farm-maintenance-logs-labelling-with-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07559 2026-04-10 cs.AI 70%

Dual-Loop Control in DCVerse: Advancing Reliable Deployment of AI in Data Centers via Digital Twins

双环控制在DCVerse中的应用:通过数字孪生推进AI在数据中心的可靠部署

Qingang Zhang, Yuejun Yan, Guangyu Wu, Siew-Chien Wong, Jimin Jia, Zhaoyang Wang, Yonggang Wen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出双环控制框架,通过数字孪生技术解决数据中心能源效率与故障风险平衡问题,实现更可靠的AI部署,实验显示能提升能效并满足服务等级协议要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06502 2026-04-09 cs.LG 70%

VLMShield: Efficient and Robust Defense of Vision-Language Models against Malicious Prompts

VLMShield: 有效且稳健的视觉语言模型对抗恶意提示防御

Peigui Qi, Kunsheng Tang, Yanpu Yu, Jialin Wu, Yide Song, Wenbo Zhou, Zhicong Huang, Cheng Hong, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) University of Washington(华盛顿大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出VLMShield,通过多模态聚合特征提取框架提升视觉语言模型对恶意提示的防御能力,实验显示其在鲁棒性、效率和实用性方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08258 2026-04-09 cs.AI 70%

Diagnosing and Mitigating Sycophancy and Skepticism in LLM Causal Judgment

诊断和缓解大语言模型因果判断中的阿谀和怀疑

Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出CAUSALT3基准测试,通过三个轴评估分解性能,识别并缓解因果判断中的阿谀和怀疑陷阱,通过Regulated Causal Anchoring方法改进推理控制。

Comments 19 pages, 3 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20779 2026-04-09 cs.LG cs.CV cs.HC 70%

CHiQPM: Calibrated Hierarchical Interpretable Image Classification

CHiQPM:校准的分层可解释图像分类

Thomas Norrenbrock, Timo Kaiser, Sovan Biswas, Neslihan Kose, Ramesh Manuvinakurike, Bodo Rosenhahn

机构 * Institute for Information Processing (tnt) L3S - Leibniz Universität Hannover(信息处理研究所 (tnt) L3S - 莱布尼茨汉诺威大学) Intel Labs(英特尔实验室)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 CHiQPM提出了一种兼具全局和局部可解释性的图像分类模型,通过对比解释多数类和分层解释方法,实现高准确率和可解释性,为人类与AI协作提供支持。

Comments Accepted to NeurIPS 2025, updated version with correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29403 2026-04-07 cs.CR cs.AI 70%

Security in LLM-as-a-Judge: A Comprehensive SoK

LLM-as-a-Judge 的安全性:全面的系统化知识综述

Aiman Al Masoud, Antony Anju, Marco Arazzi, Mert Cihangiroglu, Vignesh Kumar Kembu, Serena Nicolazzo, Antonino Nocera, Vinod P., Saraga Sakthidharan

机构 * University of Pavia(帕维亚大学) Cochin University of Science and Technology(科钦科技大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文系统分析了LLM-as-a-Judge的安全性问题,提出分类框架,探讨了攻击、防御和应用等方向,揭示了现有框架的漏洞及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03356 2026-04-07 cs.AI 70%

Evaluating Artificial Intelligence Through a Christian Understanding of Human Flourishing

通过基督教对人类繁荣的理解评估人工智能

Nicholas Skytland, Lauren Parsons, Alicia Llewellyn, Steele Billings, Peter Larson, John Anderson, Sean Boisen, Steve Runge

机构 * Gloo WinShape Foundation(WinShape基金会) Biblica

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出基督教单轮Flourishing AI基准,评估前沿模型在七个维度上的人类繁荣表现,发现AI默认采用世俗主义,导致道德和神学推理不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23883 2026-04-07 cs.AI 70%

Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges

代理AI安全:威胁、防御、评估与开放挑战

Anshuman Chhabra, Shrestha Datta, Shahriar Kabir Nahin, Prasant Mohapatra

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文探讨代理AI系统的安全威胁与防御策略,分析其在自动化中的独特风险,并提出安全设计的开放挑战。

Comments Published in IEEE Access. DOI: https://doi.org/10.1109/access.2026.3675554

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15925 2026-04-07 cs.RO cs.AI cs.CV 70%

VERDI: VLM-Embedded Reasoning for Autonomous Driving

VERDI:嵌入视觉语言模型的自动驾驶推理

Bowen Feng, Zhiting Mei, Julian Ost, Filippo Ghilotti, Baiang Li, Roger Girgis, Anirudha Majumdar, Felix Heide

机构 * Princeton University(普林斯顿大学) Torc Robotics

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 VERDI通过在训练时整合视觉语言模型的推理过程和常识知识,提升自动驾驶系统的决策能力,实现更高效的模块化架构,同时保持快速推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02947 2026-04-06 cs.AI 70%

AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

AgentHazard:用于评估计算机使用代理有害行为的基准

Yunhao Feng, Yifan Ding, Yingshui Tan, Xingjun Ma, Yige Li, Yutao Wu, Yifeng Gao, Kun Zhai, Yanming Guo

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) Hunan Institute of Advanced Technology(湖南先进技术研究院) Deakin University(迪肯大学) Singapore Management University(新加坡管理大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 AgentHazard基准通过2653个实例评估计算机使用代理的有害行为,揭示了模型在连续上下文和工具使用中识别安全风险的能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02669 2026-04-06 cs.CL 70%

Redirected, Not Removed: Task-Dependent Stereotyping Reveals the Limits of LLM Alignments

转向而非移除:任务依赖性刻板印象揭示了LLM对齐的局限

Divyanshu Kumar, Ishita Gupta, Nitin Aravind Birur, Tanay Baswa, Sahil Agarwal, Prashanth Harshangi

机构 * Enkrypt AI

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 研究通过任务依赖性刻板印象分析,揭示LLM对齐的局限性,指出单一基准测试无法全面反映模型偏见,且对齐实践可能掩盖而非减轻代表性伤害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00290 2026-04-06 cs.AI cs.MA 70%

ClinicalReTrial: Clinical Trial Redesign with Self-Evolving Agents

临床试验重设计:具有自进化代理的临床试验重设计

Sixue Xing, Kerui Wu, Xuanye Xia, Meng Jiang, Jintai Chen, Tianfan Fu

机构 * University of Notre Dame(圣母大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Georgia Institute of Technology(佐治亚理工学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出ClinicalReTrial系统,通过自进化代理对临床试验协议进行迭代重设计,提升成功率并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09938 2026-03-31 cs.CL 70%

Model Merging in the Era of Large Language Models: Methods, Applications, and Future Directions

大语言模型时代下的模型合并:方法、应用与未来方向

Mingyang Song, Mao Zheng

机构 * Tencent, China(腾讯(中国))

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型时代模型合并的方法、应用及未来方向,通过FUSE分类体系系统回顾了算法空间、下游应用及支持生态系统,识别了关键挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.00839 2026-03-31 cs.LG q-fin.RM stat.ML 70%

Algorithmic Insurance

算法保险

Dimitris Bertsimas, Agni Orfanoudaki

机构 * Sloan School of Management, Massachusetts Institute of Technology(麻省理工学院斯隆管理学院) Saïd Business School, Oxford University(牛津大学赛德商学院)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 研究算法保险在AI致损中的风险定价与责任框架,提出基于CVaR的分类阈值优化方法,通过乳腺癌案例验证降低尾部风险并提升保险收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27335 2026-03-31 cs.CL 70%

PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering

PubMed Reasoner: 基于动态推理的证据导向生物医学问答检索

Yiqing Zhang, Xiaozhong Liu, Fabricio Murai

机构 * PayPal Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 PubMed Reasoner通过动态推理机制提升生物医学问答的准确性与证据可靠性,采用三阶段框架优化检索过程并生成有据可查的回答。

Comments 20 pages; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12104 2026-03-27 cs.CR cs.AI 70%

DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents

DRIFT: 基于注入隔离的动态规则防御以保障LLM代理安全

Hao Li, Xiaogeng Liu, Hung-Chun Chiu, Dianqi Li, Ning Zhang, Chaowei Xiao

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Independent Researcher(独立研究者)

专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract);分类 cs.AI

AI总结 DRIFT通过动态安全策略和注入隔离技术,有效防御LLM代理中的提示注入攻击,验证了其在多个基准测试中的高安全性和高实用性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20953 2026-03-24 cs.CR cs.AI 70%

Before the Tool Call: Deterministic Pre-Action Authorization for Autonomous AI Agents

在工具调用之前:自主AI代理的确定性预行动授权

Uchi Uchibeke

机构 * APort Technologies Inc.(APort技术公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出Open Agent Passport,通过同步拦截工具调用、评估声明性策略并生成加密审计记录,实现自主AI代理的确定性预授权,提升安全性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20697 2026-03-24 cs.CV cs.AI 70%

Satellite-to-Street: Synthesizing Post-Disaster Views from Satellite Imagery via Generative Vision Models

卫星到街道:通过生成视觉模型从卫星图像合成灾害后视角

Yifan Yang, Lei Zou, Wendy Jepson

机构 * Department of Geography Texas A\&M University(地理系德克萨斯农工大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过生成视觉模型从卫星图像合成灾害后街道视角的方法,对比了基于VLM和MoE的生成策略,揭示了高现实感生成与结构信息保留之间的平衡问题。

Comments Accepted for presentation at IGARSS 2026 (IEEE International Geoscience and Remote Sensing Symposium)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18130 2026-03-20 cs.RO cs.AI 70%

Final Report for the Workshop on Robotics & AI in Medicine

医学领域机器人与人工智能研讨会最终报告

Juan P Wachs

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 研讨会聚焦医疗领域机器人与AI的协同发展,强调数据获取、评估方法标准化及跨学科培训的重要性,提出建立国家AI与机器人卓越中心的迫切需求。

Comments 51 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15639 2026-03-19 cs.AI 70%

The Comprehension-Gated Agent Economy: A Robustness-First Architecture for AI Economic Agency

基于理解的智能体经济:面向AI经济代理的鲁棒性优先架构

Rahul Baxi

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出Comprehension-Gated Agent Economy架构,通过对抗鲁棒性审计生成验证函数,实现经济权限的鲁棒性约束,确保经济安全与竞争力。

Comments v2: updated correspondence email

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16445 2026-03-18 cs.AI 70%

Visual Distraction Undermines Moral Reasoning in Vision-Language Models

视觉干扰削弱了视觉语言模型中的道德推理

Xinyi Yang, Chenheng Xu, Weijun Hong, Ce Mo, Qian Wang, Fang Fang, Yixin Zhu

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Yuanpei College, Peking University(北京大学元培学院) Department of Psychology, Sun Yat-sen University(中山大学心理学系) State Key Lab of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康北京市重点实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究揭示视觉输入会改变视觉语言模型的道德决策,超越文本安全机制,提出多模态基准MDS以分析视觉与上下文变量对道德决策的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17646 2026-03-17 cs.LG 70%

Unveiling the Basin-Like Loss Landscape in Large Language Models

揭示大语言模型中的盆地状损失景观

Huanran Chen, Yinpeng Dong, Zeming Wei, Yao Huang, Yichi Zhang, Hang Su, Jun Zhu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 研究发现大语言模型的损失景观中出现盆地结构,随着模型规模增大,模型对参数空间扰动的鲁棒性增强,但最坏方向的损失景观尖锐且有害,对抗性微调会快速降低模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13257 2026-03-17 cs.AI 70%

Distilling Deep Reinforcement Learning into Interpretable Fuzzy Rules: An Explainable AI Framework

将深度强化学习转化为可解释的模糊规则:一个可解释人工智能框架

Sanup S. Araballi, Simon Khan, Chilukuri K. Mohan

机构 * Dept. of EECS, Syracuse University, NY 13244, USA(电子工程与计算机科学系, Syracuse大学,纽约州,13244,美国) Air Force Research Laboratory, Rome, NY 13441, USA(空军研究实验室,罗马,纽约州,13441,美国)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种分层Takagi-Sugeno-Kang模糊分类器系统,通过K-means聚类和岭回归将神经策略转化为可读的IF-THEN规则,并引入三个量化指标评估解释性。

Comments Accepted to AAAI 2026 Spring Symposium Series

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07427 2026-03-17 cs.AI cs.CR 70%

AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation

AutoControl Arena:为前沿AI风险评估合成可执行测试环境

Changyi Li, Pengfei Lu, Xudong Pan, Fazl Barez, Min Yang

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出AutoControl Arena框架,通过逻辑-叙述解耦原理,结合可执行代码与LLM生成动态,有效缓解逻辑幻觉并提升灵活性,验证了在压力下AI风险显著增加,揭示了不同模型在安全性和对齐性上的差异。

Comments Project page: https://cosmosyi.github.io/AutoControl-Arena/; Code: https://github.com/CosmosYi/AutoControl-Arena/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08697 2026-03-16 cs.HC cs.AI 70%

Auditing Student-AI Collaboration: A Case Study of Online Graduate CS Students

审查学生与AI协作:在线研究生计算机科学学生的案例研究

Nifu Dan

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本研究通过混合方法审计,探讨学生与AI协作的偏好,分析现有AI能力与学生期望之间的差距,以改进教育用AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02907 2026-03-13 cs.CL 70%

Beyond the Black Box: A Survey on the Theory and Mechanism of Large Language Models

超越黑箱:大型语言模型理论与机制的综述

Zeyu Gan, Ruifeng Ren, Wei Yao, Xiaolin Hu, Gengze Xu, Chen Qian, Huayi Tang, Zixuan Gong, Xinhao Yao, Pengwei Tang, Zhenxing Dou, Yong Liu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型的理论与机制,提出生命周期分类法,分析核心理论问题并识别前沿挑战,旨在推动LLM发展向科学学科转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11701 2026-03-13 stat.ML cs.LG 70%

Decomposing Observational Multiplicity in Decision Trees: Leaf and Structural Regret

分解决策树中的观测多重性:叶和结构后悔

Mustafa Cavus

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出决策树中叶和结构后悔的概念,分析观测多重性的来源,证明结构后悔主导了多重性,并通过实验展示其在提升模型安全性中的作用。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏