arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-24 至 2026-08-24 共收录 23 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 23 篇

2608.21278 2026-08-24 cs.AI 新提交 88%

CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment

CLEAR:用于保持效用的大语言模型安全对齐的连续潜在适配器路由

Chengxiao Wang, Enyi Jiang, Xiaojing Liao, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校西贝尔计算与数据科学学院) Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本研究提出CLEAR框架,通过轻量型隐藏状态门控控制安全低秩适配器的激活强度,在降低LLM有害输出的同时,减少了全局安全调优带来的效用损失,实现了安全与效用的更好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20554 2026-08-24 cs.CR cs.LG 新提交 83%

aiXamine: Unified Black-Box Evaluation of Cross-Dimensional Trade-offs in LLM Safety, Security, and Privacy

aiXamine:针对大语言模型安全、安全与隐私的跨维度权衡的统一黑盒评估

Fatih Deniz, Yazan Boshmaf, Dorde Popovic, Issa Khalil

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 该研究推出aiXamine统一黑盒平台,对超120个LLM开展大规模联合评估,发现安全、隐私等跨维度权衡现象,揭示当前对齐方法将多维度可信性视为单一目标的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20345 2026-08-24 cs.CL cs.AI cs.CY 新提交 82%

When Vocabulary Comprehension Fails Clinical Reasoning: Evaluating Therapy Bots' Safety Risks for Generation Alpha

当词汇理解失效于临床推理:评估面向阿尔法世代(Gen Alpha,2010-2024年出生)的治疗机器人的安全风险

Manisha Mehta, Virendra Mehta

机构 * Lynbrook High School(林布鲁克高中) University of Trento(特伦托大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究构建两个基准评估Claude、GPT-4o等LLM的治疗机器人安全风险,发现其存在10-14个百分点的词汇理解与临床风险校准差距,识别六种失败模式,提出四项监管与技术改进建议。

Comments 42 pages, 6 figures. Accepted at ACM FAccT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21057 2026-08-24 cs.LG 新提交 79%

Designing a Robust LLM-Based Evaluation System for Agentic AI in Drug Discovery Through Human Alignment

通过人类对齐设计用于药物发现中智能体AI的鲁棒性大语言模型评估系统

Emma Granqvist, Rocío Mercado, Samuel Genheden

机构 * AstraZeneca(阿斯利康) Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) Science for Life Laboratory (SciLifeLab)(生命科学实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 本研究针对药物发现智能体AI,提出人类对齐的LLM作为评判者评估框架,优化后对齐度达0.86,为科学领域智能体系统评估提供可复用模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14251 2026-08-24 cs.LG 版本更新 79%

Calibrate-Then-Delegate: Safety Monitoring with Risk and Budget Guarantees via Model Cascades

校准后再委托:通过模型级联实现具有风险和预算保证的安全监控

Edoardo Pona, Milad Kazemi, Mehran Hosseini, Yali Du, David Watson, Osvaldo Simeone, Nicola Paoletti

机构 * King’s College London(伦敦国王学院) University of Manchester(曼彻斯特大学) Northeastern University London(伦敦东北大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出Calibrate-Then-Delegate方法,通过模型级联在保证计算成本的同时实现实例级决策,有效提升安全监控的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21095 2026-08-24 cs.SE cs.AI cs.CL cs.CR cs.IR 新提交 76%

Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems

可信检索增强生成:用于检测生成式人工智能系统中错误信息和知识投毒的评估智能体

Balkrishna Giri, Md Toufique Hasan, Jussi Rasku, Muhammad Waseem, Pekka Abrahamsson

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 该研究针对RAG系统的安全-可靠性鸿沟,提出结合NLI验证、五信号投毒检测器及可信指数的评估智能体,在TruthfulQA等数据集上实现高检测性能,可阻止RAG系统的不安全指令注入。

Comments 7 pages, 1 figure. Accepted for publication in the Main Research Track of the Twenty-First International Conference on Software Engineering Advances (ICSEA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20661 2026-08-24 cs.AI cs.CE cs.CL cs.IR 新提交 76%

Auditable by Construction: An Ontology-Driven Framework for Trustworthy LLM Analytics in Enterprise Finance

可审计性原生:面向企业金融领域可信大语言模型分析的本体驱动框架

Sergiy Lunyakin

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 本文针对企业金融大语言模型应用的信任问题,提出知识驱动分析框架KDAF,结合本体与CARP技术,在FinanceBench评估中,其可审计性优于基线方法,表明可审计性是该框架的核心优势。

Comments 20 pages, 1 figure, 4 tables, 1 algorithm. Artifact deposit with configurations, ontology schema, prompts, audit reports and reconstruction scripts: this https URL (https://doi.org/10.5281/zenodo.22022068)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20825 2026-08-24 cs.AI 新提交 74%

Prediction certification cannot replace explanation certification: a competence envelope for trustworthy AI under compound stress

预测认证无法替代解释认证:复合压力下可信人工智能的能力边界

Nataliya Shakhovska, Ivan Izonin, Stergios-Aristoteles Mitoulis

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 研究表明仅预测侧认证无法确保AI可信,提出结合预测与解释认证的能力边界框架,可捕捉预测侧认证遗漏的失效模式,为可信AI认证提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20797 2026-08-24 cs.AI 新提交 70%

Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation

基于步骤级结果推理与聚合的移动智能体自动轨迹评估

Pengshuai Yang, Zijing Gao, Xue Yu, Benhui Zhuang, Bo Yuan, Junlan Feng

机构 * Jiutian Research(九天研究院) China Mobile(中国移动)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本研究提出CRATE(含安全评估扩展版CRATE-S)这一VLM-as-judge框架,通过步骤级推理解决移动智能体轨迹评估的上下文过载与安全缺失问题,在AndroidWorld、MobileRisk数据集上取得优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21074 2026-08-24 cs.CL cs.AI cs.HC cs.SE 新提交 62%

PromptResponse: Optimizing Prompts for LLM Coding Tasks

PromptResponse:优化大语言模型编码任务的提示词

Erik Thureck, Robert Kühnen, Tim Jacobowitz

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) HU Berlin(柏林洪堡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出PromptResponse,通过对HumanEval数据集的5种变体让GPT-4o执行8200次编码任务,发现统一格式(尤其JSON)可提升代码效率与稳定性,LLM调优提示词会降低性能,还发布了相关数据集与评估流程。

Comments 22 pages, 7 figures, 10 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20393 2026-08-24 cs.CL cs.AI 新提交 62%

Knowledge-Graph-Gated Defactualization for Style-Controllable and Fact-Preserving Generation in Agentic Conversational AI

面向智能体对话AI的风格可控且事实保留生成的知识图谱门控去事实化方法

Tanmay Kumar Shrivastava, Darsh Rohit Nandu, Rajesh Kumar Mundotiya

机构 * Indian Institute of Technology (IIT) Bhilai(印度比莱印度理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 针对智能体对话AI的事实保留与风格可控生成需求,提出DSR知识工程框架,结合KG与激活引导,在LLaMA系列模型上验证其可提升实体恢复率并保持风格控制,无需微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21049 2026-08-24 cs.CR cs.AI cs.NI 新提交 57%

$Z^2$-ACT: End-to-End Verifiable Agentic Intent Control for Open 6G RAN

$Z^2$-ACT:面向开放6G无线接入网的端到端可验证智能体意图控制

Sunder Ali Khowaja, Kapal Dev, George C. Alexandropoulos

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对开放6G RAN多厂商部署的安全可验证需求,提出$Z^2$-ACT架构,集成多类核心组件并经实验验证其执行过滤与攻击恢复能力提升。

Comments 12 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21036 2026-08-24 cs.AI 新提交 57%

Evaluating Large Language Model Performance on International Maritime Dangerous Goods Code Compliance

评估大型语言模型在国际海运危险货物规则合规性上的性能

Alexander Thomas, Hubert P. H. Shum, Darren Nellis, Manli Zhu, Phatpicha Yochum, William Bartle, Daniel Wrightson

机构 * NCB Hazcheck Limited(NCB Hazcheck有限公司) Durham University(杜伦大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究构建首个IMDG规则合规性基准DGEval,评估13个LLM的性能,发现其在积载等安全关键领域表现弱,仅可辅助结构化查询,需人工监督。

Comments 28 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20938 2026-08-24 cs.AI 新提交 57%

No Judgment Without a Reason: Counterfactual Receipts for Versioned AI Evaluators

无理由不判断:面向版本化AI评估器的反事实收据

Ye Chen, Weining Zhang

机构 * Alibaba Group(阿里巴巴集团) Cheung Kong Graduate School of Business(长江商学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 该研究针对AI评估器的推理问责问题,提出反事实收据方法与ReasonBench基准,发现模型标准准确率掩盖鲁棒性缺陷,需解耦预测与认证以实现可信审计。

Comments 26 pages, 11 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18300 2026-08-24 cs.AI 版本更新 57%

The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations

用于大规模推荐解释的LLM评判模型的生命周期

Emma Yanyang Kong, JJ Tan, Ishan Gupta, Lars Olds, Claire Campbell, David Fagnan, Ratna Kavuri, Veli Balin, Rohan Gosain, Louis Garcia, Minsu Jang

机构 * Netflix(网飞公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06519 2026-08-24 cs.CL 版本更新 57%

MedRAGChecker: Claim-Level Verification for Biomedical Retrieval-Augmented Generation

MedRAGChecker: 用于生物医学检索增强生成的声明级验证

Yuelyu Ji, Min Gu Kwak, Hang Zhang, Xizhi Wu, Chenyu Li, Yanshan Wang

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 MedRAGChecker通过声明级验证和诊断框架,提高生物医学RAG生成答案的可靠性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20983 2026-08-24 cs.SI cs.HC 新提交 56%

Beyond Truth Discovery: A Two-Stage Framework to Assess the Severity of False Claim during Disasters

超越真相发现:一种评估灾害期间虚假声明严重程度的两阶段框架

Ruichen Yao, Tejna Dasari, Gulshat Baispay, Aizhan Zaurbek, Yifan Liu, Yaokun Liu, Zelin Li, Dong Wang

专题命中 安全评测 :alignment(abstract,comments)

AI总结 该研究针对灾害中社交媒体虚假声明严重程度评估问题,提出两阶段框架,结合可信度与危害性维度构建基准,发现LLMs及上下文学习与人工判断对齐度更强。

Comments The 2026 ACM Conference on Human-AI Complementarity and Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21300 2026-08-24 cs.CV 新提交 50%

When Adaptation Hurts: Connecting Representational Drift to OOD Failures in MedSAM Fine-Tuning

当适应适得其反:将表征漂移与MedSAM微调中的分布外故障关联起来

Marko Haralović, Sounic Akkaraju, Carlo Baretta, Vasil Zapryanov, Alexia Briassouli

机构 * University of Zagreb(萨格勒布大学) University of Twente(特温特大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本研究分析MedSAM的六种微调策略在不同医学图像数据集上的泛化表现,发现仅编码器LoRA等策略可缓解远分布外性能下降,提示随机抖动能提升模型鲁棒性。

Comments Accepted at the SAFER Workshop, MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21177 2026-08-24 cs.HC 新提交 50%

From Search Agents to Dissemination Interfaces: Understanding Human Trust in Health Information from Conversational Search

从搜索智能体到传播界面:理解人们对对话式搜索中健康信息的信任

Xin Sun, Rongjun Ma, Xiaochang Zhao, Janne Lindqvist, Jan de Wit, Zhuying Li, Abdallah El Ali, Jos A. Bosch

专题命中 安全评测 :trustworthy(abstract)

AI总结 本研究通过两项混合方法研究,发现人们对ChatGPT提供的健康信息信任显著高于谷歌,且传播界面类型会显著影响这种信任,为开发可信的LLM驱动健康工具提供了关键见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18587 2026-08-24 eess.SY 版本更新 50%

High-Altitude Platforms Beyond Connectivity: A Survey of Integrated Sensing, Storage, Communication, Computing, and Intelligence

面向S^2C^2I集成高空平台:架构、跨职能设计、评估与部署视角

Haoxiang Luo, Mohamed-Slim Alouini

专题命中 安全评测 :trustworthy(abstract)

AI总结 本综述聚焦S^2C^2I集成高空平台,阐述其架构、技术、评估方法与部署,通过应急案例验证其服务优势,指明相关研究机遇,提供从设计到部署的路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15765 2026-08-24 cs.CV 版本更新 50%

Learning to Orchestrate Vision Foundation Models for Multi-Task Dense Prediction

任务指令引导的视觉基础模型因果路由用于多任务学习

Donghyun Han, Yuseok Bae, Jung Uk Kim, Hyung-Il Kim

机构 * Electronics and Telecommunications Research Institute (ETRI)(韩国电子通信研究院(ETRI)) Kyung Hee University(庆熙大学) Chonnam National University(全南大学)

专题命中 安全评测 :alignment(abstract)

AI总结 提出TIGER框架,通过自然语言任务指令引导路由网络,结合反事实因果对齐,协调多个异构视觉基础模型实现多任务密集预测,在NYUD-v2和Pascal Context上超越现有方法。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06607 2026-08-24 cs.CR 版本更新 50%

Your Harness is Not Secure: Benchmarking Real-world Threat of Command Line Interface Agent

你的工具不安全:评测命令行界面智能体的现实威胁

Weidi Luo, Qiming Zhang, Tianyu Lu, Xiaogeng Liu, Bin Hu, Hung-Chun Chiu, Siyuan Ma, Yizhe Zhang, Xusheng Xiao, Yinzhi Cao, Zhen Xiang, Chaowei Xiao

专题命中 安全评测 :safety(abstract)

AI总结 该研究针对CLI智能体滥用风险,推出与MITRE ATT&CK对齐的AdvCLI基准测试,评估7款CLI智能体后发现其常越过拒绝边界,可完成部分恶意OS级任务,为开发安全机制提供测试平台。

Comments Accepted by EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11055 2026-08-24 cs.CV 版本更新 50%

Crane: Context-Guided Prompt Learning and Attention Refinement for Zero-Shot Anomaly Detection

Crane:用于零样本异常检测的上下文引导提示学习与注意力优化

Alireza Salehi, Mohammadreza Salehi, Reshad Hosseini, Cees G. M. Snoek, Makoto Yamada, Mohammad Sabokrou

专题命中 安全评测 :alignment(abstract)

AI总结 本研究提出基于CLIP的框架Crane,通过相关性注意力模块、上下文引导提示学习等改进零样本异常检测,在7个工业基准上显著提升图像级AP与像素级AUPRO,还衍生出更强变体Crane+。

Comments British Machine Vision Conference (BMVC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏