arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2602.11522 2026-08-10 cs.HC 版本更新 50%

Asymmetric Trust Effects of Corrective AI in Expert Advisory Workflows under Epistemic Dependence

人工智能参与对专家咨询工作流中信任的影响

Dennis Kim, Roya Daneshi, Bruce Draper, Sarath Sreedharan

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究探讨人工智能在专家咨询工作流中对用户信任的影响,发现人类专家使用AI的方式会影响用户对专业知识的信任。

Comments Revised version. Accepted to AIES 2026. Includes technical appendices and additional analyses

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06287 2026-08-07 cs.SE 新提交 50%

Automatic Translation of Unstructured Requirements into Linear Temporal Logic through Large Language Models

基于大语言模型将非结构化需求自动翻译为线性时序逻辑

Alexandra Newcomb, Omar Ochoa

专题命中 安全评测 :safety(abstract)

AI总结 本文评估6种大语言模型,通过少样本提示策略在含15个需求的基准上生成线性时序逻辑公式,验证通用LLMs无需微调即可完成非结构化自然语言转LTL任务,可作为半自动化形式化工作流的前端助手。

Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05956 2026-08-07 cs.MA cs.SY eess.SY 新提交 50%

Certifying Collective Reasoning in Multi-Agent Systems via Koopman Spectral Analysis

基于Koopman谱分析的多智能体系统集体推理验证

Nuzhat Khan, Indrakshi Dey

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出基于Koopman算子理论的框架,通过分析多智能体集体的Koopman转移算子谱,实现对其推理收敛时间、派系及决策的可验证,在注意力共识模型上验证了方法的有效性,且运行高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05855 2026-08-07 cs.DC 新提交 50%

RepoOMP: Repository-Aware Hotspot OpenMP Parallelization via Dependency-Aware Context Reduction

RepoOMP:基于仓库感知的热点OpenMP并行化方法——通过依赖感知的上下文缩减

Yongjie Qian, Ke Gao, Zhibin Zhang, Shaohui Peng, Ling Li

专题命中 安全评测 :safety(abstract)

AI总结 RepoOMP是一种混合框架,通过构建MAP和STC,在951个热点上实现平均加速比8.23×至8.96×,降低智能体令牌成本,为仓库热点并行化提供证据引导的工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05614 2026-08-07 cs.HC 新提交 50%

Toward Resilient Human-AI Collaboration: A Lifecycle Taxonomy of Sociotechnical Risks and Cascading Failures

面向弹性人机协作:社会技术风险与级联故障的生命周期分类

Md Foysal Ahmed, Isaac Kobby Anni, Md Main Uddin Rony

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出人机协作风险的生命周期分类框架,识别六大跨领域风险集群,构建交互模型揭示风险级联机制,为设计更具弹性的人机协作系统提供基础。

Comments 11 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05485 2026-08-07 cs.CV 新提交 50%

VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing

VideoArgus:基于智能体评分规则的视频生成与编辑统一评估框架

Ziyun Zeng, Zixuan Wang, Yongsheng Yu, Hang Hua, Jiebo Luo

机构 * University of Rochester(罗切斯特大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对现有视频评估基准的局限,本文提出VideoArgus框架,构建含1026个实例的VideoArgus-Bench,其在与人类判断的相关性上优于基准特定评估器,且模型排名稳定。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05223 2026-08-07 cs.SE cs.CR 新提交 50%

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

面向编码智能体中恶意技能文件的风险评估

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 安全评测 :safety(abstract)

AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。

Comments 29 pages, 6 figures, 6 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05184 2026-08-07 cs.IT cs.MM eess.IV math.IT 新提交 50%

Media Meets Communication in 6G: Fundamentals, Key Technologies, and Applications

6G中的媒体与通信:基础、关键技术及应用

Bingyan Xie, Longyu Zhou, Zihan Chen, Shunpu Tang, Mingyang Shi, Yu Tian, Guo Lu, Yongpeng Wu, Tianhao Liang, Tony Q. S. Quek, Guangtao Zhai, Wenjun Zhang

专题命中 安全评测 :trustworthy(abstract)

AI总结 该文针对6G视觉通信的媒体通信技术开展系统性综述,提出含四大维度的统一框架,涵盖AI驱动媒体技术与感知媒体的无线传输等内容,为6G媒体通信研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09443 2026-08-07 cs.CR 版本更新 50%

LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge

大型语言模型目前尚不可靠地充当评判者:对LLM作为评判者的鲁棒性的综合评估

Songze Li, Chuokun Xu, Jiaying Wang, Xueluan Gong, Chen Chen, Jirui Zhang, Jun Wang, Kwok-Yan Lam, Shouling Ji

专题命中 安全评测 :red teaming(abstract)

AI总结 本研究引入RobustJudge框架,评估LLM-as-a-Judge的鲁棒性,发现其易受攻击,鲁棒性对提示模板和模型选择敏感,优化攻击结合长后缀可提升PAI-Judge分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09406 2026-08-07 q-bio.QM math.AC 版本更新 50%

CAKR: Commutative algebra k-mer representations for genomics

CAKR:用于基因组学的交换代数k-mer表示

Faisal Suwayyid, Yuta Hozumi, Mushal Zia, JunJie Wee, Hongsong Feng, Guo-Wei Wei

专题命中 安全评测 :alignment(abstract)

AI总结 本研究提出CAKR即交换代数k-mer表示框架,将多学科方法结合用于比较基因组分析,在三类任务的多数据集上优于五种现有方法,兼具可扩展性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26996 2026-08-06 cs.IR 版本更新 50%

LUCid: Redefining Relevance For Lifelong Personalization

LUCid:重新定义终身个性化中的相关性

Chimaobi Okite, Anika Misra, Joyce Chai, Rada Mihalcea

专题命中 安全评测 :alignment(abstract)

AI总结 LUCid通过真实查询与交互历史的配对,评估情境用户导向的相关性,揭示现有系统在相关性定义与个性化需求间的根本矛盾,推动模型在提取情境相关用户信息上的改进。

Comments second version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25465 2026-08-06 cs.SE 版本更新 50%

BloomAPR: A Bloom's Taxonomy-based Framework for Assessing the Capabilities of LLM-Powered APR Solutions

BloomAPR:基于布鲁姆教育目标分类学的框架,用于评估大语言模型驱动的自动程序修复(APR)方案的能力

Yinghang Ma, Jiho Shin, Leuson Da Silva, Zhen Ming, Jiang, Song Wang, Foutse Khomh, Shin Hwei Tan

专题命中 安全评测 :trustworthy(abstract)

AI总结 BloomAPR是基于布鲁姆教育目标分类学的动态评估框架,评估了ChatRepair、CigaR等APR方案在不同LLM及布鲁姆分类层级下的漏洞修复能力,发现其存在性能差异并指出基准演进的必要性。

Comments 22 pages, 7 figures, Manuscript submitted to ACM Transactions on Software Engineering and Methodology

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22874 2026-08-06 cs.CV 版本更新 50%

Deformable Medical Image Registration with KAN-based Implicit Neural Representations

基于KAN的隐式神经表示的可变形医学图像配准

Nikita Drozdov, Marat Zinovev, Dmitry Sorokin

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学)

专题命中 安全评测 :alignment(abstract)

AI总结 提出基于KAN的INR框架KAN-IDIR与RandKAN-IDIR,用于无需数据集级训练的逐对优化可变形医学图像配准,在多模态医学图像上实现高准确性、低开销与稳定性,适用于临床研究。

Comments Accepted at Machine Learning and Knowledge Extraction

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14006 2026-08-06 cs.CV cs.RO 版本更新 50%

ResPlan: A Large-Scale Vector-Graph Dataset of 17,000 Residential Floor Plans

ResPlan:包含17000张住宅平面图的大规模矢量图数据集

Mohamed Abouagour, Eleftherios Garyfallidis

机构 * Department of Intelligent Systems Engineering, Indiana University(智能系统工程系,印第安纳大学)

专题命中 安全评测 :alignment(abstract)

AI总结 ResPlan是含17000张住宅平面图的矢量图数据集,具备功能空间标注与四类图边,相比RPLAN、MSD有更高质量单元布局,含相关代码与三个基准任务基线,可公开获取。

Comments 11 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04006 2026-08-05 cs.HC 新提交 50%

Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education

校准可信度:为教育领域评估大型语言模型(LLM)协同设计指标与可视化方案

Adam Coscia, Sujata Duwal, Langdon Holmes, Scott Crossley, Alex Endert

专题命中 安全评测 :alignment(abstract)

AI总结 本研究针对教育领域LLM响应的教学适配性评估缺口,通过与学习工程师协同设计可信度指标与可视化工具,提升了评估信度,为相关工具提出设计准则。

Comments Under review. 48 pages, 22 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03337 2026-08-05 cs.SE 新提交 50%

Assessing Behavioral Validation in UI Component Test Suites Using Inferred Metamorphic Relations

利用推断的变形关系评估UI组件测试套件中的行为验证

Yu Pei, Cunming Zhang, Jeongju Sohn, Mike Papadakis

专题命中 安全评测 :alignment(abstract)

AI总结 该研究提出基于推断变形关系(MR)的框架,可补充执行类指标,用于评估UI组件测试套件的行为验证,发现现有测试存在行为缺口,且MR覆盖率具备实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03078 2026-08-05 cs.CV 新提交 50%

LDU-Bench: Multimodal LLM Evaluation for Lithography Defect Understanding under Layout-Varying Circuit Backgrounds

LDU-Bench:面向不同布局电路背景下光刻缺陷理解的多模态大语言模型评估基准

Huanglong Ji, Botong Zhao, Shujing Lv, Yue Lv

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出LDU-Bench这一多模态基准,将光刻审查工作流程分解为四项任务,评估发现现有多模态大语言模型的缺陷分类能力无法稳定迁移至下游审查阶段,为工业MLLM评估提供了统一平台。

Comments 12 pages, 3 figures, and 5 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00647 2026-08-04 q-fin.TR q-fin.CP q-fin.RM 新提交 50%

Axient: On-Chain Credit and Loss Allocation for Leveraged Event Markets: A Venue-Agnostic Protocol for Traders, Credit Providers, Market Makers, and Liquidation Backstops

Axient:杠杆事件市场的链上信用与损失分配——面向交易者、信用提供者、做市商及清算后援的场所无关协议

Maksym Nechepurenko

专题命中 安全评测 :safety(abstract)

AI总结 Axient是面向多角色的场所无关链上信用协议,通过形式化架构与内生模型实现损失分配等机制,实验验证其分层保护等特性,为杠杆事件市场提供解决方案。

Comments 90 pages, 17 figures. Formal protocol design and fixed-seed synthetic agent-based validation; no live Axient or venue data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00279 2026-08-04 eess.IV cs.CV 新提交 50%

Learning to See Locally and Align Clinically with Pathology Semantics for Radiology Report Generation

学习局部感知并与病理学语义临床对齐的放射学报告生成方法

Xuan Cuong Ngo

专题命中 安全评测 :alignment(abstract)

AI总结 针对放射学视觉-语言模型的图像-文本对齐缺陷,提出病理学感知对齐框架PALM,结合共享病理学原型与掩码证据建模,在多数据集上提升报告生成与异常鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02320 2026-08-04 cs.RO cs.CV 新提交 50%

TravKAN: Fast and Interpretable Nonlinear Traversability Analysis with Kolmogorov-Arnold Networks

TravKAN:基于Kolmogorov-Arnold网络的快速可解释非线性可通行性分析

Daniel Fusaro, Simone Mosco, Wanmeng Li, Alberto Pretto

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于Kolmogorov-Arnold网络的TravKAN框架,结合LiDAR反射率手工特征,在公开数据集上性能优于传统深度模型,兼具可解释性与高效性,适用于安全关键的机器人可通行性分析。

Comments This paper has been accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01938 2026-08-04 cs.CR 新提交 50%

D-MUTRA: DLT-based MUTual Remote Attestation for Multi-Agent Systems

D-MUTRA:面向多智能体系统的基于分布式账本(DLT)的相互远程证明

Adam Zahir, Vincent Lefebvre, Mark Angoustures, Milan Groshev, Carlos J. Bernardos

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对多智能体系统传统远程证明的局限,本文提出基于区块链的D-MUTRA框架,实现智能体间的持续相互证明,可检测恶意软件修改,且扩展时开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01759 2026-08-04 cs.CR 新提交 50%

Benign Alone, Harmful Together: Exploiting Experience Composition in Self-Evolving LLM Agents

单独无害,联合有害:在自进化大语言模型智能体中利用经验组合

Bingyu Yan, Xiaoming Zhang, Chaozhuo Li, Ziyi Zhou, Yirui Qi, Litian Zhang

专题命中 安全评测 :safety(abstract)

AI总结 本研究提出EvoBreak攻击,利用自进化LLM智能体的良性经验组合,结合BreakGym生成训练目标,在保持高无害性的同时优于现有攻击,揭示了新的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01592 2026-08-04 cs.SE 新提交 50%

How Well Do LLMs Generate Taxonomies in the SE Domain? A Multi-perspective Evaluation Framework

大型语言模型在软件工程领域生成分类体系的表现如何?一个多视角评估框架

Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Tao Xiao, Yasutaka Kamei

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出首个SE领域自动化分类体系生成的多视角评估框架,对比TnT-LLM与CLIMB两种方法及5种LLM,揭示二者在质量、效率上的权衡,为SE领域应用该技术提供了可操作见解。

Comments 13 pages, Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01451 2026-08-04 cs.SE 新提交 50%

Doc2CI: A Multi-Service Study of CI Configuration Generation Using Large Language Models

Doc2CI:基于大语言模型的CI配置生成多服务研究

Taher A. Ghaleb

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过构建DOC2CI基准评估LLM生成CI配置的能力,发现其结构有效性不足,提出无需训练的模式引导修复方法提升有效性,为相关工具开发提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00692 2026-08-04 cs.SE 新提交 50%

Vul4Py: Benchmarking Automated Vulnerability Repair in Python with Paired Exploit and Functional Oracles

Vul4Py:利用配对漏洞利用与功能预言机对Python自动化漏洞修复进行基准测试

Tan Bui, Ting Zhang, Ferdian Thung, Yunpeng Xiong, Penghao Jiang, Xin Zhou, David Lo

专题命中 安全评测 :trustworthy(abstract)

AI总结 本研究提出Vul4Py基准测试,含100个Python真实漏洞及配对预言机,对比三类AVR方法,发现智能体OpenHands修复漏洞数远超同类方法,配对预言机保障结果可信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00624 2026-08-04 cs.SE 新提交 50%

Can Perplexity Serve as a Cognitive Signal for Code Understandability?

困惑度能否作为代码可理解性的认知信号?

Xiaokai Rong, Mohammadali Sefidi Esfahani, Aashish Yadavally, Rigby Peter, Tien N. Nguyen

专题命中 安全评测 :alignment(abstract)

AI总结 本研究通过实证发现,词元级困惑度的简单片段级聚合与人类代码可理解性相关性不可靠,明确其仅适用于局部代码困惑,需经特定分析才能用于可靠的代码可理解性测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00072 2026-08-04 cs.CV 新提交 50%

Volcanic Clouds Detection through QCNN and Geostationary Satellite Multispectral Imagery

基于QCNN与静止卫星多光谱影像的火山云检测

Federica Torrisi, Claudia Corradino, Alessandro Grilli, Tommaso Catuogno, Mattia Verducci, Elisabetta Paladino, Luigi Giannelli, Alessandro Sebastianelli

机构 * Istituto Nazionale di Geofisica e Vulcanologia (INGV)(国家地球物理与火山学研究所) Thales Alenia Space Italia(泰雷兹阿莱尼亚空间意大利公司) Euro-Mediterranean Center on Climate Change(欧亚地中海气候变化中心) Università di Catania(卡塔尼亚大学) INFN(国家核物理研究所)

专题命中 安全评测 :safety(abstract)

AI总结 本研究探讨混合量子卷积神经网络(QCNN)对含火山云的卫星图像分类的潜力,对比不同量子比特数QCNN与纯经典架构的性能,以解决火山云检测难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27902 2026-08-04 cs.CV 版本更新 50%

One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

一个补丁就够:面向基于多模态大语言模型(MLLM)的场景文本定位的强化优化视觉标记接地

Rui Tang, Wentao Yang, Peirong Zhang, Yongxin Shi, Shun Zhang, Huiguo He, Lianwen Jin

机构 * South China University of Technology(华南理工大学) HiThink Research(海思思考研究院)

专题命中 安全评测 :alignment(abstract)

AI总结 针对现有多补丁场景文本定位范式的冗余噪声与定位歧义问题,提出以视觉为中心的单补丁文本定位框架 SPaTS,通过强化学习优化的单补丁选择等技术实现性能提升,显著优于前沿相关模型。

Comments 15 pages, 11 figures. Accepted to ACM Multimedia 2026

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01347 2026-08-04 q-bio.NC cs.HC 版本更新 50%

A clinically validated framework for auditing AI chatbot behavior in mental health interactions

易受攻击的交互循环:人工智能聊天机器人心理健康互动中的系统性故障模式

Veith Weilnhammer, Kevin YC Hou, Lennart Luettgau, Christopher Summerfield, Raymond Dolan, Matthew M Nour

专题命中 安全评测 :safety(abstract)

AI总结 本文提出SIM-VAIL框架,通过分析AI聊天机器人在心理健康对话中的风险表现,揭示了易受攻击的交互循环系统性故障模式,并为安全改进提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23816 2026-08-04 cs.CV 版本更新 50%

Semantic-Guided Cross-Sensor Super Resolution of Remote Sensing Images: A Gated Dual Conditioning Flow Matching Model

语义引导的遥感图像跨传感器超分辨率:门控双条件流匹配模型

Forouzan Fallah, Wenwen Li, Chia-Yu Hsu, Hyunho Lee, Anna Liljedahl, Yezhou Yang

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院) School of Geographical Sciences and Urban Planning(地理科学与城市规划学院) Arizona State University(亚利桑那州立大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对遥感图像跨传感器超分辨率的稀缺数据与域偏移问题,提出语义引导的RareFlow框架,结合门控ControlNet与文本语义引导,在多基准上验证了其高保真超分辨率生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏