arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1028 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 1028 篇

2608.13017 2026-08-14 cs.HC 新提交 50%

How LLMs Respond to Escalating Delusions: Four Longitudinal Trajectories of Model Behavior

大语言模型(LLM)对日益严重的妄想的反应:模型行为的四种纵向轨迹

Anna Sterna, Kacper Dudzic, Karolina Drożdż, Hubert Plisiecki, Marcin Rządeczka, Marcin Moskalewicz

专题命中 安全评测 :safety(abstract)

AI总结 本研究通过30天的纵向实验,评估15种主流LLM对模拟精神症状进展的反应,识别出四种不同行为轨迹,提出需从识别时机、稳定性和干预准确性维度纵向评估LLM加剧AI精神病的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12635 2026-08-14 cs.AR 新提交 50%

GateTruth: Auditing the Rigor of RTL Design Benchmarks via Mutation Testing

GateTruth:通过变异测试审计RTL设计基准的严谨性

Meet Bhadra

专题命中 安全评测 :trustworthy(abstract)

AI总结 GateTruth是用于审计RTL基准测试平台严谨性的变异测试引擎,实验显示多数RTLLM v2.0基准测试平台未达95%变异体杀伤阈值,4096-token输出上限会影响模型排名,其成果推动将变异体杀伤认证设为RTL基准的标准要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12515 2026-08-14 cs.CV cs.RO 新提交 50%

Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

视觉-语言模型能否从机器人的第一人称视角图像评估人际距离风险?

Vladyslava Rudas, Dmytro Kuzmenko

机构 * National University of Kyiv-Mohyla Academy(基辅莫希拉国立大学) University of Turin(都灵大学)

专题命中 安全评测 :safety(abstract)

AI总结 该研究评估了InternVL、Qwen-VL、SmolVLM三种VLM在机器人第一人称视角图像人际距离危险分类中的表现,发现Qwen-VL经特定优化后高危险召回率更高,当前VLM在相关推理定位上仍有局限。

Comments Accepted at the EMR 2026 workshop at ECCV 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12051 2026-08-13 cs.CV 新提交 50%

Do Not Forget the Obvious - RISC: A Risk-Informed Slice-Coverage Protocol for Safe Autonomous Driving

勿忽视显而易见的内容——RISC:一种用于安全自动驾驶的风险感知切片覆盖协议

Fabian Hüger

机构 * CARIAD SE

专题命中 安全评测 :safety(abstract)

AI总结 该研究提出RISC协议,将安全问题转化为风险切片,通过风险引导选择提升自动驾驶关键故障发现率,可应用于多类自动驾驶子系统,补充现有测试验证流程。

Comments 14 pages, 3 figures, 5 tables. Accepted at the ECCV 2026 Workshop on Safe and Defensive Autonomous Driving (SDAD). Non-archival workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11592 2026-08-13 cs.RO 新提交 50%

Video2Track: From Real-World Interaction Videos to Steerable Adversarial Closed-Track Testing for Automated Driving Systems

Video2Track:从真实世界交互视频到自动驾驶系统的可操控对抗性封闭赛道测试

Mengjie Tian, Xinrui Zhang, Tianyu Li, Peizhi Zhang, Guirong Zhou, Haojie Feng, Junpeng Huang, Qixiang Zhang, Lu Xiong

专题命中 安全评测 :safety(abstract)

AI总结 本文提出Video2Track框架,通过两个耦合模块将真实驾驶视频交互场景转化为可操控对抗性封闭赛道测试,可复现实景交互场景并生成可控变体,为ADS验证提供可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11564 2026-08-13 cs.CV cs.RO 新提交 50%

Repurposing RGB-based Foundation Model for Depth Estimation on Thermal Images Using Hierarchical Supervision

利用分层监督将基于RGB的基础模型重新用于热图像的深度估计

Jie Hong, Tingtian Li, Xuesong Li, Xiao Li

机构 * The University of Hong Kong(香港大学) Commonwealth Scientific and Industrial Research Organisation (CSIRO)(英联邦科学与工业研究组织)

专题命中 安全评测 :alignment(abstract)

AI总结 针对热图像深度估计中RGB基础模型分层表示利用不足的问题,提出RGB-HS框架,通过分层监督和基于图像质量的标记加权对齐,在基准上实现了有竞争力的性能。

Comments Accepted in IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10084 2026-08-12 eess.IV cs.CV 新提交 50%

When Repository Labels Are Not Image-Level Truth: A Supervision Auditing Framework for Chest Radiograph AI

当仓库标签并非图像级真值:面向胸部X光AI的监督审计框架

Yesika Alexandra Agudelo-Londoño, Jhon Wilmer Pino-Román, Brahian Carrera Rodríguez, José Miguel Castañeda-Bedoya, Juan Pablo Gómez-López, Aura C. Puche-Sarmiento, Niharika S. D'Souza, Juan Sebastian Osorio-Valencia, Jon E. Duque-Grajales, Jazmín Ximena Suárez-Revelo, Jorge Mario Vélez-Arango, Gabriel Castrillón

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对胸部X光仓库标签非图像级真值的问题,提出RSA框架,以MIMIC-CXR心脏肥大数据为例发现其标签与专家评估一致性极低,用专家精选队列训练的DenseNet121模型达0.853的ROC-AUC,强调监督审计的重要性。

Comments Accepted (oral) at the 3rd MICCAI Student Board (MSB) EMERGE Workshop, MICCAI 2026. This is the authors' version; the final authenticated version will appear in Springer Lecture Notes in Computer Science (LNCS). 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11074 2026-08-12 cs.CV 新提交 50%

CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering

CapProbe:通过全场景密集问答评估详细图像描述

Mouxiao Huang, Qiangyu Yan, Borui Jiang, Han Shu

机构 * Huawei Technologies(华为技术有限公司)

专题命中 安全评测 :alignment(abstract)

AI总结 CapProbe是用于评估VLMs生成的详细图像描述的全场景密集问答基准,通过区域对齐的事实核查,揭示了13个VLMs的覆盖差距、能力-效率权衡及遗漏的失败模式,相关资源将很快发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10262 2026-08-12 cs.MA 新提交 50%

Not a Monolith: Lab-Level Divergence in the Cooperative Equilibria of Chinese Frontier LLM Agents

并非单一整体:中国前沿大语言模型智能体合作均衡的实验室层面差异

Francisco León Zúñiga Bolívar

专题命中 安全评测 :alignment(abstract)

AI总结 该研究以四款中国前沿LLM智能体为对象,消除混淆因素后发现,合作倾向的设定单位是实验室,中国模型并非单一整体,且生态系统内差异大于东西差异。

Comments 9 pages, 8 tables. Companion study to arXiv:2605.29874, under a fixed-converter design. Code and replication package: https://github.com/arqFranciscoLeon/evollm (archived: https://doi.org/10.5281/zenodo.20248614)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09145 2026-08-11 cs.CV 新提交 50%

Right Answer, Wrong Heat: Explanation-Aware Evaluation and Thermal-Grounded Feedback for MLLMs on Infrared Images

正确答案,错误依据:面向红外图像多模态大语言模型的感知感知评估与热基础反馈机制

Yongsong Huang, Xiaofeng Liu, Tomo Miyazaki, Yaohou Fan, Shinichiro Omachi

专题命中 安全评测 :trustworthy(abstract)

AI总结 该研究针对红外图像多模态大语言模型仅以答案准确率评估的问题,提出感知感知评估框架与无需训练的热基础反馈机制,可提升解释热基础度,为可信红外场景理解模型的开发提供了方向。

Comments This manuscript is currently under peer review. Copyright may subsequently be transferred to the publisher, after which the availability of this version may be subject to the publisher's policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09097 2026-08-11 cs.CV 新提交 50%

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

SI-Edit:面向草图-指令引导的像素级精度局部图像编辑

Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) City University of Macau(澳门城市大学) Meitu Inc(美图公司)

专题命中 安全评测 :alignment(abstract)

AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08785 2026-08-11 eess.SY cs.SY 新提交 50%

Robust Fault Detection and Classification in Power Systems via Physics-Informed and Data-Driven Learning

基于物理信息与数据驱动学习的电力系统鲁棒故障检测与分类

Biswash Basnet, Varsha Sen

专题命中 安全评测 :safety(abstract)

AI总结 本文提出结合物理信息与数据驱动学习的智能框架,基于SMOTE平衡数据集训练PINN等模型,实现电力系统故障的鲁棒检测与分类,在噪声及训练数据占比波动下仍保持高准确率,可用于电网实时保护与广域监测控制。

Comments 19 pages, published journal article

Journal ref Journal of Electrical Engineering and Automation 7(3), 241-259 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07993 2026-08-11 cs.CV 新提交 50%

MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval

MRBench:用于人体动作-文本检索的综合基准

Fulong Liu, Liang Xu, Chengqun Yang, Yuhao Zhang, Yichao Yan, Xiaokang Yang

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出综合动作-文本检索基准MRBench,针对现有基准缺陷构建,提出轻量级粒度感知模型,提升混合粒度检索效果,为动作-语言对齐评估提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06705 2026-08-10 cs.SE 新提交 50%

Translation Tag Team: Formal Rules and LLMs Translate More Macros Together than Apart

翻译搭档团队:形式化规则与大语言模型协同翻译宏比单独翻译更有效

Brent Pappas, Joseph Zalusky, Zachary Burkett, Paul Gazzillo

专题命中 安全评测 :safety(abstract)

AI总结 该研究提出形式化翻译器MerC,结合MerC与大语言模型(LLMs)的搭档方法,在宏翻译任务中比单独使用任一技术更优,可降低失败率并提升翻译覆盖率。

Comments 13 pages, 7 figures, 2 tables, 8 listings, conference. To be published in ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06662 2026-08-10 cond-mat.mtrl-sci cond-mat.mes-hall physics.comp-ph 新提交 50%

Cross-Geometry Transferability Assessment of Universal Machine Learning Interatomic Potentials: From Bulk Materials to Atomic Nanowires

通用机器学习原子间势的跨几何可迁移性评估:从块体材料到原子纳米线

Pedro H. M. Zanineli, Bruno Focassio, Gabriel R. Schleder

专题命中 安全评测 :alignment(abstract)

AI总结 该研究评估通用机器学习原子间势的跨几何可迁移性,构建ZrO₂多构型数据集,测试26个预训练模型,发现零样本预测存在几何依赖型误差,对比不同训练策略,指出适配低配位离子纳米结构需多样目标数据与物理验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06287 2026-08-07 cs.SE 新提交 50%

Automatic Translation of Unstructured Requirements into Linear Temporal Logic through Large Language Models

基于大语言模型将非结构化需求自动翻译为线性时序逻辑

Alexandra Newcomb, Omar Ochoa

专题命中 安全评测 :safety(abstract)

AI总结 本文评估6种大语言模型,通过少样本提示策略在含15个需求的基准上生成线性时序逻辑公式,验证通用LLMs无需微调即可完成非结构化自然语言转LTL任务,可作为半自动化形式化工作流的前端助手。

Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05956 2026-08-07 cs.MA cs.SY eess.SY 新提交 50%

Certifying Collective Reasoning in Multi-Agent Systems via Koopman Spectral Analysis

基于Koopman谱分析的多智能体系统集体推理验证

Nuzhat Khan, Indrakshi Dey

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出基于Koopman算子理论的框架,通过分析多智能体集体的Koopman转移算子谱,实现对其推理收敛时间、派系及决策的可验证,在注意力共识模型上验证了方法的有效性,且运行高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05855 2026-08-07 cs.DC 新提交 50%

RepoOMP: Repository-Aware Hotspot OpenMP Parallelization via Dependency-Aware Context Reduction

RepoOMP:基于仓库感知的热点OpenMP并行化方法——通过依赖感知的上下文缩减

Yongjie Qian, Ke Gao, Zhibin Zhang, Shaohui Peng, Ling Li

专题命中 安全评测 :safety(abstract)

AI总结 RepoOMP是一种混合框架,通过构建MAP和STC,在951个热点上实现平均加速比8.23×至8.96×,降低智能体令牌成本,为仓库热点并行化提供证据引导的工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05614 2026-08-07 cs.HC 新提交 50%

Toward Resilient Human-AI Collaboration: A Lifecycle Taxonomy of Sociotechnical Risks and Cascading Failures

面向弹性人机协作:社会技术风险与级联故障的生命周期分类

Md Foysal Ahmed, Isaac Kobby Anni, Md Main Uddin Rony

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出人机协作风险的生命周期分类框架,识别六大跨领域风险集群,构建交互模型揭示风险级联机制,为设计更具弹性的人机协作系统提供基础。

Comments 11 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05485 2026-08-07 cs.CV 新提交 50%

VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing

VideoArgus:基于智能体评分规则的视频生成与编辑统一评估框架

Ziyun Zeng, Zixuan Wang, Yongsheng Yu, Hang Hua, Jiebo Luo

机构 * University of Rochester(罗切斯特大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对现有视频评估基准的局限,本文提出VideoArgus框架,构建含1026个实例的VideoArgus-Bench,其在与人类判断的相关性上优于基准特定评估器,且模型排名稳定。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05223 2026-08-07 cs.SE cs.CR 新提交 50%

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

面向编码智能体中恶意技能文件的风险评估

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 安全评测 :safety(abstract)

AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。

Comments 29 pages, 6 figures, 6 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05184 2026-08-07 cs.IT cs.MM eess.IV math.IT 新提交 50%

Media Meets Communication in 6G: Fundamentals, Key Technologies, and Applications

6G中的媒体与通信:基础、关键技术及应用

Bingyan Xie, Longyu Zhou, Zihan Chen, Shunpu Tang, Mingyang Shi, Yu Tian, Guo Lu, Yongpeng Wu, Tianhao Liang, Tony Q. S. Quek, Guangtao Zhai, Wenjun Zhang

专题命中 安全评测 :trustworthy(abstract)

AI总结 该文针对6G视觉通信的媒体通信技术开展系统性综述,提出含四大维度的统一框架,涵盖AI驱动媒体技术与感知媒体的无线传输等内容,为6G媒体通信研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04006 2026-08-05 cs.HC 新提交 50%

Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education

校准可信度:为教育领域评估大型语言模型(LLM)协同设计指标与可视化方案

Adam Coscia, Sujata Duwal, Langdon Holmes, Scott Crossley, Alex Endert

专题命中 安全评测 :alignment(abstract)

AI总结 本研究针对教育领域LLM响应的教学适配性评估缺口,通过与学习工程师协同设计可信度指标与可视化工具,提升了评估信度,为相关工具提出设计准则。

Comments Under review. 48 pages, 22 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03337 2026-08-05 cs.SE 新提交 50%

Assessing Behavioral Validation in UI Component Test Suites Using Inferred Metamorphic Relations

利用推断的变形关系评估UI组件测试套件中的行为验证

Yu Pei, Cunming Zhang, Jeongju Sohn, Mike Papadakis

专题命中 安全评测 :alignment(abstract)

AI总结 该研究提出基于推断变形关系(MR)的框架,可补充执行类指标,用于评估UI组件测试套件的行为验证,发现现有测试存在行为缺口,且MR覆盖率具备实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03078 2026-08-05 cs.CV 新提交 50%

LDU-Bench: Multimodal LLM Evaluation for Lithography Defect Understanding under Layout-Varying Circuit Backgrounds

LDU-Bench:面向不同布局电路背景下光刻缺陷理解的多模态大语言模型评估基准

Huanglong Ji, Botong Zhao, Shujing Lv, Yue Lv

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出LDU-Bench这一多模态基准,将光刻审查工作流程分解为四项任务,评估发现现有多模态大语言模型的缺陷分类能力无法稳定迁移至下游审查阶段,为工业MLLM评估提供了统一平台。

Comments 12 pages, 3 figures, and 5 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00647 2026-08-04 q-fin.TR q-fin.CP q-fin.RM 新提交 50%

Axient: On-Chain Credit and Loss Allocation for Leveraged Event Markets: A Venue-Agnostic Protocol for Traders, Credit Providers, Market Makers, and Liquidation Backstops

Axient:杠杆事件市场的链上信用与损失分配——面向交易者、信用提供者、做市商及清算后援的场所无关协议

Maksym Nechepurenko

专题命中 安全评测 :safety(abstract)

AI总结 Axient是面向多角色的场所无关链上信用协议,通过形式化架构与内生模型实现损失分配等机制,实验验证其分层保护等特性,为杠杆事件市场提供解决方案。

Comments 90 pages, 17 figures. Formal protocol design and fixed-seed synthetic agent-based validation; no live Axient or venue data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00279 2026-08-04 eess.IV cs.CV 新提交 50%

Learning to See Locally and Align Clinically with Pathology Semantics for Radiology Report Generation

学习局部感知并与病理学语义临床对齐的放射学报告生成方法

Xuan Cuong Ngo

专题命中 安全评测 :alignment(abstract)

AI总结 针对放射学视觉-语言模型的图像-文本对齐缺陷,提出病理学感知对齐框架PALM,结合共享病理学原型与掩码证据建模,在多数据集上提升报告生成与异常鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02320 2026-08-04 cs.RO cs.CV 新提交 50%

TravKAN: Fast and Interpretable Nonlinear Traversability Analysis with Kolmogorov-Arnold Networks

TravKAN:基于Kolmogorov-Arnold网络的快速可解释非线性可通行性分析

Daniel Fusaro, Simone Mosco, Wanmeng Li, Alberto Pretto

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于Kolmogorov-Arnold网络的TravKAN框架,结合LiDAR反射率手工特征,在公开数据集上性能优于传统深度模型,兼具可解释性与高效性,适用于安全关键的机器人可通行性分析。

Comments This paper has been accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01938 2026-08-04 cs.CR 新提交 50%

D-MUTRA: DLT-based MUTual Remote Attestation for Multi-Agent Systems

D-MUTRA:面向多智能体系统的基于分布式账本(DLT)的相互远程证明

Adam Zahir, Vincent Lefebvre, Mark Angoustures, Milan Groshev, Carlos J. Bernardos

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对多智能体系统传统远程证明的局限,本文提出基于区块链的D-MUTRA框架,实现智能体间的持续相互证明,可检测恶意软件修改,且扩展时开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01759 2026-08-04 cs.CR 新提交 50%

Benign Alone, Harmful Together: Exploiting Experience Composition in Self-Evolving LLM Agents

单独无害,联合有害:在自进化大语言模型智能体中利用经验组合

Bingyu Yan, Xiaoming Zhang, Chaozhuo Li, Ziyi Zhou, Yirui Qi, Litian Zhang

专题命中 安全评测 :safety(abstract)

AI总结 本研究提出EvoBreak攻击,利用自进化LLM智能体的良性经验组合,结合BreakGym生成训练目标,在保持高无害性的同时优于现有攻击,揭示了新的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏