How LLMs Respond to Escalating Delusions: Four Longitudinal Trajectories of Model Behavior
大语言模型(LLM)对日益严重的妄想的反应:模型行为的四种纵向轨迹
专题命中 安全评测 :safety(abstract)
AI总结 本研究通过30天的纵向实验,评估15种主流LLM对模拟精神症状进展的反应,识别出四种不同行为轨迹,提出需从识别时机、稳定性和干预准确性维度纵向评估LLM加剧AI精神病的潜力。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
大语言模型(LLM)对日益严重的妄想的反应:模型行为的四种纵向轨迹
专题命中 安全评测 :safety(abstract)
AI总结 本研究通过30天的纵向实验,评估15种主流LLM对模拟精神症状进展的反应,识别出四种不同行为轨迹,提出需从识别时机、稳定性和干预准确性维度纵向评估LLM加剧AI精神病的潜力。
GateTruth:通过变异测试审计RTL设计基准的严谨性
专题命中 安全评测 :trustworthy(abstract)
AI总结 GateTruth是用于审计RTL基准测试平台严谨性的变异测试引擎,实验显示多数RTLLM v2.0基准测试平台未达95%变异体杀伤阈值,4096-token输出上限会影响模型排名,其成果推动将变异体杀伤认证设为RTL基准的标准要求。
视觉-语言模型能否从机器人的第一人称视角图像评估人际距离风险?
机构 * National University of Kyiv-Mohyla Academy(基辅莫希拉国立大学) ; University of Turin(都灵大学)
专题命中 安全评测 :safety(abstract)
AI总结 该研究评估了InternVL、Qwen-VL、SmolVLM三种VLM在机器人第一人称视角图像人际距离危险分类中的表现,发现Qwen-VL经特定优化后高危险召回率更高,当前VLM在相关推理定位上仍有局限。
Comments Accepted at the EMR 2026 workshop at ECCV 2026 (non-archival)
勿忽视显而易见的内容——RISC:一种用于安全自动驾驶的风险感知切片覆盖协议
机构 * CARIAD SE
专题命中 安全评测 :safety(abstract)
AI总结 该研究提出RISC协议,将安全问题转化为风险切片,通过风险引导选择提升自动驾驶关键故障发现率,可应用于多类自动驾驶子系统,补充现有测试验证流程。
Comments 14 pages, 3 figures, 5 tables. Accepted at the ECCV 2026 Workshop on Safe and Defensive Autonomous Driving (SDAD). Non-archival workshop paper
Video2Track:从真实世界交互视频到自动驾驶系统的可操控对抗性封闭赛道测试
专题命中 安全评测 :safety(abstract)
AI总结 本文提出Video2Track框架,通过两个耦合模块将真实驾驶视频交互场景转化为可操控对抗性封闭赛道测试,可复现实景交互场景并生成可控变体,为ADS验证提供可扩展方案。
利用分层监督将基于RGB的基础模型重新用于热图像的深度估计
机构 * The University of Hong Kong(香港大学) ; Commonwealth Scientific and Industrial Research Organisation (CSIRO)(英联邦科学与工业研究组织)
专题命中 安全评测 :alignment(abstract)
AI总结 针对热图像深度估计中RGB基础模型分层表示利用不足的问题,提出RGB-HS框架,通过分层监督和基于图像质量的标记加权对齐,在基准上实现了有竞争力的性能。
Comments Accepted in IROS 2026
当仓库标签并非图像级真值:面向胸部X光AI的监督审计框架
专题命中 安全评测 :trustworthy(abstract)
AI总结 针对胸部X光仓库标签非图像级真值的问题,提出RSA框架,以MIMIC-CXR心脏肥大数据为例发现其标签与专家评估一致性极低,用专家精选队列训练的DenseNet121模型达0.853的ROC-AUC,强调监督审计的重要性。
Comments Accepted (oral) at the 3rd MICCAI Student Board (MSB) EMERGE Workshop, MICCAI 2026. This is the authors' version; the final authenticated version will appear in Springer Lecture Notes in Computer Science (LNCS). 10 pages, 3 figures
CapProbe:通过全场景密集问答评估详细图像描述
机构 * Huawei Technologies(华为技术有限公司)
专题命中 安全评测 :alignment(abstract)
AI总结 CapProbe是用于评估VLMs生成的详细图像描述的全场景密集问答基准,通过区域对齐的事实核查,揭示了13个VLMs的覆盖差距、能力-效率权衡及遗漏的失败模式,相关资源将很快发布。
并非单一整体:中国前沿大语言模型智能体合作均衡的实验室层面差异
专题命中 安全评测 :alignment(abstract)
AI总结 该研究以四款中国前沿LLM智能体为对象,消除混淆因素后发现,合作倾向的设定单位是实验室,中国模型并非单一整体,且生态系统内差异大于东西差异。
Comments 9 pages, 8 tables. Companion study to arXiv:2605.29874, under a fixed-converter design. Code and replication package: https://github.com/arqFranciscoLeon/evollm (archived: https://doi.org/10.5281/zenodo.20248614)
正确答案,错误依据:面向红外图像多模态大语言模型的感知感知评估与热基础反馈机制
专题命中 安全评测 :trustworthy(abstract)
AI总结 该研究针对红外图像多模态大语言模型仅以答案准确率评估的问题,提出感知感知评估框架与无需训练的热基础反馈机制,可提升解释热基础度,为可信红外场景理解模型的开发提供了方向。
Comments This manuscript is currently under peer review. Copyright may subsequently be transferred to the publisher, after which the availability of this version may be subject to the publisher's policy
SI-Edit:面向草图-指令引导的像素级精度局部图像编辑
机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) ; City University of Macau(澳门城市大学) ; Meitu Inc(美图公司)
专题命中 安全评测 :alignment(abstract)
AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。
Comments accepted by ACM MM 2026
基于物理信息与数据驱动学习的电力系统鲁棒故障检测与分类
专题命中 安全评测 :safety(abstract)
AI总结 本文提出结合物理信息与数据驱动学习的智能框架,基于SMOTE平衡数据集训练PINN等模型,实现电力系统故障的鲁棒检测与分类,在噪声及训练数据占比波动下仍保持高准确率,可用于电网实时保护与广域监测控制。
Comments 19 pages, published journal article
Journal ref Journal of Electrical Engineering and Automation 7(3), 241-259 (2025)
MRBench:用于人体动作-文本检索的综合基准
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出综合动作-文本检索基准MRBench,针对现有基准缺陷构建,提出轻量级粒度感知模型,提升混合粒度检索效果,为动作-语言对齐评估提供测试平台。
翻译搭档团队:形式化规则与大语言模型协同翻译宏比单独翻译更有效
专题命中 安全评测 :safety(abstract)
AI总结 该研究提出形式化翻译器MerC,结合MerC与大语言模型(LLMs)的搭档方法,在宏翻译任务中比单独使用任一技术更优,可降低失败率并提升翻译覆盖率。
Comments 13 pages, 7 figures, 2 tables, 8 listings, conference. To be published in ASE 2026
通用机器学习原子间势的跨几何可迁移性评估:从块体材料到原子纳米线
专题命中 安全评测 :alignment(abstract)
AI总结 该研究评估通用机器学习原子间势的跨几何可迁移性,构建ZrO₂多构型数据集,测试26个预训练模型,发现零样本预测存在几何依赖型误差,对比不同训练策略,指出适配低配位离子纳米结构需多样目标数据与物理验证。
基于大语言模型将非结构化需求自动翻译为线性时序逻辑
专题命中 安全评测 :safety(abstract)
AI总结 本文评估6种大语言模型,通过少样本提示策略在含15个需求的基准上生成线性时序逻辑公式,验证通用LLMs无需微调即可完成非结构化自然语言转LTL任务,可作为半自动化形式化工作流的前端助手。
Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works
基于Koopman谱分析的多智能体系统集体推理验证
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文提出基于Koopman算子理论的框架,通过分析多智能体集体的Koopman转移算子谱,实现对其推理收敛时间、派系及决策的可验证,在注意力共识模型上验证了方法的有效性,且运行高效。
RepoOMP:基于仓库感知的热点OpenMP并行化方法——通过依赖感知的上下文缩减
专题命中 安全评测 :safety(abstract)
AI总结 RepoOMP是一种混合框架,通过构建MAP和STC,在951个热点上实现平均加速比8.23×至8.96×,降低智能体令牌成本,为仓库热点并行化提供证据引导的工作流。
面向弹性人机协作:社会技术风险与级联故障的生命周期分类
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文提出人机协作风险的生命周期分类框架,识别六大跨领域风险集群,构建交互模型揭示风险级联机制,为设计更具弹性的人机协作系统提供基础。
Comments 11 pages, 2 Figures
VideoArgus:基于智能体评分规则的视频生成与编辑统一评估框架
机构 * University of Rochester(罗切斯特大学)
专题命中 安全评测 :alignment(abstract)
AI总结 针对现有视频评估基准的局限,本文提出VideoArgus框架,构建含1026个实例的VideoArgus-Bench,其在与人类判断的相关性上优于基准特定评估器,且模型排名稳定。
Comments Preprint
面向编码智能体中恶意技能文件的风险评估
专题命中 安全评测 :safety(abstract)
AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。
Comments 29 pages, 6 figures, 6 tables. Preprint; under review
6G中的媒体与通信:基础、关键技术及应用
专题命中 安全评测 :trustworthy(abstract)
AI总结 该文针对6G视觉通信的媒体通信技术开展系统性综述,提出含四大维度的统一框架,涵盖AI驱动媒体技术与感知媒体的无线传输等内容,为6G媒体通信研究提供支撑。
校准可信度:为教育领域评估大型语言模型(LLM)协同设计指标与可视化方案
专题命中 安全评测 :alignment(abstract)
AI总结 本研究针对教育领域LLM响应的教学适配性评估缺口,通过与学习工程师协同设计可信度指标与可视化工具,提升了评估信度,为相关工具提出设计准则。
Comments Under review. 48 pages, 22 figures, 2 tables
利用推断的变形关系评估UI组件测试套件中的行为验证
专题命中 安全评测 :alignment(abstract)
AI总结 该研究提出基于推断变形关系(MR)的框架,可补充执行类指标,用于评估UI组件测试套件的行为验证,发现现有测试存在行为缺口,且MR覆盖率具备实际应用价值。
LDU-Bench:面向不同布局电路背景下光刻缺陷理解的多模态大语言模型评估基准
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出LDU-Bench这一多模态基准,将光刻审查工作流程分解为四项任务,评估发现现有多模态大语言模型的缺陷分类能力无法稳定迁移至下游审查阶段,为工业MLLM评估提供了统一平台。
Comments 12 pages, 3 figures, and 5 tables, including appendices
Axient:杠杆事件市场的链上信用与损失分配——面向交易者、信用提供者、做市商及清算后援的场所无关协议
专题命中 安全评测 :safety(abstract)
AI总结 Axient是面向多角色的场所无关链上信用协议,通过形式化架构与内生模型实现损失分配等机制,实验验证其分层保护等特性,为杠杆事件市场提供解决方案。
Comments 90 pages, 17 figures. Formal protocol design and fixed-seed synthetic agent-based validation; no live Axient or venue data
学习局部感知并与病理学语义临床对齐的放射学报告生成方法
专题命中 安全评测 :alignment(abstract)
AI总结 针对放射学视觉-语言模型的图像-文本对齐缺陷,提出病理学感知对齐框架PALM,结合共享病理学原型与掩码证据建模,在多数据集上提升报告生成与异常鲁棒性
TravKAN:基于Kolmogorov-Arnold网络的快速可解释非线性可通行性分析
专题命中 安全评测 :safety(abstract)
AI总结 本文提出基于Kolmogorov-Arnold网络的TravKAN框架,结合LiDAR反射率手工特征,在公开数据集上性能优于传统深度模型,兼具可解释性与高效性,适用于安全关键的机器人可通行性分析。
Comments This paper has been accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
D-MUTRA:面向多智能体系统的基于分布式账本(DLT)的相互远程证明
专题命中 安全评测 :trustworthy(abstract)
AI总结 针对多智能体系统传统远程证明的局限,本文提出基于区块链的D-MUTRA框架,实现智能体间的持续相互证明,可检测恶意软件修改,且扩展时开销可忽略。
单独无害,联合有害:在自进化大语言模型智能体中利用经验组合
专题命中 安全评测 :safety(abstract)
AI总结 本研究提出EvoBreak攻击,利用自进化LLM智能体的良性经验组合,结合BreakGym生成训练目标,在保持高无害性的同时优于现有攻击,揭示了新的安全风险。