Exploring and Bridging Knowledge Holes in Unlearned Multimodal Large Language Models
探索与弥合未学习多模态大语言模型中的知识缺口
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 针对未学习多模态大语言模型存在的知识缺口问题,提出带锚定正则化的选择性保护方法,在保障未学习安全性的同时大幅恢复模型响应质量。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
探索与弥合未学习多模态大语言模型中的知识缺口
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 针对未学习多模态大语言模型存在的知识缺口问题,提出带锚定正则化的选择性保护方法,在保障未学习安全性的同时大幅恢复模型响应质量。
CockpitHAT:面向具身多智能体座舱的依赖图驱动分层归因方法
机构 * ByteDance(字节跳动)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 该研究针对LLM多智能体系统的“正确性崩溃”问题,提出CockpitHAT分层归因框架,发布含212条轨迹的CockpitBench基准,在相关基准上超越现有方法,实现可靠故障诊断。
大型语言模型可提高医师准确率,但会导致错误依赖
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本研究开发智能体式检索增强型LLM CORA,发现其可将46名医师的诊断准确率从70.8%提升至82.6%,但存在错误答案获引用支持时医师抵抗大幅下降的安全风险。
FinDeepIndicator:端到端金融指标构建中深度研究智能体的基准测试
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; China Economics and Management Academy, Central University of Finance and Economics(中央财经大学中国经济与管理研究院) ; Asian Institute of Digital Finance, National University of Singapore(新加坡国立大学亚洲数字金融研究所) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 本研究提出首个评估深度研究智能体端到端金融指标构建表现的基准FinDeepIndicator,含多市场数据,实验发现DR智能体优于检索增强LLMs但仍不可靠,为金融领域智能体开发提供参考。
人工智能认知的多维度评估(MAAC):面向基于文本的人工智能系统的过程导向认知评估理论框架
机构 * Wayne State University(韦恩州立大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 针对现有AI评估仅关注结果的局限,本文提出MAAC框架,从九个认知维度对基于文本的AI系统进行过程导向评估,补充了现有结果基准的不足。
观察到谄媚的人工智能认可他人会降低其吸引力,但不会降低其说服力
机构 * Carnegie Mellon University(卡内基梅隆大学) ; New York University(纽约大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 研究探讨提高用户对谄媚人工智能的认知能否防危害,通过两项预注册实验及合并其他研究发现,警告和视频干预虽改变评价,但未降说服力,个体层面干预或难护用户免受人工智能之害。
FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集
机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) ; University of Electronic Science and Technology of China(电子科技大学) ; Tianjin University(天津大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。
从事实到判断:探讨任务框架对对话系统中LLM确信度的影响
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
AI总结 研究探讨了任务框架对LLM在对话系统中判断确信度的影响,发现对话上下文显著改变模型判断,强调了对话框架在评估中的重要性。
Comments 11 pages, 3 figures
Journal ref Proceedings of the 16th International Workshop on Spoken Dialogue System Technology (IWSDS 2026), pages 193-204
突破极端对流检测中的统计相似性陷阱
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 该研究针对深度学习气象模型的统计相似性陷阱,提出DART框架,解决粗粒度大气预报转高分辨率卫星亮温场的挑战,在极端对流检测中表现优异,还通过吉大港洪水案例验证了其现实应用价值。
Comments This paper has been withdrawn due to a complete pivot in research direction and methodology. We have shifted from the atmospheric domain application to a general methodological direction. A new version of this research will be submitted separately
用于红外视觉语言模型定向语义攻击的QR结构化热触发装置
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本研究提出QR-STT框架,作为隐蔽黑盒攻击手段,可定向操控IR-VLMs的语义对齐,其扰动还能跨任务迁移,凸显了对该类攻击进行鲁棒性评估的必要性。
ModelEquivBench:LLM生成优化模型的多关系验证评估系统
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究提出多关系评估系统ModelEquivBench,将其用于评估GPT-5.4等三个LLM生成的优化模型,发现不同模型在特征不同阶段失败,无法简化为单一准确率分数。
Comments 9 pages, 2 figures, 3 tables
IyawoBench v2.0:尼日利亚基层医疗中大型语言模型临床分诊的扩展诊断评估
专题命中 安全评测 :safety(abstract);分类 cs.CY
AI总结 IyawoBench v2.0评估尼日利亚基层医疗的大型语言模型临床分诊,提出含三类失效模式的框架及新指标,发现前沿模型存缺陷,最优模型随部署场景变化,为中低收入国家临床AI选择提供基准。
更快但不同:加速多模态扩散语言模型中的内容漂移诊断与控制
机构 * School of Mathematics and Statistics, Beijing Institute of Technology(北京理工大学数学与统计学院) ; Zhejiang University(浙江大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 该研究针对加速多模态扩散语言模型的内容漂移问题,通过实验诊断出漂移源于过期状态,提出缩短KV缓存刷新区间的控制方法,在1.3倍加速时实现近乎完全一致,且未发现事实错误差异。
Comments 9 pages, 4 figures, 6 tables. Preprint
基准测试并非验证:金融大语言模型应用的系统级视角
机构 * Prometeia S.p.A.(普罗米特亚公司)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 该研究指出金融大语言模型不能仅靠基准测试验证,提出需从系统全栈进行多层验证,还讨论了LLM-as-a-judge的应用与控制措施,强调要研究系统感知基准等相关方向。
大型语言模型(LLMs)的财务推理是否可信?针对长期财务报表的现实测试
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 该研究针对LLMs的财务推理可信度,构建含对抗陷阱的FinIndices基准测试,发现其存在知识与结构瓶颈,监督微调可部分恢复结构化逻辑。
Comments The FinIndices dataset is publicly available at https://huggingface.co/datasets/User158072/Finindice
智能体AI中的OpenClaw与Ollama:迈向完全自主且可扩展的AI智能体系统
机构 * University of the Peloponnese(伯罗奔尼撒大学) ; Cornell University(康奈尔大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 该研究提出智能体AI的分层架构,分析OpenClaw与Ollama组成的全栈系统,验证系统集成可提升智能体能力,指出相关挑战并提供路线图,所有资源公开以支持研究。
质量行动保证:虚拟现实客观结构化临床考试中考官声明的多模态验证
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 研究针对VR儿科OSCEs中考官评分受主观因素影响问题,提出多模态框架QAA,结合约束时间动作对齐模型与大语言模型,通过对比动作与真实事件序列验证考官声明,提升了评估的公平性。
通过门控语义质量多样性实现自我进化智能体的驾驭
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
AI总结 研究大语言模型智能体驾驭因素提升性能的问题,提出自我进化智能体驾驭框架,将提出与评估更改分开,通过门控存档避免过度拟合,在多领域测试中取得较好泛化效果,证明诊断与评估循环的有效性。
Comments 9 pages, 4 figures, 3 tables
临床医生级别的一致性缺乏临床谨慎:LLM评估者在医学AI基准测试中的局限性
机构 * University of Luebeck(吕贝克大学) ; University of Tübingen(图宾根大学) ; University Hospital Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医院) ; University Hospital Würzburg(维尔茨堡大学医院) ; Charité – Universitätsmedizin Berlin(柏林夏里特医学院) ; Genie Enterprise Deutschland GmbH
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 针对德语开放回答临床基准MedQADE,评估LLM评估者与医生的对齐程度,发现统计一致性高但缺乏临床元认知,且存在系统性的模型谱系偏差。
对大型语言模型中社会期望反应进行量化与缓解:一种匹配可欲性的等级强制选择心理测量研究
机构 * The University of Tokyo(东京大学) ; Kobe University(Kobe大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 本文提出了一种心理测量框架,用于量化和缓解LLM问卷评估中的社会期望反应偏差,通过匹配可欲性来减少偏差并保持目标特征的恢复。
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Volume 1: Long Papers, pp. 40148-40166
HARGO:面向HPC任务的LLM RL后训练的异质性感知奖励引导优化
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 针对HPC任务的LLM RL后训练的异质性问题,提出HARGO方法,通过置信度调制优势实现逐响应重要性加权,在四项HPC任务的三项核心指标上均取得最优性能。
将人工智能融入软件工程教育中的需求质量学习:一项基于TPACK的实证研究
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究针对软件工程教育中AI融入需求质量学习的需求,基于TPACK框架将多智能体AI工具融入硕士级RE作业,通过混合方法验证了其在提升学生需求质量认知等方面的作用,为相关AI融入设计提供了指导。
Comments 11 pages, 6 figures, 3 tables, presented in the 38th CSEE&T in Florence, Italy, from July 20-22, 2026
针对AI引发的同质化问题实现个性化研究构思的多样化
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究针对AI辅助研究构思的同质化问题,提出DivAlign四阶段流程,在保留研究者-方向适配性的同时降低社区研究组合冗余,相关成果代码与数据已公开。
ClawTrack:面向真实世界智能体的追踪级评估与改进
机构 * Meituan(美团)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本研究针对现有智能体评估仅看结果的缺口,提出双评估基准ClawTrack,含320个任务及过程评分器,评估21个模型后发现其可归因推理、验证结果验证瓶颈等,助力智能体改进。
不要凭直觉部署AI智能体:能力并非生产就绪
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究针对AI智能体部署依赖能力而非生产就绪性的问题,提出ProofAgent Index(PAI)这一四维度治理就绪指标,经医疗、金融领域验证可区分风险,实现从直觉部署到可审计决策的转变。
Comments 24
面向视觉语言赋能的无人机分类与灾害响应的系统工程框架
机构 * University of Arkansas(阿肯色大学) ; University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 该研究提出将视觉语言模型(VLMs)作为协同智能体嵌入人-无人机回路的系统工程框架,经评估可降低人因负担、提升AI信任度,推进了高风险灾害响应的人-自主系统协同。
Comments 10 pages, 8 figures. Author accepted manuscript of AIAA Paper 2026-4010, published in the AIAA AVIATION 2026 Forum
Journal ref AIAA AVIATION 2026 Forum, AIAA Paper 2026-4010, 2026
EvoCause:基于大语言模型引导的因果图进化的根本原因分析
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 EvoCause 用 LLM 优化因果图以提升电信等系统的根本原因分析性能,发布了 TeleRCA 基准,在合成数据和真实网络数据上均优于基线方法。
Digital Harf:用于普及型阿拉伯语言语和语言治疗的临床整合多模态AI系统
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 Digital Harf是专为阿拉伯语自闭症儿童设计的多模态AI治疗平台,其核心Agentic合成数据引擎解决阿拉伯语治疗内容短缺问题,获专家高接受率,为代表性语言环境构建AI治疗系统提供了思路。
Vibe-FDTR:一种面向智能体的可复现频域热反射数据分析框架
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 Vibe-FDTR是面向智能体的FDTR数据分析框架,结合领域代码包与智能体技能,在基准测试中表现优异,可降低计算成本与执行时间,助力低门槛可信热计量。
多模态空间推理的视觉信用审计
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究提出视觉信用审计(VCA)方法,分解多模态空间推理基准的成功维度,发现部分模型决策正确但未获图像额外信用,验证了其在评估模型视觉关系响应上的有效性。
Comments 20 pages, 2 figures. Code: https://github.com/SouthWinter/VCA