Feature-Aware Test Generation for Deep Learning Models
面向深度学习模型的特征感知测试生成
专题命中 视觉定位与Grounding :vision-language model(abstract)
AI总结 本文提出Detect框架,通过特征感知扰动生成高质量测试用例,揭示模型中的捷径行为和未被准确度指标捕捉的bug,提升深度学习模型的可靠性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
面向深度学习模型的特征感知测试生成
专题命中 视觉定位与Grounding :vision-language model(abstract)
AI总结 本文提出Detect框架,通过特征感知扰动生成高质量测试用例,揭示模型中的捷径行为和未被准确度指标捕捉的bug,提升深度学习模型的可靠性。
BACH-V: 联结抽象与具体的人类价值观在大语言模型中
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 BACH-V研究通过探测和引导方法揭示大语言模型中抽象与具体价值观的联结机制,发现其能稳定锚定抽象价值观以影响具体决策。
Comments 34 pagess, 16 figures, 6 tables, submitted to ACL 2026
OpenLearnLM基准:一个评估教育大型语言模型知识、技能和态度的统一框架
机构 * Chosun University(chosun大学) ; Korea University(韩国大学) ; Ewha Womans University(成均馆大学) ; Korea Institute for Curriculum and Evaluation(韩国课程评价院) ; Seoul National University(首尔国立大学) ; Texas A&M University(德克萨斯农工大学) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 OpenLearnLM基准通过统一框架评估教育大型语言模型的知识、技能和态度,揭示不同模型在多维度上的能力差异。
自然语言中词语的多维神经表征
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本研究通过心理语言学建模与fMRI结合,揭示了词语多维属性在自然语言理解中的神经表征,发现八个潜在维度支持不同的认知功能。
Comments 65 pages, 7 figures
RAC:基于检索的澄清以实现可靠的对话搜索
机构 * Sorbonne Université, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎) ; Ecole nationale Supérieure d’Informatique (ESI), Algeria(信息技术国家高等学院(ESI)、阿尔及利亚) ; AgroParisTech, UMR MIA-PS, Palaiseau, France(农业巴黎技术学院、UMR MIA-PS、法国帕莱索)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 RAC通过检索增强的方法生成基于语料库的澄清问题,提高对话搜索的准确性与可靠性。
Comments This is the author's version of the work. The definitive version is published in: Proceedings of the 48th European Conference on Information Retrieval (ECIR '26), 29 March--2 April, 2026, Delft, Netherlands
ChartComplete: 基于分类的包容性图表数据集
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 ChartComplete数据集基于图表分类学,涵盖30种图表类型,为多模态大语言模型提供新的基准测试资源。
Comments 7 pages, 4 figures, 3 tables, 1 algorithm. Dataset and source code available at https://github.com/AI-DSCHubAUB/ChartComplete-Dataset
AirHunt: 通过融合视觉语言模型语义与连续规划实现高效空中物体导航
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) ; Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) ; Department of Physics, Southern University of Science and Technology(南方科技大学物理系)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI
AI总结 AirHunt通过融合视觉语言模型语义与连续规划,实现高效空中物体导航,提升开放集物体定位的准确性和效率。
基于语言的群体感知:通过自然语言描述实现去中心化的人员重识别
机构 * IRIDIA, Université libre de Bruxelles(IRIDIA,布鲁塞尔自由大学) ; Toyota Motor Europe(丰田欧洲 motors)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
AI总结 本文提出一种基于自然语言的去中心化人员重识别方法,通过视觉-语言模型生成文本描述,实现群体协作识别与可解释性提升。
零样本适应性任务规划用于自主建造机器人:轻量级单 agent 和多 agent 系统的比较研究
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI
AI总结 本研究通过比较轻量级单 agent 和多 agent 系统,探索了零样本适应性任务规划在自主建造机器人中的应用,展示了四 agent 团队在效率和成本上的优势。
压缩以聚焦:面向多轮GUI代理的高效坐标压缩政策优化
机构 * HiThink Research(HiThink研究院) ; University of California, Irvine(加州大学尔湾分校) ; Hangzhou Dianzi University(杭州电子科技大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 本文提出CCPO框架,通过坐标感知空间压缩和基于距离的优势函数,实现多轮GUI代理的高效政策优化,达到SOTA性能并显著提升压缩效率与训练速度。
视觉语言模型中的代理鲁棒性可以轻易转移
机构 * Chongqing Key Laboratory of Bio-perception(重庆生物感知实验室) ; Multimodal Intelligent Information Processing, Chongqing University, Chongqing 401331, China(多模态智能信息处理,重庆大学,重庆401331,中国) ; School of Microelectronics(微电子学院) ; Communication Engineering, Chongqing University, Chongqing 401331, China(通信工程,重庆大学,重庆401331,中国) ; School of Data Science, Lingnan University, Hong Kong(数据科学学院,岭南大学,香港)
专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出HPT-GPD框架,通过异构代理转移提升视觉语言模型的对抗鲁棒性,同时缓解过拟合问题,增强零样本自然泛化能力。
VILTA:一种用于增强驾驶策略鲁棒性的视觉语言模型闭环对抗者
专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision language model(abstract);分类 cs.CV
AI总结 VILTA通过整合视觉语言模型到闭环训练中,提升自动驾驶策略在长尾事件中的安全性和鲁棒性。
Comments Accepted to AAAI 2026
基于语义解耦的两阶段雨天攻击:揭示视觉-语言模型在天气鲁棒性方面的缺陷
机构 * Chengyin Hu(独立研究者) ; Xiang Chen(独立研究者) ; Zhe Jia(独立研究者) ; Weiwen Shi(独立研究者) ; Fengyu Zhang(独立研究者) ; Jiujiang Guo(独立研究者) ; Yiwei Wei(独立研究者)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种基于语义解耦的两阶段雨天攻击框架,揭示了视觉-语言模型在天气鲁棒性方面的缺陷。
视觉-语言模型中的对抗防御:概述
机构 * School of Microelectronics and Communication Engineering(微电子与通信工程学院) ; Chongqing University(重庆大学) ; Chongqing, China(中国重庆)
专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI
AI总结 本文综述了视觉-语言模型对抗防御的最新进展,探讨了三种主要防御范式及其优缺点,旨在提升模型的鲁棒性。
面向大规模和小规模模型的不确定性感知协作系统用于多模态情感分析
机构 * School of Computer Science, South China Normal University(计算机科学学院,华南师范大学) ; School of Artificial Intelligence, South China Normal University(人工智能学院,华南师范大学) ; School of Electronics and Information Technology, Sun Yat-sen University(电子与信息工程学院,中山大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG
AI总结 本文提出U-ACS系统,通过整合UBM与MLLMs,利用不确定性感知机制提升多模态情感分析的效率与性能。
SpatialBench-UC: 文本到图像生成中空间提示遵循的不确定性感知评估
机构 * ESIEA
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI
AI总结 SpatialBench-UC通过评估文本到图像生成中空间提示遵循的不确定性,提出了一个可重复的基准测试,以提高模型在空间指令下的表现和置信度评估。
Comments 19 pages, includes figures and tables
多阶段验证导向框架用于缓解多模态RAG中的幻觉
机构 * The University of New South Wales(新南威尔士大学)
专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.AI
AI总结 本文提出了一种多阶段验证导向框架,通过优先考虑事实准确性和真实性来缓解多模态RAG中的幻觉问题,并在KDD Cup 2025中取得第三名。
Comments KDD Cup 2025 Meta CRAG-MM Challenge: Third Prize in the Single-Source Augmentation Task
统一无源领域适应
机构 * Institute of Machine Intelligence, University of Shanghai for Science and Technology(上海理工大学机器智能研究院) ; TAMS Group, Department of Informatics, Universität Hamburg(汉堡大学信息学院TAMS小组) ; School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出CausalDA,从因果性角度解决统一无源领域适应问题,通过预训练视觉-语言模型和信息瓶颈提升模型鲁棒性,在多种SFDA场景中取得新成果。
IIR-VLM:面向大视觉-语言模型的上下文实例识别
机构 * Northeastern University(东北大学) ; Wyze Labs, Inc.(Wyze实验室)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(title);分类 cs.CV
AI总结 IIR-VLM通过整合预训练的ILR专家模型,提升大视觉-语言模型在上下文实例识别中的性能,有效解决细粒度辨别问题。
面向自主网络的基于视觉语言模型的优化驱动意图处理
机构 * School of Computing, Queen's University, Ontario, Canada(计算学院,女王大学,安大略,加拿大)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI
AI总结 本文提出IntentOpt基准测试,评估不同视觉语言模型在生成网络优化代码中的性能,发现视觉参数提取和程序化思维提示显著降低执行成功率,开源模型表现低于闭源模型。
Comments Accepted for presentation at The IEEE International Conference on Communications (ICC) 2026
可迁移的模型无关视觉-语言模型适应方法用于高效的弱到强泛化
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 TransMiter是一种轻量级适配器,通过无监督方式提升视觉-语言模型的泛化能力,实现高效的知识迁移。
Comments AAAI2026 Oral (camera ready version)
SparseOccVLA: 通过稀疏查询弥合占用与视觉语言模型之间的鸿沟,实现统一的4D场景理解和规划
机构 * Huazhong University of Science and Technology(华中科技大学) ; Xiaomi EV(小米电动车) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI
AI总结 SparseOccVLA通过稀疏查询整合视觉语言模型与语义占用,实现统一的4D场景理解和规划,提升自动驾驶性能。
少即是多——直到它破裂:大视觉-语言模型中视觉标记压缩的安全隐患
机构 * Griffith University(格里菲斯大学) ; University of Technology Sydney(悉尼技术大学) ; University of Utah(犹他大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI
AI总结 本研究揭示了视觉标记压缩在大视觉-语言模型中显著降低鲁棒性的问题,并提出压缩感知攻击以系统研究该漏洞。
从感知到 punchline:通过野生表情包艺术赋能 VLM
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; School of Software Engineering(软件工程学院) ; Columbia Engineering(哥伦比亚工程学院) ; Columbia University(哥伦比亚大学) ; The Chinese University of Hong Kong MMLab(香港中文大学MMLab)
专题命中 VLM训练与架构 :VLM(title);分类 cs.LG
AI总结 HUMOR 通过分层推理和群体偏好对齐,提升 VLM 在多模态生成中的推理多样性与幽默质量。
Comments 46 pages, 20 figures
器官感知注意力提升CT分诊与分类
机构 * Duke University(杜克大学) ; University of Arizona(亚利桑那大学)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 ORACLE-CT通过器官感知注意力和标量融合方法,在胸部和腹部CT分诊中实现最先进的分类性能。
PREGEN:在合成视频检索中揭示潜在思想
机构 * Bosch Center for AI(博世人工智能中心) ; INSIGHT Lab(洞察实验室) ; Ben-Gurion University of the Negev(巴伊兰大学内盖夫分校)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 PREGEN通过结合预训练VLM和轻量级编码模型,高效解决合成视频检索问题,显著提升检索性能和泛化能力。
Histopath-C: 向 histopathology 视觉-语言适应的现实领域偏移迈进
机构 * LIVIA, ÉTS Montreal, Canada International Laboratory on Learning Systems (ILLS)(LIVIA,蒙特利尔工程学院,加拿大国际学习系统实验室)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 Histopath-C通过引入现实合成损坏的基准和LATTE策略,提升组织病理学图像的视觉-语言适应鲁棒性。
Comments Accepted to WACV 2026
NeuralFur: 从多视角图像中重建动物毛发
机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ETH Zürich(苏黎世联邦理工学院) ; Technical University of Darmstadt(德累斯顿技术大学) ; University of Tübingen(图宾根大学)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV
AI总结 NeuralFur通过视觉语言模型指导多视角图像重建,实现不同动物的高保真3D毛发建模。
Comments For additional results and code, please refer to https://neuralfur.is.tue.mpg.de
SemAlign:语言引导的半监督领域泛化
机构 * University of Moratuwa(穆塔瓦大学)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV
AI总结 SemAlign通过将模型中间特征与视觉语言模型的语义特征空间对齐,结合增强和正则化策略,提升半监督领域泛化的性能。
Comments 15 pages, 6 figures
通过知识性经验学习对齐代理世界模型
机构 * Zhejiang University(浙江大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。
Comments Ongoing work