Semantic Composition in Visually Grounded Language Models
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.LG
Comments Carnegie Mellon University Senior Thesis. arXiv admin note: substantial text overlap with arXiv:2212.10549
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.LG
Comments Carnegie Mellon University Senior Thesis. arXiv admin note: substantial text overlap with arXiv:2212.10549
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Technical report in WSDM Cup 2023
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments 12 pages, 7 figures
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments CIKM2022 camera ready version
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments 10 pages, 5 figures
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2021
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments 9 pages
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.LG
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2019
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Published at ICCV'2019
Journal ref The IEEE International Conference on Computer Vision (ICCV) 2019
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments EMNLP 2019
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments ICCV 2019 accepted paper
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments 11 pages, 7 figures
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
面向忠实且高效的语义通信:一种本体论方法
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract)
AI总结 针对多视图VQA任务,提出ODSC本体驱动语义通信框架,通过共享本体知识库优化场景图,可减少SI数据量、提升问答准确率及多视图VQA准确率。
FashionKG-RAG:面向时尚问答的知识图谱增强检索增强生成
专题命中 视觉问答 :grounding(abstract,abstract_cn)
AI总结 针对现有时尚知识图谱的局限性,本文提出全领域知识图谱FashionEcoKG,并开发无需训练的PG-RAG框架,通过双粒度路径重排序模块提升时尚问答的检索与答案准确性,效果优于多种基线方法。
答案保留型攻击下的模型置信度:信息性-可操纵性前沿
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract)
AI总结 该研究针对答案保留型攻击,发现视觉-语言系统的置信度信号不具备固有鲁棒性,四类防御均无效,协调攻击可大幅降低置信度门控下的接受准确率。
基于大语言模型的视觉编码器分层预训练
机构 * University of Cincinnati(辛辛那提大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出HIVE框架,通过引入视觉编码器与大语言模型间的分层交叉注意力机制,提升视觉语言对齐,改进特征融合与表征学习,实验表明其在图像分类和多模态任务中表现优异。
Comments 17 pages, 14 figures, accepted to Computer Vision and Pattern Recognition Conference (CVPR) Workshops 2026. 5th MMFM Workshop: What is Next in Multimodal Foundation Models?
Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 7415-7424) 2026
K12-KGraph:一种对齐课程的图谱用于基准测试和训练教育大语言模型
机构 * Peking University(北京大学) ; Institute for Advanced Algorithms Research(先进算法研究所) ; OriginHub Technology(OriginHub技术) ; Zhongguancun Academy(中关村学院)
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract)
AI总结 本文提出K12-KGraph,基于中小学教材构建的课程对齐知识图谱,用于构建多选基准测试K12-Bench和训练数据集K12-Train,验证课程结构监督在教育模型训练中的高效性。
不确定性并非临床VQA的安全网,但它能预测模型失败吗?
机构 * Amsterdam University Medical Center, University of Amsterdam(阿姆斯特丹大学医学中心) ; Amsterdam Public Health(阿姆斯特丹公共卫生) ; LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn)
AI总结 研究临床视觉语言模型的不确定性估计是否可靠,发现其质量随模型准确率变化,在模型脆弱时失效,但能预测扰动下的性能崩溃。
Comments 17 pages, 4 figures
将具身问答从感知扩展到决策
机构 * Peking University(北京大学) ; XYZ Embodied AI(XYZ具身AI)
专题命中 视觉问答 :VLM(abstract,abstract_cn)
AI总结 提出大规模具身问答数据集EQA-Decision和基线模型RoboDecision,系统覆盖静态场景构建、空间理解、任务动态推理和即时决策四个维度,以统一框架评估具身环境中的感知、推理和行动级决策。
Comments 11 pages,4 figures
一种用于柬埔寨检索增强问答的语言模型比较研究
机构 * Department of Computer Science, Chungbuk National University(Chungbuk National University 计算机科学系) ; Department of Big Data, Chungbuk National University(Chungbuk National University 大数据系) ; General Department of Information and Communication Technology, Ministry of Post and Telecommunications(邮电部信息和通信技术总局) ; Department of Management Information Systems, Chungbuk National University(Chungbuk National University 管理信息系统系) ; BigDatalabs Co., Ltd(BigDatalabs 公司)
专题命中 视觉问答 :grounding(abstract,abstract_cn)
AI总结 本文针对低资源非拉丁语种柬埔寨语言,比较了多种语言模型在检索增强问答任务中的性能,发现检索器选择是影响效果的关键因素,生成器在不同指标上表现各异。
Comments 14 pages, 1 figure,
大语言模型的瓶颈:为何开源视觉大语言模型在层级视觉识别上遇到困难
机构 * Boston University(波士顿大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文指出开源大语言模型缺乏对视觉世界的层级知识,导致视觉大语言模型在识别如水母鱼但无法识别脊椎动物时存在瓶颈,通过构建六种分类学和四个图像数据集的百万级多项选择视觉问答任务验证了这一问题。
Comments Accepted to CVPR 2026. Project page and code: https://yuanqing-ai.github.io/llm-hierarchy/
SEA-Vision:面向东南亚的多语言综合文档和场景文本理解基准
机构 * Xiamen University, China(厦门大学,中国) ; Shopee, China(Shopee,中国) ; Tongji University, China(同济大学,中国)
专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract)
AI总结 SEA-Vision提出一个多语言基准,用于评估文档解析和文本中心视觉问答,涵盖11种东南亚语言,包含15234页文档和7496对问答对,揭示多语言文档理解的差距。
Comments Accepted By CVPR2026
自然语言基础的思维社会中的风暴
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文探讨了基于自然语言的思维社会(NLSOMs)的结构和应用,通过多代理系统解决多种AI任务,并提出未来研究方向。
Comments published in Computational Visual Media Journal (CVMJ); 9 pages in main text + 7 pages of references + 38 pages of appendices, 14 figures in main text + 13 in appendices, 7 tables in appendices
Journal ref (2025). Computational Visual Media, 11(1), 29-81
ExStrucTiny:一种用于从文档图像中进行模式变量结构信息提取的基准
机构 * J.P. Morgan AI Research(摩根大通人工智能研究)
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract)
AI总结 ExStrucTiny是一个新的文档图像结构信息提取基准,通过结合手动和合成样本,涵盖更多多样化的文档类型和提取场景,旨在提升通用模型在结构化信息提取中的性能。
Comments EACL 2026, main conference