arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-03 至 2026-02-03 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 9 篇

2602.01541 2026-02-03 cs.CV cs.AI 86%

Toward Cognitive Supersensing in Multimodal Large Language Model

迈向多模态大语言模型的认知超感知

Boyi Li, Yifan Shen, Yuanzhe Liu, Yifan Xu, Jiateng Liu, Xinzhuo Li, Zhengyuan Li, Jingyuan Zhu, Yunhan Zhong, Fangzhou Lan, Jianguo Cao, James M. Rehg, Heng Ji, Ismini Lourentzou, Xu Cao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出认知超感知方法,通过整合视觉图像预测头和强化学习阶段,提升多模态大语言模型在复杂认知任务中的表现,展现其在视觉问答基准中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00269 2026-02-03 cs.CV cs.AI 84%

FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering

FaithSCAN: 基于模型的单次幻觉检测用于可靠的视觉问答

Chaodong Tong, Qi Zhang, Chen Li, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences (CAS) and the School of Cyber Security, University of CAS(信息工程研究所、中国科学院(CAS)和安全学院、CAS大学)

专题命中 视觉问答 :visual question answering(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 FaithSCAN通过利用VLMs的内部信号实现高效准确的视觉问答幻觉检测,克服现有方法的效率与鲁棒性限制。

Comments 21 pages, 13 figures, 8 tables. Submitted to IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03194 2026-02-03 cs.CV cs.AI cs.LG 83%

HueManity: Probing Fine-Grained Visual Perception in MLLMs

HueManity: 探索 MLLMs 中的细粒度视觉感知

Rynaa Grover, Jayant Sravan Tamarapalli, Sahiti Yerramilli, Nilay Pande

机构 * Google(谷歌) Waymo

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 HueManity 通过细粒度视觉感知基准测试揭示 MLLMs 在捕捉细粒度视觉细节方面的显著缺陷。

Journal ref ICML 2025 Workshop on Assessing World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00746 2026-02-03 cs.SE cs.CV 83%

Can Vision-Language Models Handle Long-Context Code? An Empirical Study on Visual Compression

视觉-语言模型能处理长上下文代码吗?对视觉压缩的实证研究

Jianping Zhong, Guochang Li, Chen Zhi, Junxiao Han, Zhen Qin, Xinkui Zhao, Nan Wang, Shuiguang Deng, Jianwei Yin

机构 * Zhejiang University(浙江大学) Hangzhou City University(杭州市大学) Shenzhou Aerospace Software Technology Company Limited(神州航天软件技术有限公司)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出LongCodeOCR,通过视觉压缩替代文本压缩,提升长上下文代码任务的性能与效率,同时揭示了视觉压缩在全局依赖支持与保真度之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16403 2026-02-03 cs.CV 79%

ReasonVQA: A Multi-hop Reasoning Benchmark with Structural Knowledge for Visual Question Answering

ReasonVQA: 一个带有结构知识的多跳推理问答基准数据集

Duong T. Tran, Trung-Kien Tran, Manfred Hauswirth, Danh Le Phuoc

机构 * Bosch Center for AI(博世人工智能中心) Technical University of Berlin(柏林技术大学) Fraunhofer FOKUS(弗劳恩霍夫研究所)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 ReasonVQA是一个结合结构知识的多跳推理问答基准数据集,通过生成复杂问题挑战现有VQA模型,推动领域发展。

Comments Accepted at the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06582 2026-02-03 cs.CL cs.AI cs.CV cs.IR cs.LG 67%

TabRAG: Improving Tabular Document Question Answering for Retrieval Augmented Generation via Structured Representations

TabRAG:通过结构化表示改进表格文档问答以增强检索增强生成

Jacob Si, Mike Qu, Michelle Lee, Marek Rei, Yingzhen Li

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 TabRAG通过结构化表示改进表格文档问答,采用布局分割和视觉语言模型解析,提升表格问答性能。

Comments NeurIPS 2025 AI4Tab

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00083 2026-02-03 cs.IR cs.AI cs.CL cs.LG 62%

SPARC-RAG: Adaptive Sequential-Parallel Scaling with Context Management for Retrieval-Augmented Generation

SPARC-RAG:基于上下文管理的自适应顺序-并行扩展用于检索增强生成

Yuxin Yang, Gangda Deng, Ömer Faruk Akgül, Nima Chitsazan, Yash Govilkar, Akasha Tigalappanavara, Shi-Xiong Zhang, Sambit Sahu, Viktor Prasanna

机构 * University of Southern California(南加州大学) Capital One

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 SPARC-RAG通过多代理框架实现顺序与并行扩展的协调,提升检索增强生成在多跳问答中的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00029 2026-02-03 cs.CL cs.AI cs.LG 62%

Construct, Align, and Reason: Large Ontology Models for Enterprise Knowledge Management

构建、对齐与推理:面向企业知识管理的大型本体模型

Yao Zhang, Hongyin Zhu

机构 * Yonyou AI Lab(用友人工智能实验室) Yonyou Network Technology Co., Ltd.(用友网络技术有限公司)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大型本体模型(LOM),通过构建、对齐和推理框架,实现企业知识管理中多源异构数据的整合与复杂语义推理,实验表明其在复杂图推理任务中表现优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01986 2026-02-03 cs.HC 50%

Belief Updating and Delegation in Multi-Task Human-AI Interaction: Evidence from Controlled Simulations

信念更新与委托在多任务人机交互中的作用:来自受控模拟的证据

Shreyan Biswas, Alexander Erlei, Ujwal Gadiraju

专题命中 视觉问答 :visual question answering(abstract)

AI总结 研究发现用户在多任务人机交互中形成路径依赖的期望,保守更新信念,并基于主观信念而非客观性能决定对AI的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏