arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-24 至 2026-02-24 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 8 篇

2602.16412 2026-02-24 cs.CV 83%

ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding

ReMoRa:基于精细运动表示的多模态大语言模型用于长视频理解

Daichi Yashima, Shuhei Kurita, Yusuke Oda, Komei Sugiura

机构 * Keio University(庆应大学) NII(日本信息处理学会) NII LLMC(日本信息处理学会语言模型中心)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 ReMoRa通过精细运动表示实现长视频理解,有效压缩视频数据并提升多模态大语言模型性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10652 2026-02-24 cs.CL 78%

ViTextVQA: A Large-Scale Visual Question Answering Dataset and a Novel Multimodal Feature Fusion Method for Vietnamese Text Comprehension in Images

ViTextVQA: 一个大规模视觉问答数据集和一种新的多模态特征融合方法用于图像中的越南语文本理解

Quan Van Nguyen, Dan Quang Tran, Huy Quang Pham, Thang Kien-Bao Nguyen, Nghia Hieu Nguyen, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen

机构 * Faculty of Information Science and Engineering, University of Information Technology(信息科学与工程学院,信息科技大学) Vietnam National University(越南国家大学)

专题命中 视觉问答 :visual question answering(title,abstract)

AI总结 ViTextVQA是一个大规模视觉问答数据集,提出了一种新的多模态特征融合方法,用于提升图像中越南语文本的理解能力。

Comments International Journal of Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19188 2026-02-24 cs.CV 77%

PositionOCR: Augmenting Positional Awareness in Multi-Modal Models via Hybrid Specialist Integration

PositionOCR: 通过混合专家整合增强多模态模型的位置意识

Chen Duan, Zhentao Guo, Pei Fu, Zining Wang, Kai Zhou, Pengfei Yan

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 PositionOCR通过整合文本定位专家与LLM的上下文能力,提升多模态模型在文本定位和定位任务中的位置准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19356 2026-02-24 cs.CV 74%

Can Vision-Language Models Answer Face to Face Questions in the Real-World?

视觉-语言模型能否在现实世界中回答面对面问题?

Reza Pourreza, Rishit Dagli, Apratim Bhattacharyya, Sunny Panchal, Guillaume Berger, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视觉问答 :vision-language model(title);分类 cs.CV

AI总结 本文提出了一种新的数据集IVD,用于评估视觉-语言模型在现实世界中回答面对面问题的能力,并通过微调减少与人类表现的差距。

Comments ICLR 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19091 2026-02-24 cs.CV 70%

CREM: Compression-Driven Representation Enhancement for Multimodal Retrieval and Comprehension

CREM: 为多模态检索与理解的压缩驱动表示增强

Lihao Liu, Yan Wang, Biao Yang, Da Li, Jiangxia Cao, Yuxiao Luo, Xiang Chen, Xiangyu Wu, Wei Yuan, Fan Yang, Guiguang Ding, Tingting Gao, Guorui Zhou

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 CREM通过压缩驱动的表示增强方法,在提升多模态检索性能的同时保持生成能力,实现生成与嵌入任务的统一优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19240 2026-02-24 cs.AI 57%

Topology of Reasoning: Retrieved Cell Complex-Augmented Generation for Textual Graph Question Answering

推理拓扑:检索细胞复杂度增强的生成用于文本图问题回答

Sen Zhao, Lincheng Zhou, Yue Chen, Ding Zou

机构 * Academy of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学先进交叉学科研究院) School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院) Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴电信设备智能系统部)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出TopoRAG,通过将文本图提升为细胞复杂度,捕捉高维拓扑依赖,提升文本图问题回答的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19224 2026-02-24 cs.CV 57%

Knowledge-aware Visual Question Generation for Remote Sensing Images

面向遥感图像的知识感知视觉问题生成

Siran Li, Li Mi, Javiera Castillo-Navarro, Devis Tuia

机构 * EPFL Switzerland(瑞士联邦理工学院)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 本文提出KRSVQG模型,通过结合外部知识生成更丰富、基于图像和领域知识的问题,提升遥感图像问答系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21990 2026-02-24 cs.CV cs.SD 57%

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

WAVE: 基于多模态大语言模型的学习统一且多功能的音频-视觉嵌入

Changli Tang, Qinfan Xiao, Ke Mei, Tianyi Wang, Fengyun Rao, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯公司)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 WAVE通过联合多模态多任务训练方法,实现了统一且多功能的音频-视觉嵌入,显著提升了跨模态检索和问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏