arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3153 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3153 篇

2601.10744 2026-03-24 cs.AI cs.CV 62%

Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration

探索与长期记忆:一个基准和基于多模态LLM的强化学习框架用于具身探索

Sen Wang, Bangwei Liu, Zhenkun Gao, Lizhuang Ma, Xuhong Wang, Yuan Xie, Xin Tan

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LMEE框架,通过多模态LLM强化学习促进终身学习,构建LMEE-Bench基准评估具身探索过程与结果,采用MemoryExplorer方法提升记忆检索与主动探索能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13366 2026-03-17 cs.CV cs.AI 62%

Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding

在不确定性中思考:通过潜在熵感知解码减轻MLRMs中的幻觉

Zhongxing Xu, Zhonghua Wang, Zhe Qian, Dachuan Shi, Feilong Tang, Ming Hu, Shiyan Su, Xiaocheng Zou, Wei Feng, Dwarikanath Mahapatra, Yifan Peng, Mingquan Lin, Zongyuan Ge

机构 * Monash University(墨尔本大学) Georgia Tech(佐治亚理工学院) Cornell University(康奈尔大学) Northeastern University(东北大学) Khalifa University(卡利法大学) University of Minnesota(明尼苏达大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过潜在熵感知解码策略减轻多模态大推理模型中的幻觉问题,利用语义上下文增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10722 2026-03-17 cs.CV cs.AI 62%

UAV traffic scene understanding: A regulation embedded multi-modal network and a unified benchmark

无人机交通场景理解:一种嵌入监管的多模态网络和一个统一的基准

Yu Zhang, Zhicheng Zhao, Ze Luo, Chenglong Li, Jin Tang

机构 * Computer Network Information Center, Chinese Academy of Sciences, Beijing 100190, China(中国科学院计算机网络信息中心,北京100190,中国) University of Chinese Academy of Sciences, Beijing 100190, China(中国科学院大学,北京100190,中国) Anhui Provincial Key Laboratory of Multi-modal Cognitive Computation, Anhui University, Hefei 230601, China(安徽省多模态认知计算重点实验室,安徽大学,合肥230601,中国) Information Materials and Intelligent Sensing Laboratory of Anhui Province, Anhui University, Hefei 230601, China(安徽省信息材料与智能感知实验室,安徽大学,合肥230601,中国)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MTCNet多模态交通认知网络,通过原型引导知识嵌入模块和质量感知光谱补偿模块,提升无人机交通场景理解的鲁棒性,并构建首个大规模光学-热红外基准Traffic-VQA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00150 2026-03-16 cs.CV cs.AI cs.CE cs.MM 62%

FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications

FCMBench: 首个大规模金融信用多模态基准用于实际应用

Yehui Yang, Dalu Yang, Fangxin Shang, Wenshuo Zhou, Jie Ren, Yifan Liu, Haojun Fei, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(奇富科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 FCMBench是首个大规模且隐私合规的多模态基准,涵盖金融信用应用中的任务和鲁棒性挑战,包含26种证书类型、5198张隐私合规图像和13806对VQA样本,评估模型在现实干扰下的感知与推理任务,揭示现代视觉语言模型的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18507 2026-03-16 cs.CV cs.AI 62%

Multimodal Continual Learning with MLLMs from Multi-scenario Perspectives

多场景视角下的多模态持续学习与MLLMs

Kai Jiang, Siqi Huang, Xiangyu Chen, Jiawei Shao, Hongyuan Zhang, Ping Luo, Xuelong Li

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UNIFIER框架,通过视觉表征扩展和视觉一致性约束解决多场景下的持续学习问题,提升跨场景视觉问答和F1分数。

Comments 22 pages, 17 figures. This is a preprint version of a paper submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00312 2026-03-10 cs.AI cs.LG 62%

How Well Do Multimodal Models Reason on ECG Signals?

多模态模型在心电图信号上的推理能力如何?

Maxwell A. Xu, Harish Haresamudram, Catherine W. Liu, Patrick Langer, Jathurshan Pradeepkumar, Wanting Mao, Sunita J. Ferns, Aradhana Verma, Jimeng Sun, Paul Schmiedmayer, Xin Liu, Daniel McDuff, Emily B. Fox, James M. Rehg

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Rush University(拉什大学) ETH Zurich(苏黎世联邦理工学院) St. Christopher's Hospital for Children(圣克里斯opher儿童医院) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Google Inc(谷歌公司)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种评估多模态模型在ECG信号上推理能力的框架,通过感知和演绎两个方面验证模型的逻辑和模式识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13795 2026-03-10 cs.CV cs.AI 62%

Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs

Bee:一个高质量语料库和全栈工具包,解锁高级完全开放的多模态大语言模型

Yi Zhang, Bolin Ni, Xin-Sheng Chen, Heng-Rui Zhang, Yongming Rao, Houwen Peng, Qinglin Lu, Han Hu, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Tencent Hunyuan Team(腾讯文英团队)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Bee通过高质量数据集和全栈工具包,提升完全开放多模态大语言模型的性能,达到与半开放模型相当甚至超越的水平。

Comments homepage: https://open-bee.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09486 2026-03-10 cs.CV cs.AI cs.MM 62%

Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding

视频-EM:面向长视频理解的事件中心型片段记忆

Yun Wang, Long Zhang, Jingren Liu, Jiaqi Yan, Zhanjie Zhang, Jiahao Zheng, Ao Ma, Run Ling, Xun Yang, Dapeng Wu, Xiangyu Chen, Xuelong Li

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Tianjin University(天津大学) Nanjing University(南京大学) Zhejiang University(浙江大学) The Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所(TeleAI))

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 Video-EM通过事件中心型片段记忆框架,将长视频问答转化为事件构建与记忆细化,提升长视频理解的连贯性与可靠性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01646 2026-03-09 cs.CL cs.AI cs.LG 62%

ESGenius: Benchmarking LLMs on Environmental, Social, and Governance (ESG) and Sustainability Knowledge

ESGenius:对环境、社会和治理(ESG)及可持续性知识的LLM基准测试

Chaoyue He, Xin Zhou, Yi Wu, Xinjia Yu, Yan Zhang, Lei Zhang, Di Wang, Shengfei Lyu, Hong Xu, Xiaoqiao Wang, Wei Liu, Chunyan Miao

机构 * Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性公司实验室) Alibaba Group(阿里巴巴集团)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 ESGenius是首个针对LLM在ESG及可持续性知识评估的综合问答基准,通过RAG方法显著提升模型性能。

Comments EMNLP'25 Main Oral (42 pages, 10 figures, 11 tables), Nominations for Resource Award & Theme Paper Award

Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pages 14612-14653

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03160 2026-03-06 cs.CV cs.AI 62%

SpineBench: A Clinically Salient, Level-Aware Benchmark Powered by the SpineMed-450k Corpus

SpineBench:一种临床显著、层级感知的基准,由SpineMed-450k语料库驱动

Ming Zhao, Wenhui Dong, Yang Zhang, Xiang Zheng, Zhonghao Zhang, Zian Zhou, Yunzhi Guan, Liukun Xu, Wei Peng, Zhaoyang Gong, Zhicheng Zhang, Dachuan Li, Xiaosheng Ma, Yuli Ma, Jianing Ni, Changjiang Jiang, Lixia Tian, Qixin Chen, Kaishun Xia, Pingping Liu, Tongshun Zhang, Zhiqiang Liu, Zhongyan Bi, Chenyang Si, Tiansheng Sun, Caifeng Shan

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SpineBench通过SpineMed-450k语料库驱动,针对脊柱疾病提供临床显著的层级感知基准,评估模型在多模态数据下的细粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01104 2026-03-03 cs.HC cs.AI cs.CV cs.CY 62%

Egocentric Co-Pilot: Web-Native Smart-Glasses Agents for Assistive Egocentric AI

第一人称共驾:面向辅助第一人称AI的网页原生智能眼镜代理

Sicheng Yang, Yukai Huang, Weitong Cai, Shitong Sun, Fengyi Fang, You He, Yiqiao Xie, Jiankang Deng, Hang Zhang, Jifei Song, Zhensong Zhang

机构 * Shenzhen International Graduate School Tsinghua University Shenzhen China(深圳国际研究生院清华大学深圳中国) Independent Researcher London United Kingdom(独立研究者伦敦英国) Queen Mary University of London London United Kingdom(女王玛丽大学伦敦英国) Imperial College London London United Kingdom(帝国理工学院伦敦英国) University Of Surrey Guildford United Kingdom(Surrey大学Guildford英国)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 Egocentric Co-Pilot通过网页原生智能眼镜代理实现第一人称AI的持续辅助,结合神经符号框架和多模态意图层,展示了在日常生活中提升可及性和情境感知的实用路径。

Comments 14 pages, 6 figures, WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00511 2026-03-03 cs.CV cs.LG 62%

Multimodal Adaptive Retrieval Augmented Generation through Internal Representation Learning

多模态自适应检索增强生成通过内部表示学习

Ruoshuang Du, Xin Sun, Qiang Liu, Bowen Song, Zhongqi Chen, Weiqiang Wang, Liang Wang

机构 * Shanghaitech University School of Information Science(上海科技大学信息科学学院) Chinese Academy of Sciences Institute of Automation(中国科学院自动化研究所)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 本文提出MMA-RAG,通过动态评估模型内部知识置信度,提升视觉问答系统在多模态场景下的检索增强生成性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00462 2026-03-03 cs.CV cs.AI 62%

OPGAgent: An Agent for Auditable Dental Panoramic X-ray Interpretation

OPGAgent: 一种用于可审计牙科全景X光解读的智能体

Zhaolin Yu, Litao Yang, Ben Babicka, Ming Hu, Jing Hao, Anthony Huang, James Huang, Yueming Jin, Jiasong Wu, Zongyuan Ge

机构 * AIM for Health Lab Faculty of Information Technology, Monash University(信息科技学院,莫纳什大学) Monash University(莫纳什大学) Curae Health Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) National University of Singapore(新加坡国立大学) Southeast University(东南大学)

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 OPGAgent是一种用于可审计牙科全景X光解读的智能体系统,通过多工具协调和共识机制,在结构化报告和VQA评估中优于现有牙科VLMs和医疗智能体框架。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00041 2026-03-03 cs.CV cs.AI 62%

Culture In a Frame: C$^3$B as a Comic-Based Benchmark for Multimodal Culturally Awareness

文化在框架中:C$^3$B作为基于漫画的多模态文化意识基准

Yuchen Song, Andong Chen, Wenxin Zhu, Kehai Chen, Xuefeng Bai, Muyun Yang, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 C$^3$B是一个基于漫画的多模态文化意识基准,旨在评估和提升多语言、多任务和多文化环境下MLLMs的文化理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21142 2026-02-25 cs.CV cs.LG 62%

LUMEN: Longitudinal Multi-Modal Radiology Model for Prognosis and Diagnosis

LUMEN: 长期多模态放射学模型用于预后和诊断

Zhifan Jiang, Dong Yang, Vishwesh Nath, Abhijeet Parida, Nishad P. Kulkarni, Ziyue Xu, Daguang Xu, Syed Muhammad Anwar, Holger R. Roth, Marius George Linguraru

机构 * 1 Sheikh Zayed Institute for Pediatric Surgical Innovation, Children's National Hospital, Washington DC, USA 2 Nvidia Corporation, Santa Clara, CA, USA 3 ETSI Telecomunicaci\' o n, Universidad Polit\' e cnica de Madrid, Madrid, Spain 4 School of Medicine Health Sciences, George Washington University, Washington DC, USA

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 LUMEN模型通过多任务指令微调提升纵向放射影像的诊断与预后能力。

Comments Accepted to IEEE International Symposium on Biomedical Imaging (ISBI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14201 2026-02-23 cs.CV cs.AI 62%

GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery

GeoEyes: 面向超高清遥感影像证据驱动理解的按需视觉聚焦

Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yifan Zhang, Long Lan, Xue Yang, Hongda Sun, Yulin Wang, Di Wang, Jun Song, Jing Zhang, Bo Du

机构 * National University of Defense Technology, China(国防科技大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) University of the Chinese Academy of Sciences, China(中国科学院大学) Shanghai Jiao Tong University, China(上海交通大学) Wuhan University, China(武汉大学) Chinese Academy of Science, China(中国科学院) Tsinghua University, China(清华大学) Renmin University of China, China(中国人民大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 GeoEyes通过分阶段训练框架,结合冷启动数据集和代理强化学习方法,解决超高清遥感影像中证据获取不足的问题,提升视觉问答任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13662 2026-02-23 cs.CV cs.AI 62%

LeafNet: A Large-Scale Dataset and Comprehensive Benchmark for Foundational Vision-Language Understanding of Plant Diseases

LeafNet:一个大规模数据集和全面基准,用于植物病害的基础视觉-语言理解

Khang Nguyen Quoc, Phuong D. Dao, Luyl-Da Quach

机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) Department of Integrative Biology, The University of Texas at Austin(德克萨斯大学奥斯汀分校整合生物学系) Department of Software Engineering, FPT University(FPT大学软件工程系)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 LeafNet通过大规模多模态数据集和基准测试,揭示了VLMs在植物疾病理解中的性能差异,强调了多模态架构在提升诊断精度中的关键作用。

Comments 26 pages, 13 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14879 2026-02-20 cs.CV cs.AI 62%

CT-Bench: A Benchmark for Multimodal Lesion Understanding in Computed Tomography

CT-Bench:一种用于CT中多模态病变理解的基准测试

Qingqing Zhu, Qiao Jin, Tejas S. Mathai, Yin Fang, Zhizheng Wang, Yifan Yang, Maame Sarfo-Gyamfi, Benjamin Hou, Ran Gu, Praveen T. S. Balamuralikrishna, Kenneth C. Wang, Ronald M. Summers, Zhiyong Lu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 CT-Bench是一个用于CT多模态病变理解的基准测试,包含病变图像和元数据集以及多任务视觉问答基准测试,通过评估多种多模态模型并展示其在临床中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16689 2026-02-19 cs.CV cs.LG 62%

Are Object-Centric Representations Better At Compositional Generalization?

基于对象中心表示的组合泛化能力是否更强?

Ferdinand Kapl, Amir Mohammad Karimi Mamaghan, Maximilian Seitzer, Karl Henrik Johansson, Carsten Marr, Stefan Bauer, Andrea Dittadi

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz AI, Munich(慕尼黑海德堡人工智能研究所) KTH Royal Institute of Technology(皇家理工学院) MPI for Intelligent Systems, Tübingen(图宾根人工智能研究所) Institute of AI for Health, Computational Health Center, Helmholtz Munich(健康人工智能研究所,计算健康中心,海德堡慕尼黑)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 本研究通过三个视觉世界基准,发现对象中心表示在组合泛化任务中表现更优,尤其在数据受限时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08448 2026-02-10 cs.CV cs.AI 62%

Vista: Scene-Aware Optimization for Streaming Video Question Answering under Post-Hoc Queries

Vista:面向事后查询的场景感知流视频问答优化

Haocheng Lu, Nan Zhang, Wei Tao, Xiaoyang Qu, Guokuan Li, Jiguang Wan, Jianzong Wang

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Vista通过场景感知分割、压缩和召回技术,实现了高效且可扩展的流视频问答,提升了长上下文推理能力,同时保持低延迟和内存效率。

Comments Accepted to AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00083 2026-02-03 cs.IR cs.AI cs.CL cs.LG 62%

SPARC-RAG: Adaptive Sequential-Parallel Scaling with Context Management for Retrieval-Augmented Generation

SPARC-RAG:基于上下文管理的自适应顺序-并行扩展用于检索增强生成

Yuxin Yang, Gangda Deng, Ömer Faruk Akgül, Nima Chitsazan, Yash Govilkar, Akasha Tigalappanavara, Shi-Xiong Zhang, Sambit Sahu, Viktor Prasanna

机构 * University of Southern California(南加州大学) Capital One

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 SPARC-RAG通过多代理框架实现顺序与并行扩展的协调,提升检索增强生成在多跳问答中的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00029 2026-02-03 cs.CL cs.AI cs.LG 62%

Construct, Align, and Reason: Large Ontology Models for Enterprise Knowledge Management

构建、对齐与推理:面向企业知识管理的大型本体模型

Yao Zhang, Hongyin Zhu

机构 * Yonyou AI Lab(用友人工智能实验室) Yonyou Network Technology Co., Ltd.(用友网络技术有限公司)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大型本体模型(LOM),通过构建、对齐和推理框架,实现企业知识管理中多源异构数据的整合与复杂语义推理,实验表明其在复杂图推理任务中表现优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20705 2026-01-29 cs.CV cs.AI 62%

LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?

LEMON:大型语言模型在教学视频中的时间多模态理解表现如何?

Zhuang Yu, Lei Shen, Jing Zhao, Shiliang Sun

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 LEMON是一个针对教学视频的多模态理解评估基准,旨在评估大型语言模型在时间推理和跨模态整合方面的表现,揭示其在复杂教育内容中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23565 2026-01-29 cs.CV cs.AI 62%

RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature

RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准

Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Peking University(北京大学) New York University(纽约大学) Fudan University(复旦大学) Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20298 2026-01-27 cs.CL cs.AI cs.CV 62%

MangaVQA and MangaLMM: A Benchmark and Specialized Model for Multimodal Manga Understanding

MangaVQA和MangaLMM:多模态漫画理解的基准和专用模型

Jeonghun Baek, Kazuki Egashira, Shota Onohara, Atsuyuki Miyai, Yuki Imajuku, Hikaru Ikuta, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MangaVQA和MangaLMM,用于多模态漫画理解的基准和专用模型,通过视觉问答和文本识别任务提升漫画叙事理解能力。

Comments EACL 2026 Findings. Project page: https://manga109.github.io/MangaVQA_LMM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18536 2026-01-27 cs.CV cs.CL cs.IR cs.LG 62%

FilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQA

FilterRAG: 零样本引导式检索增强生成以缓解视觉问答中的幻觉

Nobin Sarwar

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 FilterRAG通过结合BLIP-VQA与检索增强生成,利用外部知识源减少视觉问答中的幻觉问题,提升模型在知识驱动和分布外场景的鲁棒性。

Comments 12 pages, 6 figures and 2 tables; Accepted at ICCV 2025 Workshop on Building Foundation Models You Can Trust (T2FM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10671 2026-01-21 cs.CV cs.AI 62%

Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey

基于图像-语言基础模型的图像到视频迁移学习:全面综述

Jinxuan Li, Chaolei Tan, Haoxuan Chen, Jianxin Ma, Jian-Fang Hu, Jianhuang Lai, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了基于图像-语言基础模型的图像到视频迁移学习,系统分类了现有技术并分析了其在视频-文本任务中的应用与挑战。

Comments Updated version, github repository is available at https://github.com/YuriPreisdent/awesome-image-to-video-transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18177 2026-01-21 cs.CV cs.LG cs.MA 62%

Scene-Aware Vectorized Memory Multi-Agent Framework with Cross-Modal Differentiated Quantization VLMs for Visually Impaired Assistance

具有跨模态差异化量化功能的场景感知向量内存多智能体框架用于视障辅助

Xiangxiang Wang, Xuanyu Wang, YiJia Luo, Yongbin Yu, Manping Fan, Jingtao Zhang, Liyong Ren

机构 * School of Information Software Engineering, University of Electronic Science Sichuan Provincial Key Laboratory for Human Disease Gene Study, Sichuan Academy of Medical Sciences \& Sichuan Provincial People's Hospital, University of Electronic Science Faculty of Computing, Harbin Institute of Technology, Harbin, China

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种具有跨模态差异化量化的多智能体框架,通过减少内存消耗和提升处理效率,为视障人士提供更高效的环境感知与辅助导航支持。

Comments 28 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00138 2026-01-16 cs.AI cs.CV 62%

Explicit Abstention Knobs for Predictable Reliability in Video Question Answering

可预测可靠性中的显式回避调节器用于视频问答

Jorge Ortiz

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Rutgers University(罗格斯大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过置信度阈值控制视频问答中的错误率,验证了在分布偏移下置信度回避机制的可靠性。

Comments Preprint. Diagnostic study of confidence-based abstention under evidence truncation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10272 2026-01-16 cs.CL cs.AI cs.LG cs.SD 62%

MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts

MoST:通过模态感知混合专家混合语音和文本

Yuxuan Lou, Kai Yang, Yang You

机构 * School of Computer Science, National University of Singapore(新加坡国立大学计算机科学学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 MoST通过模态感知混合专家架构,实现语音和文本的高效融合,首次公开了基于混合专家的语音-文本大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏