arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 27387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3250 篇

2603.18178 2026-05-19 cs.CV cs.AI 94%

VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events

VLM-AutoDrive: 事后训练视觉-语言模型用于安全关键的自动驾驶事件

Mohammad Qazim Bhat, Yufan Huang, Niket Agarwal, Hao Wang, Michael Woods, John Kenyon, Tsung-Yi Lin, Xiaodong Yang, Ming-Yu Liu, Kevin Xie

机构 * NVIDIA

专题命中 视觉问答 :VLM(title,title_cn);vision-language model(title,abstract);visual question answering(abstract);multimodal large language model(abstract)

AI总结 本文提出VLM-AutoDrive框架,通过整合元数据生成的描述、LLM生成的描述、视觉问答对和推理监督,提升预训练视觉语言模型在安全关键自动驾驶事件中的检测性能。

Comments 16 pages, 9 figures, submitted to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17129 2026-08-19 cs.CV cs.RO 新提交 93%

PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents

PROBE:基于操作的视觉问答(使用VLM智能体)

Vineet Bhat, Siyi Chen, Alex Zook, Xuning Yang, Stan Birchfield, Valts Blukis, Jonathan Tremblay

机构 * NVIDIA(英伟达)

专题命中 视觉问答 :VLM(title,title_cn);visual question answering(title,abstract);vision-language model(abstract);grounding(abstract)

AI总结 针对现实杂乱环境中需操作遮挡物体的视觉问答问题,提出PROBE框架,含模拟器、基准测试集及微调方案,提升VLM智能体性能并验证模拟到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19776 2026-06-19 cs.CV 新提交 93%

Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding

Occ-VLM: 面向室内场景理解的占用接地视觉语言模型

Jianing Li, Zhou Fang, Yijiang Liu, Li Du

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)

专题命中 视觉问答 :VLM(title,title_cn);vision language model(title);vision-language model(abstract);visual question answering(abstract)

AI总结 提出Occ-VLM,仅用姿态RGB图像和单一2D视觉编码器,通过重建3D占用作为几何先验,实现统一的3D场景理解,在占用预测、3D VQA和密集描述任务上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15603 2026-09-15 cs.CV cs.AI 新提交 93%

A Unified Vision-Language Model for PSMA PET/CT Report Generation, Visual Question Answering, and Lesion Segmentation

用于PSMA PET/CT报告生成、视觉问答和病灶分割的统一视觉语言模型

Yang Xing, Jiong Wu, Savas Ozdemir, Yang Zhou, Boxiao Yu, Ying Zhang, Zheren Zhu, Chenyu You, Wei Shao, Yang Lu, Kang Wang, Tinsu Pan, Yang Yang, Kuang Gong

机构 * University of Florida(佛罗里达大学) University of California, San Francisco(加利福尼亚大学旧金山分校) Stony Brook University(纽约州立大学石溪分校) The University of Texas MD Anderson Cancer Center(得克萨斯大学MD安德森癌症中心)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn)

AI总结 提出统一PSMA PET/CT视觉语言模型,集成报告生成、视觉问答和病灶分割,在多项指标上优于现有方法,实现多任务一体化分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04032 2026-08-18 cs.CL cs.AI cs.CV 版本更新 93%

jina-vlm: Small Multilingual Vision Language Model

Jina-VLM:小规模多语言视觉语言模型

Andreas Koukounas, Georgios Mastrapas, Florian Hönicke, Sedigheh Eslami, Guillaume Roncari, Han Xiao

机构 * Jina AI

专题命中 视觉问答 :VLM(title,title_cn);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Jina-VLM是一款24亿参数的多语言视觉语言模型,通过结合SigLIP2视觉编码器与Qwen3语言主干,实现了高效多语言视觉问答性能。

Comments 23 pages, 1-10 main content, 11-23 references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19329 2026-05-22 cs.CV cs.AI 93%

RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding

RE-VLM:事件增强的视觉-语言模型用于场景理解

Hanqing Liu, Mingjie Liu, Luoping Cui, Endian Lin, Donghong Jiang, Chuang Zhu

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 视觉问答 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出RE-VLM,一种结合RGB图像和事件流的双流视觉-语言模型,旨在提升在正常和恶劣条件下对场景的理解能力。通过事件相机提供的高时间分辨率和宽动态范围的数据,RE-VLM在场景描述和视觉问答任务中优于现有模型。

Comments 10 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14044 2026-04-16 cs.CV 92%

Decoding the Delta: Unifying Remote Sensing Change Detection and Understanding with Multimodal Large Language Models

解读Delta:利用多模态大语言模型统一遥感变化检测与理解

Xiaohe Li, Jiahao Li, Kaixin Zhang, Yuqiang Fang, Leilei Lin, Hong Wang, Haohua Wu, Zide Fan

机构 * Aerospace Information Research Institute, CAS(航天信息研究所,中国科学院) Space Engineering University(航天工程大学) Capital Normal University(首都师范大学)

专题命中 视觉问答 :LLaVA(summary_cn,abstract);multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);visual question answering(abstract)

AI总结 本文提出Delta-LLaVA框架,通过多时间尺度对比推理和空间定位,解决遥感变化理解中的时间盲问题,实现像素级分割与视觉问答的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.13296 2026-09-15 cs.CV cs.LG 新提交 92%

Harnessing Image Question Dependence for Better VLM Test-time Reinforcement Learning

利用图像-问题依赖性改进VLM测试时强化学习

Xinrui He, Ting-Wei Li, Junting Wang, Mengting Ai, Xinyu He, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉问答 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 针对VLM测试时强化学习中共识信号不可靠的问题,提出TTIQ框架,利用图像与问题的依赖性构建奖励,在多个VQA数据集上取得最优平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07861 2026-08-11 cs.CV cs.HC cs.IR cs.MM 新提交 92%

How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems

回答我的问题需要多少成本?基于云VLM的VQA系统基准测试

Henri Vanhuynegem, Weitao Xu, Yiran Shen, Guohao Lan

专题命中 视觉问答 :VLM(title,title_cn);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本研究推出首个将客户端输入预处理作为受控变量的VQABench基准,评估12种预处理技术在3个VQA数据集、4个商业VLMs上的95168次API调用,明确预处理对云VLM-based VQA的成本-质量影响,为VQA系统部署提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15861 2026-06-16 cs.CV 新提交 92%

Object Tokens as a Bridge Between Segmentation and Visual Question Answering in Robotic Surgery

对象标记作为机器人手术中分割与视觉问答的桥梁

Yiping Li, Ronald de Jong, Romy van Jaarsveld, Franco Badaloni, Gino Kuiper, Jelle Ruurda, Josien Pluim, Marcel Breeuwer

机构 * Department of Biomedical Engineering, Eindhoven University of Technology(埃因霍温理工大学生物医学工程系) Department of Electrical Engineering, Eindhoven University of Technology(埃因霍温理工大学电气工程系) Department of Surgery, University Medical Center Utrecht(乌得勒支大学医学中心外科)

专题命中 视觉问答 :VLM(summary_cn,abstract);visual question answering(title,abstract);vision-language model(abstract);visual reasoning(abstract)

AI总结 提出统一框架,联合像素级分割与视觉问答,通过VLM生成对象标记引导答案预测和分割掩码,在RAMIE和EndoVis18数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04712 2026-05-12 cs.CV cs.AI eess.IV 91%

SAR-RAG: ATR Visual Question Answering by Semantic Search, Retrieval, and MLLM Generation

SAR-RAG:通过语义搜索、检索和MLLM生成实现目标识别的视觉问答

David F. Ramirez, Tim Overman, Kristen Jaskie, Joe Marvin, Andreas Spanias

机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) Prime Solutions Group Inc(Prime Solutions Group公司)

专题命中 视觉问答 :MLLM(title,title_cn);visual question answering(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SAR-RAG方法,结合多模态大语言模型和语义嵌入向量数据库,通过语义搜索和检索提升SAR图像目标识别的准确性,通过分类和回归指标验证效果。

Comments Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.06922 2026-09-09 cs.CV 新提交 91%

BEFORE THE FLIP: Measuring Hidden Score Shifts In Quantized Vision Language Models Before The Answer Changes for Visual Question Answering

在翻转之前:量化视觉语言模型中答案改变前的隐藏分数偏移测量用于视觉问答

Sourajit Saha, Shubhashis Roy Dipta, Shaswati Saha, Nobin Sarwar, Yuxuan Jiang

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract_cn)

AI总结 本研究提出“在翻转之前”方法,测量量化视觉语言模型中答案不变时的隐藏分数偏移,发现4比特压缩比8比特更显著改变分数差距,但逐问题调整精度无可靠益处。

Comments Under Review at VLM4RWD @ NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17488 2026-06-09 cs.CV 91%

AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation

AutoVQA-G:用于自动视觉问答与接地标注的自我改进代理框架

Rongsheng Hu, Runwei Guan, Yicheng Di, Jiayu Bao, Yuan Liu

机构 * School of Artificial Intelligence(人工智能学院)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本文提出AutoVQA-G框架,通过迭代优化流程提升视觉问答接地标注的准确性,优于现有多模态LLM,为构建高质量数据促进更稳健的视觉语言模型训练提供新方法。

Comments Accepted at IEEE ICASSP 2026. 5 pages, 5 figures. Code available at https://github.com/rohnson1999/AutoVQA-G

Journal ref Proc. 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 12312-12316, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15626 2024-08-29 cs.CV 91%

Can Visual Language Models Replace OCR-Based Visual Question Answering Pipelines in Production? A Case Study in Retail

Bianca Lamm, Janis Keuper

机构 * Markant Services International GmbH(玛兰特国际服务有限公司) Offenburg University(奥芬堡大学)

专题命中 视觉问答 :visual question answering(title,abstract);visual language model(title);vision language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11862 2025-09-16 cs.CV cs.AI cs.LG 91%

Bridging Vision Language Models and Symbolic Grounding for Video Question Answering

Haodi Ma, Vyom Pathak, Daisy Zhe Wang

机构 * Univerisy of Florida(佛罗里达大学)

专题命中 视觉问答 :vision language model(title,abstract);grounding(title,abstract);VLM(abstract);InternVL(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.07048 2026-09-09 cs.CV 新提交 91%

FreqDoor: A Hidden Trojan in the Frequency Domain for Backdoor Attacks on Vision-Language Models

FreqDoor:面向视觉-语言模型后门攻击的频率域隐藏木马

Yasir Arafat Prodhan, Sadad Hasan, Mohammed Imamul Hassan Bhuiyan

专题命中 视觉问答 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);LLaVA(abstract,abstract_cn);visual question answering(abstract)

AI总结 提出FreqDoor,一种在频率域植入不可见触发器的训练时后门攻击,通过混合幅度谱并保留相位,在多个VLM上实现高攻击成功率。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28762 2026-09-01 cs.CV 新提交 91%

Inter-3D VQA: A Roadside Multimodal Benchmark for 3D Spatiotemporally Grounded Visual Question Answering

Inter-3D VQA:用于3D时空视觉问答的路侧多模态基准

Shaozu Ding, Linan Song, Dajiang Suo

机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院)

专题命中 视觉问答 :visual question answering(title,abstract);VLM(summary_cn,abstract_cn);MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 本文提出用于交叉口3D时空视觉问答的路侧多模态基准Inter-3D VQA,构建含40.7万问答对的数据集,提出基线模型Inter-Geo与评估框架Inter-Metrics,实验显示Inter-Geo在接地时空推理任务上优于基于图像的VLM。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14766 2026-07-30 cs.CV cs.CL 版本更新 91%

ASCD: Attention-Steerable Contrastive Decoding for Reducing Hallucination in MLLM

ASCD:用于减少多模态大语言模型(MLLM)幻觉的注意力可导向对比解码

Yujun Wang, Aniri, Jinhe Bi, Soeren Pirk, Yunpu Ma

专题命中 视觉问答 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对MLLM的幻觉问题,提出ASCD方法,通过正负引导调整解码时的注意力分数,在多基准上显著减少幻觉并提升VQA准确率,且无需额外训练。

Comments Accepted at AAAI 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(12): 10306-10314, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25802 2026-05-26 cs.CV 91%

Rethinking VLM Representation for VLA Initialization

重新思考用于VLA初始化的VLM表示

Weifeng Lin, Siyuan Huang, Hao Li, Tingwei Chen, Ruichuan An, Xinyu Wei, Jianbo Liu, Hongsheng Li

机构 * CUHK(香港中文大学) PolyU Peking University(北京大学) ACE Robotics(ACE机器人)

专题命中 视觉问答 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文通过控制表示设计问题,沿能力级具身VQA监督、参数更新策略和机器人数据预训练三个轴,研究VLA初始化,发现保留预训练VLM表示对动作性能至关重要,而LoRA比全微调提供更可靠的初始化,分阶段基于LoRA的训练获得最强变体。

Comments 9 main-text pages, 5 appendix pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10948 2025-03-18 cs.CV cs.AI cs.RO eess.IV 91%

Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery

Guankun Wang, Long Bai, Wan Jun Nah, Jie Wang, Zhaoxi Zhang, Zhen Chen, Jinlin Wu, Mobarakol Islam, Hongbin Liu, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Universiti Malaya(马来亚大学) Centre for Artificial Intelligence and Robotics, HKISI-CAS(香港智能系统研究所人工智能与机器人中心) University College London(伦敦大学学院)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);visual language model(abstract);grounding(abstract)

Comments The manuscript is accepted by ICLR 2025 FM-Wild Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19307 2026-05-20 cs.CV 90%

MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems

MetaRA: 多模态大语言模型基于视觉问答系统的元形态鲁棒性评估

Quanxing Xu, Yuhao Tian, Ling Zhou, Xian Zhong, Xiaohua Huang, Rubing Huang, Chia-Wen Lin

机构 * School of Computer Science and Engineering, Macau University of Science and Technology, Macao SAR(澳门科学技术大学计算机科学与工程学院) Hubei Key Laboratory of Transportation Internet of Things, School of Computer Science and Artificial Intelligence, Wuhan University of Technology(湖北省交通物联网重点实验室,武汉理工大学)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MetaRA,一种基于元形态测试的框架,用于评估多模态大语言模型基于视觉问答系统的鲁棒性,通过生成受控的图像-问题输入变体,揭示模型在语言扰动、视觉线索依赖和多模态推理中的弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18915 2025-05-27 cs.CV 90%

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zongwei Zhou, Alan Yuille

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(title);vision-language model(abstract);VLM(abstract)

Comments NeurIPS 2025 datasets&benchmarks track submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11265 2025-03-17 cs.CV 90%

DynRsl-VLM: Enhancing Autonomous Driving Perception with Dynamic Resolution Vision-Language Models

Xirui Zhou, Lianlei Shan, Xiaolin Gui

机构 * Xi’an Jiaotong University(西安交通大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(title,abstract);vision language model(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02233 2026-09-03 cs.CV cs.AI 新提交 90%

InfraPatch: Cross-Task Targeted Grayscale Patch Attacks on Infrared-Adapted Vision-Language Models

InfraPatch:针对红外适配视觉语言模型的跨任务定向灰度补丁攻击

Chengyin Hu, Dingyi Lu, Jiaju Han, Xiang Chen, Weiwen Shi, Jiahuan Long, Yiwei Wei, Jiujiang Guo

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);visual question answering(abstract)

AI总结 本文提出针对红外适配视觉语言模型的InfraPatch定向灰度补丁攻击框架,在10种模型变体上实现86.00%-100%的定向攻击成功率,揭示红外多模态模型的脆弱性,推动其鲁棒性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12374 2026-09-18 cs.RO cs.AI 版本更新 90%

AntiGrounding: Executable Robot Trajectories as Visual Prompts for VLM-Guided Manipulation

AntiGrounding:可执行机器人轨迹作为VLM引导操作的视觉提示

Wenbo Li, Yiteng Chen, Wenhao Li, Qingyao Wu

机构 * School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学) School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 视觉问答 :VLM(title,title_cn);vision-language model(abstract);visual question answering(abstract);分类 cs.AI

AI总结 AntiGrounding提出双几何-视觉轨迹接口,将可执行轨迹作为视觉提示,通过多视图VQA评分选择动作,在真实操作任务中以单评估器达到71.25%成功率,优于现有基线。

Comments 8 pages, 7 figures, 3 tables. Submitted to ICRA 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17443 2026-09-16 cs.CV 新提交 90%

BrainFocus: EEG-Guided ROI Selection for Efficient Vision-Language Models

BrainFocus:用于高效视觉语言模型的EEG引导感兴趣区域选择

Yihui Peng, Guorui Lu, Qinyu Chen

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University(莱顿大学高级计算机科学研究所(LIACS))

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 提出BrainFocus框架,利用EEG信号引导VLM仅处理相关ROI,在40类基准上提升VQA准确率4.14-9.87pp并减少23.2%-39.5%计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.14523 2026-09-15 cs.CV 新提交 90%

Selective Tool Use for Agentic Change Visual Question Answering in Remote Sensing

遥感中智能体变化视觉问答的选择性工具使用

Yakoub Bazi, Mohamad M. Al Rahhal, Mohamed A. Mekhtiche, Mansour Zuair

机构 * King Saud University(沙特国王大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);visual question answering(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 针对遥感变化视觉问答中VLM不可靠问题,提出选择性工具使用框架,通过调用确定性工具获取语义证据,显著提升准确率,并验证了语义图质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25343 2026-09-04 cs.CV 版本更新 90%

Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity

发票草垛:强视觉同质性下的文档检索与视觉问答基准测试

Heethanjan Kanagalingam, Thenukan Pathmanathan, Mokeeshan Vathanakumar, Basim Azam, Sarah Monazam Erfani, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) Lakehead University(湖首大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);visual question answering(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 针对视觉同质文档集合中的检索困难,提出Invoice Haystack基准和VL-RAG混合检索框架,通过文本与视觉嵌入融合及VLM验证过滤,显著提升检索准确率。

Comments Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03733 2026-08-05 cs.AI 新提交 90%

Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement

面向多模态大语言模型自我改进的故障感知图像自增强

Chunyang Jiang, Pingping Zhang, Yuzhi Zhao, Wenao Ma, Zhijian Hou, Mengyang Wu, Yiyang Cai, Senkang Hu, Sitong Cheng, Chi-Min Chan, Wei Xue, Yike Guo

专题命中 视觉问答 :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.AI

AI总结 提出FISA框架,基于MLLM失败案例生成保留答案的增强图像,经自检验与双重保真过滤后,可提升视觉问答性能,且兼容文本自增强、数据效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02300 2026-08-04 cs.CV 新提交 90%

A General-Purpose VLM Can Teach an Astronomy Foundation Model to Better Recognize Galaxy Morphology

通用视觉语言模型(VLM)可指导天文基础模型更好地识别星系形态

Dichang Zhang, Jiaqi Deng, Yixuan Shao, Yuanpeng Liu, Jiali Cui, Zhiqiang Lao, Heather Yu, Liang Peng, Simon Birrer, Dimitris Samaras

机构 * Stony Brook University(石溪大学) University of Technology Sydney(悉尼科技大学) Futurewei Technologies(华为主机技术公司)

专题命中 视觉问答 :VLM(title,title_cn);分类 cs.CV

AI总结 该研究提出用通用视觉语言模型(VLM)作为弱监督教师,指导天文基础模型Zoobot提升星系形态识别性能,可高效适配未来大型天文巡天任务。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏