Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
视觉-深度研究基准:重新思考多模态大语言模型的视觉和文本搜索
专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出Vision-DeepResearch基准,通过精心设计的问题评估多模态大语言模型的视觉与文本搜索能力,并引入多轮裁剪搜索流程提升实际检索性能。