What's the Best Way to Retrieve Slides? A Comparative Study of Multimodal, Caption-Based, and Hybrid Retrieval Techniques
机构 * Aristotle University of Thessaloniki(亚里士多德大学)
专题命中 其他VLM :vision-language model(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Aristotle University of Thessaloniki(亚里士多德大学)
专题命中 其他VLM :vision-language model(abstract)
机构 * Sun Yat-sen University(中山大学) ; Guangdong University of Technology(广东工业大学) ; Northwestern University(西北大学)
专题命中 其他VLM :multimodal large language model(abstract)
Comments Accepted by EMNLP 2025 main track