arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-03 至 2025-09-03 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2507.22369 2025-09-03 cs.CV cs.AI 81%

Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring

Sinh Trong Vu, Hieu Trung Pham, Dung Manh Nguyen, Hieu Minh Hoang, Nhu Hoang Le, Thu Ha Pham, Tai Tan Mai

机构 * Banking Academy of Vietnam(越南银行学院) Dublin City University(都柏林城市大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19944 2025-09-03 cs.CV cs.CL 77%

KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts

Taebaek Hwang, Minseo Kim, Gisang Lee, Seonuk Kim, Hyunjun Eun

机构 * Waddle Seoul National University(首尔国立大学) Krafton UNIST(全南大学) SK Telecom(SK电信)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02164 2025-09-03 cs.CV 70%

Omnidirectional Spatial Modeling from Correlated Panoramas

Xinshen Zhang, Tongxi Fu, Xu Zheng

机构 * The Hong Kong Polytechnic University(香港理工大学) Zhejiang Sci-Tech University(浙江科技学院)

专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02748 2025-09-03 cs.CV cs.AI 62%

Story Generation from Visual Inputs: Techniques, Related Tasks, and Challenges

Daniel A. P. Oliveira, Eugénio Ribeiro, David Martins de Matos

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏