arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-02 至 2025-12-02 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 6 篇

2512.01419 2025-12-02 cs.CV cs.AI 88%

Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries

Rice-VL:评估跨东盟国家的视觉语言模型的文化理解能力

Tushar Pranav, Eshan Pandey, Austria Lyka Diane Bala, Aman Chadha, Indriyati Atmosukarto, Donny Soh Cheng Lock

机构 * Singapore Institute of Technology(新加坡理工学院) Amazon GenAI(亚马逊人工智能实验室)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)

AI总结 RICE-VL通过评估视觉语言模型在11个东盟国家的文化理解能力,揭示了模型在文化多样性地区存在的偏见和局限性,强调了开发更具包容性的模型的重要性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00773 2025-12-02 cs.CV 79%

DEJIMA: A Novel Large-scale Japanese Dataset for Image Captioning and Visual Question Answering

DEJIMA:一种新的大规模日语数据集用于图像描述和视觉问答

Toshiki Katsube, Taiga Fukuhara, Kenichiro Ando, Yusuke Mukuta, Kohei Uehara, Tatsuya Harada

机构 * The University of Tokyo(东京大学) RIKEN(日本资源技术研究所)

专题命中 视觉问答 :visual question answering(title);grounding(abstract);分类 cs.CV

AI总结 DEJIMA是首个大规模日语图像描述与视觉问答数据集,通过整合网络收集、目标检测和大语言模型优化,提升了日语语言和文化表现力,显著优于现有翻译或人工标注数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14227 2025-12-02 cs.CV cs.AI 62%

VoQA: Visual-only Question Answering

VoQA:仅视觉的问题回答

Jianing An, Luyang Jiang, Jie Luo, Wenjun Wu, Lei Huang

机构 * SKLCCSE, School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(北京航空航天大学杭州国际创新研究院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 VoQA通过仅依赖视觉信息回答问题,改进了传统VQA的局限性,通过问题对齐微调策略提升纯视觉推理能力。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00226 2025-12-02 cs.CV cs.AI 62%

DenseScan: Advancing 3D Scene Understanding with 2D Dense Annotation

DenseScan: 通过2D密集标注提升3D场景理解

Zirui Wang, Tao Zhang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Wuhan University(武汉大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 DenseScan通过2D密集标注提升3D场景理解,结合多视角图像和多模态大语言模型生成丰富语义标注,拓展下游任务应用。

Comments Workshop on Space in Vision, Language, and Embodied AI at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00881 2025-12-02 cs.AI 57%

Hybrid-DMKG: A Hybrid Reasoning Framework over Dynamic Multimodal Knowledge Graphs for Multimodal Multihop QA with Knowledge Editing

Hybrid-DMKG: 一种基于动态多模态知识图谱的混合推理框架用于多模态多跳问答与知识编辑

Li Yuan, Qingfei Huang, Bingshan Zhu, Yi Cai, Qingbao Huang, Changmeng Zheng, Zikun Deng, Tao Wang

专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI

AI总结 Hybrid-DMKG通过动态多模态知识图谱实现多跳问答中的准确推理,提升对知识更新的鲁棒性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00115 2025-12-02 cs.SD cs.CV cs.MM 57%

MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning

MoLT:基于层级令牌的高效音频视觉学习

Kyeongha Rho, Hyeongkeun Lee, Jae Won Cho, Joon Son Chung

机构 * KAIST(韩国科学技术院) Sejong University(世宗大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 MoLT通过层级令牌融合提升音频视觉学习效率,采用轻量适应策略和正交正则化,优于现有方法。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏