arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-06 至 2026-02-06 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2602.04142 2026-02-06 cs.CV cs.AI 81%

JSynFlow: Japanese Synthesised Flowchart Visual Question Answering Dataset built with Large Language Models

JSynFlow:利用大语言模型构建的日本合成流程图视觉问答数据集

Hiroshi Sasaki

机构 * The Japan Research Institute, Limited(日本研究所有限公司)

专题命中 视觉问答 :visual question answering(title);VLM(abstract);分类 cs.CV、cs.AI

AI总结 JSynFlow利用大语言模型生成日本流程图视觉问答数据集,提升VLM在流程图问答任务中的性能。

Comments 7 pages, 1 figure

Journal ref Proceedings of the Annual Conference of JSAI, JSAI2025:2Win587-2Win587, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04924 2026-02-06 cs.LG cs.SD 79%

Knowing When to Answer: Adaptive Confidence Refinement for Reliable Audio-Visual Question Answering

何时回答:可靠音频-视觉问答的自适应置信度细化

Dinh Phu Tran, Jihoon Jeong, Saad Wazir, Seongah Kim, Thao Do, Cem Subakan, Daeyoung Kim

机构 * School of Computing, KAIST, Republic of Korea(韩国釜山科学技术院计算机科学学院) Laval University(拉瓦尔大学) Mila-Quebec AI Institute(魁北克人工智能研究所)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.LG

AI总结 本文提出自适应置信度细化方法,用于提升音频-视觉问答任务中可靠性的性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05728 2026-02-06 cs.CL cs.AI 57%

CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question Answering

CompactRAG: 减少多跳问答中的LLM调用和令牌开销

Hao Yang, Zhiyu Yang, Xupeng Zhang, Wei Wei, Yunjie Zhang, Lin Yang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Erik Jonsson School of Engineering and Computer Science, University of Texas at Dallas(埃里克·乔纳森工程与计算机科学学院,德克萨斯大学达拉斯分校) Isoftstone Information Technology (Group) Co.,Ltd.(伊软石信息技术(集团)有限公司) College of Electronic and Information Engineering, Tongji University(电子信息工程学院,同济大学) School of Electronic Information, Central South University(电子信息学院,中南大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 CompactRAG通过解耦离线语料重组与在线推理,减少多跳问答中的LLM调用和令牌消耗,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏