arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-26 至 2025-11-26 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 8 篇

2409.12842 2025-11-26 cs.RO cs.AI 85%

Vision Language Models Can Parse Floor Plan Maps

视觉语言模型可以解析平面图

David DeFazio, Hrudayangam Mehta, Meng Wang, Ping Yang, Jeremy Blackburn, Shiqi Zhang

机构 * School of Computing, Binghamton University(计算机学院,宾夕法尼亚州立大学)

专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型在地图解析任务中的性能,展示了其在复杂室内导航中的高成功率,并指出在大型开放区域中性能下降的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19768 2025-11-26 cs.CV cs.AI cs.RO 73%

Prune-Then-Plan: Step-Level Calibration for Stable Frontier Exploration in Embodied Question Answering

剪枝后再规划:用于具身问答中稳定前沿探索的分步校准

Noah Frahm, Prakrut Patel, Yue Zhang, Shoubin Yu, Mohit Bansal, Roni Sengupta

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 Prune-Then-Plan通过分步校准稳定具身问答中的前沿探索,提升导航效率和回答质量。

Comments webpage: https://noahfrahm.github.io/Prune-Then-Plan-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19557 2025-11-26 cs.CV cs.AI cs.LG 67%

Think First, Assign Next (ThiFAN-VQA): A Two-stage Chain-of-Thought Framework for Post-Disaster Damage Assessment

先思后定(ThiFAN-VQA):一种用于灾后损害评估的两阶段链式思考框架

Ehsan Karimi, Nhut Le, Maryam Rahnemoonfar

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ThiFAN-VQA通过两阶段推理框架提升灾后损害评估的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20490 2025-11-26 cs.LG cs.AI 62%

MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology

MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准

Kiril Vasilev, Alexandre Misrahi, Eeshaan Jain, Phil F Cheng, Petros Liakopoulos, Olivier Michielin, Michael Moor, Charlotte Bunne

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院) HUG

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20190 2025-11-26 cs.CV 57%

SFA: Scan, Focus, and Amplify toward Guidance-aware Answering for Video TextVQA

SFA: 扫描、聚焦与放大以实现面向指导的视频文本VQA回答

Haibin He, Qihuang Zhong, Juhua Liu, Bo Du, Peng Wang, Jing Zhang

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(计算与数学系、曼彻斯特 Metropolitan 大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 SFA通过扫描、聚焦与放大机制,提出首个Video-LLM方法,提升视频文本VQA任务的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19648 2025-11-26 cs.CL cs.AI 57%

Efficient Multi-Hop Question Answering over Knowledge Graphs via LLM Planning and Embedding-Guided Search

通过LLM规划和嵌入引导搜索实现高效的多跳知识图谱问答

Manil Shrestha, Edward Kim

机构 * Department of Computer Science, Drexel University, Philadelphia, PA, USA(计算机科学系,德雷塞尔大学,费城,宾夕法尼亚州,美国)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出两种混合算法,通过LLM规划和嵌入引导搜索实现高效且可验证的多跳知识图谱问答,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20227 2025-11-26 cs.IR 50%

HKRAG: Holistic Knowledge Retrieval-Augmented Generation Over Visually-Rich Documents

HKRAG:面向视觉丰富文档的综合知识检索增强生成

Anyang Tong, Xiang Niu, ZhiPing Liu, Chang Tian, Yanyan Wei, Zenglin Shi, Meng Wang

专题命中 视觉问答 :visual question answering(abstract)

AI总结 HKRAG通过综合检索和生成机制,提升视觉丰富文档中显著与细节知识的检索与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20086 2025-11-26 cs.CL 50%

More Bias, Less Bias: BiasPrompting for Enhanced Multiple-Choice Question Answering

更多偏见,更少偏见:用于增强多项选择题回答的BiasPrompting

Duc Anh Vu, Thong Nguyen, Cong-Duy Nguyen, Viet Anh Nguyen, Anh Tuan Luu

机构 * Nanyang Techonological University(南洋理工大学) National University of Singapore(国立新加坡大学) Centre for AI research, VinUniversity(Vin大学人工智能研究中心)

专题命中 视觉问答 :grounding(abstract)

AI总结 BiasPrompting通过引导LLMs生成并评估所有可能答案的推理过程,提升多项选择题回答的推理能力,尤其在复杂问题中表现优异。

Comments Accepted at the 41st ACM/SIGAPP Symposium On Applied Computing (SAC 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏