arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-08 至 2025-12-08 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2505.22143 2025-12-08 cs.CV 83%

3D Question Answering via only 2D Vision-Language Models

仅通过2D视觉-语言模型实现3D问答

Fengyun Wang, Sicheng Yu, Jiawei Wu, Jinhui Tang, Hanwang Zhang, Qianru Sun

机构 * Nanyang Technological University, Singapore Singapore Management University, Singapore National University of Singapore, Singapore Nanjing University of Science \& Technology, Nanjing, China

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出cdViews方法,通过仅使用2D视觉-语言模型,实现3D问答任务的高性能表现。

Comments ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05137 2025-12-08 cs.CV cs.AI 81%

ChromouVQA: Benchmarking Vision-Language Models under Chromatic Camouflaged Images

ChromouVQA:在色度伪装图像下评估视觉-语言模型的基准测试

Yunfei Zhang, Yizhuo He, Yuanxun Shao, Zhengtao Yao, Haoyan Xu, Junhao Dong, Zhen Yao, Zhikang Dong

机构 * Amazon(亚马逊公司) Google(谷歌公司) MurcuryMind(MurcuryMind公司) University of Southern California(南加州大学) Nanyang Technological University(南洋理工大学) Lehigh University(莱斯大学) Stony Brook University(石溪大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 ChromouVQA通过色度伪装图像评估视觉-语言模型在复杂背景下的表现,提出对比度配方提升形状恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05863 2025-12-08 cs.CL cs.AI 57%

Optimizing Medical Question-Answering Systems: A Comparative Study of Fine-Tuned and Zero-Shot Large Language Models with RAG Framework

优化医疗问答系统:基于RAG框架的微调与零样本大语言模型比较研究

Tasnimul Hassan, Md Faisal Karim, Haziq Jeelani, Elham Behnam, Robert Green, Fayeq Jeelani Syed

机构 * Department of Electrical Engineering Computer Science University of Toledo Toledo, USA Institute of Mathematical Sciences Claremont Graduate University Claremont, USA Department of Bioengineering University of Toledo Toledo, USA Department of Computer Science Bowling Green State University Bowling Green, USA

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文通过RAG框架结合微调与零样本大语言模型,提升医疗问答系统的准确性与可靠性,实验证明检索增强显著提高回答质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05119 2025-12-08 cs.IR cs.AI cs.CL 57%

RAG-IGBench: Innovative Evaluation for RAG-based Interleaved Generation in Open-domain Question Answering

RAG-IGBench: 用于开放领域问答中基于检索增强生成的交错生成的创新评估

Rongyang Zhang, Yuqing Huang, Chengqiang Lu, Qimeng Wang, Yan Gao, Yi Wu, Yao Hu, Yin Xu, Wei Wang, Hao Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Xiaohongshu Inc.(小红书公司) Xi’an Jiaotong University(西安交通大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI

AI总结 RAG-IGBench通过创新的评估指标和多模态数据,评估基于检索增强生成的交错生成任务,验证了模型在开放领域问答中的性能提升。

Comments 26 pages, 6 figures, NeurIPS 2025 D&B Track poster

详情

展开后加载摘要…

URL PDF HTML 收藏