arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-20 至 2026-02-20 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2602.16930 2026-02-20 cs.HC cs.AI 79%

Say It My Way: Exploring Control in Conversational Visual Question Answering with Blind Users

说我的方式:探索盲人用户在对话式视觉问答中的控制能力

Farnaz Zamiri Zeraati, Yang Trista Cao, Yuehan Qiao, Hal Daumé, Hernisa Kacorri

机构 * University of Maryland(马里兰大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

AI总结 本文通过邀请盲人用户定制对话式VQA系统,探讨如何通过提示工程等技术克服系统局限性,并提供新的公开数据集和交互设计见解。

Comments Preprint, Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14879 2026-02-20 cs.CV cs.AI 62%

CT-Bench: A Benchmark for Multimodal Lesion Understanding in Computed Tomography

CT-Bench:一种用于CT中多模态病变理解的基准测试

Qingqing Zhu, Qiao Jin, Tejas S. Mathai, Yin Fang, Zhizheng Wang, Yifan Yang, Maame Sarfo-Gyamfi, Benjamin Hou, Ran Gu, Praveen T. S. Balamuralikrishna, Kenneth C. Wang, Ronald M. Summers, Zhiyong Lu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 CT-Bench是一个用于CT多模态病变理解的基准测试,包含病变图像和元数据集以及多任务视觉问答基准测试,通过评估多种多模态模型并展示其在临床中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏