arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-19 至 2025-11-19 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2511.13892 2025-11-19 cs.AI 83%

Jailbreaking Large Vision Language Models in Intelligent Transportation Systems

Badhan Chandra Das, Md Tasnim Jawad, Md Jueal Mia, M. Hadi Amini, Yanzhao Wu

机构 * KFSCIS, Florida International University(凯斯-西储大学信息科学学院) Knight Foundation School of Computing and Information Sciences(骑士基金会计算与信息科学学院) Learning for InterDependent Networks Laboratory (solid lab)(依赖网络学习实验室)

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13135 2025-11-19 cs.CV 70%

MedGEN-Bench: Contextually entangled benchmark for open-ended multimodal medical generation

Junjie Yang, Yuhao Yan, Gang Wu, Yuxuan Wang, Ruoyu Liang, Xinjie Jiang, Xiang Wan, Fenglei Fan, Yongquan Zhang, Feiwei Qin, Changmiao Wang

机构 * South China University of Technology(华南理工大学) Sun Yat-sen University(中山大学) Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University of Finance & Economics(浙江财经大学) National University of Singapore(新加坡国立大学) Shenzhen Research Institute of Big Data(深圳大数据研究院) City University of Hong Kong(香港城市大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments CVPR 2026 Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13881 2025-11-19 cs.CV 70%

VLMs Guided Interpretable Decision Making for Autonomous Driving

Xin Hu, Taotao Jing, Renran Tian, Zhengming Ding

机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) Qualcomm(高通公司) Department of Industrial and Systems Engineering, North Carolina State University(北卡罗来纳州立大学工业与系统工程系)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏