arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-18 至 2025-11-18 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 7 篇

2510.21424 2025-11-18 cs.CL cs.AI cs.CV cs.LG 82%

Vision Language Models for Dynamic Human Activity Recognition in Healthcare Settings

Abderrazek Abid, Thanh-Cong Ho, Fakhri Karray

机构 * MBZUAI University of Waterloo(滑铁卢大学)

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref In: Rojas I., Ortuño F., Rojas Ruiz F., Herrera L.J., Valenzuela O., Escobar J.J. (eds) Bioinformatics and Biomedical Engineering. IWBBIO 2026. Lecture Notes in Bioinformatics, vol 15561. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13476 2025-11-18 cs.AI 79%

Multi-Agent Multimodal Large Language Model Framework for Automated Interpretation of Fuel Efficiency Analytics in Public Transportation

Zhipeng Ma, Ali Rida Bahja, Andreas Burgdorf, André Pomp, Tobias Meisen, Bo Nørregaard Jørgensen, Zheng Grace Ma

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI

Journal ref Applied Sciences, 2025, 15(21), 11619

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11898 2025-11-18 cs.CV cs.AI 76%

Prompt Triage: Structured Optimization Enhances Vision-Language Model Performance on Medical Imaging Benchmarks

Arnav Singhvi, Vasiliki Bikia, Asad Aali, Akshay Chaudhari, Roxana Daneshjou

机构 * Stanford University, Department of Computer Science, Stanford, CA, USA(斯坦福大学计算机科学系) Stanford University, Department of Biomedical Data Science, Stanford, CA, USA(斯坦福大学生物医学数据科学系) Stanford University, Stanford Institute for Human-Centered Artificial Intelligence, Stanford, CA, USA(斯坦福大学人类中心人工智能研究所) Stanford University, School of Medicine, Department of Dermatology, Stanford, CA, USA(斯坦福大学医学院皮肤科系) Stanford University, Department of Radiology, Stanford, CA, USA(斯坦福大学放射科)

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13225 2025-11-18 cs.CL 71%

Seeing isn't Hearing: Benchmarking Vision Language Models at Interpreting Spectrograms

Tyler Loakman, Joseph James, Chenghua Lin

机构 * Department of Computer Science, University of Sheffield, UK(谢菲尔德大学计算机科学系) Department of Computer Science, University of Manchester, UK(曼彻斯特大学计算机科学系)

专题命中 其他VLM :vision language model(title)

Comments Accepted to IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12644 2025-11-18 cs.CV 57%

Use as Many Surrogates as You Want: Selective Ensemble Attack to Unleash Transferability without Sacrificing Resource Efficiency

Bo Yang, Hengwei Zhang, Jindong Wang, Yuchen Ren, Chenhao Lin, Chao Shen, Zhengyu Zhao

机构 * Information Engineering University(信息工程大学) Xi’an Jiaotong University(西安交通大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04743 2025-11-18 cs.CV 57%

SRD: Reinforcement-Learned Semantic Perturbation for Backdoor Defense in VLMs

Shuhan Xu, Siyuan Liang, Hongling Zheng, Aishan Liu, Xinbiao Wang, Yong Luo, Fu Lin, Leszek Rutkowski, Dacheng Tao

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12040 2025-11-18 cs.CV 57%

SRSplat: Feed-Forward Super-Resolution Gaussian Splatting from Sparse Multi-View Images

Xinyuan Hu, Changyue Shi, Chuxiao Yang, Minghao Chen, Jiajun Ding, Tao Wei, Chen Wei, Zhou Yu, Min Tan

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments AAAI2026-Oral. Project Page: https://xinyuanhu66.github.io/SRSplat/

详情

展开后加载摘要…

URL PDF HTML 收藏