arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-03 至 2025-10-03 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 3 篇

2510.01576 2025-10-03 cs.CV cs.AI cs.HC 84%

Guiding Multimodal Large Language Models with Blind and Low Vision People Visual Questions for Proactive Visual Interpretations

Ricardo Gonzalez Penuela, Felipe Arias-Russi, Victor Capriles

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 7 pages, 2 figure, 2 tables, CV4A11y Workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17551 2025-10-03 cs.MM cs.AI cs.CV cs.SD eess.AS 81%

Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion

Yu Sun, Yin Li, Ruixiao Sun, Chunhui Liu, Fangming Zhou, Ze Jin, Linjie Wang, Xiang Shen, Zhuolin Hao, Hongyu Xiong

机构 * ByteDance Inc.(字节跳动公司)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01247 2025-10-03 cs.CL cs.AI 57%

Let's Play Across Cultures: A Large Multilingual, Multicultural Benchmark for Assessing Language Models' Understanding of Sports

Punit Kumar Singh, Nishant Kumar, Akash Ghosh, Kunal Pasad, Khushi Soni, Manisha Jaishwal, Sriparna Saha, Syukron Abu Ishaq Alfarozi, Asres Temam Abagissa, Kitsuchart Pasupa, Haiqin Yang, Jose G Moreno

机构 * Indian Institute of Technology Patna(印度理工学院帕纳布分校) Sardar Patel Institute of Technology(萨达尔·帕特尔技术学院) Universitas Gadjah Mada(加查马大学) King Mongkut’s Institute of Technology Ladkrabang(拉差班国王技术学院) Shenzhen Technology University(深圳技术大学) Université de Toulouse(图卢兹大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

Comments 52 pages, 56 figures; appearing at EMNLP'25

详情

展开后加载摘要…

URL PDF HTML 收藏