arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-03 至 2025-11-03 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2510.27256 2025-11-03 cs.LG cs.HC 79%

ECVL-ROUTER: Scenario-Aware Routing for Vision-Language Models

Xin Tang, Youfang Han, Fangfei Gou, Wei Zhao, Xin Meng, Yang Yu, Jinguo Zhang, Yuanchun Shi, Yuntao Wang, Tengxiang Zhang

机构 * Tsinghua University(清华大学) Goertek Inc(歌尔股份有限公司)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.LG

Comments 23 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26824 2025-11-03 cs.DL cs.AI cs.IR 57%

LeMat-Synth: a multi-modal toolbox to curate broad synthesis procedure databases from scientific literature

Magdalena Lederbauer, Siddharth Betala, Xiyao Li, Ayush Jain, Amine Sehaba, Georgia Channing, Grégoire Germain, Anamaria Leonescu, Faris Flaifil, Alfonso Amayuelas, Alexandre Nozadze, Stefan P. Schmid, Mohd Zaki, Sudheesh Kumar Ethirajan, Elton Pan, Mathilde Franckel, Alexandre Duval, N. M. Anoop Krishnan, Samuel P. Gleason

专题命中 其他VLM :vision language model(abstract);分类 cs.AI

Comments 29 pages, 13 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏