arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-12 至 2025-09-12 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 6 篇

2509.08913 2025-09-12 eess.IV 85%

Generalized User-Oriented Image Semantic Coding Empowered by Large Vision-Language Model

Sin-Yu Huang, Vincent W. S. Wong

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract)

Comments Accepted by IEEE Global Communications Conference (GLOBECOM), Taipei, Taiwan, Dec. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09064 2025-09-12 cs.CV 79%

Enhancing 3D Medical Image Understanding with Pretraining Aided by 2D Multimodal Large Language Models

Qiuhui Chen, Xuancheng Yao, Huping Ye, Yi Hong

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted by IEEE Journal of Biomedical and Health Informatics (JBHI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09356 2025-09-12 cs.AI cs.RO 70%

Curriculum-Based Multi-Tier Semantic Exploration via Deep Reinforcement Learning

Abdel Hakim Drid, Vincenzo Suriani, Daniele Nardi, Abderrezzak Debilou

机构 * Department of Electrical Engineering - Mohamed Khider, University of Biskra, Biskra (Algeria)(巴尔克拉大学电子工程系) Department of Engineering - University of Basilicata, Potenza (Italy)(巴塞里卡大学工程系) Department of Computer, Control, and Management Engineering ``Antonio Ruberti'', Sapienza University of Rome, Rome (Italy)(罗马萨皮恩扎大学计算机、控制与管理工程系)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments The 19th International Conference on Intelligent Autonomous Systems (IAS 19), 2025, Genoa

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09311 2025-09-12 cs.CV 70%

Image Recognition with Vision and Language Embeddings of VLMs

Illia Volkov, Nikita Kisel, Klara Janouskova, Jiri Matas

机构 * Visual Recognition Group, Faculty of Electrical Engineering, Czech Technical University in Prague(视觉识别组,电气工程学院,布拉格捷克技术大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08940 2025-09-12 cs.CV 57%

Discovering Divergent Representations between Text-to-Image Models

Lisa Dunlap, Joseph E. Gonzalez, Trevor Darrell, Fabian Caba Heilbron, Josef Sivic, Bryan Russell

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Accepted to ICCV 2025. Code available at https://github.com/adobe-research/CompCon

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09629 2025-09-12 cs.CL 50%

Bridging the Capability Gap: Joint Alignment Tuning for Harmonizing LLM-based Multi-Agent Systems

Minghang Zhu, Zhengliang Shi, Zhiwei Xu, Shiguang Wu, Lingjie Wang, Pengjie Ren, Zhaochun Ren, Zhumin Chen

机构 * Shandong University(山东大学) Leiden University(莱顿大学)

专题命中 VLM训练与架构 :grounding(abstract)

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏