arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-19 至 2025-09-19 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5 篇

2406.14596 2025-09-19 cs.CV cs.AI cs.LG 85%

VLM Agents Generate Their Own Memories: Distilling Experience into Embodied Programs of Thought

Gabriel Sarch, Lawrence Jang, Michael J. Tarr, William W. Cohen, Kenneth Marino, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) Google DeepMind(谷歌DeepMind)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project website: https://ical-learning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15076 2025-09-19 cs.LG cs.CV 84%

Forecasting and Visualizing Air Quality from Sky Images with Vision-Language Models

Mohammad Saleh Vahdatpour, Maryam Eyvazi, Yanqing Zhang

机构 * Georgia State University(佐治亚州立大学) Savannah College of Art and Design(萨凡纳艺术与设计学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Published at ICCVW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09808 2025-09-19 cs.CV cs.AI 84%

Fine-tuning Vision Language Models with Graph-based Knowledge for Explainable Medical Image Analysis

Chenjun Li, Laurin Lux, Alexander H. Berger, Martin J. Menten, Mert R. Sabuncu, Johannes C. Paetzold

机构 * School of Electrical and Computer Engineering, Cornell University(电气与计算机工程学院,康奈尔大学) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) Cornell Tech(康奈尔科技) Weill Cornell Medicine(韦尔·康奈尔医学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14735 2025-09-19 cs.CL 82%

Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM

Chenkun Tan, Pengyu Wang, Shaojun Zhou, Botian Jiang, Zhaowei Li, Dong Zhang, Xinghao Wang, Yaqian Zhou, Xipeng Qiu

机构 * Fudan University(复旦大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract)

Comments Accepted by Findings of EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14982 2025-09-19 cs.CV cs.CL 57%

Large Multi-modal Models Can Interpret Features in Large Multi-modal Models

Kaichen Zhang, Yifei Shen, Bo Li, Ziwei Liu

机构 * S-Lab, NTU, Singapore(新加坡国立大学S实验室) LMMs-Lab Team(多模态模型实验室团队) Microsoft Research Asia(微软亚洲研究院)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏