arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-20 至 2025-08-20 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5 篇

2508.13470 2025-08-20 cs.CV cs.AI 88%

STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models

Tinh-Anh Nguyen-Nhu, Triet Dao Hoang Minh, Dat To-Thanh, Phuc Le-Gia, Tuan Vo-Lan, Tien-Huy Nguyen

机构 * Ho Chi Minh University of Technology(胡志明理工大学) Vietnamese-German University(越德大学) Ho Chi Minh University of Science(胡志明理工大学) University of Information Technology(信息科技大学) Vietnam National University, Ho Chi Minh city(越南国家大学,胡志明市)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI

Comments ICCV Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13524 2025-08-20 cs.CV cs.AI 84%

Evaluating Open-Source Vision Language Models for Facial Emotion Recognition against Traditional Deep Learning Models

Vamsi Krishna Mulukutla, Sai Supriya Pavarala, Srinivasa Raju Rudraraju, Sridevi Bonthu

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Journal ref EAI Endorsed Transactions on AI and Robotics, 4, August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13460 2025-08-20 cs.CV 83%

Revisiting MLLM Token Technology through the Lens of Classical Visual Coding

Jinming Liu, Junyan Lin, Yuntao Wei, Kele Shao, Keda Tao, Jianguo Huang, Xudong Yang, Zhibo Chen, Huan Wang, Xin Jin

机构 * Eastern Institute of Technology, Ningbo, China(东部技术研究所) Westlake University(西湖大学) USTC(中国科学技术大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04680 2025-08-20 cs.LG cs.AI cs.CV 75%

Identify, Isolate, and Purge: Mitigating Hallucinations in LVLMs via Self-Evolving Distillation

Wenhao Li, Xiu Su, Jingyi Wu, Feng Yang, Yang Liu, Yi Chen, Shan You, Chang Xu

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments In Figure 2, the correlation coefficient and the scatter plot do not match. I calculated this correlation using two sets of settings. I used the scatter plot from setting A, but accidentally wrote the correlation coefficient, r, from setting B

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13439 2025-08-20 cs.CV cs.AI cs.CL eess.IV 73%

Structured Prompting and Multi-Agent Knowledge Distillation for Traffic Video Interpretation and Risk Inference

Yunxiang Yang, Ningning Xu, Jidong J. Yang

机构 * Smart Mobility and Infrastructure Lab(智能移动与基础设施实验室) College of Engineering, University of Georgia(工程学院,佐治亚大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 16 pages, 10 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏