arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-17 至 2025-11-17 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 9 篇

2511.10671 2025-11-17 cs.CL cs.CV 85%

Grounded Visual Factualization: Factual Anchor-Based Finetuning for Enhancing MLLM Factual Consistency

Filippo Morbiato, Luca Romano, Alessandro Persona

机构 * University of Padua(帕多瓦大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11066 2025-11-17 cs.CV cs.AI cs.CL 73%

S2D-ALIGN: Shallow-to-Deep Auxiliary Learning for Anatomically-Grounded Radiology Report Generation

Jiechao Gao, Chang Liu, Yuangang Li

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23318 2025-11-17 cs.CV cs.AI 73%

FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning

Jiajun Cao, Qizhe Zhang, Peidong Jia, Xuhui Zhao, Bo Lan, Xiaoan Zhang, Zhuo Li, Xiaobao Wei, Sixiang Chen, Liyun Li, Xianming Liu, Ming Lu, Yang Wang, Shanghang Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09063 2025-11-17 cs.LG 70%

Human-Corrected Labels Learning: Enhancing Labels Quality via Human Correction of VLMs Discrepancies

Zhongnian Li, Lan Chen, Yixin Xu, Shi Xu, Xinzheng Xu

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.LG

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10948 2025-11-17 cs.CV cs.HC 70%

DEFT-LLM: Disentangled Expert Feature Tuning for Micro-Expression Recognition

Ren Zhang, Huilai Li, Chao qi, Guoliang Xu, Tianyu Zhou, Wei wei, Jianqin Yin

机构 * College of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(智能工程与自动化学院,北京邮电大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11262 2025-11-17 cs.CV cs.CL 57%

Discovering Meaningful Units with Visually Grounded Semantics from Image Captions

Melika Behjati, James Henderson

机构 * Idiap Research Institute(日内瓦研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10774 2025-11-17 cs.CV 57%

Frequency-Aware Vision-Language Multimodality Generalization Network for Remote Sensing Image Classification

Junjie Zhang, Feng Zhao, Hanqiang Liu, Jun Yu

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11035 2025-11-17 cs.MA 50%

GraphMASAL: A Graph-based Multi-Agent System for Adaptive Learning

Biqing Zeng, Mengquan Liu, Zongwei Zhen

专题命中 VLM训练与架构 :grounding(abstract)

Comments 9 pages, 3 figures,submitted to AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06031 2025-11-17 cs.RO 50%

GELATO: Multi-Instruction Trajectory Reshaping via Geometry-Aware Multiagent-based Orchestration

Junhui Huang, Yuhe Gong, Changsheng Li, Xingguang Duan, Luis Figueredo

机构 * Beijing Institute of Technology (BIT)(北京理工大学) School of Computer Science, University of Nottingham(诺丁汉大学计算机学院)

专题命中 VLM训练与架构 :VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏