arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-21 至 2025-10-21 共收录 13 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 13 篇

2503.06073 2025-10-21 cs.CL cs.AI cs.CV 86%

GEM: Empowering MLLM for Grounded ECG Understanding with Time Series and Images

Xiang Lan, Feng Wu, Kai He, Qinghao Zhao, Shenda Hong, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Peking University People’s Hospital(北京大学人民医院) Peking University(北京大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2025 Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17777 2025-10-21 cs.CV 83%

SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference

Samir Khaki, Junxian Guo, Jiaming Tang, Shang Yang, Yukang Chen, Konstantinos N. Plataniotis, Yao Lu, Song Han, Zhijian Liu

机构 * NVIDIA MIT(麻省理工学院) UC San Diego(南加州大学圣地亚哥分校) University of Toronto(多伦多大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16870 2025-10-21 cs.CV 83%

Uncovering Brain-Like Hierarchical Patterns in Vision-Language Models through fMRI-Based Neural Encoding

Yudan Ren, Xinlong Wang, Kexin Wang, Tian Xia, Zihan Ma, Zhaowei Li, Xiangrong Bi, Xiao Li, Xiaowei He

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10090 2025-10-21 cs.RO cs.AI 83%

Manual2Skill: Learning to Read Manuals and Acquire Robotic Skills for Furniture Assembly Using Vision-Language Models

Chenrui Tie, Shengxiang Sun, Jinxuan Zhu, Yiwei Liu, Jingxiang Guo, Yue Hu, Haonan Chen, Junting Chen, Ruihai Wu, Lin Shao

机构 * National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) Peking University(北京大学) Sichuan University(四川大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

Journal ref Robotics: Science and Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17197 2025-10-21 cs.CV cs.AI 81%

ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models

Pu Zhang, Yuwei Li, Xingyuan Xian, Guoming Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15430 2025-10-21 cs.CV cs.AI 81%

Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models

Shuang Liang, Zhihao Xu, Jialing Tao, Hui Xue, Xiting Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Withdrawn due to an accidental duplicate submission. This paper (arXiv:2510.15430) was unintentionally submitted as a new entry instead of a new version of our previous work (arXiv:2508.09201)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17205 2025-10-21 cs.CV cs.CL 70%

$\mathcal{V}isi\mathcal{P}runer$: Decoding Discontinuous Cross-Modal Dynamics for Efficient Multimodal LLMs

Yingqi Fan, Anhao Zhao, Jinlan Fu, Junlong Tong, Hui Su, Yijie Pan, Wei Zhang, Xiaoyu Shen

机构 * Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT, Ningbo(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT,宁波) Shanghai Jiao Tong University(上海交通大学) Hong Kong Polytechnic University(香港理工大学) Meituan Inc.(美团公司) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13061 2025-10-21 cs.CV 70%

Advancing Complex Wide-Area Scene Understanding with Hierarchical Coresets Selection

Jingyao Wang, Yiming Chen, Lingyu Si, Changwen Zheng

机构 * Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of the Chinese Academy of Sciences(中国科学院大学) Beijing University of Technology(北京理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted by ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17041 2025-10-21 cs.CV cs.AI cs.LG 67%

Free$^2$Guide: Training-Free Text-to-Video Alignment using Image LVLM

Jaemin Kim, Bryan Sangwoo Kim, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICCV 2025 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22904 2025-10-21 cs.HC cs.AI 57%

SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches

Ehsan Latif, Zirak Khan, Xiaoming Zhai

机构 * AI4STEM Education Center University of Georgia(AI4STEM教育中心乔治亚大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

Comments Submitted to NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01879 2025-10-21 cs.MM cs.CV cs.SD eess.AS 57%

Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision

Che Liu, Yingji Zhang, Dong Zhang, Weijie Zhang, Chenggong Gong, Yu Lu, Shilin Zhou, Ziliang Gan, Ziao Wang, Haipang Wu, Ji Liu, André Freitas, Qifan Wang, Zenglin Xu, Rongjuncheng Zhang, Yong Dai

机构 * Imperial College London(伦敦帝国学院) University of Manchester(曼彻斯特大学) HiThink Research(HiThink研究院) Soochow University(苏州大学) Hong Kong Baptist University(香港 Baptist大学) Idiap Research Institute(Idiap研究 institute) Meta AI Fudan University(复旦大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Project: https://github.com/HiThink-Research/NEXUS-O

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15682 2025-10-21 cs.CV 57%

ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval

Guanqi Zhan, Yuanpei Liu, Kai Han, Weidi Xie, Andrew Zisserman

机构 * VGG, University of Oxford(牛津大学视觉几何组) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by CBMI 2025 (IEEE International Conference on Content-Based Multimedia Indexing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12943 2025-10-21 cs.CL 50%

The Curious Case of Curiosity across Human Cultures and LLMs

Angana Borah, Zhijing Jin, Rada Mihalcea

机构 * University of Michigan - Ann Arbor(密歇根大学安阿伯分校) University of Toronto(多伦多大学) Vector Institute(向量研究所) MPI for Intelligent Systems, Tubingen, Germany(图宾根德国智能系统研究所)

专题命中 VLM训练与架构 :grounding(abstract)

Comments Preprint (Paper under review)

详情

展开后加载摘要…

URL PDF HTML 收藏