arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-11 至 2025-11-11 共收录 73 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 17 篇

2511.02113 2025-11-11 cs.IR 78%

Enhancing Multimodal Recommendations with Vision-Language Models and Information-Aware Fusion

Hai-Dang Kieu, Min Xu, Thanh Trung Huynh, Dung D. Le

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05680 2025-11-11 cs.RO 78%

VLM-driven Skill Selection for Robotic Assembly Tasks

Jeong-Jung Kim, Doo-Yeol Koh, Chang-Hyun Kim

机构 * Department of AI Machinery, Korea Institute of Machinery & Materials(人工智能机械系,韩国机械材料研究院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19404 2025-11-11 cs.CV 77%

LangBridge: Interpreting Image as a Combination of Language Embeddings

Jiaqi Liao, Yuwei Niu, Fanqing Meng, Hao Li, Changyao Tian, Yinuo Du, Yuwen Xiong, Dianqi Li, Xizhou Zhu, Li Yuan, Jifeng Dai, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) PengCheng Laboratory(鹏城实验室) Chongqing University(重庆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV

Comments The code and weights are open-sourced. Project page: https://curryx-001.github.io/LangBridge.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06619 2025-11-11 cs.RO cs.AI 70%

How Do VLAs Effectively Inherit from VLMs?

Chuheng Zhang, Rushuai Yang, Xiaoyu Chen, Kaixin Wang, Li Zhao, Yi Chen, Jiang Bian

机构 * Microsoft Research(微软研究院) The Hong Kong University of Science(香港科学大学) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05841 2025-11-11 cs.CV cs.AI 62%

Understanding Cross Task Generalization in Handwriting-Based Alzheimer's Screening via Vision Language Adaptation

Changqing Gong, Huafeng Qin, Mounim A. El-Yacoubi

机构 * Telecom SudParis, Institut Polytechnique de Paris(电信 SudParis,巴黎理工学院)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06653 2025-11-11 cs.CV cs.CL 57%

HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment

Ruijia Wu, Ping Chen, Fei Shen, Shaoan Zhao, Qiang Hui, Huanlin Gao, Ting Lu, Zhaoxiang Liu, Fang Zhao, Kai Wang, Shiguo Lian

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by AAAI 2026 as an Oral Presentation (13 pages, 7 figures, 7 tables)

Journal ref AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21412 2025-11-11 cs.CV 57%

Bridging the gap to real-world language-grounded visual concept learning

Whie Jung, Semin Kim, Junee Kim, Seunghoon Hong

机构 * School of Computing, KAIST(计算机学院,韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Journal ref Advances in Neural Information Processing Systems (NeurIPS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06225 2025-11-11 cs.CV 57%

MoRA: Missing Modality Low-Rank Adaptation for Visual Recognition

Shu Zhao, Nilesh Ahuja, Tan Yu, Tianyi Shen, Vijaykrishnan Narayanan

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Intel(英特尔) NVIDIA(英伟达)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07607 2025-11-11 cs.CV 57%

X2Edit: Revisiting Arbitrary-Instruction Image Editing through Self-Constructed Data and Task-Aware Representation Learning

Jian Ma, Xujie Zhu, Zihao Pan, Qirong Peng, Xu Guo, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12547 2025-11-11 cs.CL cs.AI 57%

Revealing emergent human-like conceptual representations from language prediction

Ningyu Xu, Qi Zhang, Chao Du, Qiang Luo, Xipeng Qiu, Xuanjing Huang, Menghan Zhang

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Institute of Modern Languages and Linguistics(现代语言与语言学研究所) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理重点实验室) Research Institute of Intelligent Complex Systems(智能复杂系统研究所) Institute of Trustworthy Embodied Artificial Intelligence(可信具身人工智能研究所) State Key Laboratory of Genetics and Development of Complex Phenotypes(复杂表型遗传与发育国家重点实验室)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

Comments 66 pages. Accepted manuscript. Final version published in Proceedings of the National Academy of Sciences (PNAS): https://www.pnas.org/doi/10.1073/pnas.2512514122

Journal ref Proceedings of the National Academy of Sciences, U.S.A., 122 (44) e2512514122 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 3 篇

2504.18800 2025-11-11 cs.CV cs.AI 62%

Video CLIP Model for Multi-View Echocardiography Interpretation

Ryo Takizawa, Satoshi Kodera, Tempei Kabayama, Ryo Matsuoka, Yuta Ando, Yuto Nakamura, Haruki Settai, Norihiko Takeda

机构 * The University of Tokyo Hospital(东京大学医院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06297 2025-11-11 cs.HC cs.AI 57%

Decomate: Leveraging Generative Models for Co-Creative SVG Animation

Jihyeon Park, Jiyoon Myung, Seone Shin, Jungki Son, Joohyung Han

机构 * MODULABS

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

Comments Accepted at the 1st Workshop on Generative and Protective AI for Content Creation (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06195 2025-11-11 cs.HC cs.AI 57%

AI as intermediary in modern-day ritual: An immersive, interactive production of the roller disco musical Xanadu at UCLA

Mira Winick, Naisha Agarwal, Chiheb Boussema, Ingrid Lee, Camilo Vargas, Jeff Burke

机构 * UCLA(加州大学洛杉矶分校)

专题命中 其他VLM :vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏