arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2510.12943 2025-10-21 cs.CL 50%

The Curious Case of Curiosity across Human Cultures and LLMs

Angana Borah, Zhijing Jin, Rada Mihalcea

机构 * University of Michigan - Ann Arbor(密歇根大学安阿伯分校) University of Toronto(多伦多大学) Vector Institute(向量研究所) MPI for Intelligent Systems, Tubingen, Germany(图宾根德国智能系统研究所)

专题命中 VLM训练与架构 :grounding(abstract)

Comments Preprint (Paper under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16592 2025-10-10 cs.CL cs.MM 50%

What Media Frames Reveal About Stance: A Dataset and Study about Memes in Climate Change Discourse

Shijia Zhou, Siyao Peng, Simon M. Luebke, Jörg Haßler, Mario Haim, Saif M. Mohammad, Barbara Plank

机构 * MaiNLP & MCML, LMU Munich, Germany(LMU慕尼黑媒体与传播系) Department of Media and Communication, LMU Munich, Germany(LMU慕尼黑媒体与传播系) National Research Council Canada, Ottawa, Canada(加拿大国家研究委员会)

专题命中 VLM训练与架构 :LLaVA(abstract)

Comments 20 pages, 9 figures, EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00647 2025-10-02 cs.CL 50%

MCM-DPO: Multifaceted Cross-Modal Direct Preference Optimization for Alt-text Generation

Jinlan Fu, Shenzhen Huangfu, Hao Fei, Yichong Huang, Xiaoyu Shen, Xipeng Qiu, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Eastern Institute of Technology(东方技术研究所)

专题命中 VLM训练与架构 :vision-language model(abstract)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26276 2025-10-01 cs.CL cs.SD 50%

Optimizing Speech Language Models for Acoustic Consistency

Morteza Rohanian, Michael Krauthammer

专题命中 VLM训练与架构 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12771 2025-09-17 cs.CL 50%

Contrastive Learning with Enhanced Abstract Representations using Grouped Loss of Abstract Semantic Supervision

Omri Suissa, Muhiim Ali, Shengmai Chen, Yinuo Cai, Shekhar Pradhan

专题命中 VLM训练与架构 :VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11766 2025-09-16 cs.RO 50%

Igniting VLMs toward the Embodied Space

Andy Zhai, Brae Liu, Bruno Fang, Chalse Cai, Ellie Ma, Ethan Yin, Hao Wang, Hugo Zhou, James Wang, Lights Shi, Lucy Liang, Make Wang, Qian Wang, Roy Gan, Ryan Yu, Shalfun Li, Starrick Liu, Sylas Chen, Vincent Chen, Zach Xu

机构 * X SQUARE ROBOT

专题命中 VLM训练与架构 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09629 2025-09-12 cs.CL 50%

Bridging the Capability Gap: Joint Alignment Tuning for Harmonizing LLM-based Multi-Agent Systems

Minghang Zhu, Zhengliang Shi, Zhiwei Xu, Shiguang Wu, Lingjie Wang, Pengjie Ren, Zhaochun Ren, Zhumin Chen

机构 * Shandong University(山东大学) Leiden University(莱顿大学)

专题命中 VLM训练与架构 :grounding(abstract)

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01226 2025-08-05 cs.IR cs.MM 50%

CM$^3$: Calibrating Multimodal Recommendation

Xin Zhou, Yongjie Wang, Zhiqi Shen

专题命中 VLM训练与架构 :MLLM(abstract)

Comments Working Paper: https://github.com/enoche/CM3

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00321 2025-08-04 cs.HC 50%

Evaluating the Efficacy of Large Language Models for Generating Fine-Grained Visual Privacy Policies in Homes

Shuning Zhang, Ying Ma, Xin Yi, Hewu Li

专题命中 VLM训练与架构 :vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23940 2025-07-02 cs.CL 50%

Graft: Integrating the Domain Knowledge via Efficient Parameter Synergy for MLLMs

Yang Dai, Jianxiang An, Tianwei Lin, Hongyang He, Hongzhe Huang, Wenqiao Zhang, Zheqi Lv, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10557 2025-07-01 cs.CL 50%

MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models

Jianhong Tu, Zhuohao Ni, Nicholas Crispino, Zihao Yu, Michael Bendersky, Beliz Gunel, Ruoxi Jia, Xin Liu, Lingjuan Lyu, Dawn Song, Chenguang Wang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) The University of British Columbia(不列颠哥伦比亚大学) Google Research(谷歌研究) Virginia Tech(弗吉尼亚理工大学) University of California, Davis(加州大学戴维斯分校) Sony AI(索尼人工智能) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11874 2025-06-26 cs.CL 50%

VAQUUM: Are Vague Quantifiers Grounded in Visual Data?

Hugh Mee Wong, Rick Nouwen, Albert Gatt

机构 * Utrecht University(乌特勒支大学)

专题命中 VLM训练与架构 :VLM(abstract)

Comments Proceedings of ACL 2025, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03673 2025-06-09 cs.RO 50%

RoboOS: A Hierarchical Embodied Framework for Cross-Embodiment and Multi-Agent Collaboration

Huajie Tan, Xiaoshuai Hao, Cheng Chi, Minglan Lin, Yaoxu Lyu, Mingyu Cao, Dong Liang, Zhuo Chen, Mengsi Lyu, Cheng Peng, Chenrui He, Yulong Ao, Yonghua Lin, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 VLM训练与架构 :MLLM(abstract)

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22584 2025-05-29 cs.IR 50%

DocReRank: Single-Page Hard Negative Query Generation for Training Multi-Modal RAG Rerankers

Navve Wasserman, Oliver Heinimann, Yuval Golbari, Tal Zimbalist, Eli Schwartz, Michal Irani

专题命中 VLM训练与架构 :VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18864 2025-05-27 cs.CL 50%

Audio Jailbreak Attacks: Exposing Vulnerabilities in SpeechGPT in a White-Box Framework

Binhao Ma, Hanqing Guo, Zhengping Jay Luo, Rui Duan

机构 * Department of Computer Science University of Missouri-Kansas City(计算机科学系 密苏里大学-康科特分校) Department of Computer Science and Physics Rider University(计算机科学与物理系 Rider大学) Department of Electrical and Computer Engineering University of Hawai’i at Mānoa(电气与计算机工程系 夏威夷大学马诺亚分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05517 2025-05-20 cs.CL 50%

SWIFT:A Scalable lightWeight Infrastructure for Fine-Tuning

Yuze Zhao, Jintao Huang, Jinghan Hu, Xingjun Wang, Yunlin Mao, Daoze Zhang, Hong Zhang, Zeyinzi Jiang, Zhikai Wu, Baole Ai, Ang Wang, Wenmeng Zhou, Yingda Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 VLM训练与架构 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14285 2025-05-20 cs.CL 50%

Vulnerability of Text-to-Image Models to Prompt Template Stealing: A Differential Evolution Approach

Yurong Wu, Fangwen Mu, Qiuhong Zhang, Jinjing Zhao, Xinrun Xu, Lingrui Mei, Yang Wu, Lin Shi, Junjie Wang, Zhiming Ding, Yiwei Wang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of California at Merced(加州大学默塞德分校) University of Chinese Academy of Sciences(中国科学院大学) The University of Sydney(悉尼大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

Comments 14 pages,8 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16856 2025-04-24 cs.CL 50%

Emo Pillars: Knowledge Distillation to Support Fine-Grained Context-Aware and Context-Less Emotion Classification

Alexander Shvets

机构 * NLP Group, Pompeu Fabra University, Barcelona, Spain(自然语言处理组,庞培法布拉大学,巴塞罗那,西班牙) Language Technologies Unit, Barcelona Supercomputing Center, Spain(语言技术单元,巴塞罗那超级计算中心,西班牙)

专题命中 VLM训练与架构 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07110 2025-04-22 eess.SY cs.SY 50%

Bio-Eng-LMM AI Assist chatbot: A Comprehensive Tool for Research and Education

Ali Forootani, Danial Esmaeili Aliabadi, Daniela Thraen

专题命中 VLM训练与架构 :LLaVA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08849 2025-04-17 eess.SP 50%

ECG-Chat: A Large ECG-Language Model for Cardiac Disease Diagnosis

Yubao Zhao, Jiaju Kang, Tian Zhang, Puyu Han, Tong Chen

专题命中 VLM训练与架构 :multimodal large language model(abstract)

Comments Accepted by 2025 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18416 2025-04-16 cs.MM 50%

Muse: A Multimodal Conversational Recommendation Dataset with Scenario-Grounded User Profiles

Zihan Wang, Xiaocui Yang, Yongkang Liu, Shi Feng, Daling Wang, Yifei Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21106 2025-04-15 cs.CL 50%

Function Alignment: A New Theory of Mind and Intelligence, Part I: Foundations

Gus G. Xia

专题命中 VLM训练与架构 :grounding(abstract)

Comments 12 pages, 2 figures. Part I of a multi-part position paper on a new theory of mind

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12940 2025-04-01 cs.CL 50%

Improving Fine-grained Visual Understanding in VLMs through Text-Only Training

Dasol Choi, Guijin Son, Soo Yong Kim, Gio Paik, Seunghyeok Hong

专题命中 VLM训练与架构 :VLM(abstract)

Comments AAAI25 workshop accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09313 2025-03-18 cs.CL cs.IR 50%

xVLM2Vec: Adapting LVLM-based embedding models to multilinguality using Self-Knowledge Distillation

Elio Musacchio, Lucia Siciliani, Pierpaolo Basile, Giovanni Semeraro

专题命中 VLM训练与架构 :vision-language model(abstract)

Comments fix typo in number of tasks in MMEB; fix url for source code; added missing reference to XTD10

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09481 2025-03-13 cs.CL 50%

BAMBI: Developing Baby Language Models for Italian

Alice Suozzi, Luca Capone, Gianluca E. Lebani, Alessandro Lenci

专题命中 VLM训练与架构 :VLM(abstract)

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04724 2025-03-07 cs.CL 50%

LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLM

Sambal Shikhar, Mohammed Irfan Kurpath, Sahal Shaji Mullappilly, Jean Lahoud, Fahad Khan, Rao Muhammad Anwer, Salman Khan, Hisham Cholakkal

专题命中 VLM训练与架构 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21260 2025-03-03 eess.IV 50%

PET Image Denoising via Text-Guided Diffusion: Integrating Anatomical Priors through Text Prompts

Boxiao Yu, Savas Ozdemir, Jiong Wu, Yizhou Chen, Ruogu Fang, Kuangyu Shi, Kuang Gong

专题命中 VLM训练与架构 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19917 2025-02-28 cs.CL 50%

Picking the Cream of the Crop: Visual-Centric Data Selection with Collaborative Agents

Zhenyu Liu, Yunxin Li, Baotian Hu, Wenhan Luo, Yaowei Wang, Min Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract)

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00249 2025-02-19 eess.AS 50%

Acoustic Prompt Tuning: Empowering Large Language Models with Audition Capabilities

Jinhua Liang, Xubo Liu, Wenwu Wang, Mark D. Plumbley, Huy Phan, Emmanouil Benetos

专题命中 VLM训练与架构 :visual language model(abstract)

Comments Published at IEEE Transactions on Audio, Speech and Language Processing

Journal ref IEEE Transactions on Audio, Speech and Language Processing (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09170 2025-02-14 cs.RO 50%

LimSim Series: An Autonomous Driving Simulation Platform for Validation and Enhancement

Daocheng Fu, Naiting Zhong, Xu Han, Pinlong Cai, Licheng Wen, Song Mao, Botian Shi, Yu Qiao

专题命中 VLM训练与架构 :VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏