arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5095 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5095 篇

2602.22462 2026-02-27 cs.CV cs.IR 78%

MammoWise: Multi-Model Local RAG Pipeline for Mammography Report Generation

MammoWise:多模型本地RAG流水线用于乳腺X线摄影报告生成

Raiyan Jahangir, Nafiz Imtiaz Khan, Amritanand Sudheerkumar, Vladimir Filkov

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 VLM训练与架构 :LLaVA(abstract,comments);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 MammoWise是一种本地多模型流水线,通过多任务分类和检索增强生成技术,实现乳腺X线摄影报告的高准确度生成与分类。

Comments arXiv preprint (submitted 25 Feb 2026). Local multi-model pipeline for mammography report generation + classification using prompting, multimodal RAG (ChromaDB), and QLoRA fine-tuning; evaluates MedGemma, LLaVA-Med, Qwen2.5-VL on VinDr-Mammo and DMID; reports BERTScore/ROUGE-L and classification metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14797 2026-08-18 cs.CL 新提交 78%

Beyond Tokens: A Survey on Decoding Methods for Large Language and Vision-Language Models

超越令牌:大型语言与视觉-语言模型的解码方法综述

Haoran Wang, Xiongxiao Xu, Philip S. Yu, Kai Shu

机构 * Emory University(埃默里大学) Illinois Institute of Technology(伊利诺伊理工大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract)

AI总结 该综述针对LLMs与LVLMs,梳理其解码方法的三种新兴范式,强调解码方法在确保模型输出与用户意图一致上的高效性,同时指出挑战并展望未来方向。

Comments ACM SIGKDD Explorations Newsletter, Volume 28, Issue 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25355 2026-07-29 cs.SD 新提交 78%

From Semantics to Readout: Mechanistic Understanding of Audio Tokens after Fine-Tuning for Temporal Audio Grounding

从语义到读出:时间音频接地微调后音频令牌的机制理解

Yujian Ma, Jinqiu Sang, Ruizhe Li, Jiaao Yu, Ang Li

专题命中 VLM训练与架构 :grounding(title,abstract)

AI总结 研究大型音频语言模型中音频令牌在微调后的机制,通过四种分析研究其分层语义等,发现微调前已有潜在证据,微调后解码器更易访问事件信息,支持从语义到读出的解释,有助于解码器连接时间输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20956 2026-07-21 cs.CV cs.AI cs.LG 版本更新 78%

BUSTR: Descriptor-Aware Vision-Language Learning for Breast Ultrasound Report Generation

BUSTR:用于乳腺超声报告生成的描述符感知视觉语言学习

Rawa Mohammed, Mina Attin, Laxmi Gewali, Bryar Shareef

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

AI总结 针对公共BUS数据集缺乏配对报告限制模型发展的问题,提出BUSTR框架,利用结构化病变信息,通过构建描述符派生报告、训练多头编码器及双重目标指导训练,提升了乳腺超声报告生成的相似性和描述符恢复能力。

Comments 17 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05738 2026-06-25 cs.CL 版本更新 78%

MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language Models

MedLayBench-V:面向医学视觉语言模型中专家与普通人语义对齐的大规模基准

Han Jang, Junhyeok Lee, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University College of Medicine(首尔国立大学医学院) Department of Radiology, Seoul National University Hospital(首尔国立大学医院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院健康人工智能研究所) The Advanced Imaging and Computational Neuroimaging (AICON) Laboratory(先进影像与计算神经影像实验室)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract)

AI总结 提出首个大规模多模态基准MedLayBench-V,通过结构化概念基础精炼管道实现专家-普通人语义对齐,用于训练和评估能弥合医患沟通鸿沟的医学视觉语言模型。

Comments Findings of ACL 2026. 9 pages, 5 figures, 11 tables, plus appendix

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 18375-18394

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22123 2026-05-14 cs.CL 78%

Multilingual Vision-Language Models, A Survey

多语言视觉-语言模型:综述

Andrei-Alexandru Manea, Jindřich Libovický

机构 * Faculty of Mathematics and Physics, Charles University, V Holešovičkách 747/2, Prague, Czech Republic(数学与物理系,查尔斯大学,V Holešovičkách 747/2,布拉格,捷克共和国)

专题命中 VLM训练与架构 :vision-language model(title,abstract)

AI总结 本文综述了处理多语言文本和图像的视觉-语言模型,分析了语言中立性与文化意识之间的矛盾,指出对比学习在训练中的主导地位及文化适应性的数据依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10485 2026-05-12 cs.RO 78%

VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models

VEGA:面向空间感知的视觉编码器对齐用于视觉-语言-动作模型

Hao Wang, Xiaobao Wei, Jingyang He, Chengyu Bai, Chun-Kai Fan, Jiajun Cao, Jintao Chen, Ying Li, Shanyu Rong, Ming Lu, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLM训练与架构 :grounding(title,abstract)

AI总结 VEGA通过直接对齐视觉编码器输出与空间感知特征,提升视觉-语言-动作模型的空间意识,实现更可解释的对齐目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24380 2026-04-28 cs.CL 78%

Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency

大型视觉语言模型的结构剪枝:对剪枝动态、恢复和数据效率的全面研究

Yiran Huang, Lukas Thede, Massimiliano Mancini, Wenjia Xu, Zeynep Akata

机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) Munich Center for Machine Learning, Germany(慕尼黑机器学习中心,德国) Helmholtz Munich, Germany(海德堡-慕尼黑赫尔姆霍尔茨研究中心,德国) University of Tübingen, Tübingen AI Center, Germany(图宾根大学,图宾根人工智能中心,德国) University of Trento, Italy(特伦托大学,意大利) Beijing University of Posts and Telecommunications, China(北京邮电大学,中国)

专题命中 VLM训练与架构 :vision language model(title,abstract)

AI总结 本文研究了通过结构化剪枝压缩现有大型视觉语言模型的方法,发现宽度剪枝在低资源环境下表现更优,结合监督微调和隐藏状态蒸馏可实现高效恢复,仅需5%的数据即可保持95%性能。

Comments Accepted at International Journal of Computer Vision (IJCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06883 2026-04-28 cs.IR 78%

Structural and Disentangled Adaptation of Large Vision Language Models for Multimodal Recommendation

大型视觉语言模型的结构和解耦适应用于多模态推荐

Zhongtao Rao, Peilin Zhou, Dading Chong, Zhiwei Chen, Shoujin Wang, Nan Tang

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract)

AI总结 本文提出SDA框架,通过跨模态结构对齐和模态解耦适应,解决多模态推荐中表示不一致和梯度冲突问题,实验显示在三个Amazon数据集上提升了推荐性能。

Comments Accepted to SIGIR '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16943 2026-04-21 cs.CL 78%

MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation

MNAFT:多模态大语言模型的模态神经感知微调用于图像翻译

Bo Li, Ningyuan Deng, Tianyu Dong, Shaobo Wang, Shaolin Zhu, Lijie Wen

机构 * School of Computer Science and Technology, Tianjin University, Tianjin, China(天津大学计算机科学与技术学院) School of Software, Tsinghua University, Beijing, China(清华大学软件学院) School of Information Resource Management, Renmin University of China,Beijing, China(中国人民大学信息资源管理学院) School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Baidu Inc., Beijing, China(百度公司)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract)

AI总结 本文提出MNAFT,通过识别视觉和语言模块中语言无关和语言特定的神经元,改进多模态大语言模型在图像翻译中的表现,实验表明其优于现有方法。

Comments Accepted by SCIS (SCIENCE CHINA Information Science)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05546 2026-04-15 cs.CL 78%

Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects

大型视觉-语言模型高效推理:瓶颈、技术与前景

Jun Zhang, Yicheng Ji, Feiyang Ren, Yihang Li, Bowen Zeng, Zonghao Chen, Ke Chen, Lidan Shou, Gang Chen, Huan Li

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract)

AI总结 本文系统分析了大型视觉-语言模型推理中的效率瓶颈,提出基于推理生命周期的分类技术,探讨了信息密度、长上下文注意力管理和内存限制的平衡,并展望了未来四个前沿方向。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05614 2026-04-08 cs.RO 78%

Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment

通过显式语言-动作对齐实现层次化视觉-语言-动作模型的 grounding

Theodor Wulff, Federico Tavella, Rahul Singh Maharjan, Manith Adikari, Angelo Cangelosi

机构 * The University of Manchester(曼彻斯特大学)

专题命中 VLM训练与架构 :grounding(title,abstract)

AI总结 本文提出通过显式语言-动作对齐训练框架,提升视觉-语言-动作模型的 grounding 能力,基于 LanguageTable 数据集验证了多模态 grounding 表示的有效性,并建立强基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15093 2026-03-24 eess.SP cs.IT math.IT 78%

Beam Prediction Based on Multimodal Large Language Models

基于多模态大语言模型的波束预测

Tianhao Mao, Le Liang, Jie Yang, Xiao Li, Shi Jin, Geoffrey Ye Li

专题命中 VLM训练与架构 :multimodal large language model(title,abstract)

AI总结 本文提出基于多模态大语言模型的波束预测框架,通过融合RGB图像和LiDAR点云等异构数据,提升动态环境下波束预测精度与通信性能,实验表明其在波束准确性和通信性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15414 2026-03-11 eess.IV 78%

Entropy-and-Channel-Aware Adaptive-Rate Semantic Communication with MLLM-Aided Feature Compensation

熵与信道感知的自适应速率语义通信 with MLLM辅助特征补偿

Weixuan Chen, Qianqian Yang, Yuhao Chen, Chongwen Huang, Qian Wang, Zehui Xiong, Zhaoyang Zhang

专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract)

AI总结 本文提出一种基于熵与信道感知的自适应速率语义通信框架,利用MLLM辅助特征补偿提升通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08219 2026-02-10 cs.HC 78%

HOICraft: In-Situ VLM-based Authoring Tool for Part-Level Hand-Object Interaction Design in VR

HOICraft:基于VLM的现场手-物体交互设计VR部分级作者工具

Dohui Lee, Qi Sun, Sang Ho Yoon

专题命中 VLM训练与架构 :VLM(title,abstract)

AI总结 HOICraft是一种基于VLM的VR手-物体交互设计工具,通过推荐可交互元素、自定义属性和映射手部运动,提升VR中HOI设计效率。

Comments 25 pages, 15 figures, Presented at ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18065 2026-01-27 cs.CL 78%

Grounded Concreteness: Human-Like Concreteness Sensitivity in Vision-Language Models

grounded concreteness: 人类-like 的 concreteness 敏感性在 vision-language 模型中

Aryan Roy, Zekun Wang, Christopher J. MacLellan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLM训练与架构 :vision-language model(title);grounding(abstract)

AI总结 本文研究了视觉语言模型在纯文本提示下对concreteness的敏感性,并发现其在更具体的输入上表现更优,具有更清晰的表示和更符合人类规范的判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04275 2025-12-01 cs.DC 78%

DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models

DistTrain: 通过解耦训练解决多模态大语言模型中的模型与数据异质性

Zili Zhang, Yinmin Zhong, Yimin Jiang, Hanpeng Hu, Jianjian Sun, Zheng Ge, Yibo Zhu, Daxin Jiang, Xin Jin

专题命中 VLM训练与架构 :multimodal large language model(title,abstract)

AI总结 DistTrain通过解耦模型编排和数据预处理,提升多模态大语言模型的训练效率和资源利用率。

Comments SIGCOMM 2025 (https://dl.acm.org/doi/10.1145/3718958.3750472)

Journal ref SIGCOMM'25: Proceedings of the ACM SIGCOMM 2025 Conference Pages 24-38

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08970 2025-11-13 astro-ph.SR 78%

JW-Flare: Accurate Solar Flare Forecasting Method Based on Multimodal Large Language Models

Mingfu Shao, Hui Wang, Yuyang Li, Jiaben Lin, Jifeng Liu, Baolin Tan, Juan Guo, Yin Zhang, Jing Huang, Jiangtao Su, Yingzi Sun, Haiqing Xu, Jie Chen, Suo Liu, Yuanyong Deng, Liyue Tong, Yang Bai, Cunshi Wang, Kaifan Ji, Yuqing Zhou

专题命中 VLM训练与架构 :multimodal large language model(title,abstract)

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07777 2025-11-12 eess.SP 78%

A Causal-Guided Multimodal Large Language Model for Generalized Power System Time-Series Data Analytics

Zhenghao Zhou, Yiyan Li, Xinjie Yu, Runlong Liu, Zelin Guo, Zheng Yan, Mo-Yuen Chow, Yuqi Yang, Yang Xu

专题命中 VLM训练与架构 :multimodal large language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02113 2025-11-11 cs.IR 78%

Enhancing Multimodal Recommendations with Vision-Language Models and Information-Aware Fusion

Hai-Dang Kieu, Min Xu, Thanh Trung Huynh, Dung D. Le

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05680 2025-11-11 cs.RO 78%

VLM-driven Skill Selection for Robotic Assembly Tasks

Jeong-Jung Kim, Doo-Yeol Koh, Chang-Hyun Kim

机构 * Department of AI Machinery, Korea Institute of Machinery & Materials(人工智能机械系,韩国机械材料研究院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04012 2025-11-07 cs.SE 78%

PSD2Code: Automated Front-End Code Generation from Design Files via Multimodal Large Language Models

Yongxi Chen, Lei Chen

专题命中 VLM训练与架构 :multimodal large language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02234 2025-11-05 cs.MM cs.CL cs.SD 78%

An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM

Jiawei Liu, Enis Berk Çoban, Zarina Schevchenko, Hao Tang, Zhigang Zhu, Michael I Mandel, Johanna Devaney

机构 * The Graduate Center, CUNY(CUNY研究生中心) Brooklyn College, CUNY(CUNY布鲁克林学院) Borough of Manhattan Community College, CUNY(CUNY曼哈顿社区学院) The City College of New York, CUNY(CUNY纽约城市学院)

专题命中 VLM训练与架构 :MLLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20859 2025-10-27 q-bio.NC 78%

Vision-language models learn the geometry of human perceptual space

Craig Sanders, Billy Dickson, Sahaj Singh Maini, Robert Nosofsky, Zoran Tiganj

专题命中 VLM训练与架构 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19375 2025-09-29 cs.LG cs.AI cs.CL cs.CV cs.HC 78%

DOTA: Distributional Test-Time Adaptation of Vision-Language Models

Zongbo Han, Jialong Yang, Guangyu Wang, Junfan Li, Qianli Xu, Mike Zheng Shou, Changqing Zhang

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology Shenzhen(哈尔滨工业大学深圳学院) Institute for Infocomm Research, A*STAR(信息通信研究机构,A*STAR) Show Lab, National University of Singapore(新加坡国立大学Show实验室) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10696 2025-08-15 cs.CE 78%

Chem3DLLM: 3D Multimodal Large Language Models for Chemistry

Lei Jiang, Shuzhou Sun, Biqing Qi, Yuchen Fu, Xiaohua Xu, Yuqiang Li, Dongzhan Zhou, Tianfan Fu

专题命中 VLM训练与架构 :multimodal large language model(title,abstract)

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10416 2025-08-07 cs.MM cs.SD eess.AS 78%

Can Sound Replace Vision in LLaVA With Token Substitution?

Ali Vosoughi, Jing Bi, Pinxin Liu, Yunlong Tang, Chenliang Xu

专题命中 VLM训练与架构 :LLaVA(title);vision-language model(abstract)

Comments Project page: https://ali-vosoughi.github.io/SoundCLIP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18940 2025-07-28 cs.CL cs.MM 78%

LLaVA-NeuMT: Selective Layer-Neuron Modulation for Efficient Multilingual Multimodal Translation

Jingxuan Wei, Caijun Jia, Qi Chen, Yujun Cai, Linzhuang Sun, Xiangxiang Zhang, Gaowei Wu, Bihui Yu

机构 * University of Chinese Academy of Sciences(中国科学院大学) The University of Queensland(昆士兰大学)

专题命中 VLM训练与架构 :LLaVA(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01067 2025-06-12 cs.AI cs.CL cs.CV cs.HC cs.LG 78%

Human-like object concept representations emerge naturally in multimodal large language models

Changde Du, Kaicheng Fu, Bincheng Wen, Yi Sun, Jie Peng, Wei Wei, Ying Gao, Shengpei Wang, Chuncheng Zhang, Jinpeng Li, Shuang Qiu, Le Chang, Huiguang He

机构 * State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Neuroscience, State Key Laboratory of Brain Cognition and Brain-Inspired Intelligence Technology(神经科学研究所) CAS Center for Excellence in Brain Science and Intelligence Technology(中国科学院脑科学与智能技术卓越创新中心) Chinese Academy of Sciences(中国科学院)

专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV、cs.AI、cs.LG

Comments Published on Nature Machine Intelligence

Journal ref Nature Machine Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05130 2025-05-27 cs.DC 78%

CacheFL: Privacy-Preserving and Efficient Federated Cache Model Fine-Tuning for Vision-Language Models

Mengjun Yi, Hanwen Zhang, Hui Dou, Jian Zhao, Furao Shen

专题命中 VLM训练与架构 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏