VILA: On Pre-training for Visual Language Models
专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV
Comments CVPR 2024
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV
Comments CVPR 2024
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);visual language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,journal_ref);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
Journal ref ICLR 2025, BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks. In Proceedings of the International Conference on Learning Representations (ICLR), 2025
专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 25 pages, 25M file size. Project Page: https://llava-vl.github.io/llava-plus/
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV、cs.AI、cs.LG
Comments Published at International Conference on Computer Vision (ICCV) 2023. Poster at https://xuanlinli17.github.io/pdfs/iccv23_large_vlm_distillation_poster.pdf
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV、cs.AI、cs.LG
Comments IJCV minor revision; 16 pages; code: https://github.com/Imbalance-VLM/Imbalance-VLM
从街景图像到街道质量指标:面向郊区15分钟城市的视觉语言推理
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文以法国尼斯东北部郊区为研究对象,采用开源的SAGAI工作流,利用视觉语言模型从街景图像评估街景质量,发现理想街景仅存在于部分郊区区域,证明了VLM可支持郊区城市诊断,助力循证规划。
Comments 16 pages, 4 figures
视觉相似性的多种意义:一种文本提示的图像感知度量
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 研究人类视觉相似性判断的上下文依赖问题,通过引入大规模数据集微调VLM,产生能捕捉多种视觉相似性意义的TPIPS度量,该度量与人类感知更契合,还在多种任务中开启新功能。
Comments Project Webpage: https://peterwang512.github.io/TPIPS Code: https://github.com/adobe-research/TPIPS
用于视觉令牌剪枝的AI4AI框架
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。
TransVLM:一种用于检测任意 shot 转换的视觉-语言框架和基准
机构 * University of Melbourne(墨尔本大学) ; HeyGen Research(HeyGen研究院) ; Nanyang Technological University(南洋理工大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 TransVLM 提出了一种视觉-语言框架,通过注入光流作为关键运动先验,提升对任意 shot 转换的检测能力,同时设计了可扩展的数据引擎和基准测试,实验表明其性能优于传统方法和现有 VLM。
Comments v2: Corrected an inaccurate statement in the abstract regarding production deployment. Accepted by ECCV 2026. For more related research, please visit HeyGen Research (https://www.heygen.com/research) and HeyGen Avatar-V (https://www.heygen.com/research/avatar-v-model). Project page: https://chence17.github.io/TransVLM/
基于OpenStreetMap的领域自适应方法:为遥感VLMs的领域适应
机构 * INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里德斯』)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出OSMDA方法,利用OpenStreetMap数据生成自标注数据,无需人工标注或强外部模型,通过细调基础VLM实现遥感领域适应,经10个基准测试显示其在文本生成任务中达到SOTA,且训练成本更低。
RefineSVG:视觉反馈驱动的图像转SVG生成强化学习
机构 * Shenzhen University(深圳大学) ; Peking University(北京大学)
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 RefineSVG是一种视觉反馈驱动的闭环框架,通过引入SVG语义词汇表和渐进式训练,使MLLM实现高保真图像转SVG生成,性能优于现有基线。
Comments 17 pages, 5 main-paper figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). Includes the complete supplementary material
用基于树图解析支持的加权班扎夫交互解释生物医学CLIP
机构 * University of Warsaw(华沙大学) ; Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对视觉语言模型在医学任务中解释难的问题,引入ParseFIxLIP方法,将树图解析融入班扎夫交互博弈,通过smart_depth分组策略减轻概念碎片化,提升跨模态交互可解释性,为VLM决策提供医学领域相关见解。
Comments 12 pages, 13 figures. Accepted at EXPLIMED 2026 (Third Workshop on Explainable Artificial Intelligence for the medical domain), IJCAI-ECAI 2026
T2T-VICL:通过隐式文本驱动的视觉语言模型进行跨任务视觉上下文学习
机构 * Duke University(杜克大学) ; Texas A&M University(德克萨斯农工大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究跨任务视觉上下文学习问题,提出T2T-VICL协作式提示转移框架,通过大教师VLM生成结构化描述构建数据集,提炼能力到轻量级学生VLM,实验表明该框架能改进任务感知对齐,揭示跨任务VICL的潜力与局限。
Comments 22 pages, 6 figures, under submission
概念树:一个可控的合成数据框架助力更强的个性化视觉语言模型
机构 * Peking University(北京大学) ; CUHK MMLab(香港中文大学MMLab) ; Zhongguancun Academy(中关村学院) ; Beijing Key Laboratory of Data Intelligence and Security(北京数据智能与安全重点实验室)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究提升VLM个性化能力问题,提出概念树(CaT)框架,以树结构表示概念生成多样正负样本,经数据过滤策略确保质量,实验证明该框架显著增强VLM在个性化基准测试中的能力,是首个可控合成数据管道。
Comments ECCV26 Camera Ready
COMFYCLAW:面向图像生成工作流的自进化技能工具包
机构 * University of Maryland(马里兰大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Nvidia(英伟达) ; Lehigh University(里海大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 提出COMFYCLAW框架,通过类型化图编辑、区域级VLM验证器和渐进式技能库进化,提升ComfyUI工作流构建的代理可靠性和性能,在多个基准上取得最佳平均评分。
视觉虫洞:异构多智能体系统中的潜在空间通信
机构 * Purdue University(普渡大学) ; Contextual AI(情境人工智能) ; Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 提出Vision Wormhole框架,通过通用视觉编解码器将推理轨迹映射到共享连续空间,实现异构VLM间的潜在状态传输,无需配对翻译器,降低对齐复杂度并提升效率。
Comments Preprint. Work in progress
MGVQ:协同多维敏感度感知与梯度-海森融合的向量量化
机构 * Bauman Moscow State Technical University(巴甫洛夫莫斯科国立技术大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 提出MGVQ框架,通过敏感度引导的结构化混合精度量化和梯度感知的二阶误差补偿,实现视觉-语言模型的超低位向量量化,在2-bit量化下最高提升4.9个点。
GAZE:基于视图级工具和文献检索的 grounded 零样本评估
机构 * Imperial College London, UK(伦敦帝国学院) ; University of Toronto, Canada(多伦多大学) ; University College London, UK(伦敦大学学院)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 GAZE框架通过调用视图级工具和文献检索工具,使医学VLM在迭代方式下工作,实现对罕见脑MRI的零样本评估,提升病变定位和诊断准确率。
机构 * University of Washington(华盛顿大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);grounding(abstract)
Comments ACL 2025; 19 pages, 3 figures
专题命中 VLM训练与架构 :LLaVA(abstract);visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)
Comments published at COLM-2024
哪种预训练范式更有利于空间智能?视觉-语言模型与视频生成模型的实证比较
机构 * Zhejiang University(浙江大学) ; Om AI Research(Om人工智能研究) ; Binjiang Institute of Zhejiang University(浙江大学滨江研究院)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 本文通过冻结特征探测研究,系统比较了视觉-语言模型(VLM)和视频生成模型(VGM)在语义标注、实例分组和3D几何预测三个空间智能维度上的表现,发现两者互补且简单融合可提升整体性能。
Comments Code is here: \href{https://github.com/om-ai-lab/Probing-VLM-VGM}{https://github.com/om-ai-lab/Probing-VLM-VGM}
多模态大语言模型的令牌通信
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)
AI总结 本文针对多模态大语言模型(MLLMs)的令牌传输问题,提出适配MLLMs的令牌通信框架,通过集成神经编解码器、两阶段语义对齐训练及自适应适配器,在相同传输数据量下实现更优任务性能。
Comments 13 pages, 11 figures, 2 tables
用于联邦多模态大语言模型微调的弹性正则化和合成重放持续学习
机构 * The University of British Columbia(英属哥伦比亚大学) ; Fudan University(复旦大学) ; Royal College of Science, Imperial College London(伦敦帝国理工学院皇家科学学院) ; Dyson School of Design Engineering(戴森设计工程学院) ; Suzhou Institute of Biomedical Engineering and Technology (SIBET), Chinese Academy of Sciences(中国科学院苏州生物医学工程技术研究所) ; East China Normal University(华东师范大学)
专题命中 VLM训练与架构 :MLLM(title,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究针对联邦多模态大语言模型微调中灾难性遗忘问题,提出FedCMM框架,在参数、数据、聚合三个层面嵌入持续学习保障,经实验验证该框架在准确性和反向迁移上优于基线,能实现跨异构网络AI部署的稳健进化适应。
Comments submitted to IEEE JSTSP
$M^2$-VLA:通过层混合与元技能提升视觉语言模型的通用操控能力
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai, China(智能机器人与先进制造学院,复旦大学,上海,中国) ; Synapath
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn)
AI总结 本文提出$M^2$-VLA,通过层混合和元技能模块提升视觉语言模型在机器人操控中的泛化能力,实验验证了其在模拟和现实环境中的有效性。
M2Note: 通过错误笔记本学习实现视觉语言模型的持续演化
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract,abstract_cn)
AI总结 提出M2Note,一种无需训练的持续演化框架,通过将失败轨迹转化为可编辑的笔记,利用多模态检索增强生成在推理时引导模型,避免重复错误,并在多个基准上提升性能。
从理论到决策规则:校准视觉-语言模型弱监督的噪声标签交叉点——基于三个医学影像基准
机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)
专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 通过三个医学影像基准校准理论预测的噪声标签交叉点,提出基于少量金标标签的决策规则。
Comments 5 pages, 2 figures, 4 tables
使用Cornstarch高效分布式多模态大语言模型训练
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract)
AI总结 提出Cornstarch框架,通过冻结感知流水线并行和令牌工作负载平衡的上下文并行,解决多模态大语言模型训练中的异构性问题,平均吞吐量提升2.26倍。
Comments ICML'26