Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title)
Comments Accepted at Findings of EMNLP2024
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title)
Comments Accepted at Findings of EMNLP2024
MemCatalyst:通过数据投毒增强视觉-语言模型的数据审计
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.LG
AI总结 本研究提出MemCatalyst数据投毒工具,通过文本与图像投毒策略增强视觉-语言模型的成员推断审计性能,在黑盒设置下投毒样本可跨架构迁移,仅需少量投毒样本即可提升审计效果且不影响模型性能。
中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.AI
AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。
Comments 41 pages, 31 figures, 9 tables. Preprint
VLM2Rec: 解决视觉语言模型嵌入器在多模态序列推荐中的模态崩溃问题
机构 * Pohang University of Science
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出VLM2Rec框架,通过弱模态惩罚对比学习和跨模态关系拓扑正则化,解决多模态序列推荐中模态崩溃问题,提升推荐准确性和鲁棒性。
在视觉语言模型中保留局部化补丁语义
机构 * Department of Computer and Information Sciences, Temple University, Philadelphia, USA(计算机与信息科学系,特兰普大学,费城,美国)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV
AI总结 为解决视觉语言模型中图像与文本 tokens 信息扩散问题,提出 Logit Lens Loss(LLL)以保留图像 tokens 的局部化语义,提升模型可解释性和分割任务性能。
DiffPrune:用于视觉-语言模型中 token 剪枝的可微信息节流方法
机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) ; CUHK MMLab, CPII under InnoHK(香港中文大学MMLab,InnoHK下属CPII)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 DiffPrune 是一种用于视觉-语言模型的可微 token 剪枝方法,通过信息节流器避免松弛选择的不稳定性,在保留 96.5% 准确率的同时实现 2.85 倍 LLM 预填充加速,推理开销仅 0.69 毫秒。
跨架构视觉语言模型中基于方向的推理时防御措施审计
专题命中 VLM训练与架构 :vision-language model(title);LLaVA(abstract,abstract_cn);vision language model(abstract);分类 cs.AI
AI总结 该研究审计了视觉语言模型中5种基于方向的推理时防御,发现其性能具架构特异性,部分防御间几何重叠,需按解码器家族单独校准。
RetiBridge:用知识引导的多模态大语言模型连接定量视网膜生物标志物与定性诊断
机构 * University of Liverpool(利物浦大学) ; Institute of Life Course & Medical Sciences(生命课程与医学科学研究院) ; Department of Eye and Vision Sciences(眼科与视觉科学系) ; Computer Science Department(计算机科学系) ; Cardiovascular & Metabolic Medicine(心血管与代谢医学) ; Liverpool Centre for Cardiovascular Science(利物浦心血管科学中心)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 该研究提出RetiBridge模型,结合CFP、OCT数据与文本,通过知识引导微调学习定量到定性诊断路径,在眼科理解基准上表现优于开源基线及OpenAI o3,代码数据已公开。
Comments 10 pages, 4 figures, 3 table. Equal contribution: Zhuangzhi Gao and Hongyi Qin. Corresponding author: Yalin Zheng (yzheng@liverpool.ac.uk)
MedARC:面向3D医学视觉-语言模型的无训练视觉令牌自适应冗余压缩
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对3D医学VLMs的视觉令牌冗余压缩问题,本文提出无训练框架MedARC,整合三类线索估计令牌重要性,通过显著性感知合并策略压缩令牌,在CT-RATE和MR-RATE上实现性能保持的同时降低开销。
Comments 9 pages
DICA:多模态大语言模型中的双指标引导对比对齐
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。
零努力图像到音乐生成:一种可解释的基于RAG的视觉语言模型方法
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The University of Hong Kong(香港大学) ; The Hong Kong University of Science(香港科学大学) ; The Hong Kong Polytechnic University Hong Kong China(香港理工大学香港中国) ; The University of Hong Kong Hong Kong China(香港大学香港中国)
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.AI
AI总结 本文提出一种基于RAG的视觉语言模型方法,实现图像到音乐生成,通过ABC记谱法连接文本与音乐模态,并利用多模态检索增强生成和自反思技术,提供高可解释性且低计算成本的音乐生成方案。
FADE: 通过减少大型视觉语言模型中的语言先验主导性来缓解幻觉
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.AI
AI总结 本文通过分析信息流,发现FFN模块在关键层引入语言先验,主导视觉证据,导致幻觉;提出无需训练的FADE方法衰减FFN输出,有效缓解幻觉并保持推理效率。
Comments 18 pages, 5 figures, 27 tables
增强视觉语言模型以理解多样传感器:成本高效的优化与基准测试
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出传感器感知属性微调(SAFT)与多样负属性(DNA)优化,利用少量传感器数据克服RGB中心偏见,无需修改模型架构,显著提升非RGB传感器图像理解,并发布首个综合基准VS-TDX。
Comments The manuscript was posted before all internal disclosure and documentation checks were completed. We are withdrawing this version to avoid confusion while the authors complete the necessary review process
看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础
机构 * Utrecht University(乌得勒支大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.AI
AI总结 研究视觉-语言模型在对话中是否混淆潜在共享与已共享信息,发现模型过度依赖地图内容预测对齐,忽视对话历史中的基础建立过程。
Comments 17 pages, 9 figures, 8 tables; accepted to SIGDIAL 2026
一种丰富手术视频数据集的方法,用于视觉-语言模型的细粒度时空理解
机构 * Hamburg University of Technology(汉堡理工大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出SurgSTU-Pipeline生成管道,通过时空连续性过滤创建细粒度时空问答数据集SurgSTU,提升视觉-语言模型在手术视频中的时空理解能力。
让语言约束几何:视觉-语言模型作为3D生成的语义和空间评判者
机构 * Peking University(北京大学) ; hi-lab, Xiaohongshu Inc.(小红书科技公司 hi-lab) ; MMLab, CUHK(香港中文大学 MMLab) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出VLM3D框架,利用视觉-语言模型作为可微分的语义和空间评判者,通过双查询评判信号改善文本到3D生成的语义对齐和几何一致性。
Comments arXiv admin note: substantial text overlap with arXiv:2509.15772
CheXanatomy: 面向胸部X光片的解剖感知视觉-语言建模
机构 * Stanford Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学医学与影像人工智能中心) ; Department of Radiology, Stanford University(斯坦福大学放射学系)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出CheXanatomy框架,通过自回归令牌空间监督将解剖知识融入预训练视觉-语言模型,实现解剖分割,在合成和真实X光片上性能媲美U-Net,并提升域迁移鲁棒性和样本效率。
FlowTrain:面向工业级视觉-语言模型的基于流的解耦训练
机构 * Huawei(华为)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.LG
AI总结 提出FlowTrain框架,通过生产者-消费者数据流和统一内存池解耦编码器与主干网络训练,采用异构并行分配器和动态打包调度器,实现超过50% MFU和1.7倍吞吐量提升。
逐步令牌选择用于高效多模态大语言模型
机构 * Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV
AI总结 提出一种基于指针机制的逐步视觉令牌选择方法,通过可微松弛实现端到端训练,动态决定保留令牌数量,在去除88.9%令牌时保持94.6%准确率并加速1.88倍。
视觉编码器作为隐私边界:无编码器视觉-语言模型中的视觉令牌侧信道
机构 * School of Engineering, Institute of Science Tokyo(东京科学大学工学院) ; College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) ; Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 研究无编码器视觉-语言模型中视觉令牌侧信道导致的隐私泄露问题,通过解码器攻击从中间视觉令牌恢复图像和文本,发现空间采样保真度是关键因素,并指出KV缓存也存在泄露风险。
Video2LoRA: 视觉-语言模型的参数化视频内化
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出Video2LoRA方法,通过感知器超网络从视频编码中直接生成LoRA适配器,实现零视觉令牌的视频查询,在保持性能的同时大幅降低计算成本。
Comments https://frames2lora.github.io/
EdgeFM: 为视觉-语言模型高效边缘推理设计的框架
机构 * Go Further. AI ; School of Data Science Fudan University(复旦大学数据科学学院) ; RUYi Dynamics Co. Ltd(RUYi Dynamics有限公司) ; Independent Researcher(独立研究者)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 EdgeFM通过轻量级代理驱动框架,优化边缘部署的视觉-语言模型推理,提升跨平台性能和可移植性,实现比传统工具链更快的推理速度。
Comments Technique Report version
UNIVID:用于视频审核的统一视觉语言模型
机构 * Bytedance(字节跳动)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出UNIVID统一视觉语言模型,通过生成可解释的策略感知字幕,实现端到端视频审核,减少违规泄露42.7%和过度审核率37.0%。
Comments 7 pages, 3 figures. Accepted to ACL 2026 Industry Track
Food-R1: 一种基于强化学习的统一多任务食品视觉语言模型
机构 * Huazhong University of Science and Technology(华中科技大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对现有食品视觉语言模型依赖监督微调导致推理和泛化能力受限以及营养标注稀缺的问题,提出包含链式思维标注的大规模基准CalorieBench-80K和基于强化微调(GRPO)的统一多任务食品视觉语言模型Food-R1,在食品相关任务上持续超越强基线。
AsymVLM:面向高效视觉-语言模型推理的非对称令牌剪枝
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.LG
AI总结 针对视觉和文本令牌在预填充与解码阶段的不同特性,提出非对称剪枝方法AsymVLM,通过视觉令牌的激进剪枝和文本令牌的基于阈值的驱逐,实现高达54%的FLOPs节省并在文档和图表理解任务上提升2-3%的准确率。
多轮自适应提示攻击对大型视觉-语言模型
机构 * The University of Melbourne(墨尔本大学) ; The University of Adelaide(阿德莱德大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV
AI总结 提出多轮自适应提示攻击(MAPA),通过交替文本-视觉攻击动作和跨轮迭代调整攻击轨迹,显著提升对大型视觉-语言模型的多轮越狱攻击成功率。
超越代理梯度:面向视觉-语言模型的完全可微分令牌剪枝
机构 * Shenzhen University of Advanced Technology(深圳大学先进技术学院) ; CUHK MMLab(香港中文大学MMLab) ; CPII under InnoHK(创新工场CPII)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出DiffPrune方法,通过将剪枝重新表述为令牌信息的连续控制而非离散选择学习,利用信息节流阀调节令牌,实现完全可微分的令牌重要性学习,在保持96.5%全模型精度的同时将LLM预填充加速2.85倍。
Ablate-to-Validate: 视觉语言模型真的在使用连续思维令牌吗?
机构 * University of Washington(华盛顿大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出了一种诊断原则Ablate-to-Validate,通过Token Replacement Test(TRT)测试视觉语言模型是否真正利用了连续令牌内容,发现模型性能提升可能并非源于令牌内容,而是令牌存在本身。
一种用于显微镜视觉-语言模型中高效提示选择的人机协作框架
机构 * University of South Florida(佛罗里达州立大学) ; SRC Biosciences(SRC生物科学公司)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出了一种人机协作框架,通过目标驱动的主动学习方法解决显微镜视觉-语言模型中提示集构建的问题,减少专家验证图像的数量,提高分类性能。
Comments Accepted to CVPR workshops, 2026
医学语境扭曲了临床视觉语言模型的决策
机构 * MICS(医学信息学中心) ; CentraleSupélec - Université Paris-Saclay(中央超导学院 - 巴黎萨克雷大学) ; Cancer Data Science Unit(癌症数据科学单元) ; IHU PRISM ; National Institute in Precision Oncology(精准肿瘤学国家研究所) ; University Paris-Saclay(巴黎萨克雷大学) ; CentraleSupelec(中央超导学院) ; Gustave Roussy(儒勒-维维安-圣拉扎尔医院) ; INSERM(国家医学研究院) ; CONICET(阿根廷国家科研与技术创新委员会) ; Universidad de Buenos Aires(布宜诺斯艾利斯大学)
专题命中 VLM训练与架构 :vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 本文研究了医学语境对临床视觉语言模型决策的影响,发现模型在整合医学记录的视觉和文本信息时存在模态依赖、无关历史依赖和提示敏感性等问题,强调了在临床应用前需要建立明确的保障措施。