Jailbreaking Attack against Multimodal Large Language Model
专题命中 VLM训练与架构 :multimodal large language model(title);LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :multimodal large language model(title);LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :visual language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
Comments Working in progress
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments Accepted to CVPR 2023. Project webpage: https://danielchyeh.github.io/metaper/
ComMem:视觉语言模型测试时自适应的互补记忆系统
机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing, China(生命科学学院,IDG/麦克戈文脑科学研究院,清华大学,北京,中国) ; Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所,北京,中国) ; Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国) ; Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(心理学与认知科学系,清华大学,北京,中国) ; Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心,清华大学,北京,中国)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn,comments);分类 cs.AI
AI总结 提出受生物互补记忆系统启发的ComMem方法,通过快速适应细节记忆和慢速整合抽象记忆协同工作,实现视觉语言模型在测试时的跨模态一致自适应,在15个基准数据集上显著优于现有方法。
Comments A brain-inspired complementary memory framework leveraging fast visual caching and slow textual refinement for VLM test-time adaptation
由非残障人士训练的模型:评估图像质量如何影响产品描述生成
机构 * University of California, Irvine(加州大学尔湾分校) ; Northwestern University(西北大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV
AI总结 研究评估图像质量对视觉语言模型生成产品描述准确性的影响,发现图像质量下降会导致模型性能显著降低,提出改进模型可靠性的建议。
Comments Published at CHI 2026; Honorable Mention for Best Paper (Top 5%). Dataset available at: https://github.com/Accessibility-Research-Collective-UCI/image-quality-vlm-chi26
LLaVA-OneVision-1.5:面向民主化多模态训练的完全开放框架
机构 * LLaVA-OneVision Community Contributors(LLaVA-OneVision社区贡献者)
专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 LLaVA-OneVision-1.5通过开放框架和高效训练方法实现了多模态模型的低成本高性能训练。
Comments LLaVA-OneVision-1.5 Technical Report
机构 * Adobe Research(Adobe研究院) ; Tel Aviv University(特拉维夫大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
Comments Project page at: https://shelley-golan.github.io/VLM-Guided-Creative-Generation/
专题命中 VLM训练与架构 :visual language model(title);vision-language model(abstract,comments);VLM(abstract);分类 cs.CV
Comments Disclaimer: This work is part of a course project and reflects ongoing exploration in the field of vision-language models and calorie estimation. Findings and conclusions are subject to further validation and refinement
RoboSeg:基于单眼在手相机的机器人操作的在线部件级语义重建
机构 * School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程及自动化学院)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract)
AI总结 RoboSeg是无需CAD模型的部件级语义重建系统,结合VLM、TSDF融合与SAM3,实现机器人操作的部件语义索引,在24次物理试验中21次完成综合任务。
VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs
机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) ; Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) ; McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract)
AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。
Comments 16 pages, 5 figures
SeededGrasp:复杂场景中多实体语言引导抓取
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; University of British Columbia(英属哥伦比亚大学) ; Google Deepmind(谷歌DeepMind)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract)
AI总结 针对复杂场景中机器人抓取问题,提出 SeededGrasp 框架,通过 VLM 预测种子点,结合轻量级抓取生成模型,解耦语义与几何执行,无需端到端训练,发布多实体数据集,实验证明该方法优于基线。
跟随我的眼睛:基于VLM的扫视路径预测的后门攻击
专题命中 VLM训练与架构 :VLM(title_cn,summary_cn)
AI总结 本文首次研究了针对基于VLM的扫视路径预测的后门攻击,通过设计两种可变输出攻击方法,展示了如何在不同触发模式下绕过检测,验证了边缘部署系统的实际威胁。
简洁是推理效率的灵魂:通过数据策展诱导VLM的简洁性
机构 * DatologyAI
专题命中 VLM训练与架构 :VLM(title_cn,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出通过预训练数据策展诱导视觉语言模型输出简洁答案,从而降低推理成本,在保持精度的同时实现35倍成本优势。
Comments 36 pages, see https://datologyai.com for more information
“我没生气,只是专注”:理解人机协作中的人类情绪
机构 * Faculty of Engineering, Monash University(莫纳什大学工程学院) ; CSIRO Robotics(CSIRO机器人实验室)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision language model(abstract)
AI总结 提出基于视觉语言模型(VLM)的情绪识别系统,利用上下文理解改善人机协作中的情绪解读,实验表明其语义相似性和情感对齐优于基线CNN系统,且用户偏好情绪自适应机器人行为。
Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8260-8267, July 2026
Wall-OSS-0.5 技术报告
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);grounding(abstract)
AI总结 本文提出Wall-OSS-0.5,一个基于3B VLM骨干网络并增强动作生成组件的4B开源VLA模型,通过梯度桥接联合训练策略,在超过20个实体上预训练,实现零样本真实机器人行为,并在微调后超越π_0.5,证明VLA预训练本身即可产生可执行的机器人能力。
ICED: 通过可解释的概念分解实现概念级机器去学习
机构 * Fujian Normal University(福建师范大学) ; Nanyang Technological University(南洋理工大学) ; University of New South Wales(新南威尔士大学) ; Data61 CSIRO(Data61澳大利亚联邦科学与工业研究组织)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出ICED框架,通过多模态大语言模型构建任务特定概念词汇,实现VLMs中概念级去学习,有效去除目标知识并保留非目标语义,实验表明其在目标遗忘和模型效用方面表现优异。
字典对齐的概念控制用于保护多模态大语言模型
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Amazon(亚马逊) ; University of Central Florida(中佛罗里达大学)
专题命中 VLM训练与架构 :LLaVA(abstract);InternVL(abstract);multimodal large language model(abstract);MLLM(abstract)
AI总结 本文提出字典对齐的概念控制框架,通过定制概念字典和稀疏自编码器实现对多模态大语言模型激活的精细控制,提升安全性的同时保持通用能力。
Comments Accepted in CVPR 2026. Project page: https://peterljq.github.io/project/daco
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)
Comments Preprint
用于自动驾驶汽车鲁棒交通标志感知的视觉-语言模型蒸馏
机构 * Clemson University(克莱姆森大学)
专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.LG
AI总结 本研究提出LAMDA框架,通过冻结OpenCLIP文本编码器构建原型库监督视觉特征,在GTSRB和LISA数据集上,可同时提升TSR模型对三类物理攻击的鲁棒性且不降低干净准确率。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
解耦相似性用于大视觉-语言模型中的任务感知token剪枝
机构 * Wuhan University(武汉大学) ; University of Exeter(埃克塞特大学) ; Chinese Academy of Sciences(中国科学院) ; Xi'an University of Electronic Science and Technology(西安电子科技大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
AI总结 本文提出DeSAP方法,通过解耦相似性实现精准任务感知token剪枝,提升大视觉-语言模型的效率与性能,实验表明在不同基准和架构上均优于现有方法。
Comments Accepted at ACM Multimedia 2026. Camera-ready version
AdaBoosting 文本提示用于视觉-语言模型
机构 * KT Corporation(KT公司) ; Pohang University of Science and Technology (POSTECH)(浦项科技大学) ; National AI Research Lab(国家人工智能研究实验室)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.LG
AI总结 提出文本提示提升(TPB)框架,通过AdaBoost策略将每个文本提示分类器视为弱学习器,顺序集成以聚焦难分类样本,提升少样本分类精度并实现跨模型迁移。
Comments Accepted to ECCV 2026 Spotlight
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.AI
Comments 56 pages, 7 figures
Journal ref Humanit. Soc. Sci. Commun. 13, 300 (2026)
捕捉令牌趋势以实现多模态大语言模型中无需训练的令牌剪枝
机构 * Xiamen University(厦门大学) ; Xiamen Ocean Vocational College(厦门海洋职业技术学院) ; Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV
AI总结 该研究针对多模态大语言模型现有无训练剪枝方法忽略令牌重要性动态变化的问题,提出趋势感知剪枝框架,通过捕捉注意力流动量实现动态修正,大幅减少视觉令牌且保持性能,实现高效多模态推理。
视觉还是认知?多模态大语言模型的视觉上下文敏感性
机构 * University of Copenhagen(哥本哈根大学) ; University of Cambridge(剑桥大学) ; ETH Zürich(苏黎世联邦理工学院) ; Clemson University(克莱姆森大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV
AI总结 该研究探究多模态大语言模型在视觉证据与先验冲突任务上的失效原因,引入WhatIfVis基准,发现其能编码视觉证据但难以控制对其的依赖,监督微调等方法可提升可控性。
用于视觉语言模型智能体强化学习的统一评论家混合优势估计
机构 * KAUST(沙特阿卜杜拉国王科技大学)
专题命中 VLM训练与架构 :VLM(title,abstract_cn);vision-language model(abstract);分类 cs.AI
AI总结 研究视觉语言模型智能体强化学习,提出HyGAE框架,用统一评论家估计值,推导混合优势联合优化令牌和轮次级目标,在多轮决策环境评估中平均成功率91%,比其他方法显著提升10%,证明混合优势解析形式对优化关键。
Comments Accepted by ECCV 2026
UltraViT:用于大型视觉语言模型的延迟优化设备端视觉编码器
机构 * Samsung AI Cambridge(三星人工智能剑桥实验室) ; Technical University of Iasi(雅西技术大学) ; Queen Mary University of London(伦敦玛丽女王大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV
AI总结 针对大型视觉语言模型在设备端部署受限问题,提出UltraViT视觉编码器,通过考虑设备延迟设计金字塔架构,并采用两阶段生成式预训练策略,有效提升编码效率,优于现有基线。
Comments Accepted at ECCV 2026
MQAdapter:用于从粗到细的视觉语言模型微调的多模态量子适配器
机构 * Anhui University(安徽大学) ; Origin Quantum Computing Company Limited(本源量子计算有限公司)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 针对视觉语言模型在少样本学习中细粒度区分不足的问题,提出多模态量子适配器MQAdapter。先检索Top-K候选类别作语义锚点,再用跨模态量子学习机制,利用量子特性建模高阶交互,细化视觉特征,参数高效且能集成现有算法提升性能。
视觉语言模型中的奖励估值:快感缺乏背后的因果机制
机构 * EPFL(苏黎世联邦理工学院)
专题命中 VLM训练与架构 :vision language model(title,abstract);vision-language model(abstract);分类 cs.LG
AI总结 研究探讨视觉语言模型中奖励估值情况,基于神经科学观点,通过有针对性扰动识别奖励预期单元,测试其因果作用,发现模型存在奖励估值和预期缺陷,结果反映了人工智能模型与人类平行的奖励估值回路。
医学视觉语言模型的模型编辑评估与理解
机构 * EECS, University of Michigan(密歇根大学电子工程与计算机科学系)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract_cn);分类 cs.AI
AI总结 针对现有多模态编辑基准不适配临床需求的问题,提出临床基准M3Bench,测试多类编辑方法的性能短板,为医学VLM部署后安全适配提供支撑。
Comments Accepted to the European Conference on Computer Vision (ECCV) 2026. Code and benchmark are available at https://github.com/BioMed-AI-Lab-U-Michgan/M3Bench
MVPruner: 用于加速自动驾驶中多视图视觉语言模型的动态令牌剪枝
机构 * School of Information Engineering, Chang’an University, China(长安大学信息工程学院) ; School of Artificial Intelligence, Shanghai Jiaotong University, China(上海交通大学人工智能学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出MVPruner,一种两阶段自适应令牌剪枝方法,通过动态分配剪枝预算和基于指令的令牌选择,在保持精度的同时大幅降低计算量,实现多视图视觉语言模型的高效推理。
Comments accepted by ECCV26