arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2402.02309 2024-02-07 cs.LG cs.CL cs.CR cs.CV 84%

Jailbreaking Attack against Multimodal Large Language Model

Zhenxing Niu, Haodong Ren, Xinbo Gao, Gang Hua, Rong Jin

专题命中 VLM训练与架构 :multimodal large language model(title);LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12915 2024-01-24 cs.AI cs.CL cs.CV 84%

Red Teaming Visual Language Models

Mukai Li, Lei Li, Yuwei Yin, Masood Ahmed, Zhenguang Liu, Qi Liu

专题命中 VLM训练与架构 :visual language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10169 2023-06-21 cs.CV cs.CL cs.LG 84%

Meta-Personalizing Vision-Language Models to Find Named Instances in Video

Chun-Hsiao Yeh, Bryan Russell, Josef Sivic, Fabian Caba Heilbron, Simon Jenni

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Accepted to CVPR 2023. Project webpage: https://danielchyeh.github.io/metaper/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28719 2026-06-30 cs.AI 84%

ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models

ComMem:视觉语言模型测试时自适应的互补记忆系统

Guanglong Sun, Shuang Cui, Bo Lei, Liyuan Wang, Zihan Zhai, Hongwei Yan, Hang Su, Jun Zhu, Yi Zhong

机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing, China(生命科学学院,IDG/麦克戈文脑科学研究院,清华大学,北京,中国) Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所,北京,中国) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国) Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(心理学与认知科学系,清华大学,北京,中国) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心,清华大学,北京,中国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn,comments);分类 cs.AI

AI总结 提出受生物互补记忆系统启发的ComMem方法,通过快速适应细节记忆和慢速整合抽象记忆协同工作,实现视觉语言模型在测试时的跨模态一致自适应,在15个基准数据集上显著优于现有方法。

Comments A brain-inspired complementary memory framework leveraging fast visual caching and slow textual refinement for VLM test-time adaptation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08917 2026-04-01 cs.HC cs.CV 84%

"It's trained by non-disabled people": Evaluating How Image Quality Affects Product Captioning with Vision-Language Models

由非残障人士训练的模型:评估图像质量如何影响产品描述生成

Kapil Garg, Xinru Tang, Jimin Heo, Dwayne R. Morgan, Darren Gergle, Erik B. Sudderth, Anne Marie Piper

机构 * University of California, Irvine(加州大学尔湾分校) Northwestern University(西北大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV

AI总结 研究评估图像质量对视觉语言模型生成产品描述准确性的影响,发现图像质量下降会导致模型性能显著降低,提出改进模型可靠性的建议。

Comments Published at CHI 2026; Honorable Mention for Best Paper (Top 5%). Dataset available at: https://github.com/Accessibility-Research-Collective-UCI/image-quality-vlm-chi26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23661 2025-12-16 cs.CV 84%

LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training

LLaVA-OneVision-1.5:面向民主化多模态训练的完全开放框架

Xiang An, Yin Xie, Kaicheng Yang, Wenkang Zhang, Xiuwei Zhao, Zheng Cheng, Yirui Wang, Songcen Xu, Changrui Chen, Didi Zhu, Chunsheng Wu, Huajie Tan, Chunyuan Li, Jing Yang, Jie Yu, Xiyao Wang, Bin Qin, Yumeng Wang, Zizhen Yan, Ziyong Feng, Ziwei Liu, Bo Li, Jiankang Deng

机构 * LLaVA-OneVision Community Contributors(LLaVA-OneVision社区贡献者)

专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 LLaVA-OneVision-1.5通过开放框架和高效训练方法实现了多模态模型的低成本高性能训练。

Comments LLaVA-OneVision-1.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10715 2025-10-14 cs.GR cs.CV 84%

VLM-Guided Adaptive Negative Prompting for Creative Generation

Shelly Golan, Yotam Nitzan, Zongze Wu, Or Patashnik

机构 * Adobe Research(Adobe研究院) Tel Aviv University(特拉维夫大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Project page at: https://shelley-golan.github.io/VLM-Guided-Creative-Generation/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09936 2024-12-16 cs.CV 84%

CaLoRAify: Calorie Estimation with Visual-Text Pairing and LoRA-Driven Visual Language Models

Dongyu Yao, Keling Yao, Junhong Zhou, Yinghao Zhang

专题命中 VLM训练与架构 :visual language model(title);vision-language model(abstract,comments);VLM(abstract);分类 cs.CV

Comments Disclaimer: This work is part of a course project and reflects ongoing exploration in the field of vision-language models and calorie estimation. Findings and conclusions are subject to further validation and refinement

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09778 2026-08-11 cs.RO 新提交 83%

RoboSeg: Online Part-Level Semantic Reconstruction for Robotic Manipulation via a Single Eye-in-Hand Camera

RoboSeg:基于单眼在手相机的机器人操作的在线部件级语义重建

Zhaochen Lan, Mengxiang Lin

机构 * School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程及自动化学院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 RoboSeg是无需CAD模型的部件级语义重建系统,结合VLM、TSDF融合与SAM3,实现机器人操作的部件语义索引,在24次物理试验中21次完成综合任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28818 2026-08-05 cs.CL q-bio.NC 版本更新 83%

Do VLMs Align Better with Humans than LLMs during Natural Reading?

VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs

Jinzhou Wu, Zhengwu Ma, Jixing Li, Baoping Tang, Zitong Lu

机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20207 2026-07-23 cs.RO 新提交 83%

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

SeededGrasp:复杂场景中多实体语言引导抓取

Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of British Columbia(英属哥伦比亚大学) Google Deepmind(谷歌DeepMind)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 针对复杂场景中机器人抓取问题,提出 SeededGrasp 框架,通过 VLM 预测种子点,结合轻量级抓取生成模型,解耦语义与几何执行,无需端到端训练,发布多实体数据集,实验证明该方法优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08766 2026-07-03 cs.CR 版本更新 83%

Follow My Eyes: Backdoor Attacks on Goal-Directed Scanpath Prediction

跟随我的眼睛:基于VLM的扫视路径预测的后门攻击

Diana Romero, Mutahar Ali, Momin Ahmad Khan, Habiba Farrukh, Fatima Anwar, Salma Elmalaki

专题命中 VLM训练与架构 :VLM(title_cn,summary_cn)

AI总结 本文首次研究了针对基于VLM的扫视路径预测的后门攻击,通过设计两种可变输出攻击方法,展示了如何在不同触发模式下绕过检测,验证了边缘部署系统的实际威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25432 2026-07-01 cs.LG cs.AI cs.CV 新提交 83%

Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation

简洁是推理效率的灵魂:通过数据策展诱导VLM的简洁性

DatologyAI, :, Matthew L. Leavitt, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, David Schwab, Bogdan Gaza, Ari Morcos

机构 * DatologyAI

专题命中 VLM训练与架构 :VLM(title_cn,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出通过预训练数据策展诱导视觉语言模型输出简洁答案,从而降低推理成本,在保持精度的同时实现35倍成本优势。

Comments 36 pages, see https://datologyai.com for more information

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16816 2026-06-03 cs.RO 83%

"I'm Not Mad, Just Focused'': Understanding Human Emotions in Human-Robot Collaboration

“我没生气,只是专注”:理解人机协作中的人类情绪

Seung Chan Hong, Dana Kulić, Leimin Tian

机构 * Faculty of Engineering, Monash University(莫纳什大学工程学院) CSIRO Robotics(CSIRO机器人实验室)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision language model(abstract)

AI总结 提出基于视觉语言模型(VLM)的情绪识别系统,利用上下文理解改善人机协作中的情绪解读,实验表明其语义相似性和情感对齐优于基线CNN系统,且用户偏好情绪自适应机器人行为。

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8260-8267, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30877 2026-06-02 cs.RO 83%

Wall-OSS-0.5 Technical Report

Wall-OSS-0.5 技术报告

Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vincent Chen, Harrison Huang, James Wang, Dance Kuzi, Andy Zhai, Hang Su, Roy Gan, Lucy Liang, Hao Wang, Qian Wang

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);grounding(abstract)

AI总结 本文提出Wall-OSS-0.5,一个基于3B VLM骨干网络并增强动作生成组件的4B开源VLA模型,通过梯度桥接联合训练策略,在超过20个实体上预训练,实现零样本真实机器人行为,并在微调后超越π_0.5,证明VLA预训练本身即可产生可执行的机器人能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14309 2026-05-18 cs.CV cs.AI cs.LG 83%

ICED: Concept-level Machine Unlearning via Interpretable Concept Decomposition

ICED: 通过可解释的概念分解实现概念级机器去学习

Shen Lin, Jing Lin, Junhao Dong, Piotr Koniusz, Li Xu

机构 * Fujian Normal University(福建师范大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Data61 CSIRO(Data61澳大利亚联邦科学与工业研究组织)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出ICED框架,通过多模态大语言模型构建任务特定概念词汇,实现VLMs中概念级去学习,有效去除目标知识并保留非目标语义,实验表明其在目标遗忘和模型效用方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08846 2026-04-13 cs.LG cs.AI cs.CL cs.CV 83%

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs

字典对齐的概念控制用于保护多模态大语言模型

Jinqi Luo, Jinyu Yang, Tal Neiman, Lei Fan, Bing Yin, Son Tran, Mubarak Shah, René Vidal

机构 * University of Pennsylvania(宾夕法尼亚大学) Amazon(亚马逊) University of Central Florida(中佛罗里达大学)

专题命中 VLM训练与架构 :LLaVA(abstract);InternVL(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出字典对齐的概念控制框架,通过定制概念字典和稀疏自编码器实现对多模态大语言模型激活的精细控制,提升安全性的同时保持通用能力。

Comments Accepted in CVPR 2026. Project page: https://peterljq.github.io/project/daco

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04568 2025-05-20 cs.CV cs.AI cs.CL cs.LG 83%

Feedback-Driven Vision-Language Alignment with Minimal Human Supervision

Giorgio Giannone, Ruoteng Li, Qianli Feng, Evgeny Perevodchikov, Rui Chen, Aleix Martinez

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08815 2026-08-11 cs.LG 新提交 83%

Distilling Vision-Language Models for Robust Traffic Sign Perception in Autonomous Vehicles

用于自动驾驶汽车鲁棒交通标志感知的视觉-语言模型蒸馏

Pedram MohajerAnsari, Amir Salarpour, Mert D. Pesé

机构 * Clemson University(克莱姆森大学)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出LAMDA框架,通过冻结OpenCLIP文本编码器构建原型库监督视觉特征,在GTSRB和LISA数据集上,可同时提升TSR模型对三类物理攻击的鲁棒性且不降低干净准确率。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11240 2026-08-10 cs.CV 版本更新 83%

Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models

解耦相似性用于大视觉-语言模型中的任务感知token剪枝

Kexin Ma, Jing Xiao, Chaofeng Chen, Geyong Min, Guibo Zhu, Jinqiao Wang, Liang Liao

机构 * Wuhan University(武汉大学) University of Exeter(埃克塞特大学) Chinese Academy of Sciences(中国科学院) Xi'an University of Electronic Science and Technology(西安电子科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出DeSAP方法,通过解耦相似性实现精准任务感知token剪枝,提升大视觉-语言模型的效率与性能,实验表明在不同基准和架构上均优于现有方法。

Comments Accepted at ACM Multimedia 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00684 2026-08-06 cs.LG 版本更新 83%

AdaBoosting Text Prompts for Vision-Language Models

AdaBoosting 文本提示用于视觉-语言模型

Seokhee Jin, Changhwan Sung, Sunung Mun, Hoyoung Kim, Jungseul Ok

机构 * KT Corporation(KT公司) Pohang University of Science and Technology (POSTECH)(浦项科技大学) National AI Research Lab(国家人工智能研究实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.LG

AI总结 提出文本提示提升(TPB)框架,通过AdaBoost策略将每个文本提示分类器视为弱学习器,顺序集成以聚焦难分类样本,提升少样本分类精度并实现跨模型迁移。

Comments Accepted to ECCV 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07551 2026-08-05 cs.HC cs.AI cs.DL 83%

ArchiveGPT: A human-centered evaluation of using a vision language model for image cataloguing

Line Abele, Gerrit Anders, Tolgahan Aydın, Jürgen Buder, Helen Fischer, Dominik Kimmel, Markus Huff

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.AI

Comments 56 pages, 7 figures

Journal ref Humanit. Soc. Sci. Commun. 13, 300 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28341 2026-07-31 cs.CV 新提交 83%

Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models

捕捉令牌趋势以实现多模态大语言模型中无需训练的令牌剪枝

Jie Ma, Zhike Qiu, Jie Gao, Jiayi Ji, Qian Chen, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) Xiamen Ocean Vocational College(厦门海洋职业技术学院) Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 该研究针对多模态大语言模型现有无训练剪枝方法忽略令牌重要性动态变化的问题,提出趋势感知剪枝框架,通过捕捉注意力流动量实现动态修正,大幅减少视觉令牌且保持性能,实现高效多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26326 2026-07-30 cs.CV 新提交 83%

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

视觉还是认知?多模态大语言模型的视觉上下文敏感性

Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson

机构 * University of Copenhagen(哥本哈根大学) University of Cambridge(剑桥大学) ETH Zürich(苏黎世联邦理工学院) Clemson University(克莱姆森大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 该研究探究多模态大语言模型在视觉证据与先验冲突任务上的失效原因,引入WhatIfVis基准,发现其能编码视觉证据但难以控制对其的依赖,监督微调等方法可提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23605 2026-07-28 cs.AI 新提交 83%

Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning

用于视觉语言模型智能体强化学习的统一评论家混合优势估计

Wenxuan Zhang, Yuhui Wang, Donggang Jia, Xiaoqian Shen, Jian Ding, Ivan Viola, Jürgen Schmidhuber, Mohamed Elhoseiny

机构 * KAUST(沙特阿卜杜拉国王科技大学)

专题命中 VLM训练与架构 :VLM(title,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 研究视觉语言模型智能体强化学习,提出HyGAE框架,用统一评论家估计值,推导混合优势联合优化令牌和轮次级目标,在多轮决策环境评估中平均成功率91%,比其他方法显著提升10%,证明混合优势解析形式对优化关键。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23373 2026-07-28 cs.CV 新提交 83%

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

UltraViT:用于大型视觉语言模型的延迟优化设备端视觉编码器

Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati, Anestis Zaganidis, Yassine Ouali, Hyeonuk Kim, Georgios Tzimiropoulos

机构 * Samsung AI Cambridge(三星人工智能剑桥实验室) Technical University of Iasi(雅西技术大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 针对大型视觉语言模型在设备端部署受限问题,提出UltraViT视觉编码器,通过考虑设备延迟设计金字塔架构,并采用两阶段生成式预训练策略,有效提升编码效率,优于现有基线。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12418 2026-07-15 cs.CV 新提交 83%

MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning

MQAdapter:用于从粗到细的视觉语言模型微调的多模态量子适配器

Yumiao Zhao, Bo Jiang, Min Lu, Xiao Wang, Jin Tang

机构 * Anhui University(安徽大学) Origin Quantum Computing Company Limited(本源量子计算有限公司)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对视觉语言模型在少样本学习中细粒度区分不足的问题,提出多模态量子适配器MQAdapter。先检索Top-K候选类别作语义锚点,再用跨模态量子学习机制,利用量子特性建模高阶交互,细化视觉特征,参数高效且能集成现有算法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06626 2026-07-09 cs.LG q-bio.NC 新提交 83%

Reward Valuation in Vision Language Models: Causal Mechanisms Underlying Anhedonia

视觉语言模型中的奖励估值:快感缺乏背后的因果机制

Melika Honarmand, Samin Mahdipour Aghabagher, Martin Schrimpf

机构 * EPFL(苏黎世联邦理工学院)

专题命中 VLM训练与架构 :vision language model(title,abstract);vision-language model(abstract);分类 cs.LG

AI总结 研究探讨视觉语言模型中奖励估值情况,基于神经科学观点,通过有针对性扰动识别奖励预期单元,测试其因果作用,发现模型存在奖励估值和预期缺陷,结果反映了人工智能模型与人类平行的奖励估值回路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05310 2026-07-07 cs.AI 新提交 83%

Evaluating and Understanding Model Editing for Medical Vision Language Models

医学视觉语言模型的模型编辑评估与理解

Guli Zhu, Chenwei Wu, Liyue Shen

机构 * EECS, University of Michigan(密歇根大学电子工程与计算机科学系)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract_cn);分类 cs.AI

AI总结 针对现有多模态编辑基准不适配临床需求的问题,提出临床基准M3Bench,测试多类编辑方法的性能短板,为医学VLM部署后安全适配提供支撑。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026. Code and benchmark are available at https://github.com/BioMed-AI-Lab-U-Michgan/M3Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27660 2026-07-02 cs.CV 新提交 83%

MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving

MVPruner: 用于加速自动驾驶中多视图视觉语言模型的动态令牌剪枝

Nan Yang, Zhanwen Liu, Linfeng Zhang, Shangyu Xie, Yang Wang, Wenzhuo Zhou, Xiangmo Zhao

机构 * School of Information Engineering, Chang’an University, China(长安大学信息工程学院) School of Artificial Intelligence, Shanghai Jiaotong University, China(上海交通大学人工智能学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出MVPruner,一种两阶段自适应令牌剪枝方法,通过动态分配剪枝预算和基于指令的令牌选择,在保持精度的同时大幅降低计算量,实现多视图视觉语言模型的高效推理。

Comments accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏