arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2604.20366 2026-04-23 cs.CV 89%

Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation

在不降低性能的情况下缓解大型视觉-语言模型的幻觉

Xingyu Zhu, Junfeng Fang, Shuo Wang, Beier Zhu, Zhicai Wang, Yonghui Yang, Xiangnan He

机构 * MoE Key Lab of BIPC(BIPC摩尔实验室) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出MPD框架,通过语义感知组件解耦和可解释参数更新,有效减少幻觉并保持生成能力,实验显示在LLaVA-Bench和MME上减少23.4%幻觉同时保持97.4%的生成能力。

Comments ACL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17041 2026-04-21 cs.CV 89%

SIF: Semantically In-Distribution Fingerprints for Large Vision-Language Models

SIF:用于大视觉-语言模型的语义内分布指纹

Yifei Zhao, Qian Lou, Mengxin Zheng

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出SIF,一种无需参数修改的非侵入性所有权验证框架,通过语义对齐指纹蒸馏和鲁棒指纹优化,提升大视觉-语言模型的版权保护能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00013 2026-08-04 cs.CL cs.AI cs.CV 新提交 88%

What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态

Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13178 2026-06-02 cs.CV cs.AI 88%

CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models

CLIP Tricks You: 面向大型视觉-语言模型中高效像素定位的无训练令牌剪枝

Sangin Lee, Yukyung Choi

机构 * KAIST(韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 提出LiteLVLM,一种无需训练、文本引导的令牌剪枝策略,通过反转CLIP视觉-文本相似度排序,保留指代区域令牌并恢复上下文令牌,实现高效像素定位推理,在多种令牌预算下性能提升超5%,保持90%原始性能同时加速22%并减少2.3倍内存。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24346 2026-04-28 cs.CV cs.AI 88%

SycoPhantasy: Quantifying Sycophancy and Hallucination in Small Open Weight VLMs for Vision-Language Scoring of Fantasy Characters

SycoPhantasy: 量化小型开放权重视觉-语言模型中趋炎附势行为与幻觉现象以评估奇幻角色的视觉-语言评分

Arya Shah, Deepali Mishra, Chaklam Silpasuwanchai

机构 * IIT Gandhinagar(印度加尔各答理工学院) IIT Kanpur(印度坎浦尔理工学院) Asian Institute of Technology(亚洲理工学院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);LLaVA(abstract,abstract_cn);vision-language model(abstract);grounding(abstract)

AI总结 本文研究小型开放权重VLM在评估图像-文本对齐时是否存在趋炎附势行为,通过引入布林系数量化模型评分与视觉证据的不匹配程度,发现模型规模与趋炎附势率呈负相关。

Comments 13 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13470 2025-08-20 cs.CV cs.AI 88%

STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models

Tinh-Anh Nguyen-Nhu, Triet Dao Hoang Minh, Dat To-Thanh, Phuc Le-Gia, Tuan Vo-Lan, Tien-Huy Nguyen

机构 * Ho Chi Minh University of Technology(胡志明理工大学) Vietnamese-German University(越德大学) Ho Chi Minh University of Science(胡志明理工大学) University of Information Technology(信息科技大学) Vietnam National University, Ho Chi Minh city(越南国家大学,胡志明市)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI

Comments ICCV Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04395 2025-05-27 cs.CV cs.LG 88%

Time-VLM: Exploring Multimodal Vision-Language Models for Augmented Time Series Forecasting

Siru Zhong, Weilin Ruan, Ming Jin, Huan Li, Qingsong Wen, Yuxuan Liang

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.LG

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10486 2025-02-18 cs.CR cs.AI cs.CV 88%

VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap

Qin Liu, Fei Wang, Chaowei Xiao, Muhao Chen

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11543 2025-01-14 cs.CV cs.AI 88%

PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment

Zhendong Liu, Yuanbi Nie, Yingshui Tan, Jiaheng Liu, Xiangyu Yue, Qiushi Cui, Chongjun Wang, Xiaoyong Zhu, Bo Zheng

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2405.13581

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15544 2024-12-23 cs.RO cs.AI cs.CV 88%

VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving

Zilin Huang, Zihao Sheng, Yansong Qu, Junwei You, Sikai Chen

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 28 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14759 2024-09-24 cs.CV cs.AI 88%

VLM's Eye Examination: Instruct and Inspect Visual Competency of Vision Language Models

Nam Hyeon-Woo, Moon Ye-Bin, Wonseok Choi, Lee Hyun, Tae-Hyun Oh

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16224 2024-09-02 cs.CV cs.AI 88%

LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models

Jingyi Wang, Jianzhong Ju, Jian Luan, Zhidong Deng

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07577 2024-07-11 cs.CV cs.AI 88%

IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model

Yatai Ji, Shilong Zhang, Jie Wu, Peize Sun, Weifeng Chen, Xuefeng Xiao, Sidi Yang, Yujiu Yang, Ping Luo

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02292 2025-10-03 cs.CL cs.CV 88%

From Behavioral Performance to Internal Competence: Interpreting Vision-Language Models with VLM-Lens

Hala Sheta, Eric Huang, Shuyu Wu, Ilia Alenabi, Jiajun Hong, Ryker Lin, Ruoxi Ning, Daniel Wei, Jialin Yang, Jiawei Zhou, Ziqiao Ma, Freda Shi

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(title,abstract);分类 cs.CV

Comments EMNLP 2025 System Demonstration | Code: https://github.com/compling-wat/vlm-lens

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14260 2026-08-17 eess.IV cs.MM 新提交 88%

Personalized Digital Semantic Communication for Image Transmission with Vision-Language Models

基于视觉语言模型的图像传输个性化数字语义通信

Nan Li, Li Zhou, Haijun Wang, Jun Xiong, Haitao Zhao, Jibo Wei

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract)

AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。

Comments Accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03229 2026-07-07 cs.DC 新提交 88%

HyperParallel-Mpipe: A Composable Algebra System for Optimizing MLLM Training over Supernode Clusters

HyperParallel-Mpipe:用于在超级节点集群上优化多模态大语言模型训练的可组合代数系统

Chong Li, Zhengdao Yu, Nelson Lossing, Thibaut Tachon, Pierre Leca, Etienne Filhol, Yujie Yuan, Chong Bao, Teng Su

专题命中 VLM训练与架构 :MLLM(title,summary_cn);multimodal large language model(abstract)

AI总结 分析多模态大语言模型(MLLM)训练痛点,引入Mpipe,用调度代数从紧凑调度规范推导运行时行为,得出多模态感知异构并行调度transpose,在Ascend 910C NPU集群上加速显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15681 2026-06-26 cs.CL 版本更新 88%

GenRecal: Generation after Recalibration from Large to Small Vision-Language Models

GenRecal:从大到小视觉语言模型的校准后生成

Byung-Kwan Lee, Ryo Hachiuma, Yong Man Ro, Yu-Chiang Frank Wang, Yueh-Hua Wu

机构 * NVIDIA KAIST(韩国成均馆大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract)

AI总结 提出GenRecal通用蒸馏框架,通过校准器对齐异构VLM特征,实现从大到小模型的有效知识迁移,在多个基准上超越大规模开源和闭源VLM。

Comments Project page: https://byungkwanlee.github.io/GenRecal-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23729 2026-06-23 cs.CV cs.AI cs.LG eess.IV 版本更新 88%

LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models

LUQ: 多模态大语言模型的逐层超低位量化

Shubhang Bhatnagar, Andy Xu, Kar-Han Tan, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加州大学洛杉矶分校) HP Inc.(惠普公司)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);multimodal large language model(title);分类 cs.CV、cs.AI、cs.LG

AI总结 提出LUQ方法,通过逐层输出激活熵衡量功能复杂度,对简单层应用超低位量化,结合多模态校准,在LLaVA-1.5和Qwen-2.5-VL上实现低于4-bit量化,内存减少40%和31%,MME性能下降<10%。

Comments Published in Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05758 2026-06-05 cs.CV cs.AI cs.LG 88%

DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models

DRIFT:一种用于视觉-语言模型中连续输出解码的残差流适配器

Zhuoming Liu, Jinhong Lin, Kwan Man Cheng, Lin Zhang, Shayok Bagchi, Yin Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) West Lafayette Jr./Sr. High School(韦斯特拉法叶高中)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);MLLM(abstract_cn)

AI总结 提出DRIFT框架,通过结合基础预测器和基于流匹配的生成式精化模块,将预训练视觉-语言模型适配到连续解码任务,在视觉定位和机器人控制等任务上优于回归和生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04509 2026-06-02 cs.CL 88%

Model-Dowser: Data-Free Importance Probing to Mitigate Catastrophic Forgetting in Multimodal Large Language Models

Model-Dowser:无数据重要性探测以缓解多模态大语言模型中的灾难性遗忘

Hyeontaek Hwang, Nguyen Dinh Son, Daeyoung Kim

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);multimodal large language model(title,abstract)

AI总结 提出Model-Dowser,一种基于重要性评分的稀疏微调方法,通过联合考虑权重幅度、输入激活和输出敏感性来缓解多模态大语言模型微调中的灾难性遗忘,在LLaVA和NVILA上优于现有方法。

Comments Accepted at ICML 2026. Code link: https://model-dowser.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27374 2026-05-28 cs.CL 88%

ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment

ICG: 通过基于MLLM的提示和个性化偏好对齐改进封面图像生成

Zhipeng Bian, Jieming Zhu, Qijiong Liu, Wang Lin, Guohao Cai, Zhaocheng Du, Jiacheng Sun, Zhou Zhao, Zhenhua Dong

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract)

AI总结 提出ICG框架,利用多模态大语言模型和扩散模型,通过元标记提取语义特征、用户嵌入个性化对齐及多奖励学习策略,实现高质量、个性化封面图像生成。

Comments Published in Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 12268-12278, EMNLP 2025. Official version: https://doi.org/10.18653/v1/2025.emnlp-main.617

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (Main Track) EMNLP 2025 12268-12278

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08461 2026-05-14 cs.LG cs.AI cs.CV hep-ex 88%

Adapting Vision-Language Models for Neutrino Event Classification in High-Energy Physics

为高能物理中的中微子事件分类适应视觉-语言模型

Dikshant Sagar, Kaiwen Yu, Alejandro Yankelevich, Jianming Bian, Pierre Baldi

机构 * Department of Computer Science, University of California, Irvine, CA, USA(计算机科学系,加州大学欧文分校,加州,美国) Department of Physics, University of California, Irvine, CA, USA(物理系,加州大学欧文分校,加州,美国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文探讨了将微调后的LLaMA 3.2应用于中微子事件分类,对比了Transformer架构与CNN在准确性和鲁棒性上的表现,展示了视觉-语言模型在物理事件分类中的潜力。

Comments Accepted for publication in Communications Physics (Nature Portfolio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19966 2026-04-23 cs.CV cs.AI cs.LG cs.RO 88%

DistortBench: Benchmarking Vision Language Models on Image Distortion Identification

DistortBench:用于图像失真识别的视觉语言模型基准测试

Divyanshu Goyal, Akhil Eppa, Vanya Bannihatti Kumar

机构 * Adobe Inc.(Adobe公司)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出DistortBench,一个用于评估视觉语言模型图像失真识别能力的基准测试,包含13500道四选一问题,涵盖27种失真类型及不同严重程度,评估18种模型,揭示当前VLM在低级感知上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21194 2026-06-23 cs.CV cs.AI cs.CL 新提交 88%

MEDLAYXPLAIN: Benchmarking the Expert-Lay Gap in Medical Vision-Language Models

MEDLAYXPLAIN: 医学视觉语言模型中的专家-外行差距基准测试

Han Jang, Junhyeok Lee, Songsoo Kim, Chae Young Lim, Hyeonjin Goh, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔大学) Seoul National University Hospital(首尔大学医院) Seoul National University College of Medicine(首尔大学医学院) Sungkyunkwan University School of Medicine(成均馆大学医学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出首个大规模医学外行语言生成基准MedLayXPlain,包含12万+区域级样本和三层UMLS本体,通过HOVER管道构建外行描述,并引入轻量级评估器MedLayEval,揭示当前医学VLM在外行可读性与临床精度间的系统性差距。

Comments 40 pages (10 pages main text, 30 pages appendix), 4 main figures, 33 vision-language models benchmarked

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10959 2026-08-12 cs.CV cs.CR 新提交 88%

Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs

一旦投毒,任意受控:视觉语言模型(VLM)中的可编程后门

Tao Lin, Gaojie Jin, Zongxin Liu, Peng Wu, Lijia Yu

专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究提出一种向VLM植入可编程后门的方法,通过启发式投毒策略和特征空间触发器隐写,可在推理时动态选择未见过的目标字幕并触发对应输出,攻击成功率高且能规避部分防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27646 2026-07-09 cs.CV physics.optics 新提交 88%

VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models

面向冻结视觉语言模型的VLM感知元光学前端设计

Chanik Kang, Raphaël Pestourie, Haejun Chung

机构 * Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系) School of Computational Science and Engineering, Georgia Institute of Technology(佐治亚理工学院计算科学与工程学院) Department of Electronic Engineering, Hanyang University(汉阳大学电子工程系)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title);分类 cs.CV

AI总结 提出CODA框架,通过可微成像和伴随梯度更新优化连续密度元光学前端,直接优化冻结CLIP分类器的交叉熵损失,在ImageNet-100上将零样本准确率从53.75%提升至65.41%,并跨模型和数据集泛化。

Comments 18 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26770 2026-03-31 cs.CV 88%

Quantized Vision-Language Models for Damage Assessment: A Comparative Study of LLaVA-1.5-7B Quantization Levels

量化视觉-语言模型用于损伤评估:LLaVA-1.5-7B量化级别的比较研究

Takato Yasuno

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);分类 cs.CV

AI总结 本文研究了量化视觉-语言模型在桥梁损伤评估中的应用,比较了不同量化级别在描述质量、推理速度和资源需求之间的平衡,发现Q5_K_M在质量、速度和效率上达到最佳平衡。

Comments 16 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00479 2026-03-03 cs.CV 88%

U-VLM: Hierarchical Vision Language Modeling for Report Generation

U-VLM:用于报告生成的分层视觉语言模型

Pengcheng Shi, Minghui Zhang, Kehan Song, Jiaqi Liu, Yun Gu, Xinglin Zhang

机构 * Medical Image Insights Co. Ltd.(医疗影像洞察有限公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 U-VLM通过分层视觉语言建模在CT-RATE和AbdomenAtlas 3.0上实现了最先进的报告生成性能,展示了精心设计的视觉编码器预训练的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14073 2026-02-18 cs.CL cs.AI 88%

Annotation-Efficient Vision-Language Model Adaptation to the Polish Language Using the LLaVA Framework

利用LLaVA框架实现波兰语视觉-语言模型的高效标注

Grzegorz Statkiewicz, Alicja Dobrzeniecka, Karolina Seweryn, Aleksandra Krasnodębska, Karolina Piosek, Katarzyna Bogusz, Sebastian Cygert, Wojciech Kusa

机构 * NASK National Research Institute(国家研究机构NASK)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);分类 cs.AI

AI总结 本文提出利用LLaVA框架高效适应波兰语的视觉-语言模型,通过自动化翻译和合成数据提升多模态模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08706 2026-01-13 cs.CV 88%

HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models

HiRes-LLaVA: 高分辨率大视觉-语言模型中碎片化输入的恢复

Runhui Huang, Xinpeng Ding, Chunwei Wang, Jianhua Han, Yulong Liu, Hengshuang Zhao, Hang Xu, Lu Hou, Wei Zhang, Xiaodan Liang

机构 * Shenzhen campus of Sun Yat-sen University(中山大学深圳校区) Huawei(华为) The Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);分类 cs.CV

AI总结 HiRes-LLaVA通过引入SliceRestore适配器和Self-Mining Sampler,有效恢复高分辨率输入的碎片化问题,提升模型在文档相关任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏