arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-22 至 2025-12-22 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 6 篇

2512.17574 2025-12-22 cs.DC cs.LG 83%

Enabling Disaggregated Multi-Stage MLLM Inference via GPU-Internal Scheduling and Resource Sharing

通过GPU内部调度和资源共享实现解耦的多阶段MLLM推理

Lingxiao Zhao, Haoran Zhou, Yuezhi Che, Dazhao Cheng

机构 * Wuhan University(武汉大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.LG

AI总结 通过GPU内部调度和资源共享实现解耦的多阶段MLLM推理,提升吞吐量和延迟性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17313 2025-12-22 cs.CV 83%

Auxiliary Descriptive Knowledge for Few-Shot Adaptation of Vision-Language Model

辅助描述性知识用于视觉-语言模型的少样本适应

SuBeen Lee, GilHan Park, WonJun Moon, Hyun Seok Seong, Jae-Pil Heo

机构 * Sungkyunkwan University(顺天妇女大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ADK框架,通过生成丰富的描述性提示提升视觉-语言模型在少样本适应中的性能,提供两种知识类型以增强类别区分能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17292 2025-12-22 cs.CV 83%

Vision-Language Model Guided Image Restoration

基于视觉语言模型的图像修复

Cuixin Yang, Rongkang Dong, Kin-Man Lam

机构 * Department of Electrical and Electronic Engineering(电子与电气工程系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出VLMIR框架,利用视觉语言模型的先验知识提升图像修复性能,通过两阶段方法结合特征提取与扩散模型实现更高质量的图像恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17189 2025-12-22 cs.CV 57%

Anatomical Region-Guided Contrastive Decoding: A Plug-and-Play Strategy for Mitigating Hallucinations in Medical VLMs

解剖区域引导的对比解码:一种用于缓解医学视觉-语言模型幻觉的即插即用策略

Xiao Liang, Chenxi Liu, Zhi Ma, Di Wang, Bin Jing, Quan Wang, Yuanyuan Shi

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了解剖区域引导的对比解码策略,通过区域特定指导缓解医学视觉-语言模型的幻觉问题,提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17121 2025-12-22 cs.LG 57%

The Effect of Negation on CLIP in Medical Imaging: Limitations of Contrastive Language-Image Pretraining

否定对CLIP在医学影像中的影响:对比语言-图像预训练的局限性

Jasmine Vu, Shivanand Sheshappanavar

机构 * Santa Clara University(圣克拉拉大学) University of Wyoming(怀俄明大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 研究探讨CLIP在医学影像中处理否定短语的局限性,并通过调优方法提升其检索准确性与可靠性。

Comments 10 pages, 7 figures, submitted to WACV Pixels to Patients Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17154 2025-12-22 cs.SD 50%

InstructDubber: Instruction-based Alignment for Zero-shot Movie Dubbing

InstructDubber:基于指令的零样本电影配音对齐

Zhedong Zhang, Liang Li, Gaoxiang Cong, Chunshan Liu, Yuhan Gao, Xiaowan Wang, Tao Gu, Yuankai Qi

机构 * VIPL group, ICT, CAS(中国科学院信息科技研究所VIPL小组)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 InstructDubber通过指令生成和持续时间蒸馏模块,实现鲁棒的领域内和零样本电影配音对齐。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏