arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-12 至 2025-11-12 共收录 40 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 12 篇

2511.07929 2025-11-12 cs.CV 70%

Federated CLIP for Resource-Efficient Heterogeneous Medical Image Classification

Yihang Wu, Ahmad Chaddad

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted in AAAI 2026 Main track. Code is available at https://github.com/AIPMLab/FedMedCLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10069 2025-11-12 cs.DC cs.LG 70%

ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism

Zedong Liu, Shenggan Cheng, Guangming Tan, Yang You, Dingwen Tao

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Electronic Science and Technology of China(电子科技大学) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

Comments Accepted at NeurIPS 2025 Oral (Thirty-Ninth Conference on Neural Information Processing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08367 2025-11-12 cs.CR 67%

Why does weak-OOD help? A Further Step Towards Understanding Jailbreaking VLMs

Yuxuan Zhou, Yuzhao Peng, Yang Bai, Kuofeng Gao, Yihao Zhang, Yechao Zhang, Xun Chen, Tao Yu, Tao Dai, Shu-Tao Xia

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08082 2025-11-12 cs.AI cs.LG econ.GN q-fin.EC 62%

Prudential Reliability of Large Language Models in Reinsurance: Governance, Assurance, and Capital Efficiency

Stella C. Dong

机构 * Reinsurance Analytics(再保险分析)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

Comments 48 pages, 9 figures, 5 tables. Submitted to the Journal of Risk and Insurance (JRI), November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08061 2025-11-12 cs.CV cs.AI 62%

Taming Identity Consistency and Prompt Diversity in Diffusion Models via Latent Concatenation and Masked Conditional Flow Matching

Aditi Singhania, Arushi Jain, Krutik Malani, Riddhi Dhawan, Souymodip Chakraborty, Vineet Batra, Ankit Phogat

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08498 2025-11-12 astro-ph.IM astro-ph.SR 50%

A Simple Ray Acceleration Structure for Non-LTE Radiative Transfer

Christopher M. J. Osborne

专题命中 VLM训练与架构 :VLM(abstract)

Comments 12 pages, 7 figures. Accepted for publication in RASTI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 4 篇

2511.08075 2025-11-12 cs.CV cs.AI 62%

CLIP is All You Need for Human-like Semantic Representations in Stable Diffusion

Cameron Braunstein, Mariya Toneva, Eddy Ilg

机构 * Saarland University, Saarbrücken Germany(萨尔兰州大学) MPI for Software Systems, Saarbrücken Germany(软件系统研究所) University of Technology Nuremberg, Nuremberg Germany(纽伦堡技术大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13231 2025-11-12 cs.CV cs.AI 62%

WildFireCan-MMD: A Multimodal Dataset for Classification of User-Generated Content During Wildfires in Canada

Braeden Sherritt, Isar Nejadgholi, Efstratios Aivaliotis, Khaled Mslmani, Marzieh Amini

机构 * Carleton University(卡尔顿大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01579 2025-11-12 cs.CV 57%

Harnessing Textual Semantic Priors for Knowledge Transfer and Refinement in CLIP-Driven Continual Learning

Lingfeng He, De Cheng, Di Xu, Huaijie Wang, Nannan Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments AAAI-2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18108 2025-11-12 cs.CV 57%

Unveiling Visual Perception in Language Models: An Attention Head Analysis Approach

Jing Bi, Junjia Guo, Yunlong Tang, Lianggong Bruce Wen, Zhang Liu, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Corning Inc(康宁公司)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Journal ref CVPR 2025 (IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏