arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1578 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1578 篇

2206.02779 2023-07-27 cs.CV cs.GR cs.LG 62%

Blended Latent Diffusion

Omri Avrahami, Ohad Fried, Dani Lischinski

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted to SIGGRAPH 2023. Project page: https://omriavrahami.com/blended-latent-diffusion-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13681 2023-07-26 cs.GR cs.AI cs.CV 62%

The Visual Language of Fabrics

Valentin Deschaintre, Julia Guerrero-Viu, Diego Gutierrez, Tamy Boubekeur, Belen Masia

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Journal ref ACM Transactions on Graphics 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01981 2023-07-06 eess.IV cs.CV cs.LG 62%

A ChatGPT Aided Explainable Framework for Zero-Shot Medical Image Diagnosis

Jiaxiang Liu, Tianxiang Hu, Yan Zhang, Xiaotang Gai, Yang Feng, Zuozhu Liu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Workshop on Interpretable ML in Healthcare at International Conference on Machine Learning (ICML) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13391 2023-06-29 cs.CV cs.LG 62%

Xplainer: From X-Ray Observations to Explainable Zero-Shot Diagnosis

Chantal Pellegrini, Matthias Keicher, Ege Özsoy, Petra Jiraskova, Rickmer Braren, Nassir Navab

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments provisionally accepted for publication at MICCAI 2023, 9 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03660 2023-05-08 cs.CL cs.AI cs.IR cs.LG 62%

Retrieval Augmented Chest X-Ray Report Generation using OpenAI GPT models

Mercy Ranjit, Gopinath Ganapathy, Ranjit Manuel, Tanuja Ganu

专题命中 其他VLM :vision language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03298 2023-04-18 cs.CV cs.AI 62%

Diversity is Definitely Needed: Improving Model-Agnostic Zero-shot Classification via Stable Diffusion

Jordan Shipard, Arnold Wiliem, Kien Nguyen Thanh, Wei Xiang, Clinton Fookes

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments (10 pages, 6 figures, 3 tables, preprint)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00779 2023-04-04 cs.CV cs.AI 62%

Probabilistic Prompt Learning for Dense Prediction

Hyeongjun Kwon, Taeyong Song, Somi Jeong, Jin Kim, Jinhyun Jang, Kwanghoon Sohn

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments accepted to CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06580 2023-03-14 cs.CV cs.CL cs.LG 62%

Towards General Purpose Medical AI: Continual Learning Medical Foundation Model

Huahui Yi, Ziyuan Qin, Qicheng Lao, Wei Xu, Zekun Jiang, Dequan Wang, Shaoting Zhang, Kang Li

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01258 2023-03-03 cs.CL cs.AI cs.LG 62%

Domain-adapted large language models for classifying nuclear medicine reports

Zachary Huemann, Changhee Lee, Junjie Hu, Steve Y. Cho, Tyler Bradshaw

专题命中 其他VLM :vision language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10939 2023-01-27 cs.CV cs.CL cs.LG 62%

Affective Faces for Goal-Driven Dyadic Communication

Scott Geng, Revant Teotia, Purva Tendulkar, Sachit Menon, Carl Vondrick

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.02903 2023-01-10 cs.LG cs.CV 62%

Transferring Pre-trained Multimodal Representations with Cross-modal Similarity Matching

Byoungjip Kim, Sungik Choi, Dasol Hwang, Moontae Lee, Honglak Lee

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments 20 pages, 10 figures, NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.10681 2022-11-22 cs.CV cs.AI 62%

Decomposed Soft Prompt Guided Fusion Enhancing for Compositional Zero-Shot Learning

Xiaocheng Lu, Ziming Liu, Song Guo, Jingcai Guo

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 10 pages included reference, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13430 2022-11-01 cs.CV cs.LG 62%

UniCLIP: Unified Framework for Contrastive Language-Image Pre-training

Janghyeon Lee, Jongsuk Kim, Hyounguk Shon, Bumsoo Kim, Seung Hwan Kim, Honglak Lee, Junmo Kim

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Neural Information Processing Systems (NeurIPS) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12112 2022-10-24 cs.CV cs.AI cs.CL 62%

Describing Sets of Images with Textual-PCA

Oded Hupert, Idan Schwartz, Lior Wolf

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to Findings of EMNLP'22

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07225 2022-10-14 cs.CV cs.AI 62%

Unified Vision and Language Prompt Learning

Yuhang Zang, Wei Li, Kaiyang Zhou, Chen Huang, Chen Change Loy

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.07870 2022-08-17 cs.CV cs.AI 62%

Language-guided Semantic Style Transfer of 3D Indoor Scenes

Bu Jin, Beiwen Tian, Hao Zhao, Guyue Zhou

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to ACM Multimedia PIES-ME 2022. Code: https://github.com/AIR-DISCOVER/LASST

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.08913 2022-03-18 cs.LG cs.AI cs.CL 62%

Memorizing Transformers

Yuhuai Wu, Markus N. Rabe, DeLesley Hutchins, Christian Szegedy

专题命中 其他VLM :vision language model(abstract);分类 cs.AI、cs.LG

Comments Published as a conference paper at ICLR 2022 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.08507 2016-03-29 cs.CV cs.AI cs.CL 62%

Generating Visual Explanations

Lisa Anne Hendricks, Zeynep Akata, Marcus Rohrbach, Jeff Donahue, Bernt Schiele, Trevor Darrell

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03361 2026-03-27 cs.AI cs.NE 61%

Concepts Learned Visually by Infants Can Contribute to Visual Learning and Understanding in AI Models

婴儿通过视觉学习的概念可以促进AI模型中的视觉学习和理解

Shify Treger, Shimon Ullman

专题命中 其他VLM :vision-language model(abstract,comments);分类 cs.AI

AI总结 研究探讨婴儿早期视觉学习概念如何促进AI模型学习,通过比较早期概念与标准深度网络模型,发现早期概念提升学习准确性和效率,改善模型表征和泛化能力。

Comments Significantly extended version of earlier work, with additional experiments, expanded discussion and related work, new experiments with human participants, and broader evaluation across multiple vision-language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20107 2026-08-21 cs.CV 新提交 57%

BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal

BeyondMasks:评估视频对象移除中的因果与物理一致性

Yigit Ekin, Enes Sanli, Aykut Erdem, Erkut Erdem, Aysegul Dundar

机构 * Bilkent University(毕尔肯大学) Koç University(科克大学) Hacettepe University(哈杰泰佩大学) KUIS AI Center(KUIS人工智能中心)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 该研究推出BeyondMasks基准及CORE评估协议,针对现有视频对象移除评估仅关注局部掩码保真度的问题,填补了视觉合理性与因果正确性的差距。

Comments ECCV 2026 Project Page: https://yigitekin.github.io/BeyondMasks/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18937 2026-08-20 cs.CL cs.AI 新提交 57%

MedUAG: Unified Understanding and Generation for Medical Multimodal Models

MedUAG:面向医学多模态模型的统一理解与生成框架

Zijie Meng, Yuncheng Zhang, Hualiang Wang, Yitian Tang, Xiaotang Gai, Chen Shen, Songtao Jiang, Shaosheng Cao, Jian Wu, Xian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Tencent Jarvis Lab(腾讯Jarvis实验室)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 针对医学多模态领域缺乏统一理解生成框架的问题,本文构建了MedUAGCorpus数据集与MedUAGBench基准,开发了MedUAG模型,其在医学理解与生成任务中表现出色,为下一代医学多模态系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18602 2026-08-20 cs.CV 新提交 57%

Teach a Molmo2Fish: Towards interactive fish tracking with natural language guidance

Teach a Molmo2Fish:面向自然语言引导的交互式鱼类追踪

Kai Van Brunt, Justin Kay, Sara Beery

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本研究针对声呐鱼类追踪数据集定制了多模态大语言模型工具Molmo2Fish,通过交互式预测修正工作流开展实验,发现其在鱼类追踪和轨迹修正上性能良好,但自然语言引导的融入仍需提升。

Comments 29 pages, 6 figures, to be published in Third Workshop on Computer Vision for Ecology at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31029 2026-08-20 cs.CV 版本更新 57%

PEEK: Picking Essential frames via Efficient Knowledge distillation

PEEK: 通过高效知识蒸馏提取关键帧

Killian Steunou, Anas Filali Razzouki, Khalil Guetari, Mounîm A. El-Yacoubi, Yannis Tevissen

机构 * Télécom SudParis — SAMOVAR(Telecom SudParis — SAMOVAR) Institut Polytechnique de Paris(巴黎政治学院) Moments Lab

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 提出PEEK方法,通过知识蒸馏将教师模型的帧相关性排名迁移至轻量级时序模型,实现高效动态帧采样,在低帧预算下显著提升视频字幕生成性能。

Comments Accepted at BMVC 2026. Supplementary material at https://www.killian-steunou.com/peek/static/pdfs/peek_supplementary.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10706 2026-08-18 cs.CV cs.MM 版本更新 57%

MMArt: A Multi-Perspective Multimodal Dataset for Visual Art Understanding

MMArt:用于视觉艺术理解的多视角多模态数据集

Shuai Wang, Wangyuan Ding, Yixian Shen, Jia-Hong Huang, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14226 2026-08-17 cs.CV 新提交 57%

RankT2I: A Submodular Framework for Discovering Interpretable and Diverse Semantics in Text-to-Image Models

RankT2I:一种用于发现文本到图像模型中可解释且多样化语义的子模框架

Ritika Allada, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出无训练、模型无关的RankT2I框架,通过子模方法自动发现T2I模型的可编辑语义,性能优于现有方法,可高效获取多领域文本到图像编辑所需的多样化语义。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13974 2026-08-17 cs.CV 新提交 57%

ProFocus: Interpreting Affective Experience in Artistic Images with Progressive Visual Focusing

ProFocus:通过渐进式视觉聚焦解释艺术图像中的情感体验

Zhiyan Zhang, Zicheng Yan, Jianqi Chen, Peipei Song, Shanshan Wang, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Anhui University(安徽大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本研究针对现有方法无法捕捉艺术情感细微线索的问题,提出ProFocus框架,通过层级艺术评论家与渐进式提示融合模块,在ArtEmis数据集上实现了更优的情感识别与解释性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13605 2026-08-17 cs.AI cs.RO 新提交 57%

Active Perception for Embodied Disambiguation

用于具身消歧的主动感知

Yiwei Liu, Luwei Yang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 该研究针对具身环境中目标歧义问题,提出以主动观测为核心的主动感知框架,结合视觉语言模型实现信息获取与用户意图澄清,经真实机器人实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12532 2026-08-14 cs.MM cs.CV cs.IR 新提交 57%

MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval

MASCOT:面向复合属性文本到图像检索的模型感知子模覆盖

Aaryan Sharma, Vishak Prasad C, Virendra Singh, Ganesh Ramakrishnan

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对现有流形重排序方法在复合属性文本到图像检索的多样性降低任务中早期排名召回率大幅下降的问题,提出MASCOT方法,在PixelProse数据集复合约束任务中表现优于MS-DPP,尤其在排名1后召回率上优势显著。

Comments 21 pages, 4 figures. Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil. Extended version with full appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11425 2026-08-13 cs.CV 新提交 57%

VLMs Win a Systematic Evaluation of Underwater Image Reconstruction

视觉语言模型(VLMs)在水下图像重建的系统评估中胜出

Sara Aghajanzadeh, Yingxue Wang, Ieva Bagdonaviciute, David Forsyth

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出水下图像重建的系统评估流程,评估发现未经过明确物理模型训练的视觉语言模型(VLMs)显著优于基于物理的模型,真实场景图像结果验证了该评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10154 2026-08-12 cs.CL cs.AI 新提交 57%

Multimodal Item Parameter Estimation using Simulated Response Probabilitie

基于模拟响应概率的多模态题目参数估计

Christopher Ormerod, YoungKoung Kim

机构 * College Board(大学理事会)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 本研究基于Qwen3.5微调多模态大语言模型,利用含图像与文本的多项选择题训练语料,通过学习学生能力相关的选择概率,实现了题目参数的准确估计。

Comments Submitted and Accepted for AIME-Con 2026

详情

展开后加载摘要…

URL PDF HTML 收藏