Blended Latent Diffusion
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Accepted to SIGGRAPH 2023. Project page: https://omriavrahami.com/blended-latent-diffusion-page/
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Accepted to SIGGRAPH 2023. Project page: https://omriavrahami.com/blended-latent-diffusion-page/
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
Journal ref ACM Transactions on Graphics 2023
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Workshop on Interpretable ML in Healthcare at International Conference on Machine Learning (ICML) 2023
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
Comments provisionally accepted for publication at MICCAI 2023, 9 pages, 2 figures, 6 tables
专题命中 其他VLM :vision language model(abstract);分类 cs.AI、cs.LG
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
Comments (10 pages, 6 figures, 3 tables, preprint)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
Comments accepted to CVPR 2023
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 其他VLM :vision language model(abstract);分类 cs.AI、cs.LG
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
Comments 20 pages, 10 figures, NeurIPS 2022
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 10 pages included reference, conference
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Neural Information Processing Systems (NeurIPS) 2022
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted to Findings of EMNLP'22
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted to ACM Multimedia PIES-ME 2022. Code: https://github.com/AIR-DISCOVER/LASST
专题命中 其他VLM :vision language model(abstract);分类 cs.AI、cs.LG
Comments Published as a conference paper at ICLR 2022 (spotlight)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
婴儿通过视觉学习的概念可以促进AI模型中的视觉学习和理解
专题命中 其他VLM :vision-language model(abstract,comments);分类 cs.AI
AI总结 研究探讨婴儿早期视觉学习概念如何促进AI模型学习,通过比较早期概念与标准深度网络模型,发现早期概念提升学习准确性和效率,改善模型表征和泛化能力。
Comments Significantly extended version of earlier work, with additional experiments, expanded discussion and related work, new experiments with human participants, and broader evaluation across multiple vision-language models
BeyondMasks:评估视频对象移除中的因果与物理一致性
机构 * Bilkent University(毕尔肯大学) ; Koç University(科克大学) ; Hacettepe University(哈杰泰佩大学) ; KUIS AI Center(KUIS人工智能中心)
专题命中 其他VLM :vision language model(abstract);分类 cs.CV
AI总结 该研究推出BeyondMasks基准及CORE评估协议,针对现有视频对象移除评估仅关注局部掩码保真度的问题,填补了视觉合理性与因果正确性的差距。
Comments ECCV 2026 Project Page: https://yigitekin.github.io/BeyondMasks/
MedUAG:面向医学多模态模型的统一理解与生成框架
机构 * Zhejiang University(浙江大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学) ; Tencent Jarvis Lab(腾讯Jarvis实验室)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI
AI总结 针对医学多模态领域缺乏统一理解生成框架的问题,本文构建了MedUAGCorpus数据集与MedUAGBench基准,开发了MedUAG模型,其在医学理解与生成任务中表现出色,为下一代医学多模态系统奠定基础。
Teach a Molmo2Fish:面向自然语言引导的交互式鱼类追踪
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV
AI总结 本研究针对声呐鱼类追踪数据集定制了多模态大语言模型工具Molmo2Fish,通过交互式预测修正工作流开展实验,发现其在鱼类追踪和轨迹修正上性能良好,但自然语言引导的融入仍需提升。
Comments 29 pages, 6 figures, to be published in Third Workshop on Computer Vision for Ecology at ECCV 2026
PEEK: 通过高效知识蒸馏提取关键帧
机构 * Télécom SudParis — SAMOVAR(Telecom SudParis — SAMOVAR) ; Institut Polytechnique de Paris(巴黎政治学院) ; Moments Lab
专题命中 其他VLM :vision language model(abstract);分类 cs.CV
AI总结 提出PEEK方法,通过知识蒸馏将教师模型的帧相关性排名迁移至轻量级时序模型,实现高效动态帧采样,在低帧预算下显著提升视频字幕生成性能。
Comments Accepted at BMVC 2026. Supplementary material at https://www.killian-steunou.com/peek/static/pdfs/peek_supplementary.pdf
MMArt:用于视觉艺术理解的多视角多模态数据集
机构 * University of Amsterdam(阿姆斯特丹大学) ; Amazon AGI(亚马逊AGI) ; College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。
RankT2I:一种用于发现文本到图像模型中可解释且多样化语义的子模框架
机构 * Virginia Tech(弗吉尼亚理工大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 本文提出无训练、模型无关的RankT2I框架,通过子模方法自动发现T2I模型的可编辑语义,性能优于现有方法,可高效获取多领域文本到图像编辑所需的多样化语义。
Comments ECCV 2026
ProFocus:通过渐进式视觉聚焦解释艺术图像中的情感体验
机构 * University of Science and Technology of China(中国科学技术大学) ; Anhui University(安徽大学)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV
AI总结 本研究针对现有方法无法捕捉艺术情感细微线索的问题,提出ProFocus框架,通过层级艺术评论家与渐进式提示融合模块,在ArtEmis数据集上实现了更优的情感识别与解释性能。
用于具身消歧的主动感知
机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) ; Shenzhen Research Institute of Big Data(深圳大数据研究院)
专题命中 其他VLM :vision-language model(abstract);分类 cs.AI
AI总结 该研究针对具身环境中目标歧义问题,提出以主动观测为核心的主动感知框架,结合视觉语言模型实现信息获取与用户意图澄清,经真实机器人实验验证有效。
MASCOT:面向复合属性文本到图像检索的模型感知子模覆盖
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 针对现有流形重排序方法在复合属性文本到图像检索的多样性降低任务中早期排名召回率大幅下降的问题,提出MASCOT方法,在PixelProse数据集复合约束任务中表现优于MS-DPP,尤其在排名1后召回率上优势显著。
Comments 21 pages, 4 figures. Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil. Extended version with full appendices
视觉语言模型(VLMs)在水下图像重建的系统评估中胜出
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 本文提出水下图像重建的系统评估流程,评估发现未经过明确物理模型训练的视觉语言模型(VLMs)显著优于基于物理的模型,真实场景图像结果验证了该评估。
基于模拟响应概率的多模态题目参数估计
机构 * College Board(大学理事会)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI
AI总结 本研究基于Qwen3.5微调多模态大语言模型,利用含图像与文本的多项选择题训练语料,通过学习学生能力相关的选择概率,实现了题目参数的准确估计。
Comments Submitted and Accepted for AIME-Con 2026