arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-09-01 至 2026-09-01 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 7 篇

2608.30255 2026-09-01 cs.IR 新提交 80%

CAMIE: Co-Engagement-Aware Multimodal Item Embeddings for Snap Dynamic Product Ads Retrieval

CAMIE:用于Snap动态产品广告检索的协同交互感知多模态物品嵌入

Xiaodong Liu, Siman Wang, Congfei Zhang, Hsiang-wei Chao, Xiao Bai, Wen Zhang, Jingxiao Ma, Zhe Liu, Yunzhi Zhou, Yajun Wang, Jinchao Li, Yu Zhang

专题命中 其他VLM :MLLM(summary_cn,abstract)

AI总结 针对Snap动态产品广告检索的挑战,提出CAMIE框架,基于LLM/MLLM主干与协同交互数据微调,线上部署后显著提升多场景下的CTR与CVR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30705 2026-09-01 cs.CV 新提交 77%

VisLens: Single-Pass Interpretable Visual Search for Multimodal LLMs

VisLens:面向多模态大语言模型的单次可解释视觉搜索方法

Jingyi He, Sanghwan Kim, Zeynep Akata

机构 * Technical University of Munich(慕尼黑工业大学) Helmholtz Munich(慕尼黑亥姆霍兹中心) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对多模态大语言模型的细粒度视觉搜索问题,提出VisLens方法,通过单次前向传播实现可解释的视觉搜索,性能优于或相当现有方法且推理速度大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14569 2026-09-01 cs.CL cs.LG 版本更新 77%

Social Caption: Evaluating Social Understanding in Multimodal Models

Social Caption: 评估多模态模型的社会理解能力

Leena Mathur, Bhaavanaa Thumu, Youssouf Kebe, Louis-Philippe Morency

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.LG

AI总结 提出基于交互理论的SOCIAL CAPTION框架,从社会推理、整体社会分析和定向社会分析三个维度评估多模态大语言模型的社会理解能力,并分析影响性能的因素。

Comments Accepted to Findings of EMNLP 2026. 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30550 2026-09-01 cs.AI cs.CV 新提交 62%

GarmentWeaver: Schema-Aware Structured Synthesis for Multimodal Sewing Patterns

GarmentWeaver:面向多模态缝纫图案的模式感知结构化合成

Yinwen Lu, Weihao Luo, Yueqi Zhong

机构 * Donghua University(东华大学) Ningbo University(宁波大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 GarmentWeaver是一种模式感知多模态缝纫图案生成框架,通过分层结构化建模与可行性正则化,生成更准确、可执行且仿真兼容的缝纫图案,性能优于基线方法。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30420 2026-09-01 cs.CV cs.AI 新提交 62%

Whole-Slide Image Analysis under Realistic Few-Shot Annotation Protocols

现实小样本标注协议下的 whole-slide 图像分析

Tiffanie Godelaine, Maxime Zanella, Karim El Khoury, Benoit Macq, Christophe De Vleeschouwer

机构 * Institute of Information and Communication Technologies, Electronics, and Applied Mathematics (ICTEAM), Université catholique de Louvain (UCLouvain)(天主教鲁汶大学信息与通信技术、电子与应用数学研究所)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对现实 whole-slide 图像场景的小样本标注问题,提出 SlideCRF 模型,结合空间与生物线索优化预测,在四个数据集上宏观 F1 较现有转导方法更优,零样本预测提升显著。

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28695 2026-09-01 cs.CV cs.IR 新提交 57%

Weaving Visual Narratives: Agentic Image Bundle Composition Beyond Atomic Visual Matching

编织视觉叙事:超越原子视觉匹配的智能体图像束合成

Rong Shan, Tianyi Xu, Congmin Zheng, Wenteng Chen, Jiachen Zhu, Junjie Wu, Teng Wang, Weiwen Liu, Changwang Zhang, Weinan Zhang, Jun Wang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) OPPO(OPPO(广东欧珀移动通信有限公司))

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对传统图像检索原子匹配范式无法捕捉用户视觉搜索意图的问题,提出BundleWeaver智能体框架,构建IBCBench数据集,实现图像束合成并取得显著性能提升。

Comments Accepted by EMNLP'26 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26824 2026-09-01 cs.DL cs.AI cs.IR 版本更新 57%

LeMat-Synth: a multi-modal toolbox to curate broad synthesis procedure databases from scientific literature

LeMat-Synth:用于从科学文献中构建广泛合成程序数据库的多模态工具箱

Magdalena Lederbauer, Siddharth Betala, Valerie Gentzke, Anamaria Leonescu, Amine Sehaba, Faris Flaifil, Ayush Jain, Alfonso Amayuelas, Nikhil Yelamarthy, Xiyao Li, Grégoire Germain, Stefano Ribes, Stefan P. Schmid, Alexandre Nozadze, Anna Kelmanson, Sudheesh Kumar Ethirajan, Mohd Zaki, Elton Pan, Georgia Channing, Connor W. Coley, Philippe Schwaller, Rocío Mercado, Alexandre Duval, Mathilde L. D. Franckel, Samuel P. Gleason

专题命中 其他VLM :vision language model(abstract);分类 cs.AI

AI总结 本研究开发LeMat-Synth Parser多模态工具箱,从8.1万篇文献构建含5.8万种合成方案的最大无机材料合成数据集,验证其质量并通过氨分解、超导领域应用展示其可扩展性,相关工具与数据集已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏