arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-26 至 2026-08-26 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 5 篇

2608.23646 2026-08-26 cs.AI cs.LG 新提交 81%

MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models

MolEmb:多模态大语言模型可作为强大的分子嵌入模型

Xinjian Zhao, Xiangru Jian, Yaoyao Xu, Xiaozhuang Song, Wei Pang, Lei Bai, Tianshu Yu

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出MolEmb框架,利用多模态大语言模型构建通用分子嵌入模型,在分子性质预测上具竞争力,还提出MolCAR基准验证上下文感知分子嵌入的特性。

Comments Presented at the 3rd Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences (FM4LS), ICML 2026. Non-archival workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24142 2026-08-26 cs.CV 新提交 79%

What Does Prompt Learning Change? -A Natural-Language Concept Analysis of Vision-Language Models

提示学习改变了什么?——视觉-语言模型的自然语言概念分析

Ryo Kamiya, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 该研究提出PromptSpLiCE方法分析视觉-语言模型提示学习后的概念分布变化,发现概念分布变化与准确率提升正相关,还推导了局部梯度表达式解释相关几何直觉。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24118 2026-08-26 cs.CL 新提交 78%

MC-CXR: A Multi-Context Chest X-ray Benchmark for Context-Induced Disruption in Vision-Language Models

MC-CXR:用于视觉-语言模型中上下文诱导干扰的多上下文胸部X射线基准

Junhyeok Lee, Songsoo Kim, Kyu Sung Choi

机构 * Seoul National University College of Medicine(首尔国立大学医学院) Seoul National University Hospital(首尔国立大学医院) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院医疗人工智能研究院)

专题命中 其他VLM :vision-language model(title,abstract)

AI总结 该研究针对视觉-语言模型在临床胸部X射线解读中受上下文干扰的问题,构建了MC-CXR基准,评估多类模型发现文本误导性比视觉误导性更易导致模型转向错误,验证了上下文诱导干扰的存在。

Comments 15 pages, 3 figures, 4 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24258 2026-08-26 cs.AI 新提交 74%

Beyond Accuracy: A Dual-Judge Evaluation Protocol for Vision-Language Models in Legally Grounded Tasks

超越准确率:面向法律依据任务的视觉语言模型双裁判评估协议

Su Myat Noe, Ha Thanh Nguyen, May Myo Zin, Ken Satoh

机构 * National Institute of Informatics (NII)(国立信息学研究所) VinUniversity(文大学) ROIS-DS Center for Juris-Informatics(ROIS-DS法学信息学中心)

专题命中 其他VLM :vision-language model(title);分类 cs.AI

AI总结 针对法律依据任务,提出双裁判评估协议,结合质量与语义等价裁判,在英国交通标志解读任务中发现不对称II型模式,发布相关资源以评估视觉语言模型的法律相关性能。

Comments Accepted and presented at the AI for Law Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24467 2026-08-26 cs.AI 新提交 57%

HMGCLIP: Heterogeneous Multi-Granularity Contrastive Learning for E-commerce Representation Learning

HMGCLIP:面向电商表征学习的异构多粒度对比学习

Qiuyu Zhu, Yi Gao, Zhichao Wan, Mingyang Ma

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 针对现有多模态大语言模型难以捕获电商产品细粒度属性的问题,提出异构多粒度对比学习框架HMGCLIP,构建异构超图对齐多粒度语义,发布细粒度电商数据集,在多基准上性能优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏