arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-16 至 2026-01-16 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 2 篇

2512.15372 2026-01-16 cs.IR cs.AI cs.CV cs.LG cs.MM 82%

Image Complexity-Aware Adaptive Retrieval for Efficient Vision-Language Models

面向高效视觉-语言模型的图像复杂度感知自适应检索

Mikel Williams-Lekuona, Georgina Cosma

机构 * Computer Science, Loughborough University, Loughborough, UK(计算机科学,洛桑大学,洛桑,英国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ICAR通过自适应计算方法提升视觉-语言模型效率,实现高效图像-文本匹配与复杂度评估。

Comments Camera-ready version for ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02737 2026-01-16 cs.CV 57%

Unveiling and Bridging the Functional Perception Gap in MLLMs: Atomic Visual Alignment and Hierarchical Evaluation via PET-Bench

揭示和弥合MLLMs中的功能感知差距:通过PET-Bench实现原子视觉对齐和分层评估

Zanting Ye, Xiaolong Niu, Xuanbin Wu, Xu Han, Shengyuan Liu, Jing Hao, Zhihao Peng, Hao Sun, Jieqin Lv, Fanghu Wang, Yanchao Huang, Hubing Wu, Yixuan Yuan, Habib Zaidi, Arman Rahmim, Yefeng Zheng, Lijun Lu

机构 * School of Biomedical Engineering, Southern Medical University(生物医学工程学院,南方医科大学) School of Biomedical Engineering, Shanghai Jiaotong University(生物医学工程学院,上海交通大学) Department of Electronic Engineering, Chinese University of Hong Kong(电子工程系,中国香港大学) Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) Department of Nuclear Medicine, The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(核医学科,广州中医药大学第二附属医院) PET Center, Department of Nuclear Medicine, Guangdong Provincial People’s Hospital, Southern Medical University(PET中心,核医学科,广东省人民医院,南方医科大学) Department of Nuclear Medicine, Nanfang Hospital, Southern Medical University(核医学科,南芳医院,南方医科大学) Division of Nuclear Medicine and Molecular Imaging, Geneva University Hospitals(核医学与分子影像学部,日内瓦大学医院) Departments of Radiology, Physics, and Biomedical Engineering, The University of British Columbia(放射学、物理和生物医学工程系,不列颠哥伦比亚大学) Medical Artificial Intelligence Laboratory, Westlake University(医学人工智能实验室,西湖大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出AVA方法,通过原子视觉对齐解决MLLMs在功能成像中的感知差距,提升诊断准确性14.83%。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏