arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-22 至 2026-01-22 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 8 篇

2601.14827 2026-01-22 cs.AI 79%

Measuring and Aligning Abstraction in Vision-Language Models with Medical Taxonomies

利用医学分类法测量和对齐视觉-语言模型中的抽象能力

Ben Schaper, Maxime Di Folco, Bernhard Kainz, Julia A. Schnabel, Cosmin I. Bercea

机构 * 1 School of Computation, Information Technology, Technical University of Munich, Germany 2 Institute of Machine Learning in Biomedical Imaging, Helmholtz Munich, Germany 3 LTCI, Télécom Paris, Institut Polytechnique de Paris, France 4 Munich Center for Machine Learning (MCML) 5 School of Biomedical Engineering Imaging Sciences, King's College London, UK 6 Department of Artificial Intelligence in Biomedical Imaging, FAU Erlangen-Nuremberg, Germany 7 Department of Computing, Imperial College London, UK

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出通过医学分类法量化和缓解视觉-语言模型中的抽象错误,引入灾难性抽象错误概念,并通过风险约束阈值和分类法感知微调减少严重错误至2%以下。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14978 2026-01-22 cs.CV 57%

Unified Multi-Dataset Training for TBPS

多数据集统一训练用于TBPS

Nilanjana Chatterjee, Sidharatha Garg, A V Subramanyam, Brejesh Lall

机构 * IIIT Delhi(德里印度理工学院) IIT Delhi(德里理工学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Scale-TBPS方法,通过统一数据集编纂和可扩展身份学习框架,在多个数据集上训练出单一TBPS模型,提升了行人检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14774 2026-01-22 cs.CV 57%

Does medical specialization of VLMs enhance discriminative power?: A comprehensive investigation through feature distribution analysis

医学专业性是否增强VLMs的判别能力?:通过特征分布分析的全面研究

Keita Takeda, Tomoya Sakai

机构 * Graduate School of Integrated Science and Technology(整合科学与技术研究生院) Nagasaki University(长崎大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本研究通过特征分布分析,探讨医学专业性对VLMs判别能力的影响,发现增强文本编码器比大量医学图像训练更关键,且非医学模型易受图像文本偏见影响。

Comments A short version paper of this research has been accepted for The IEEE International Symposium on Biomedical Imaging (ISBI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13664 2026-01-22 cs.CV 57%

VIAFormer: Voxel-Image Alignment Transformer for High-Fidelity Voxel Refinement

VIAFormer:用于高保真体素细化的体素-图像对齐变换器

Tiancheng Fang, Bowen Pan, Lingxi Chen, Jiangjing Lyu, Chengfei Lyu, Chaoyue Niu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 VIAFormer通过体素-图像对齐变换器实现高保真体素细化,结合图像索引、校正流目标和混合流变换器,提升多视角条件下体素修复的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17160 2026-01-22 cs.CV 57%

Can Synthetic Images Serve as Effective and Efficient Class Prototypes?

合成图像能否作为有效的高效类别原型?

Dianxing Shi, Dingjie Fu, Yuqiao Liu, Jun Wang

机构 * Beijing Research Institute of Uranium Geology(铀矿北京研究机构) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Great Bay University(大湾大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 LGCLIP通过大语言模型生成类别特定提示,利用扩散模型合成参考图像,以实现高效的零样本分类。

Comments Accepted by IEEE ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19699 2026-01-22 cs.NI cs.AI cs.MA 57%

A Layered Protocol Architecture for the Internet of Agents

面向智能体的分层协议架构

Charles Fleming, Luca Muscariello, Vijoy Pandey, Ramana Kompella

机构 * Cisco Research(思科研究)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出分层协议架构,通过智能体通信层和语义层实现智能体协作,解决LLMs在内存和计算能力上的限制,推动多智能体系统的扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09598 2026-01-22 cs.CV 57%

GAIA: A Global, Multi-modal, Multi-scale Vision-Language Dataset for Remote Sensing Image Analysis

GAIA: 一个全球性的多模态、多尺度遥感图像分析数据集

Angelos Zavras, Dimitrios Michail, Xiao Xiang Zhu, Begüm Demir, Ioannis Papoutsis

机构 * Orion Lab, School of Rural, Surveying and Geoinformatics Engineering, National Technical University of Athens(奥里昂实验室,农村测绘与地理信息工程学院,希腊雅典国家技术大学) Institute of Astronomy, Astrophysics, Space Applications and Remote Sensing, National Observatory of Athens(天文、天体物理、空间应用与遥感研究所,希腊雅典国家天文台) Department of Informatics and Telematics, Harokopio University of Athens(信息与电信技术系,雅典霍罗科皮欧大学) Chair of Data Science in Earth Observation, Technical University of Munich(地球观测数据科学教授职位,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Faculty of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 GAIA是一个全球性的多模态遥感图像分析数据集,通过精心构建的图像-文本对提升遥感任务的性能。

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14714 2026-01-22 cs.IR 50%

Unified Multimodal and Multilingual Retrieval via Multi-Task Learning with NLU Integration

通过多任务学习与NLU集成实现统一的多模态和多语言检索

Xinyuan Zhang, Lina Zhang, Lisung Chen, Guangyao Liu, Shuai Nie, Jiaming Xu, Runyu Shi, Ying Huang, Guoquan Zhang

专题命中 VLM训练与架构 :vision language model(abstract)

AI总结 本文提出通过多任务学习与NLU集成实现统一的多模态和多语言检索,提升跨语言和跨模态的检索效率与准确性。

Comments 4 pages, 2 figures, submitted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏