arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-18 至 2026-02-18 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 8 篇

2602.14073 2026-02-18 cs.CL cs.AI 88%

Annotation-Efficient Vision-Language Model Adaptation to the Polish Language Using the LLaVA Framework

利用LLaVA框架实现波兰语视觉-语言模型的高效标注

Grzegorz Statkiewicz, Alicja Dobrzeniecka, Karolina Seweryn, Aleksandra Krasnodębska, Karolina Piosek, Katarzyna Bogusz, Sebastian Cygert, Wojciech Kusa

机构 * NASK National Research Institute(国家研究机构NASK)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);分类 cs.AI

AI总结 本文提出利用LLaVA框架高效适应波兰语的视觉-语言模型,通过自动化翻译和合成数据提升多模态模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15549 2026-02-18 cs.RO cs.AI 83%

VLM-DEWM: Dynamic External World Model for Verifiable and Resilient Vision-Language Planning in Manufacturing

VLM-DEWM:动态外部世界模型用于制造中的可验证和抗毁视觉语言规划

Guoqin Tang, Qingxuan Jia, Gang Chen, Tong Li, Zeyuan Huang, Zihang Lv, Ning Ji

机构 * School of Intelligent Engineering and Automation(智能工程与自动化学院)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 VLM-DEWM通过动态外部世界模型提升制造中视觉语言规划的可验证性和抗毁性,显著提高状态跟踪精度和恢复成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07849 2026-02-18 cs.AI 83%

LQA: A Lightweight Quantized-Adaptive Framework for Vision-Language Models on the Edge

LQA: 一种轻量级量化自适应框架,用于边缘设备上的视觉-语言模型

Xin Wang, Hong Jia, Hualin Zhou, Sheng Guang Wang, Yu Zhang, Ting Dang, Tao Gu

机构 * School of Computing(计算机学院) Information Systems, University of Melbourne, Melbourne, Australia(信息系统学院,墨尔本大学,澳大利亚墨尔本) Faculty of Science, Auckland, New Zealand(科学学院,新西兰奥克兰) School of Computing, University of Macquarie, Sydney, Australia(计算机学院,麦考瑞大学,澳大利亚悉尼)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

AI总结 LQA提出了一种轻量级量化自适应框架,用于在边缘设备上高效部署视觉-语言模型,通过选择性混合量化和无梯度适应机制,提升适应性能并降低内存使用。

Comments 15 pages, 9 figures ,9 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09216 2026-02-18 cs.HC cs.CV cs.CY 79%

Towards Human-AI Accessibility Mapping in India: VLM-Guided Annotations and POI-Centric Analysis in Chandigarh

迈向印度的人机可及性映射:在昌迪加尔的VLM引导标注与POI中心分析

Varchita Lalwani, Utkarsh Agarwal, Michael Saugstad, Manish Kumar, Jon E. Froehlich, Anupam Sobti

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.CV

AI总结 本文提出在印度昌迪加尔部署Project Sidewalk工具,通过VLM引导标注和POI中心分析,评估了城市无障碍性改进的潜力。

Comments Accepted at the Second Workshop on AI for Urban Planning (AI4UP) at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15368 2026-02-18 cs.CV cs.AI cs.LG eess.IV 75%

GMAIL: Generative Modality Alignment for generated Image Learning

GMAIL: 生成模态对齐用于生成图像学习

Shentong Mo, Sukmin Yun

机构 * Department of Machine Learning, CMU, USA(卡内基梅隆大学机器学习系) Department of Machine Learning, MBZUAI, UAE(马斯克大学人工智能研究所) Department of Artificial Intelligence, Hanyang University ERICA, South Korea(翰阳大学ERICA人工智能系)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 GMAIL通过多模态学习方法对齐生成图像与真实图像,提升视觉-语言任务中的生成图像学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22914 2026-02-18 cs.CV cs.LG 73%

cadrille: Multi-modal CAD Reconstruction with Reinforcement Learning

cadrille: 多模态CAD重建与强化学习

Maksim Kolodiazhnyi, Denis Tarasov, Dmitrii Zhemchuzhnikov, Alexander Nikulin, Ilya Zisman, Anna Vorontsova, Anton Konushin, Vladislav Kurenkov, Danila Rukhovich

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) AXXX ETH Zurich(苏黎世联邦理工学院) Innopolis University(因诺波利斯大学) Institute of Mechanics, Armenia(亚美尼亚力学研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 cadrille通过强化学习实现多模态CAD重建,首次在CAD任务中应用RL微调,提升重建性能并设定新基准。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15318 2026-02-18 cs.CV cs.AI 62%

Sparrow: Text-Anchored Window Attention with Visual-Semantic Glimpsing for Speculative Decoding in Video LLMs

Sparrow: 一种基于文本锚定窗口注意力与视觉语义窥视的推测解码方法用于视频大语言模型

Libo Zhang, Zhaoning Zhang, Wangyang Hong, Peng Qiao, Dongsheng Li

机构 * National Key Laboratory of Parallel and Distributed Computing(平行与分布式计算国家重点实验室) College of Computer Science and Technology(计算机科学与技术学院) National University of Defense Technology(国防科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Sparrow通过文本锚定窗口注意力与视觉语义窥视方法,解决视频大语言模型中推测解码的性能下降问题,实现2.82倍加速。

Comments 15 pages , 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22211 2026-02-18 cs.CL cs.AI 57%

LogiPart: Local Large Language Models for Data Exploration at Scale with Logical Partitioning

LogiPart: 用于大规模数据探索的本地大语言模型与逻辑分区

Tiago Fernandes Tavares

机构 * Tiago Fernandes Tavares(独立研究者)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 LogiPart通过本地大语言模型与逻辑分区技术,在大规模数据探索中实现高效、可解释的税目发现,克服传统方法的效率与成本限制。

Comments This version introduces a major architectural shift to Local LLMs and NLI-based assignment, scaling the framework to O(1) generative complexity. Formerly titled 'Question-Driven Analysis and Synthesis'

详情

展开后加载摘要…

URL PDF HTML 收藏