arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-27 至 2026-02-27 共收录 50 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2602.23235 2026-02-27 cs.CV cs.AI 62%

Spatio-Temporal Token Pruning for Efficient High-Resolution GUI Agents

时空令牌剪枝用于高效高分辨率GUI代理

Zhou Xu, Bowen Zhou, Qi Wang, Shuwen Feng, Jingyu Xiao

机构 * Tsinghua University(清华大学) Xidian University(西安电子科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 GUIPruner通过时空令牌剪枝技术,实现高分辨率GUI导航的高效处理,显著提升性能并降低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22514 2026-02-27 cs.RO cs.AI cs.SY eess.SY 57%

SignVLA: A Gloss-Free Vision-Language-Action Framework for Real-Time Sign Language-Guided Robotic Manipulation

SignVLA:一种无 gloss 的视觉-语言-动作框架,用于实时 sign language 引导的机器人操作

Xinyu Tan, Ningwei Bai, Harry Gardener, Zhengyang Zhong, Luoyu Zhang, Liuhaichen Yang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

机构 * Department of Computer Science, University College London (UCL)(计算机科学系,伦敦大学学院(UCL))

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 SignVLA 提出了一种无 gloss 的视觉-语言-动作框架,用于实时手语引导的机器人操作,通过几何归一化、时间平滑和词汇精炼提升多模态交互的稳定性和可扩展性。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 3 篇

2602.05535 2026-02-27 cs.LG 79%

Detecting Misbehaviors of Large Vision-Language Models by Evidential Uncertainty Quantification

通过证据不确定性量化检测大视觉-语言模型的误行

Tao Huang, Rui Wang, Xiaofei Liu, Yi Qin, Li Duan, Liping Jing

机构 * State Key Laboratory of Advanced Rail Autonomous Operation(先进轨道交通自主运行国家重点实验室) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) Beijing Key Laboratory of Security and Privacy in Intelligent Transportation(北京智能交通安全与隐私重点实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.LG

AI总结 通过证据不确定性量化检测大视觉-语言模型的误行,识别内部冲突和无知以提高模型可靠性。

Comments Accepted to ICLR 2026. Code is available at https://github.com/HT86159/EUQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20570 2026-02-27 cs.CV cs.AI 62%

Dyslexify: A Mechanistic Defense Against Typographic Attacks in CLIP

Dyslexify: 一种针对CLIP中印刷攻击的机制性防御

Lorenz Hufe, Constantin Venhoff, Erblina Purelku, Maximilian Dreyer, Sebastian Lapuschkin, Wojciech Samek

机构 * Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) University of Oxford(牛津大学) Technological University Dublin(都柏林技术大学) Technische Universität Berlin(柏林技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Dyslexify通过消融CLIP中的印刷电路,有效防御印刷攻击,提升性能并保持应用安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04403 2026-02-27 cs.CV cs.CL cs.CR 57%

Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios

自适应数据集构建用于现实世界多模态安全场景

Jingen Qu, Lijun Li, Bo Zhang, Yichen Yan, Jing Shao

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出了一种图像导向的自适应数据集构建方法,用于构建现实世界多模态安全场景的数据集,通过生成35,000个图像-文本对及其指导响应,提升了安全评估的有效性。

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 11 篇

2512.02700 2026-02-27 cs.CV cs.LG 84%

VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm

VLM-Pruner: 为高效VLM离心令牌剪枝范式中的空间稀疏性引入缓冲

Zhenkai Wu, Xiaowen Ma, Zhenliang Ni, Dengming Zhang, Han Shu, Xin Jiang, Xinghao Chen

机构 * Zhejiang University(浙江大学) Huawei Technologies(华为技术)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 VLM-Pruner通过平衡冗余与空间稀疏性,提升VLMs的效率和性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22678 2026-02-27 cs.CV cs.AI 81%

ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport

ViCLIP-OT:首个面向越南语图像-文本检索的视觉-语言基础模型,结合最优传输

Quoc-Khang Tran, Minh-Thien Nguyen, Nguyen-Khang Pham

机构 * Can Tho University(金兰大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 ViCLIP-OT通过整合CLIP对比学习与SIGROT损失,提升越南语图像-文本检索性能,实现域内和零样本设置下的显著改进。

Comments Preprint submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10497 2026-02-27 cs.CV 79%

MERGETUNE: Continued Fine-Tuning of Vision-Language Models

MERGETUNE: 视觉-语言模型的持续微调

Wenqing Wang, Da Li, Xiatian Zhu, Josef Kittler

机构 * University of Surrey(萨里大学) Samsung AI Centre Cambridge(三星AI研究中心(剑桥)) Queen Mary University of London(伦敦大学女王学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 MERGETUNE通过持续微调和线性模式连接,恢复视觉-语言模型在微调中丢失的预训练知识,提升基础-新样本泛化和稳健微调性能。

Comments 20 pages, 5 figures

Journal ref ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22462 2026-02-27 cs.CV cs.IR 78%

MammoWise: Multi-Model Local RAG Pipeline for Mammography Report Generation

MammoWise:多模型本地RAG流水线用于乳腺X线摄影报告生成

Raiyan Jahangir, Nafiz Imtiaz Khan, Amritanand Sudheerkumar, Vladimir Filkov

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 VLM训练与架构 :LLaVA(abstract,comments);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 MammoWise是一种本地多模型流水线,通过多任务分类和检索增强生成技术,实现乳腺X线摄影报告的高准确度生成与分类。

Comments arXiv preprint (submitted 25 Feb 2026). Local multi-model pipeline for mammography report generation + classification using prompting, multimodal RAG (ChromaDB), and QLoRA fine-tuning; evaluates MedGemma, LLaVA-Med, Qwen2.5-VL on VinDr-Mammo and DMID; reports BERTScore/ROUGE-L and classification metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23363 2026-02-27 cs.CV 70%

MediX-R1: Open Ended Medical Reinforcement Learning

MediX-R1:开放端医疗强化学习

Sahal Shaji Mullappilly, Mohammed Irfan Kurpath, Omair Mohamed, Mohamed Zidan, Fahad Khan, Salman Khan, Rao Anwer, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(迈赫迈德·本·扎耶德人工智能大学) Jubilee Mission Medical College(jubilee mission 医学院) Research Institute(研究院) JJM Medical College(JJM 医学院)

专题命中 VLM训练与架构 :VLM(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 MediX-R1通过综合奖励信号和LLM评估,实现医疗多模态模型的开放端强化学习,提升临床推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23229 2026-02-27 cs.CV 70%

Large Multimodal Models as General In-Context Classifiers

大多模态模型作为通用上下文分类器

Marco Garosi, Matteo Farina, Alessandro Conti, Massimiliano Mancini, Elisa Ricci

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出CIRCLE方法,通过伪标签迭代优化,使LMM在开放世界分类中超越VLM,展示LMM作为统一分类器的潜力。

Comments CVPR Findings 2026. Project website at https://circle-lmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22689 2026-02-27 cs.CV cs.CR 70%

No Caption, No Problem: Caption-Free Membership Inference via Model-Fitted Embeddings

无标题,无问题:通过模型拟合嵌入进行无标题成员推断

Joonsung Jeon, Woo Jae Kim, Suhyeon Ha, Sooel Son, Sung-Eui Yoon

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出MoFit框架,通过模型拟合嵌入实现无标题成员推断,克服了传统方法对真实标题的依赖,提升了在无标注场景下的成员推断性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22716 2026-02-27 cs.CV cs.AI 62%

SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs

SoPE: 基于球坐标的位置嵌入:增强3D大视觉-语言模型的空间感知

Guanting Ye, Qiyan Zhao, Wenhao Yu, Liangyu Yuan, Mingkai Li, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Qing Jiang, Ka-Veng Yuen

机构 * University of Macau(澳门大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Hefei University of Technology(合肥工业大学) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SoPE通过基于球坐标的位置嵌入提升3D LVLMs的空间感知能力,结合多尺度频率混合策略,增强几何表示的一致性和表达性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17562 2026-02-27 cs.CV 57%

Visual Instruction Pretraining for Domain-Specific Foundation Models

面向领域特定基础模型的视觉指令预训练

Yuxuan Li, Yicheng Zhang, Wenhao Tang, Yimian Dai, Ming-Ming Cheng, Xiang Li, Jian Yang

机构 * PCA Lab, VCIP, Computer Science, NKU, Tianjin, China(PCA实验室、VCIP、计算机科学、NKU、天津,中国) NKIARI, Futian, Shenzhen, China(NKIARI、福田、深圳,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ViTP,通过视觉指令预训练提升领域特定基础模型的感知与推理能力,在多个遥感和医学影像任务中取得新的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22217 2026-02-27 cs.IR cs.AI 57%

RAGdb: A Zero-Dependency, Embeddable Architecture for Multimodal Retrieval-Augmented Generation on the Edge

RAGdb: 一种无依赖、可嵌入的多模态检索增强生成边缘计算架构

Ahmed Bin Khalid

机构 * SKAS IT

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 RAGdb通过单文件SQLite容器实现多模态检索增强生成,无需GPU推理,提升边缘计算效率与数据主权

Comments 6 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15226 2026-02-27 cs.MM cs.CL 50%

Not All Attention is Needed: Parameter and Computation Efficient Transfer Learning for Multi-modal Large Language Models

并非所有注意力都是必需的:面向多模态大语言模型的参数和计算高效迁移学习

Qiong Wu, Weihao Ye, Yiyi Zhou, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(教育部多媒体可信感知与高效计算重点实验室) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院)

专题命中 VLM训练与架构 :MLLM(abstract)

AI总结 本文提出高效注意力跳过方法,通过减少冗余注意力计算提升多模态大语言模型的推理效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 4 篇

2509.24597 2026-02-27 cs.CL cs.LG 79%

Inducing Dyslexia in Vision Language Models

在视觉语言模型中诱发失读症

Melika Honarmand, Ayati Sharma, Badr AlKhamissi, Johannes Mehrer, Martin Schrimpf

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.LG

AI总结 本研究通过视觉语言模型模拟失读症,揭示了视觉词形处理与阅读障碍的关系,并建立了研究脑部疾病的计算框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22299 2026-02-27 cs.MM cs.AI cs.CL cs.LG 62%

Decoding the Hook: A Multimodal LLM Framework for Analyzing the Hooking Period of Video Ads

解码钩子:一种多模态大语言模型框架用于分析视频广告的钩子阶段

Kunpeng Zhang, Poppy Zhang, Shawndra Hill, Amel Awadelkarim

机构 * University of Marland, College Park(马里兰大学 College Park分校) Meta Platforms, Inc.(Meta平台公司)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一种多模态大语言模型框架,用于分析视频广告的钩子阶段,通过多策略采样和主题提炼提升广告初期效果分析的准确性与实用性。

Comments 11 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23292 2026-02-27 cs.CV 57%

PGVMS: A Prompt-Guided Unified Framework for Virtual Multiplex IHC Staining with Pathological Semantic Learning

PGVMS: 一种基于提示的统一框架用于虚拟多色IHC染色与病理语义学习

Fuqiang Chen, Ranran Zhang, Wanming Hu, Deboch Eyob Abera, Yue Peng, Boyun Zheng, Yiwen Sun, Jing Cai, Wenjian Qin

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences and University of Chinese Academy of Sciences, Beijing, China(深圳先进技术研究院,中国科学院和中国科学院大学,北京,中国) Department of Pathology, Sun Yat-sen University Cancer Center, State Key Laboratory of Oncology in South China, Guangzhou, China(中山大学肿瘤中心病理科,南方肿瘤临床研究中心,广州,中国) Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学,香港特别行政区,中国) Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR 999077, China(电子工程系,香港中文大学,香港特别行政区,中国) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院,中国科学院,深圳,中国)

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

AI总结 PGVMS提出了一种基于提示的统一框架,利用单染训练数据解决虚拟多色IHC染色中的语义指导、染色分布不一致和空间错位问题。

Comments Accepted by TMI

Journal ref IEEE Transactions on Medical Imaging, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21058 2026-02-27 cs.CV 57%

Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control

超越像素模拟:通过诊断语义标记和原型控制生成病理图像

Minghao Han, Yichen Liu, Yizhou Liu, Zizhi Chen, Jingqun Tang, Xuecheng Wu, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd.(Fysics智能科技有限公司) University of Science and Technology Beijing(北京科技大学) ByteDance(字节跳动) School of Computer Science and Technology(计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

AI总结 UniPath通过诊断语义标记和原型控制实现可控的病理图像生成,取得SOTA性能,包括Patho-FID 80.9和98.7%的细粒度语义控制。

Comments accepted by CVPR 2026; 32 pages, 17 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏