arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-27 至 2026-02-27 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 4 篇

2509.24597 2026-02-27 cs.CL cs.LG 79%

Inducing Dyslexia in Vision Language Models

在视觉语言模型中诱发失读症

Melika Honarmand, Ayati Sharma, Badr AlKhamissi, Johannes Mehrer, Martin Schrimpf

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.LG

AI总结 本研究通过视觉语言模型模拟失读症,揭示了视觉词形处理与阅读障碍的关系,并建立了研究脑部疾病的计算框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22299 2026-02-27 cs.MM cs.AI cs.CL cs.LG 62%

Decoding the Hook: A Multimodal LLM Framework for Analyzing the Hooking Period of Video Ads

解码钩子:一种多模态大语言模型框架用于分析视频广告的钩子阶段

Kunpeng Zhang, Poppy Zhang, Shawndra Hill, Amel Awadelkarim

机构 * University of Marland, College Park(马里兰大学 College Park分校) Meta Platforms, Inc.(Meta平台公司)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一种多模态大语言模型框架,用于分析视频广告的钩子阶段,通过多策略采样和主题提炼提升广告初期效果分析的准确性与实用性。

Comments 11 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23292 2026-02-27 cs.CV 57%

PGVMS: A Prompt-Guided Unified Framework for Virtual Multiplex IHC Staining with Pathological Semantic Learning

PGVMS: 一种基于提示的统一框架用于虚拟多色IHC染色与病理语义学习

Fuqiang Chen, Ranran Zhang, Wanming Hu, Deboch Eyob Abera, Yue Peng, Boyun Zheng, Yiwen Sun, Jing Cai, Wenjian Qin

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences and University of Chinese Academy of Sciences, Beijing, China(深圳先进技术研究院,中国科学院和中国科学院大学,北京,中国) Department of Pathology, Sun Yat-sen University Cancer Center, State Key Laboratory of Oncology in South China, Guangzhou, China(中山大学肿瘤中心病理科,南方肿瘤临床研究中心,广州,中国) Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学,香港特别行政区,中国) Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR 999077, China(电子工程系,香港中文大学,香港特别行政区,中国) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院,中国科学院,深圳,中国)

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

AI总结 PGVMS提出了一种基于提示的统一框架,利用单染训练数据解决虚拟多色IHC染色中的语义指导、染色分布不一致和空间错位问题。

Comments Accepted by TMI

Journal ref IEEE Transactions on Medical Imaging, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21058 2026-02-27 cs.CV 57%

Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control

超越像素模拟:通过诊断语义标记和原型控制生成病理图像

Minghao Han, Yichen Liu, Yizhou Liu, Zizhi Chen, Jingqun Tang, Xuecheng Wu, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd.(Fysics智能科技有限公司) University of Science and Technology Beijing(北京科技大学) ByteDance(字节跳动) School of Computer Science and Technology(计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

AI总结 UniPath通过诊断语义标记和原型控制实现可控的病理图像生成,取得SOTA性能,包括Patho-FID 80.9和98.7%的细粒度语义控制。

Comments accepted by CVPR 2026; 32 pages, 17 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏