arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-26 至 2026-01-26 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 3 篇

2512.09867 2026-01-26 cs.CV cs.AI cs.CL 62%

Hierarchy-Aware Multimodal Unlearning for Medical AI

层次感知的多模态反遗忘用于医疗AI

Fengli Wu, Vaidehi Patil, Jaehong Yoon, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MedForget提出一个层次感知的多模态反遗忘基准和CHIP方法,有效解决医疗数据中层次结构的遗忘问题,同时保持下游效用。

Comments Dataset and Code: https://github.com/fengli-wu/MedForget

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23927 2026-01-26 cs.CV 57%

FUSAR-KLIP: Towards Multimodal Foundation Models for Remote Sensing

FUSAR-KLIP:迈向遥感多模态基础模型

Yi Yang, Xiaokun Zhang, Qingchen Fang, Jing Liu, Ziqi Ye, Rui Li, Li Liu, Haipeng Wang

机构 * Key Laboratory for Information Science of Electromagnetic Waves (MoE), Fudan University(电磁波信息科学重点实验室(MoE),复旦大学) Institute of Zhejiang Laboratory(浙江实验室研究院) College of Electronic Science and Technology, NUDT(电子科学与技术学院,南大学)

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

AI总结 FUSAR-KLIP是首个针对SAR图像的多模态基础模型,通过构建大规模数据集、生成结构化文本、设计自洽优化机制和建立统一评估基准,解决遥感图像与通用视觉表示之间的认知不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04634 2026-01-26 cs.CV 57%

Is What You Ask For What You Get? Investigating Concept Associations in Text-to-Image Models

你所要求的是你所得到的吗?探究文本到图像模型中的概念关联

Salma Abdel Magid, Weiwei Pan, Simon Warchol, Grace Guo, Junsik Kim, Mahia Rahman, Hanspeter Pfister

机构 * Department of Computer Science(计算机科学系) Harvard University(哈佛大学)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 本文提出 Concept2Concept 框架,用于审计文本到图像模型中提示与生成内容之间的概念关联,通过可解释的概念和度量标准进行可视化分析。

Journal ref Trans. Mach. Learn. Res, 2835-8856, 2025, https://openreview.net/forum?id=mk1YIkVvTQ

详情

展开后加载摘要…

URL PDF HTML 收藏