arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1583 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1583 篇

2406.10215 2024-12-10 cs.CL cs.LG 57%

DevBench: A multimodal developmental benchmark for language learning

Alvin Wei Ming Tan, Sunny Yu, Bria Long, Wanjing Anya Ma, Tonya Murray, Rebecca D. Silverman, Jason D. Yeatman, Michael C. Frank

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Comments Accepted at NeurIPS 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04083 2024-12-06 cs.CV 57%

Unified Framework for Open-World Compositional Zero-shot Learning

Hirunima Jayasekara, Khoi Pham, Nirat Saini, Abhinav Shrivastava

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03297 2024-12-05 cs.CV 57%

Composed Image Retrieval for Training-Free Domain Conversion

Nikos Efthymiadis, Bill Psomas, Zakaria Laskar, Konstantinos Karantzalos, Yannis Avrithis, Ondřej Chum, Giorgos Tolias

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01598 2024-12-05 cs.CV 57%

Learning Prompt with Distribution-Based Feature Replay for Few-Shot Class-Incremental Learning

Zitong Huang, Ze Chen, Zhixing Chen, Erjin Zhou, Xinxing Xu, Rick Siow Mong Goh, Yong Liu, Wangmeng Zuo, Chunmei Feng

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13596 2024-12-02 cs.CV 57%

EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing

Wei Zhang, Miaoxin Cai, Tong Zhang, Jun Li, Yin Zhuang, Xuerui Mao

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16809 2024-11-27 cs.CR cs.AI 57%

Blockchain Meets LLMs: A Living Survey on Bidirectional Integration

Jianghao Gong, Peiqi Yan, Yue Zhang, Hongli An, Logan Liu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16327 2024-11-26 cs.CV 57%

CapHDR2IR: Caption-Driven Transfer from Visible Light to Infrared Domain

Jingchao Peng, Thomas Bashford-Rogers, Zhuang Shao, Haitao Zhao, Aru Ranjan Singh, Abhishek Goswami, Kurt Debattista

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09894 2024-11-18 cs.CV 57%

Free Lunch in Pathology Foundation Model: Task-specific Model Adaptation with Concept-Guided Feature Enhancement

Yanyan Huang, Weiqin Zhao, Yihang Chen, Yu Fu, Lequan Yu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19674 2024-11-18 cs.CV 57%

Advancing Prompt Learning through an External Layer

Fangming Cui, Xun Yang, Chao Wu, Liang Xiao, Xinmei Tian

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09293 2024-11-15 cs.CV 57%

LLV-FSR: Exploiting Large Language-Vision Prior for Face Super-resolution

Chenyang Wang, Wenjie An, Kui Jiang, Xianming Liu, Junjun Jiang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02346 2024-11-12 cs.CV 57%

Concept Drift and Long-Tailed Distribution in Fine-Grained Visual Categorization: Benchmark and Method

Shuo Ye, Shiming Chen, Ruxin Wang, Tianxu Wu, Jiamiao Xu, Salman Khan, Fahad Shahbaz Khan, Ling Shao

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12964 2024-11-11 cs.CV cs.CL 57%

Enhancing Vision-Language Few-Shot Adaptation with Negative Learning

Ce Zhang, Simon Stepputtis, Katia Sycara, Yaqi Xie

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by WACV 2025. Code is available at https://github.com/zhangce01/SimNL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01090 2024-11-08 cs.CV 57%

Learning Multiple Object States from Actions via Large Language Models

Masatoshi Tateno, Takuma Yagi, Ryosuke Furuta, Yoichi Sato

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments This is an accepted WACV 2025 paper. Project page: https://masatate.github.io/ObjStatefromAction.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23907 2024-11-01 cs.CV 57%

IP-MOT: Instance Prompt Learning for Cross-Domain Multi-Object Tracking

Run Luo, Zikai Song, Longze Chen, Yunshui Li, Min Yang, Wei Yang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23676 2024-11-01 cs.CV 57%

Web-Scale Visual Entity Recognition: An LLM-Driven Data Approach

Mathilde Caron, Alireza Fathi, Cordelia Schmid, Ahmet Iscen

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19872 2024-11-01 cs.CV 57%

Towards Unified Multimodal Editing with Enhanced Knowledge Collaboration

Kaihang Pan, Zhaoyu Fan, Juncheng Li, Qifan Yu, Hao Fei, Siliang Tang, Richang Hong, Hanwang Zhang, Qianru Sun

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13219 2024-10-31 cs.CV cs.CL 57%

MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency

Junzhe Zhang, Huixuan Zhang, Xunjian Yin, Baizhou Huang, Xu Zhang, Xinyu Hu, Xiaojun Wan

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03373 2024-10-28 cs.CV 57%

Knowledge-aware Text-Image Retrieval for Remote Sensing Images

Li Mi, Xianjie Dai, Javiera Castillo-Navarro, Devis Tuia

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by IEEE TGRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15430 2024-10-25 cs.CV 57%

BoostAdapter: Improving Vision-Language Test-Time Adaptation via Regional Bootstrapping

Taolin Zhang, Jinpeng Wang, Hang Guo, Tao Dai, Bin Chen, Shu-Tao Xia

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17532 2024-10-24 cs.CL cs.AI 57%

Responsible Multilingual Large Language Models: A Survey of Development, Applications, and Societal Impact

Junhua Liu, Bin Fu

专题命中 其他VLM :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16840 2024-10-23 cs.CV 57%

MPDS: A Movie Posters Dataset for Image Generation with Diffusion Model

Meng Xu, Tong Zhang, Fuyun Wang, Yi Lei, Xin Liu, Zhen Cui

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15199 2024-10-22 cs.CV cs.GR 57%

CLIPtortionist: Zero-shot Text-driven Deformation for Manufactured 3D Shapes

Xianghao Xu, Srinath Sridhar, Daniel Ritchie

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03615 2024-10-22 cs.AI cs.CL 57%

Optimus-1: Hybrid Multimodal Memory Empowered Agents Excel in Long-Horizon Tasks

Zaijing Li, Yuquan Xie, Rui Shao, Gongwei Chen, Dongmei Jiang, Liqiang Nie

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14587 2024-10-21 cs.LG q-fin.CP 57%

Neuro-Symbolic Traders: Assessing the Wisdom of AI Crowds in Markets

Namid R. Stillman, Rory Baggott

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Comments 8 pages, 4 figures, ACM format

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13989 2024-10-21 cs.CV 57%

Reproducibility study of "LICO: Explainable Models with Language-Image Consistency"

Luan Fletcher, Robert van der Klis, Martin Sedláček, Stefan Vasilev, Christos Athanasiadis

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 15 pages, 2 figures, Machine Learning Reproducibility Challenge 2024

Journal ref Transactions on Machine Learning Research 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13370 2024-10-21 cs.CV cs.CL cs.MM 57%

Movie101v2: Improved Movie Narration Benchmark

Zihao Yue, Yepeng Zhang, Ziheng Wang, Qin Jin

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06750 2024-10-21 cs.CY cs.AI 57%

Frontier AI Ethics: Anticipating and Evaluating the Societal Impacts of Language Model Agents

Seth Lazar

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13088 2024-10-18 cs.LG cs.CL cs.MM 57%

Self-Comparison for Dataset-Level Membership Inference in Large (Vision-)Language Models

Jie Ren, Kangrui Chen, Chen Chen, Vikash Sehwag, Yue Xing, Jiliang Tang, Lingjuan Lyu

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10308 2024-10-15 cs.CV 57%

LG-CAV: Train Any Concept Activation Vector with Language Guidance

Qihan Huang, Jie Song, Mengqi Xue, Haofei Zhang, Bingde Hu, Huiqiong Wang, Hao Jiang, Xingen Wang, Mingli Song

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08860 2024-10-14 cs.CL cs.CV 57%

Audio Description Generation in the Era of LLMs and VLMs: A Review of Transferable Generative AI Technologies

Yingqiang Gao, Lukas Fischer, Alexa Lintner, Sarah Ebling

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏