arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1583 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1583 篇

2410.05363 2024-10-10 cs.CV 57%

Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation

Fanqing Meng, Jiaqi Liao, Xinyu Tan, Wenqi Shao, Quanfeng Lu, Kaipeng Zhang, Yu Cheng, Dianqi Li, Yu Qiao, Ping Luo

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Project Page: https://phygenbench123.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19146 2024-10-08 stat.ML cs.LG 57%

I Bet You Did Not Mean That: Testing Semantic Importance via Betting

Jacopo Teneggi, Jeremias Sulam

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17958 2024-09-27 cs.CL cs.CV 57%

The Hard Positive Truth about Vision-Language Compositionality

Amita Kamath, Cheng-Yu Hsieh, Kai-Wei Chang, Ranjay Krishna

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12778 2024-09-24 cs.CV 57%

EventDance++: Language-guided Unsupervised Source-free Cross-modal Adaptation for Event-based Object Recognition

Xu Zheng, Lin Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2403.14082

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09291 2024-09-17 cs.CV 57%

Infrared and Visible Image Fusion with Hierarchical Human Perception

Guang Yang, Jie Li, Xin Liu, Zhusi Zhong, Xinbo Gao

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06853 2024-09-12 cs.CV 57%

ExIQA: Explainable Image Quality Assessment Using Distortion Attributes

Sepehr Kazemi Ranjbar, Emad Fatemizadeh

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00341 2024-09-04 cs.CV 57%

Aligning Medical Images with General Knowledge from Large Language Models

Xiao Fang, Yi Lin, Dong Zhang, Kwang-Ting Cheng, Hao Chen

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13402 2024-09-04 cs.LG 57%

LLaVaOLMoBitnet1B: Ternary LLM goes Multimodal!

Jainaveen Sundaram, Ravi Iyer

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16986 2024-09-02 cs.CV 57%

AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding

Yonghui Wang, Wengang Zhou, Hao Feng, Houqiang Li

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16296 2024-08-30 cs.CV cs.IR 57%

Rethinking Sparse Lexical Representations for Image Retrieval in the Age of Rising Multi-Modal Large Language Models

Kengo Nakata, Daisuke Miyashita, Youyang Ng, Yasuto Hoshi, Jun Deguchi

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted to ECCV 2024 Workshops: 2nd Workshop on Traditional Computer Vision in the Age of Deep Learning (TradiCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14723 2024-08-28 cs.CV cs.IR 57%

Snap and Diagnose: An Advanced Multimodal Retrieval System for Identifying Plant Diseases in the Wild

Tianqi Wei, Zhi Chen, Xin Yu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07545 2024-08-21 cs.CV 57%

Vision-Language Dataset Distillation

Xindi Wu, Byron Zhang, Zhiwei Deng, Olga Russakovsky

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 31 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06158 2024-08-13 cs.CV 57%

OmniCLIP: Adapting CLIP for Video Recognition with Spatial-Temporal Omni-Scale Feature Learning

Mushui Liu, Bozheng Li, Yunlong Yu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ECAI-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04868 2024-08-12 cs.CV 57%

ChatGPT Meets Iris Biometrics

Parisa Farmanifard, Arun Ross

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Published at IJCB 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04671 2024-08-12 cs.CL cs.AI cs.CY 57%

Prompt and Prejudice

Lorenzo Berlincioni, Luca Cultrera, Federico Becattini, Marco Bertini, Alberto Del Bimbo

专题命中 其他VLM :vision language model(abstract);分类 cs.AI

Comments Accepted at ECCV workshop FAILED

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04388 2024-08-09 cs.MM cs.AI cs.IR 57%

MM-Forecast: A Multimodal Approach to Temporal Event Forecasting with Large Language Models

Haoxuan Li, Zhengmao Yang, Yunshan Ma, Yi Bin, Yang Yang, Tat-Seng Chua

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03695 2024-08-08 cs.CV 57%

Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual Storytelling

Zilyu Ye, Jinxiu Liu, Ruotian Peng, Jinjin Cao, Zhiyang Chen, Yiyang Zhang, Ziwei Xuan, Mingyuan Zhou, Xiaoqian Shen, Mohamed Elhoseiny, Qi Liu, Guo-Jun Qi

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03149 2024-08-07 cs.CV cs.CL 57%

Leveraging Entity Information for Cross-Modality Correlation Learning: The Entity-Guided Multimodal Summarization

Yanghai Zhang, Ye Liu, Shiwei Wu, Kai Zhang, Xukai Liu, Qi Liu, Enhong Chen

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments In ACL-Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19981 2024-08-06 cs.CV 57%

'Person' == Light-skinned, Western Man, and Sexualization of Women of Color: Stereotypes in Stable Diffusion

Sourojit Ghosh, Aylin Caliskan

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Upcoming publication, Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17100 2024-08-02 cs.CV 57%

Open-Set Video-based Facial Expression Recognition with Human Expression-sensitive Prompting

Yuanyuan Liu, Yuxuan Huang, Shuyang Liu, Yibing Zhan, Zijing Chen, Zhe Chen

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by ACM MM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20920 2024-07-31 cs.CV 57%

SSPA: Split-and-Synthesize Prompting with Gated Alignments for Multi-Label Image Recognition

Hao Tan, Zichang Tan, Jun Li, Jun Wan, Zhen Lei, Stan Z. Li

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15587 2024-07-30 cs.CV 57%

Composed Image Retrieval for Remote Sensing

Bill Psomas, Ioannis Kakogeorgiou, Nikos Efthymiadis, Giorgos Tolias, Ondrej Chum, Yannis Avrithis, Konstantinos Karantzalos

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted for ORAL presentation at the 2024 IEEE International Geoscience and Remote Sensing Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02364 2024-07-30 cs.CV 57%

What's in a Name? Beyond Class Indices for Image Recognition

Kai Han, Xiaohu Huang, Yandong Li, Sagar Vaze, Jie Li, Xuhui Jia

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments CVPR 2024 Workshop on Computer Vision in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18589 2024-07-29 cs.CV 57%

HICEScore: A Hierarchical Metric for Image Captioning Evaluation

Zequn Zeng, Jianqiao Sun, Hao Zhang, Tiansheng Wen, Yudi Su, Yan Xie, Zhengjue Wang, Bo Chen

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ACM MM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18121 2024-07-26 cs.CV 57%

Efficient Inference of Vision Instruction-Following Models with Elastic Cache

Zuyan Liu, Benlin Liu, Jiahui Wang, Yuhao Dong, Guangyi Chen, Yongming Rao, Ranjay Krishna, Jiwen Lu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05049 2024-07-22 cs.CV 57%

XPSR: Cross-modal Priors for Diffusion-based Image Super-Resolution

Yunpeng Qu, Kun Yuan, Kai Zhao, Qizhi Xie, Jinhua Hao, Ming Sun, Chao Zhou

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 19 pages, 7 figures; including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12023 2024-07-18 cs.CL cs.AI 57%

CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models

Zhong-Zhi Li, Ming-Liang Zhang, Fei Yin, Zhi-Long Ji, Jin-Feng Bai, Zhen-Ru Pan, Fan-Hu Zeng, Jian Xu, Jia-Xin Zhang, Cheng-Lin Liu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11375 2024-07-17 cs.CV 57%

Mask-Free Neuron Concept Annotation for Interpreting Neural Networks in Medical Domain

Hyeon Bae Kim, Yong Hyun Ahn, Seong Tae Kim

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11001 2024-07-17 cs.CL cs.LG 57%

Generative AI Systems: A Systems-based Perspective on Generative AI

Jakub M. Tomczak

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14428 2024-07-11 cs.CV 57%

Prompting Language-Informed Distribution for Compositional Zero-Shot Learning

Wentao Bao, Lichang Chen, Heng Huang, Yu Kong

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

Comments ECCV 2024 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏