arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1578 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1578 篇

2412.08271 2024-12-12 cs.CV cs.AI 62%

Position-aware Guided Point Cloud Completion with CLIP Model

Feng Zhou, Qi Zhang, Ju Dai, Lei Li, Qing Fan, Junliang Xing

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02779 2024-12-10 cs.LG cs.AI cs.ET 62%

Synergistic Development of Perovskite Memristors and Algorithms for Robust Analog Computing

Nanyang Ye, Qiao Sun, Yifei Wang, Liujia Yang, Jundong Zhou, Lei Wang, Guang-Zhong Yang, Xinbing Wang, Chenghu Zhou, Wei Ren, Leilei Gu, Huaqiang Wu, Qinying Gu

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13853 2024-12-10 cs.RO cs.AI cs.CV 62%

RealDex: Towards Human-like Grasping for Robotic Dexterous Hand

Yumeng Liu, Yaxun Yang, Youzhuo Wang, Xiaofei Wu, Jiamin Wang, Yichen Yao, Sören Schwertfeger, Sibei Yang, Wenping Wang, Jingyi Yu, Xuming He, Yuexin Ma

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://4dvlab.github.io/RealDex_page/

Journal ref Proceedings of the Thirty-Third International Joint Conference on Artificial Intelligence (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00754 2024-12-02 cs.CV cs.LG 62%

CLIPArTT: Adaptation of CLIP to New Domains at Test Time

Gustavo Adolfo Vargas Hakim, David Osowiechi, Mehrdad Noori, Milad Cheraghalikhani, Ali Bahri, Moslem Yazdanpanah, Ismail Ben Ayed, Christian Desrosiers

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18101 2024-11-28 cs.CV cs.LG 62%

Aligning Knowledge Concepts to Whole Slide Images for Precise Histopathology Image Analysis

Weiqin Zhao, Ziyu Guo, Yinshuang Fan, Yuming Jiang, Maximus Yeung, Lequan Yu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15488 2024-11-26 cs.CL cs.AI cs.CV 62%

Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark

Rong-Cheng Tu, Zi-Ao Ma, Tian Lan, Yuehao Zhao, Heyan Huang, Xian-Ling Mao

专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02537 2024-11-12 cs.CV cs.AI cs.CL cs.IR 62%

INQUIRE: A Natural World Text-to-Image Retrieval Benchmark

Edward Vendrow, Omiros Pantazis, Alexander Shepard, Gabriel Brostow, Kate E. Jones, Oisin Mac Aodha, Sara Beery, Grant Van Horn

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Published in NeurIPS 2024, Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03531 2024-11-07 cs.CV cs.AI 62%

Personalized Video Summarization by Multimodal Video Understanding

Brian Chen, Xiangyuan Zhao, Yingnan Zhu

专题命中 其他VLM :visual language model(abstract);分类 cs.CV、cs.AI

Comments In Proceedings of CIKM 2024 Applied Research Track

Journal ref 33rd ACM International Conference on Information and Knowledge Management (CIKM 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02437 2024-11-06 cs.CV cs.AI 62%

TypeScore: A Text Fidelity Metric for Text-to-Image Generative Models

Georgia Gabriela Sampaio, Ruixiang Zhang, Shuangfei Zhai, Jiatao Gu, Josh Susskind, Navdeep Jaitly, Yizhe Zhang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24018 2024-11-01 cs.LG cs.CV 62%

Bayesian-guided Label Mapping for Visual Reprogramming

Chengyi Cai, Zesheng Ye, Lei Feng, Jianzhong Qi, Feng Liu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22927 2024-10-31 cs.CV cs.LG 62%

An Individual Identity-Driven Framework for Animal Re-Identification

Yihao Wu, Di Zhao, Jingfeng Zhang, Yun Sing Koh

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22362 2024-10-31 eess.IV cs.AI cs.CV 62%

MMM-RS: A Multi-modal, Multi-GSD, Multi-scene Remote Sensing Dataset and Benchmark for Text-to-Image Generation

Jialin Luo, Yuanzhi Wang, Ziqi Gu, Yide Qiu, Shuaizhen Yao, Fuyun Wang, Chunyan Xu, Wenhua Zhang, Dan Wang, Zhen Cui

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13030 2024-10-18 cs.CV cs.CL cs.LG 62%

Sensitivity of Generative VLMs to Semantically and Lexically Altered Prompts

Sri Harsha Dumpala, Aman Jaiswal, Chandramouli Sastry, Evangelos Milios, Sageev Oore, Hassan Sajjad

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02027 2024-10-10 cs.CV cs.AI 62%

Quantifying the Gaps Between Translation and Native Perception in Training for Multimodal, Multilingual Retrieval

Kyle Buettner, Adriana Kovashka

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments EMNLP 2024 Main - Short

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15837 2024-10-10 cs.CV cs.CL cs.LG 62%

Centered Masking for Language-Image Pre-Training

Mingliang Liang, Martha Larson

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19474 2024-10-08 cs.CV cs.AI 62%

FairPIVARA: Reducing and Assessing Biases in CLIP-Based Multimodal Models

Diego A. B. Moreira, Alef Iury Ferreira, Jhessica Silva, Gabriel Oliveira dos Santos, Luiz Pereira, João Medrado Gondim, Gustavo Bonil, Helena Maia, Nádia da Silva, Simone Tiemi Hashiguti, Jefersson A. dos Santos, Helio Pedrini, Sandra Avila

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 14 pages, 10 figures. Accepted to 35th British Machine Vision Conference (BMVC 2024), Workshop on Privacy, Fairness, Accountability and Transparency in Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03303 2024-10-07 cs.LG cs.CV 62%

SELU: Self-Learning Embodied MLLMs in Unknown Environments

Boyu Li, Haobin Jiang, Ziluo Ding, Xinrun Xu, Haoran Li, Dongbin Zhao, Zongqing Lu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19610 2024-10-01 cs.LG cs.CL cs.CV 62%

Federated Learning from Vision-Language Foundation Models: Theoretical Analysis and Method

Bikang Pan, Wei Huang, Ye Shi

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05596 2024-09-20 cs.CV cs.LG 62%

Aligning Human Knowledge with Visual Concepts Towards Explainable Medical Image Classification

Yunhe Gao, Difei Gu, Mu Zhou, Dimitris Metaxas

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments MICCAI 2024 Early Accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18134 2024-09-13 cs.CV cs.LG 62%

$\mathbb{X}$-Sample Contrastive Loss: Improving Contrastive Learning with Sample Similarity Graphs

Vlad Sobal, Mark Ibrahim, Randall Balestriero, Vivien Cabannes, Diane Bouchacourt, Pietro Astolfi, Kyunghyun Cho, Yann LeCun

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05405 2024-09-12 cs.CV cs.AI cs.IR cs.MM 62%

A Survey of Multimodal Composite Editing and Retrieval

Suyan Li, Fuxiang Huang, Lei Zhang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 20 pages, 3 figures, and 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19832 2024-08-22 cs.CV cs.AI cs.CL 62%

ML-Mamba: Efficient Multi-Modal Large Language Model Utilizing Mamba-2

Wenjun Huang, Jiakai Pan, Jiahao Tang, Yanyu Ding, Yifei Xing, Yuhe Wang, Zhengzhuo Wang, Jianguo Hu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08652 2024-08-19 cs.LG cs.AI cs.HC 62%

TextCAVs: Debugging vision models using text

Angus Nicolson, Yarin Gal, J. Alison Noble

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

Comments 11 pages, 2 figures. Accepted at iMIMIC Workshop at MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05337 2024-08-13 cs.CV cs.AI 62%

VACoDe: Visual Augmented Contrastive Decoding

Sihyeon Kim, Boryeong Cho, Sangmin Bae, Sumyeong Ahn, Se-Young Yun

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17510 2024-08-02 cs.CV cs.AI 62%

Demonstrating and Reducing Shortcuts in Vision-Language Representation Learning

Maurits Bleeker, Mariya Hendriksen, Andrew Yates, Maarten de Rijke

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 27 pages, accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09760 2024-07-16 cs.CV cs.AI 62%

ICCV23 Visual-Dialog Emotion Explanation Challenge: SEU_309 Team Technical Report

Yixiao Yuan, Yingzhe Peng

专题命中 其他VLM :vision language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.07341 2024-07-10 cs.LG cs.CR cs.CV 62%

Does CLIP Know My Face?

Dominik Hintersdorf, Lukas Struppek, Manuel Brack, Felix Friedrich, Patrick Schramowski, Kristian Kersting

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Published in the Journal of Artificial Intelligence Research (JAIR)

Journal ref Journal of Artificial Intelligence Research (JAIR), Vol. 80 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03921 2024-07-08 cs.LG cs.CV 62%

Concept Bottleneck Models Without Predefined Concepts

Simon Schrodi, Julian Schur, Max Argus, Thomas Brox

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18589 2024-06-28 cs.CV cs.LG 62%

Text-Guided Alternative Image Clustering

Andreas Stephan, Lukas Miklautz, Collin Leiber, Pedro Henrique Luz de Araujo, Dominik Répás, Claudia Plant, Benjamin Roth

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17781 2024-06-27 cs.CV cs.AI cs.HC 62%

Large Language Models estimate fine-grained human color-concept associations

Kushin Mukherjee, Timothy T. Rogers, Karen B. Schloss

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏