arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2312.17345 2025-01-16 cs.CV 57%

3VL: Using Trees to Improve Vision-Language Models' Interpretability

Nir Yellinek, Leonid Karlinsky, Raja Giryes

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments accepted to IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07802 2025-01-15 cs.AI physics.space-ph 57%

Visual Language Models as Operator Agents in the Space Domain

Alejandro Carrasco, Marco Nedungadi, Enrico M. Zucchelli, Amit Jain, Victor Rodriguez-Fernandez, Richard Linares

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments Updated version of the paper presented in 2025 AIAA SciTech. https://arc.aiaa.org/doi/10.2514/6.2025-1543

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07109 2025-01-14 cs.CV 57%

The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering

Anupam Pandey, Deepjyoti Bodo, Arpan Phukan, Asif Ekbal

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14789 2025-01-14 cs.LG cs.CV 57%

Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers

Hongbo Liu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06809 2025-01-14 cs.CV 57%

RSRefSeg: Referring Remote Sensing Image Segmentation with Foundation Models

Keyan Chen, Jiafan Zhang, Chenyang Liu, Zhengxia Zou, Zhenwei Shi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05398 2025-01-10 cs.LG cs.AI 57%

Mechanistic understanding and validation of large AI models with SemanticLens

Maximilian Dreyer, Jim Berend, Tobias Labarta, Johanna Vielhaben, Thomas Wiegand, Sebastian Lapuschkin, Wojciech Samek

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments 74 pages (18 pages manuscript, 7 pages references, 49 pages appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01767 2025-01-09 cs.CV 57%

LogicAD: Explainable Anomaly Detection via VLM-based Text Feature Extraction

Er Jin, Qihui Feng, Yongli Mou, Stefan Decker, Gerhard Lakemeyer, Oliver Simons, Johannes Stegmaier

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted for publication at aaai25, project page: https://jasonjin34.github.io/logicad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02716 2025-01-09 cs.CV cs.LG 57%

Light-weight Fine-tuning Method for Defending Adversarial Noise in Pre-trained Medical Vision-Language Models

Xu Han, Linghao Jin, Xuezhe Ma, Xiaofeng Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.08110 2025-01-08 cs.LG cs.AI 57%

AtMan: Understanding Transformer Predictions Through Memory Efficient Attention Manipulation

Björn Deiseroth, Mayukh Deb, Samuel Weinbach, Manuel Brack, Patrick Schramowski, Kristian Kersting

专题命中 图文多模态 :image-text(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19650 2024-12-30 cs.CV cs.LG 57%

Toward Modality Gap: Vision Prototype Learning for Weakly-supervised Semantic Segmentation with CLIP

Zhongxing Xu, Feilong Tang, Zhe Chen, Yingxue Su, Zhiyi Zhao, Ge Zhang, Jionglong Su, Zongyuan Ge

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14014 2024-12-25 cs.CV 57%

CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model

Shuai Zhao, Ruijie Quan, Linchao Zhu, Yi Yang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by T-IP. A PyTorch re-implementation is at https://github.com/VamosC/CLIP4STR (Credit on GitHub@VamosC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16418 2024-12-24 cs.CV 57%

Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities

Huan Liu, Lingyu Xiao, Jiangjiang Liu, Xiaofan Li, Ze Feng, Sen Yang, Jingdong Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15947 2024-12-24 cs.CV 57%

MoE-LLaVA: Mixture of Experts for Large Vision-Language Models

Bin Lin, Zhenyu Tang, Yang Ye, Jinfa Huang, Junwu Zhang, Yatian Pang, Peng Jin, Munan Ning, Jiebo Luo, Li Yuan

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments update author

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20213 2024-12-20 cs.CV 57%

VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis

Chao Pang, Xingxing Weng, Jiang Wu, Jiayu Li, Yi Liu, Jiaxing Sun, Weijia Li, Shuai Wang, Litong Feng, Gui-Song Xia, Conghui He

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Equal contribution: Chao Pang, Xingxing Weng, Jiang Wu; Corresponding author: Gui-Song Xia, Conghui He

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14515 2024-12-20 cs.AI cs.PL 57%

Relational Programming with Foundation Models

Ziyang Li, Jiani Huang, Jason Liu, Felix Zhu, Eric Zhao, William Dodds, Neelay Velingker, Rajeev Alur, Mayur Naik

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12793 2024-12-18 cs.CV 57%

CRoF: CLIP-based Robust Few-shot Learning on Noisy Labels

Shizhuo Deng, Bowen Han, Jiaqi Chen, Hao Wang, Dongyue Chen, Tong Jia

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09441 2024-12-17 cs.CV 57%

CLIP-CID: Efficient CLIP Distillation via Cluster-Instance Discrimination

Kaicheng Yang, Tiancheng Gu, Xiang An, Haiqiang Jiang, Xiangzi Dai, Ziyong Feng, Weidong Cai, Jiankang Deng

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18844 2024-12-17 cs.CV 57%

Revisiting Backdoor Attacks against Large Vision-Language Models from Domain Shift

Siyuan Liang, Jiawei Liang, Tianyu Pang, Chao Du, Aishan Liu, Mingli Zhu, Xiaochun Cao, Dacheng Tao

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10292 2024-12-16 cs.CV 57%

Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation

Yu-Jhe Li, Xinyang Zhang, Kun Wan, Lantao Yu, Ajinkya Kale, Xin Lu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 17 pages. Work done during 2023 summer and has been released

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09936 2024-12-16 cs.CV 57%

CaLoRAify: Calorie Estimation with Visual-Text Pairing and LoRA-Driven Visual Language Models

Dongyu Yao, Keling Yao, Junhong Zhou, Yinghao Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Disclaimer: This work is part of a course project and reflects ongoing exploration in the field of vision-language models and calorie estimation. Findings and conclusions are subject to further validation and refinement

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09875 2024-12-16 cs.CV 57%

Selective State Space Memory for Large Vision-Language Models

Chee Ng, Yuen Fung

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07779 2024-12-12 cs.NE cs.AI 57%

Evolution of Thought: Diverse and High-Quality Reasoning via Multi-Objective Optimization

Biqing Qi, Zhouyi Qian, Yiang Luo, Junqi Gao, Dong Li, Kaiyan Zhang, Bowen Zhou

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06172 2024-12-12 cs.CV 57%

Robust Noisy Correspondence Learning via Self-Drop and Dual-Weight

Fan Liu, Chenwei Dong, Chuanyi Zhang, Hualiang Zhou, Jun Zhou

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07518 2024-12-11 cs.CV 57%

Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios

Jiaqi Fan, Jianhua Wu, Hongqing Chu, Quanbo Ge, Bingzhao Gao

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07247 2024-12-11 cs.CV 57%

Driving with InternVL: Oustanding Champion in the Track on Driving with Language of the Autonomous Grand Challenge at CVPR 2024

Jiahan Li, Zhiqi Li, Tong Lu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07226 2024-12-11 cs.CV 57%

Attention Head Purification: A New Perspective to Harness CLIP for Domain Generalization

Yingfan Wang, Guoliang Kang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05679 2024-12-11 cs.CV 57%

RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts

Xu Liu, Zhouhui Lian

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16278 2024-12-10 cs.CV 57%

Adapting Vision-Language Model with Fine-grained Semantics for Open-Vocabulary Segmentation

Yong Xien Chng, Xuchong Qiu, Yizeng Han, Kai Ding, Wan Ding, Gao Huang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12668 2024-12-10 cs.AI cs.CE 57%

From Concept to Manufacturing: Evaluating Vision-Language Models for Engineering Design

Cyril Picard, Kristen M. Edwards, Anna C. Doris, Brandon Man, Giorgio Giannone, Md Ferdous Alam, Faez Ahmed

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18291 2024-12-10 cs.CV 57%

TLDR: Text Based Last-layer Retraining for Debiasing Image Classifiers

Juhyeon Park, Seokhyeon Jeong, Taesup Moon

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏