arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6918 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6918 篇

2307.06435 2024-10-18 cs.CL 57%

A Comprehensive Overview of Large Language Models

Humza Naveed, Asad Ullah Khan, Shi Qiu, Muhammad Saqib, Saeed Anwar, Muhammad Usman, Naveed Akhtar, Nick Barnes, Ajmal Mian

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04727 2024-10-17 cs.LG cs.AI 57%

Task Aware Modulation using Representation Learning: An Approach for Few Shot Learning in Environmental Systems

Arvind Renganathan, Rahul Ghosh, Ankush Khandelwal, Vipin Kumar

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11586 2024-10-16 cs.CV 57%

Breaking Modality Gap in RGBT Tracking: Coupled Knowledge Distillation

Andong Lu, Jiacong Zhao, Chenglong Li, Yun Xiao, Bin Luo

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted by ACM MM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10227 2024-10-15 cs.CV 57%

KNN Transformer with Pyramid Prompts for Few-Shot Learning

Wenhao Li, Qiangchang Wang, Peng Zhao, Yilong Yin

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments 10 pages, 5 figures, accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09347 2024-10-15 cs.CV cs.LG eess.IV 57%

Toward Guidance-Free AR Visual Generation via Condition Contrastive Alignment

Huayu Chen, Hang Su, Peize Sun, Jun Zhu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08470 2024-10-14 cs.HC cs.CV 57%

DAT: Dialogue-Aware Transformer with Modality-Group Fusion for Human Engagement Estimation

Jia Li, Yangchen Yu, Yin Chen, Yu Zhang, Peng Jia, Yunbo Xu, Ziqiang Li, Meng Wang, Richang Hong

专题命中 多模态训练与对齐 :audio-visual(abstract);分类 cs.CV

Comments 1st Place on the NoXi Base dataset in the Multi-Domain Engagement Estimation Challenge held by MultiMediate 24, accepted by ACM Multimedia 2024. The source code is available at \url{https://github.com/MSA-LMC/DAT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10492 2024-10-07 cs.CV 57%

Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning

Dongmin Park, Zhaofang Qian, Guangxing Han, Ser-Nam Lim

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10122 2024-10-02 cs.CV 57%

Video-LLaVA: Learning United Visual Representation by Alignment Before Projection

Bin Lin, Yang Ye, Bin Zhu, Jiaxi Cui, Munan Ning, Peng Jin, Li Yuan

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19569 2024-10-01 cs.CV 57%

Fully Aligned Network for Referring Image Segmentation

Yong Liu, Ruihao Xu, Yansong Tang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18973 2024-10-01 eess.SP cs.AI q-bio.NC 57%

EEG-EMG FAConformer: Frequency Aware Conv-Transformer for the fusion of EEG and EMG

ZhengXiao He, Minghong Cai, Letian Li, Siyuan Tian, Ren-Jie Dai

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18869 2024-09-30 cs.CV 57%

Emu3: Next-Token Prediction is All You Need

Xinlong Wang, Xiaosong Zhang, Zhengxiong Luo, Quan Sun, Yufeng Cui, Jinsheng Wang, Fan Zhang, Yueze Wang, Zhen Li, Qiying Yu, Yingli Zhao, Yulong Ao, Xuebin Min, Tao Li, Boya Wu, Bo Zhao, Bowen Zhang, Liangdong Wang, Guang Liu, Zheqi He, Xi Yang, Jingjing Liu, Yonghua Lin, Tiejun Huang, Zhongyuan Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Project Page: https://emu.baai.ac.cn

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19364 2024-09-26 cs.CV 57%

SimTxtSeg: Weakly-Supervised Medical Image Segmentation with Simple Text Cues

Yuxin Xie, Tao Zhou, Yi Zhou, Geng Chen

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments accepted by MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15931 2024-09-25 cs.CV 57%

Automatic Registration of SHG and H&E Images with Feature-based Initial Alignment and Intensity-based Instance Optimization: Contribution to the COMULIS Challenge

Marek Wodzinski, Henning Müller

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14882 2024-09-24 cs.CV 57%

Probabilistically Aligned View-unaligned Clustering with Adaptive Template Selection

Wenhua Dong, Xiao-Jun Wu, Zhenhua Feng, Sara Atito, Muhammad Awais, Josef Kittler

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14403 2024-09-24 cs.RO cs.CV 57%

GraspMamba: A Mamba-based Language-driven Grasp Detection Framework with Hierarchical Feature Learning

Huy Hoang Nguyen, An Vuong, Anh Nguyen, Ian Reid, Minh Nhat Vu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 8 pages. Project page: https://airvlab.github.io/grasp-anything/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14113 2024-09-24 eess.IV cs.CV 57%

Accelerated Multi-Contrast MRI Reconstruction via Frequency and Spatial Mutual Learning

Qi Chen, Xiaohan Xing, Zhen Chen, Zhiwei Xiong

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Accepted as a poster by Medical Image Computing and Computer Assisted Intervention (MICCAI) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11059 2024-09-19 cs.CV cs.LG 57%

OneEncoder: A Lightweight Framework for Progressive Alignment of Modalities

Bilal Faye, Hanane Azzag, Mustapha Lebbah

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08513 2024-09-19 cs.CV 57%

Mamba-YOLO-World: Marrying YOLO-World with Mamba for Open-Vocabulary Detection

Haoxuan Wang, Qingdong He, Jinlong Peng, Hao Yang, Mingmin Chi, Yabiao Wang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11174 2024-09-18 q-bio.NC cs.AI 57%

Identifying Influential nodes in Brain Networks via Self-Supervised Graph-Transformer

Yanqing Kang, Di Zhu, Haiyang Zhang, Enze Shi, Sigang Yu, Jinru Wu, Xuhui Wang, Xuan Liu, Geng Chen, Xi Jiang, Tuo Zhang, Shu Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06535 2024-09-11 cs.CV 57%

PoseEmbroider: Towards a 3D, Visual, Semantic-aware Human Pose Representation

Ginger Delmas, Philippe Weinzaepfel, Francesc Moreno-Noguer, Grégory Rogez

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Published in ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04979 2024-09-10 cs.CV 57%

RCBEVDet++: Toward High-accuracy Radar-Camera Fusion 3D Perception Network

Zhiwei Lin, Zhe Liu, Yongtao Wang, Le Zhang, Ce Zhu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments The extended work of RCBEVDet (CVPR2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04817 2024-09-10 cs.CV 57%

SSFam: Scribble Supervised Salient Object Detection Family

Zhengyi Liu, Sheng Deng, Xinrui Wang, Linbo Wang, Xianyong Fang, Bin Tang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted by TMM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17793 2024-09-10 cs.CV cs.RO 57%

CLFT: Camera-LiDAR Fusion Transformer for Semantic Segmentation in Autonomous Driving

Junyi Gu, Mauro Bellone, Tomáš Pivoňka, Raivo Sell

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Accepted to IEEE Transactions on Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03223 2024-09-06 cs.CV 57%

Why mamba is effective? Exploit Linear Transformer-Mamba Network for Multi-Modality Image Fusion

Chenguang Zhu, Shan Gao, Huafeng Chen, Guangqian Guo, Chaowei Wang, Yaoxing Wang, Chen Shu Lei, Quanjiang Fan

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02513 2024-09-05 cs.CV 57%

SG-MIM: Structured Knowledge Guided Efficient Pre-training for Dense Prediction

Sumin Son, Hyesong Choi, Dongbo Min

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05904 2024-09-05 cs.CV 57%

Enhancing Representation in Radiography-Reports Foundation Model: A Granular Alignment Algorithm Using Masked Contrastive Learning

Weijian Huang, Cheng Li, Hong-Yu Zhou, Hao Yang, Jiarun Liu, Yong Liang, Hairong Zheng, Shaoting Zhang, Shanshan Wang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Journal ref Nature Communications 15, 7620 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.13542 2024-09-04 cs.CV 57%

BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird's-Eye View Representation

Zhijian Liu, Haotian Tang, Alexander Amini, Xinyu Yang, Huizi Mao, Daniela Rus, Song Han

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments ICRA 2023. The first two authors contributed equally to this work. Project page: https://bevfusion.mit.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16979 2024-09-02 cs.CV 57%

Cross Fusion RGB-T Tracking with Bi-directional Adapter

Zhirong Zeng, Xiaotao Liu, Meng Sun, Hongyu Wang, Jing Liu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14941 2024-08-28 cs.CV 57%

BOX3D: Lightweight Camera-LiDAR Fusion for 3D Object Detection and Localization

Mario A. V. Saucedo, Nikolaos Stathoulopoulos, Vidya Sumathy, Christoforos Kanellakis, George Nikolakopoulos

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Presented in MED 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14770 2024-08-28 cs.CV 57%

Text-guided Foundation Model Adaptation for Long-Tailed Medical Image Classification

Sirui Li, Li Lin, Yijin Huang, Pujin Cheng, Xiaoying Tang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Accepted by IEEE ISBI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏