arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6918 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6918 篇

2408.14600 2024-08-28 cs.CV 57%

PVAFN: Point-Voxel Attention Fusion Network with Multi-Pooling Enhancing for 3D Object Detection

Yidi Li, Jiahao Wen, Bin Ren, Wenhao Li, Zhenhuan Xu, Hao Guo, Hong Liu, Nicu Sebe

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments 3D Object Detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13960 2024-08-28 cs.LG cs.AI cs.CY 57%

Time Series Analysis for Education: Methods, Applications, and Future Directions

Shengzhong Mao, Chaoli Zhang, Yichi Song, Jindong Wang, Xiao-Jun Zeng, Zenglin Xu, Qingsong Wen

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments 24 pages, 3 figures, 6 tables, project page: see https://github.com/ai-for-edu/time-series-analysis-for-education

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13733 2024-08-27 eess.IV cs.CV 57%

Anatomical Consistency Distillation and Inconsistency Synthesis for Brain Tumor Segmentation with Missing Modalities

Zheyu Zhang, Xinzhao Liu, Zheng Chen, Yueyi Zhang, Huanjing Yue, Yunwei Ou, Xiaoyan Sun

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted Paper to European Conference on Artificial Intelligence (ECAI 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12760 2024-08-26 eess.IV cs.CV 57%

Hierarchical Attention and Parallel Filter Fusion Network for Multi-Source Data Classification

Han Luo, Feng Gao, Junyu Dong, Lin Qi

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Accepted by IEEE GRSL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16686 2024-08-26 cs.CL 57%

Can Large Language Models Automatically Jailbreak GPT-4V?

Yuanwei Wu, Yue Huang, Yixin Liu, Xiang Li, Pan Zhou, Lichao Sun

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

Comments TrustNLP@NAACL2024 (Fourth Workshop on Trustworthy Natural Language Processing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10124 2024-08-20 cs.LG cs.AI cs.IR physics.chem-ph q-bio.BM 57%

Molecular Graph Representation Learning Integrating Large Language Models with Domain-specific Small Models

Tianyu Zhang, Yuxiang Ren, Chengbin Hou, Hairong Lv, Xuegong Zhang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08013 2024-08-19 cs.CV 57%

Adaptive Learning of Consistency and Inconsistency Information for Fake News Detection

Aohan Li, Jiaxin Chen, Xin Liao, Dengyong Zhang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07883 2024-08-16 cs.CV 57%

To Impute or Not: Recommendations for Multibiometric Fusion

Melissa R Dale, Elliot Singer, Bengt J. Borgström, Arun Ross

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Proc. of IEEE International Workshop on Information Forensics and Security (WIFS), (Nuremberg, Germany), December 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06360 2024-08-14 cs.IR cs.CV 57%

Modality-Balanced Learning for Multimedia Recommendation

Jinghao Zhang, Guofan Liu, Qiang Liu, Shu Wu, Liang Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments ACM Multimedia 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01038 2024-08-13 cs.CL 57%

UNER: A Unified Prediction Head for Named Entity Recognition in Visually-rich Documents

Yi Tu, Chong Zhang, Ya Guo, Huan Chen, Jinyang Tang, Huijia Zhu, Qi Zhang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

Comments accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21770 2024-08-13 cs.AI cs.LG 57%

MoMa: Efficient Early-Fusion Pre-training with Mixture of Modality-Aware Experts

Xi Victoria Lin, Akshat Shrivastava, Liang Luo, Srinivasan Iyer, Mike Lewis, Gargi Ghosh, Luke Zettlemoyer, Armen Aghajanyan

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments v2 -> update related work section v3 -> fix spelling

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12861 2024-08-13 cs.CV 57%

Weakly Supervised LiDAR Semantic Segmentation via Scatter Image Annotation

Yilong Chen, Zongyi Xu, xiaoshui Huang, Ruicheng Zhang, Xinqi Jiang, Xinbo Gao

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06767 2024-08-12 cs.LG cs.CV 57%

A Survey on Deep Neural Network Pruning-Taxonomy, Comparison, Analysis, and Recommendations

Hongrong Cheng, Miao Zhang, Javen Qinfeng Shi

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments IEEE TPAMI major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03238 2024-08-07 cs.RO cs.CV 57%

LAC-Net: Linear-Fusion Attention-Guided Convolutional Network for Accurate Robotic Grasping Under the Occlusion

Jinyu Zhang, Yongchong Gu, Jianxiong Gao, Haitao Lin, Qiang Sun, Xinwei Sun, Xiangyang Xue, Yanwei Fu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments accepted by IROS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02222 2024-08-06 cs.CV 57%

Cross-modulated Attention Transformer for RGBT Tracking

Yun Xiao, Jiacong Zhao, Andong Lu, Chenglong Li, Yin Lin, Bing Yin, Cong Liu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03309 2024-08-06 cs.CV cs.LG 57%

AONeuS: A Neural Rendering Framework for Acoustic-Optical Sensor Fusion

Mohamad Qadri, Kevin Zhang, Akshay Hinduja, Michael Kaess, Adithya Pediredla, Christopher A. Metzler

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments SIGGRAPH 2024 (conference track full paper). First two authors contributed equally. Paper website: https://aoneus.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18849 2024-08-05 cs.CV 57%

MiPa: Mixed Patch Infrared-Visible Modality Agnostic Object Detection

Heitor R. Medeiros, David Latortue, Eric Granger, Marco Pedersoli

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11399 2024-08-05 cs.CL 57%

X-LLaVA: Optimizing Bilingual Large Vision-Language Alignment

Dongjae Shin, Hyeonseok Lim, Inho Won, Changsu Choi, Minjun Kim, Seungwoo Song, Hangyeol Yoo, Sangmin Kim, Kyungtae Lim

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

Journal ref https://aclanthology.org/2024.findings-naacl.158

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06443 2024-08-01 cs.CL 57%

BOK-VQA: Bilingual outside Knowledge-Based Visual Question Answering via Graph Representation Pretraining

Minjun Kim, Seungwoo Song, Youhan Lee, Haneol Jang, Kyungtae Lim

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08459 2024-07-19 cs.LG cs.AI 57%

A Recent Survey of Heterogeneous Transfer Learning

Runxue Bao, Yiming Sun, Yuhe Gao, Jindong Wang, Qiang Yang, Zhi-Hong Mao, Ye Ye

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12863 2024-07-19 cs.CV 57%

SkipcrossNets: Adaptive Skip-cross Fusion for Road Detection

Yan Gong, Xinyu Zhang, Hao Liu, Xinmin Jiang, Zhiwei Li, Xin Gao, Lei Lin, Dafeng Jin, Jun Li, Huaping Liu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08351 2024-07-18 cs.CV 57%

OmniSat: Self-Supervised Modality Fusion for Earth Observation

Guillaume Astruc, Nicolas Gonthier, Clement Mallet, Loic Landrieu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Journal ref ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18274 2024-07-18 cs.CV 57%

DVLO: Deep Visual-LiDAR Odometry with Local-to-Global Feature Fusion and Bi-Directional Structure Alignment

Jiuming Liu, Dong Zhuo, Zhiheng Feng, Siting Zhu, Chensheng Peng, Zhe Liu, Hesheng Wang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted by ECCV 2024.Codes are released at https://github.com/IRMVLab/DVLO

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11682 2024-07-17 cs.CV 57%

MapDistill: Boosting Efficient Camera-based HD Map Construction via Camera-LiDAR Fusion Model Distillation

Xiaoshuai Hao, Ruikai Li, Hui Zhang, Dingzhe Li, Rong Yin, Sangil Jung, Seung-In Park, ByungIn Yoo, Haimei Zhao, Jing Zhang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Accepted by ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11351 2024-07-17 cs.CV 57%

Learning Modality-agnostic Representation for Semantic Segmentation from Any Modalities

Xu Zheng, Yuanhuiyi Lyu, Lin Wang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08672 2024-07-12 cs.CV 57%

NODE-Adapter: Neural Ordinary Differential Equations for Better Vision-Language Reasoning

Yi Zhang, Chun-Wun Cheng, Ke Yu, Zhihai He, Carola-Bibiane Schönlieb, Angelica I. Aviles-Rivero

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08526 2024-07-12 cs.CV 57%

BLOS-BEV: Navigation Map Enhanced Lane Segmentation Network, Beyond Line of Sight

Hang Wu, Zhenghao Zhang, Siyuan Lin, Tong Qin, Jin Pan, Qiang Zhao, Chunjing Xu, Ming Yang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments IEEE IV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08132 2024-07-12 cs.CV 57%

DMM: Disparity-guided Multispectral Mamba for Oriented Object Detection in Remote Sensing

Minghang Zhou, Tianyu Li, Chaofan Qiao, Dongyu Xie, Guoqing Wang, Ningjuan Ruan, Lin Mei, Yang Yang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05329 2024-07-11 cs.CV 57%

OccFusion: Depth Estimation Free Multi-sensor Fusion for 3D Occupancy Prediction

Ji Zhang, Yiran Ding, Zixin Liu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02769 2024-07-04 cs.CV 57%

Fine-Grained Scene Image Classification with Modality-Agnostic Adapter

Yiqun Wang, Zhao Zhou, Xiangcheng Du, Xingjiao Wu, Yingbin Zheng, Cheng Jin

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏