arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9189 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9189 篇

2309.08793 2024-05-03 cs.AI cs.CE cs.LG 79%

Fin-Fact: A Benchmark Dataset for Multimodal Financial Fact Checking and Explanation Generation

Aman Rangapur, Haoran Wang, Ling Jian, Kai Shu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments 8 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16371 2024-04-26 cs.CV 79%

Multimodal Information Interaction for Medical Image Segmentation

Xinxin Fan, Lin Liu, Haoran Zhang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15790 2024-04-25 cs.CV 79%

Leveraging Large Language Models for Multimodal Search

Oriol Barbany, Michael Huang, Xinliang Zhu, Arnab Dhua

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Published at CVPRW 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14801 2024-04-24 cs.CV 79%

DesignProbe: A Graphic Design Benchmark for Multimodal Large Language Models

Jieru Lin, Danqing Huang, Tiejun Zhao, Dechen Zhan, Chin-Yew Lin

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03907 2024-04-24 cs.CV 79%

RoboFusion: Towards Robust Multi-Modal 3D Object Detection via SAM

Ziying Song, Guoxing Zhang, Lin Liu, Lei Yang, Shaoqing Xu, Caiyan Jia, Feiyang Jia, Li Wang

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12013 2024-04-19 cs.CL 79%

Sequential Compositional Generalization in Multimodal Models

Semih Yagcioglu, Osman Batur İnce, Aykut Erdem, Erkut Erdem, Desmond Elliott, Deniz Yuret

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

Comments Accepted to the main conference of NAACL (2024) as a long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09692 2024-04-16 cs.CV 79%

XoFTR: Cross-modal Feature Matching Transformer

Önder Tuzcuoğlu, Aybora Köksal, Buğra Sofu, Sinan Kalkan, A. Aydın Alatan

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

Comments CVPR Image Matching Workshop, 2024. 12 pages, 7 figures, 5 tables. Codes and dataset are available at https://github.com/OnderT/XoFTR

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08242 2024-04-15 cs.NE cs.AI 79%

RLEMMO: Evolutionary Multimodal Optimization Assisted By Deep Reinforcement Learning

Hongqiao Lian, Zeyuan Ma, Hongshu Guo, Ting Huang, Yue-Jiao Gong

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments Accepted as full paper at GECCO 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07399 2024-04-12 cs.CV 79%

Post-hurricane building damage assessment using street-view imagery and structured data: A multi-modal deep learning approach

Zhuoqun Xue, Xiaojian Zhang, David O. Prevatt, Jennifer Bridge, Susu Xu, Xilei Zhao

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.15802 2024-04-11 cs.AI 79%

CityNet: A Comprehensive Multi-Modal Urban Dataset for Advanced Research in Urban Computing

Zhengfei Zheng, Xu Geng, Hai Yang

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06057 2024-04-10 cs.CV 79%

Unified Multi-modal Diagnostic Framework with Reconstruction Pre-training and Heterogeneity-combat Tuning

Yupei Zhang, Li Pan, Qiushi Yang, Tan Li, Zhen Chen

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

Comments to be published in IEEE JBHI; Code available at https://github.com/helenypzhang/UMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00989 2024-04-09 cs.CV cs.AI cs.MM cs.SD eess.AS 79%

360+x: A Panoptic Multi-modal Scene Understanding Dataset

Hao Chen, Yuqi Hou, Chenyuan Qu, Irene Testini, Xiaohan Hong, Jianbo Jiao

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI、cs.MM

Comments CVPR 2024 (Oral Presentation), Project page: https://x360dataset.github.io/

Journal ref The IEEE/CVF Computer Vision and Pattern Recognition Conference (CVPR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12572 2024-04-09 eess.IV cs.CV cs.LG 79%

Interpretable 3D Multi-Modal Residual Convolutional Neural Network for Mild Traumatic Brain Injury Diagnosis

Hanem Ellethy, Viktor Vegh, Shekhar S. Chandra

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted by the Australasian Joint Conference on Artificial Intelligence 2023 (AJCAI 2023). 12 pages and 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17610 2024-04-02 cs.CV 79%

MMVP: A Multimodal MoCap Dataset with Vision and Pressure Sensors

He Zhang, Shenghao Ren, Haolei Yuan, Jianhui Zhao, Fan Li, Shuangpeng Sun, Zhenghao Liang, Tao Yu, Qiu Shen, Xun Cao

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20225 2024-04-01 cs.CV 79%

MTMMC: A Large-Scale Real-World Multi-Modal Camera Tracking Benchmark

Sanghyun Woo, Kwanyong Park, Inkyu Shin, Myungchul Kim, In So Kweon

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted on CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19501 2024-03-29 cs.CV 79%

RELI11D: A Comprehensive Multimodal Human Motion Dataset and Method

Ming Yan, Yan Zhang, Shuqiang Cai, Shuqi Fan, Xincheng Lin, Yudi Dai, Siqi Shen, Chenglu Wen, Lan Xu, Yuexin Ma, Cheng Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments CVPR2024, Project website: http://www.lidarhumanmotion.net/reli11d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18033 2024-03-28 cs.CV cs.RO 79%

SpectralWaste Dataset: Multimodal Data for Waste Sorting Automation

Sara Casao, Fernando Peña, Alberto Sabater, Rosa Castillón, Darío Suárez, Eduardo Montijano, Ana C. Murillo

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17284 2024-03-27 cs.CL 79%

Common Ground Tracking in Multimodal Dialogue

Ibrahim Khebour, Kenneth Lai, Mariah Bradford, Yifan Zhu, Richard Brutti, Christopher Tam, Jingxuan Tu, Benjamin Ibarra, Nathaniel Blanchard, Nikhil Krishnaswamy, James Pustejovsky

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.12340 2024-03-26 cs.AI 79%

mForms : Multimodal Form-Filling with Question Answering

Larry Heck, Simon Heck, Anirudh Sundar

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments 5 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10115 2024-03-25 cs.CV 79%

SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery

Xin Guo, Jiangwei Lao, Bo Dang, Yingying Zhang, Lei Yu, Lixiang Ru, Liheng Zhong, Ziyuan Huang, Kang Wu, Dingxiang Hu, Huimei He, Jian Wang, Jingdong Chen, Ming Yang, Yongjun Zhang, Yansheng Li

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10103 2024-03-22 cs.CV 79%

GSVA: Generalized Segmentation via Multimodal Large Language Models

Zhuofan Xia, Dongchen Han, Yizeng Han, Xuran Pan, Shiji Song, Gao Huang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Accepted by CVPR2024 (19 pages, 9 figures, 11 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16355 2024-03-21 cs.CV 79%

PathMMU: A Massive Multimodal Expert-Level Benchmark for Understanding and Reasoning in Pathology

Yuxuan Sun, Hao Wu, Chenglu Zhu, Sunyi Zheng, Qizi Chen, Kai Zhang, Yunlong Zhang, Dan Wan, Xiaoxiao Lan, Mengyue Zheng, Jingxiong Li, Xinheng Lyu, Tao Lin, Lin Yang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11803 2024-03-19 cs.CV 79%

Federated Modality-specific Encoders and Multimodal Anchors for Personalized Brain Tumor Segmentation

Qian Dai, Dong Wei, Hong Liu, Jinghan Sun, Liansheng Wang, Yefeng Zheng

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11681 2024-03-19 cs.RO cs.CV 79%

MASSTAR: A Multi-Modal and Large-Scale Scene Dataset with a Versatile Toolchain for Surface Prediction and Completion

Guiyong Zheng, Jinqi Jiang, Chen Feng, Shaojie Shen, Boyu Zhou

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

Comments Submitted to IROS2024. Code: https://github.com/SYSU-STAR/MASSTAR. Project Page: https://github.com/SYSU-STAR/MASSTAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07661 2024-03-19 cs.CV 79%

Depth- and Semantics-aware Multi-modal Domain Translation: Generating 3D Panoramic Color Images from LiDAR Point Clouds

Tiago Cortinhal, Eren Erdal Aksoy

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07194 2024-03-13 cs.CY cs.AI cs.HC cs.LG 79%

Improving prediction of students' performance in intelligent tutoring systems using attribute selection and ensembles of different multimodal data sources

W. Chango, R. Cerezo, M. Sanchez-Santillan, R. Azevedo, C. Romero

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Journal ref Journal of Computing in Higher Education,2021, 33, 614-634

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12152 2024-03-12 cs.CV 79%

Exploiting Multimodal Synthetic Data for Egocentric Human-Object Interaction Detection in an Industrial Scenario

Rosario Leonardi, Francesco Ragusa, Antonino Furnari, Giovanni Maria Farinella

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03719 2024-03-07 cs.CV 79%

Multimodal Transformer for Comics Text-Cloze

Emanuele Vivoli, Joan Lafuente Baeza, Ernest Valveny Llobet, Dimosthenis Karatzas

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03045 2024-03-06 cs.CL 79%

Adding Multimodal Capabilities to a Text-only Translation Model

Vipin Vijayan, Braeden Bowen, Scott Grigsby, Timothy Anderson, Jeremy Gwinnup

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03014 2024-03-06 cs.CL 79%

The Case for Evaluating Multimodal Translation Models on Text Datasets

Vipin Vijayan, Braeden Bowen, Scott Grigsby, Timothy Anderson, Jeremy Gwinnup

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏