arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9205 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9205 篇

2502.14553 2025-02-21 cs.CL cs.AI cs.LG 73%

Multiscale Byte Language Models -- A Hierarchical Architecture for Causal Million-Length Sequence Modeling

Eric Egli, Matteo Manica, Jannis Born

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14750 2025-01-14 cs.CV cs.CL 73%

FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension

Junzhuo Liu, Xuzheng Yang, Weiwei Li, Peng Wang

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

Comments 18 pages, EMNLP 2024 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12150 2024-12-18 cs.CL cs.CV cs.LG 73%

Rethinking Comprehensive Benchmark for Chart Understanding: A Perspective from Scientific Literature

Lingdong Shen, Qigqi, Kun Ding, Gaofeng Meng, Shiming Xiang

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11952 2024-12-17 cs.CV cs.AI cs.LG 73%

Advancing Comprehensive Aesthetic Insight with Multi-Scale Text-Guided Self-Supervised Learning

Yuti Liu, Shice Liu, Junyuan Gao, Pengtao Jiang, Hao Zhang, Jinwei Chen, Bo Li

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14852 2024-11-06 cs.CV cs.AI 73%

Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models

Jiayu Wang, Yifei Ming, Zhenmei Shi, Vibhav Vineet, Xin Wang, Yixuan Li, Neel Joshi

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Salesforce AI Research(Salesforce AI研究部) Microsoft Research(微软研究院)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15074 2024-10-22 cs.CV cs.AI 73%

LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound

Xuechen Guo, Wenhao Chai, Shi-Yan Li, Gaoang Wang

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09039 2024-09-17 cs.LG cs.AI cs.CV 73%

AutoGeo: Automating Geometric Image Dataset Creation for Enhanced Geometry Understanding

Zihan Huang, Tao Wu, Wang Lin, Shengyu Zhang, Jingyuan Chen, Fei Wu

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11207 2024-08-22 cs.CV cs.AI 73%

Quantum Inverse Contextual Vision Transformers (Q-ICVT): A New Frontier in 3D Object Detection for AVs

Sanjay Bhargav Dharavath, Tanmoy Dam, Supriyo Chakraborty, Prithwiraj Roy, Aniruddha Maiti

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments The paper has been accepted as a short paper at CIKM '24

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06040 2024-08-13 cs.CV cs.CL 73%

ARPA: A Novel Hybrid Model for Advancing Visual Word Disambiguation Using Large Language Models and Transformers

Aristi Papastavrou, Maria Lymperaiou, Giorgos Stamou

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06393 2024-06-21 cs.CV cs.CL q-bio.GN 73%

STimage-1K4M: A histopathology image-gene expression dataset for spatial transcriptomics

Jiawen Chen, Muqing Zhou, Wenrong Wu, Jinwei Zhang, Yun Li, Didong Li

专题命中 多模态评测 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12897 2024-06-21 cs.LG cs.AI cs.CV 73%

Advancing Histopathology-Based Breast Cancer Diagnosis: Insights into Multi-Modality and Explainability

Faseela Abdullakutty, Younes Akbari, Somaya Al-Maadeed, Ahmed Bouridane, Rifat Hamoudi

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

Comments 31 pages including references

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.06267 2024-04-19 eess.IV cs.AI cs.CV 73%

MMMNA-Net for Overall Survival Time Prediction of Brain Tumor Patients

Wen Tang, Haoyue Zhang, Pengxin Yu, Han Kang, Rongguo Zhang

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted EMBC 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11008 2024-04-18 cs.CV cs.AI 73%

AKGNet: Attribute Knowledge-Guided Unsupervised Lung-Infected Area Segmentation

Qing En, Yuhong Guo

专题命中 多模态评测 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07056 2023-12-14 eess.AS cs.MM cs.SD 73%

VoxBlink: A Large Scale Speaker Verification Dataset on Camera

Yuke Lin, Xiaoyi Qin, Guoqing Zhao, Ming Cheng, Ning Jiang, Haiyang Wu, Ming Li

专题命中 多模态评测 :multi-modal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS

Comments Accepted By ICASSP2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14785 2023-10-24 cs.CV cs.AI 73%

Vision-Enhanced Semantic Entity Recognition in Document Images via Visually-Asymmetric Consistency Learning

Hao Wang, Xiahua Chen, Rui Wang, Chenhui Chu

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments 14 pages, 6 figures, Accepted by EMNLP2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03140 2023-10-06 cs.CV cs.MM 73%

ViFiT: Reconstructing Vision Trajectories from IMU and Wi-Fi Fine Time Measurements

Bryan Bo Cao, Abrar Alali, Hansi Liu, Nicholas Meegan, Marco Gruteser, Kristin Dana, Ashwin Ashok, Shubham Jain

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments 22 pages, 12 figures, 9 tables. MobiCom 2023 ISACom

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00957 2023-09-06 cs.CV cs.AI cs.LG cs.RO 73%

Visual-Kinematics Graph Learning for Procedure-agnostic Instrument Tip Segmentation in Robotic Surgeries

Jiaqi Liu, Yonghao Long, Kai Chen, Cheuk Hei Leung, Zerui Wang, Qi Dou

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted to IROS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08016 2023-07-18 cs.CV cs.AI 73%

Breaking Down the Task: A Unit-Grained Hybrid Training Framework for Vision and Language Decision Making

Ruipu Luo, Jiwen Zhang, Zhongyu Wei

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06051 2023-06-08 cs.CV cs.AI cs.LG 73%

Open-TransMind: A New Baseline and Benchmark for 1st Foundation Model Challenge of Intelligent Transportation

Yifeng Shi, Feng Lv, Xinliang Wang, Chunlong Xia, Shaojie Li, Shujie Yang, Teng Xi, Gang Zhang

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03506 2023-06-07 cs.CL cs.AI cs.HC 73%

SI-LSTM: Speaker Hybrid Long-short Term Memory and Cross Modal Attention for Emotion Recognition in Conversation

Xingwei Liang, You Zou, Ruifeng Xu

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

Comments modification needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15913 2023-05-30 cs.CL cs.CY cs.MM 73%

MEMEX: Detecting Explanatory Evidence for Memes via Knowledge-Enriched Contextualization

Shivam Sharma, Ramaneswaran S, Udit Arora, Md. Shad Akhtar, Tanmoy Chakraborty

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.MM

Comments 9 pages main + 1 ethics + 3 pages ref. + 4 pages app (Total: 17 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.00794 2022-11-03 cs.SD cs.CV cs.CY cs.LG eess.AS 73%

Impact of annotation modality on label quality and model performance in the automatic assessment of laughter in-the-wild

Jose Vargas-Quiros, Laura Cabrera-Quiros, Catharine Oertel, Hayley Hung

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.05840 2022-09-14 cs.CL cs.AI 73%

Visual Recipe Flow: A Dataset for Learning Visual State Changes of Objects with Recipe Flows

Keisuke Shirai, Atsushi Hashimoto, Taichi Nishimura, Hirotaka Kameko, Shuhei Kurita, Yoshitaka Ushiku, Shinsuke Mori

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

Comments COLING 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.11732 2022-07-19 cs.CL cs.CV 73%

IGLUE: A Benchmark for Transfer Learning across Modalities, Tasks, and Languages

Emanuele Bugliarello, Fangyu Liu, Jonas Pfeiffer, Siva Reddy, Desmond Elliott, Edoardo Maria Ponti, Ivan Vulić

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

Comments ICML 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.11756 2022-05-25 cs.CV cs.AI 73%

UMSNet: An Universal Multi-sensor Network for Human Activity Recognition

Jialiang Wang, Haotian Wei, Yi Wang, Shu Yang, Chi Li

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.05019 2022-05-12 cs.CV cs.CL cs.LG 73%

Learning to Answer Visual Questions from Web Videos

Antoine Yang, Antoine Miech, Josef Sivic, Ivan Laptev, Cordelia Schmid

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted at the TPAMI Special Issue on the Best Papers of ICCV 2021. Journal extension of the conference paper arXiv:2012.00451. 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.05346 2022-03-11 cs.CV cs.CL 73%

Knowledge-enriched Attention Network with Group-wise Semantic for Visual Storytelling

Tengpeng Li, Hanli Wang, Bin He, Chang Wen Chen

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.00451 2021-08-13 cs.CV cs.CL cs.LG 73%

Just Ask: Learning to Answer Questions from Millions of Narrated Videos

Antoine Yang, Antoine Miech, Josef Sivic, Ivan Laptev, Cordelia Schmid

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted at ICCV 2021 (Oral); 20 pages; 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.06039 2021-04-14 cs.CL cs.AI cs.LG 73%

MultiModalQA: Complex Question Answering over Text, Tables and Images

Alon Talmor, Ori Yoran, Amnon Catav, Dan Lahav, Yizhong Wang, Akari Asai, Gabriel Ilharco, Hannaneh Hajishirzi, Jonathan Berant

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

Comments ICLR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.08948 2019-10-22 cs.CL cs.IR cs.SD eess.AS 73%

Predicting the Leading Political Ideology of YouTube Channels Using Acoustic, Textual, and Metadata Information

Yoan Dinkov, Ahmed Ali, Ivan Koychev, Preslav Nakov

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CL、eess.AS

Comments media bias, political ideology, Youtube channels, propaganda, disinformation, fake news

Journal ref INTERSPEECH-2019

详情

展开后加载摘要…

URL PDF HTML 收藏