arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9213 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9213 篇

2402.04967 2024-02-08 cs.CL cs.AI cs.CV 67%

Text or Image? What is More Important in Cross-Domain Generalization Capabilities of Hate Meme Detection Models?

Piush Aggarwal, Jawar Mehrabanian, Weigang Huang, Özge Alacam, Torsten Zesch

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted at EACL'2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02255 2024-01-23 cs.CV cs.AI cs.CL cs.LG 67%

MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts

Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chunyuan Li, Hannaneh Hajishirzi, Hao Cheng, Kai-Wei Chang, Michel Galley, Jianfeng Gao

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 116 pages, 120 figures. Accepted to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10407 2023-12-27 cs.CV cs.AI cs.LG cs.MM 67%

DeepArt: A Benchmark to Advance Fidelity Research in AI-Generated Content

Wentao Wang, Xuanyao Huang, Tianyang Wang, Swalpa Kumar Roy

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments This is the second version of this work, and new contributors join and the modification content is greatly increased

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06595 2023-12-27 cs.CL cs.AI cs.CV 67%

VisIT-Bench: A Benchmark for Vision-Language Instruction Following Inspired by Real-World Use

Yonatan Bitton, Hritik Bansal, Jack Hessel, Rulin Shao, Wanrong Zhu, Anas Awadalla, Josh Gardner, Rohan Taori, Ludwig Schmidt

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to NeurIPS 2023, Datasets and Benchmarks. Website: https://visit-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15445 2023-11-28 cs.CL cs.AI cs.CV 67%

IRFL: Image Recognition of Figurative Language

Ron Yosef, Yonatan Bitton, Dafna Shahaf

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17770 2023-10-30 cs.AI cs.CL cs.CV cs.LG 67%

GROOViST: A Metric for Grounding Objects in Visual Storytelling

Aditya K Surikuchi, Sandro Pezzelle, Raquel Fernández

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments In EMNLP 2023 main conference proceedings (to appear)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14410 2023-10-26 cs.CV cs.AI cs.CL 67%

Image Manipulation via Multi-Hop Instructions -- A New Dataset and Weakly-Supervised Neuro-Symbolic Approach

Harman Singh, Poorva Garg, Mohit Gupta, Kevin Shah, Ashish Goswami, Satyam Modi, Arnab Kumar Mondal, Dinesh Khandelwal, Dinesh Garg, Parag Singla

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments EMNLP 2023 (long paper, main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14740 2023-10-24 cs.AI cs.CL cs.CV 67%

ECHo: A Visio-Linguistic Dataset for Event Causality Inference via Human-Centric Reasoning

Yuxi Xie, Guanzhen Li, Min-Yen Kan

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Findings of EMNLP 2023. 10 pages, 6 figures, 5 tables (22 pages, 8 figures, 15 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.11713 2023-10-18 cs.CV cs.AI cs.CL 67%

Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?

Yang Chen, Hexiang Hu, Yi Luan, Haitian Sun, Soravit Changpinyo, Alan Ritter, Ming-Wei Chang

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments EMNLP 2023 (main conference); Our dataset and evaluation is available at https://open-vision-language.github.io/infoseek/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01957 2023-10-17 cs.RO cs.AI cs.CL cs.CV 67%

Driving with LLMs: Fusing Object-Level Vector Modality for Explainable Autonomous Driving

Long Chen, Oleg Sinavski, Jan Hünermann, Alice Karnsund, Andrew James Willmott, Danny Birch, Daniel Maund, Jamie Shotton

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04869 2023-10-10 cs.HC cs.AI cs.CL cs.CV 67%

ILuvUI: Instruction-tuned LangUage-Vision modeling of UIs from Machine Conversations

Yue Jiang, Eldon Schoop, Amanda Swearngin, Jeffrey Nichols

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.10574 2023-10-05 cs.HC cs.AI cs.CV cs.LG cs.MM 67%

Co-Located Human-Human Interaction Analysis using Nonverbal Cues: A Survey

Cigdem Beyan, Alessandro Vinciarelli, Alessio Del Bue

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments This is the author's version of the work. It is posted here for your personal use. Not for redistribution. The definitive version was published in ACM Computing Surveys, https://doi.org/10.1145/3626516

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07274 2023-08-15 cs.CV cs.AI cs.CL 67%

Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images

Nitzan Bitton-Guetta, Yonatan Bitton, Jack Hessel, Ludwig Schmidt, Yuval Elovici, Gabriel Stanovsky, Roy Schwartz

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to ICCV 2023. Website: whoops-benchmark.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03349 2023-08-08 cs.CL cs.AI cs.CV 67%

SciGraphQA: A Large-Scale Synthetic Multi-Turn Question-Answering Dataset for Scientific Graphs

Shengzhi Li, Nima Tajbakhsh

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14142 2023-07-27 cs.CV cs.AI cs.CL 67%

LOIS: Looking Out of Instance Semantics for Visual Question Answering

Siyu Zhang, Yeming Chen, Yaoru Sun, Fang Wang, Haibo Shi, Haoran Wang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02168 2023-07-12 cs.CL cs.AI cs.CV cs.LG 67%

I2I: Initializing Adapters with Improvised Knowledge

Tejas Srinivasan, Furong Jia, Mohammad Rostami, Jesse Thomason

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted at 2nd Conference on Lifelong Learning Agents (CoLLAs), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03274 2023-07-10 cs.CV cs.AI cs.CL 67%

It is not Sexually Suggestive, It is Educative. Separating Sex Education from Suggestive Content on TikTok Videos

Enfa George, Mihai Surdeanu

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to ACL Findings 2023. 10 pages, 3 figures, 5 tables . Please refer to https://github.com/enfageorge/SexTok for dataset and related details

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10765 2023-06-21 cs.AI cs.CL cs.CV 67%

Path to Medical AGI: Unify Domain-specific Medical LLMs with the Lowest Cost

Juexiao Zhou, Xiuying Chen, Xin Gao

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19280 2023-06-01 cs.LG cs.AI cs.CL cs.CV 67%

Large language models improve Alzheimer's disease diagnosis using multi-modality data

Yingjie Feng, Jun Wang, Xianfeng Gu, Xiaoyin Xu, Min Zhang

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17911 2023-05-30 cs.SI cs.AI cs.CL cs.CV 67%

TotalDefMeme: A Multi-Attribute Meme dataset on Total Defence in Singapore

Nirmalendu Prakash, Ming Shan Hee, Roy Ka-Wei Lee

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 6 pages. Accepted at ACM MMSys 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17530 2023-05-30 cs.CV cs.AI cs.CL 67%

PuMer: Pruning and Merging Tokens for Efficient Vision Language Models

Qingqing Cao, Bhargavi Paranjape, Hannaneh Hajishirzi

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to ACL 2023 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07474 2023-04-14 cs.CV cs.AI cs.CL cs.LG 67%

SQA3D: Situated Question Answering in 3D Scenes

Xiaojian Ma, Silong Yong, Zilong Zheng, Qing Li, Yitao Liang, Song-Chun Zhu, Siyuan Huang

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ICLR 2023. First two authors contributed equally. Project website: https://sqa3d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.12191 2023-04-04 cs.CL cs.AI cs.CV cs.LG 67%

Reassessing Evaluation Practices in Visual Question Answering: A Case Study on Out-of-Distribution Generalization

Aishwarya Agrawal, Ivana Kajić, Emanuele Bugliarello, Elnaz Davoodi, Anita Gergely, Phil Blunsom, Aida Nematzadeh

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Findings of EACL 2023. Aishwarya, Ivana, Emanuele and Aida had equal first author contributions. Elnaz and Anita had equal contributions. Aida and Aishwarya had equal senior contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.05970 2023-02-16 cs.CL cs.AI cs.CV 67%

ImaginE: An Imagination-Based Automatic Evaluation Metric for Natural Language Generation

Wanrong Zhu, Xin Eric Wang, An Yan, Miguel Eckstein, William Yang Wang

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments EACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16492 2022-11-30 cs.CL cs.AI cs.CV cs.LG 67%

Abstract Visual Reasoning with Tangram Shapes

Anya Ji, Noriyuki Kojima, Noah Rush, Alane Suhr, Wai Keen Vong, Robert D. Hawkins, Yoav Artzi

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments EMNLP 2022 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13887 2022-11-28 cs.AI cs.CL cs.CV cs.GR eess.IV 67%

TPA-Net: Generate A Dataset for Text to Physics-based Animation

Yuxing Qiu, Feng Gao, Minchen Li, Govind Thattai, Yin Yang, Chenfanfu Jiang

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09059 2022-11-28 cs.CL cs.AI cs.CV cs.LG 67%

CLiMB: A Continual Learning Benchmark for Vision-and-Language Tasks

Tejas Srinivasan, Ting-Yun Chang, Leticia Leonor Pinto Alva, Georgios Chochlakis, Mohammad Rostami, Jesse Thomason

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to NeurIPS 2022 Datasets and Benchmarks track

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00121 2022-10-04 cs.RO cs.LG 67%

Visuo-Tactile Transformers for Manipulation

Yizhou Chen, Andrea Sipos, Mark Van der Merwe, Nima Fazeli

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

Comments Accepted to CoRL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.13242 2022-07-28 cs.CV cs.AI cs.CL cs.LG 67%

Uncertainty-based Visual Question Answering: Estimating Semantic Inconsistency between Image and Knowledge Base

Jinyeong Chae, Jihie Kim

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted by the 2022 International Joint Conference on Neural Networks (IJCNN 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.13214 2022-07-26 cs.CV cs.AI cs.CL cs.LG 67%

IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning

Pan Lu, Liang Qiu, Jiaqi Chen, Tony Xia, Yizhou Zhao, Wei Zhang, Zhou Yu, Xiaodan Liang, Song-Chun Zhu

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Corrected typos. Accepted to NeurIPS 2021, 27 pages, 18 figures. Data and code are available at https://iconqa.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏