TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV
Comments 23 pages, 5 figures
机构 * Electronic Information School, Wuhan University, Wuhan 430072, China(武汉大学电子信息学院)
专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV
Comments Accepted by ICCV 2025
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; University of Virginia(弗吉尼亚大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * College of Computer, National University of Defense Technology(计算机学院,国防科技大学)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments 14 pages, 6 figures
机构 * Clemson University(克莱姆森大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * School of Electronic Engineering, Xidian University Xi'an China ; School of Information Science \& Engineering, Lanzhou University Lanzhou China ; Xidian University ; Lanzhou University
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM
Comments Accepted by ACM MM 2025
机构 * Kunming University of Science and Technology(昆明理工大学)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) ; MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能教育部重点实验室) ; The University of Tokyo(东京大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; E-surfing Vision Technology Co., Ltd(亿欧视觉科技有限公司)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments Accepted by ICCV2025
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Home Robotics Lab, E-surfing Digital Life Technology Co., Ltd., China Telecom(E-surfing数字生活技术有限公司) ; Zhejiang Lab(浙江实验室) ; Trinity College Dublin(都柏林大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
Comments Accepted by EMNLP 2025 (Main Conference)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI
Comments The paper is submitted to IAAI26. Total 9 pages with 8 figures