RCI: A Score for Evaluating Global and Local Reasoning in Multimodal Benchmarks
机构 * Oracle AI
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted in EMNLP 2025
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Oracle AI
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted in EMNLP 2025
机构 * Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine, Zhejiang University, Hangzhou(牙科医院,口腔医学院,浙江大学医学院,浙江大学,杭州) ; College of Computer Science and Technology, Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University, Hangzhou(计算机科学与技术学院,浙江大学-伊利诺伊大学 Urbana-Champaign 院,浙江大学,杭州) ; Department of Orthodontics, Shanghai Ninth People’s Hospital, College of Stomatology, Shanghai Jiao Tong University School of Medicine(正畸科,上海第九人民医院,口腔医学院,上海交通大学医学院) ; Angelalign Technology Inc.(Angelalign 技术公司)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Shanghai Innovation Institute(上海创新研究院) ; Zhongguancun Academy(中关村学院) ; Tencent(腾讯) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; Lehigh University(莱斯大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments Technical Report
机构 * University of Padova(帕多瓦大学) ; Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Örebro University(奥雷布罗大学) ; NVIDIA Research(NVIDIA研究)
专题命中 图文多模态 :multimodal(title,abstract)
Comments Project page: https://j-dapt.github.io/. 9 pages, 6 figures
机构 * University of Southern California(南加州大学) ; Amazon AGI(亚马逊人工智能实验室)
专题命中 图文多模态 :multimodal(title);分类 cs.CV
机构 * School of Engineering, Westlake University, Hangzhou, China(西湖大学工程学院) ; School of Cyberspace Security, Nanjing University of Science and Technology, Nanjing, China(南京理工大学网络安全学院)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * Shanghai Jiao Tong University(上海交通大学) ; Eastern Institute of Technology(东部技术研究所) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
机构 * Korea University(韩国大学) ; University of Seoul(首尔大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 23 pages, 17 figures
机构 * Fudan University(复旦大学) ; University of Southern California(南加州大学) ; ByteDance(字节跳动)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Peng Cheng Lab(鹏城实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments 16 pages, 6 figures
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
机构 * Brown University(布朗大学) ; Tel Aviv University(特拉维夫大学) ; University of Tübingen(图宾根大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
机构 * Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区) ; The National University of Singapore, Singapore(新加坡国立大学) ; National Key Laboratory of Science and Technology on Information System Security, China(信息系统安全科学技术国家重点实验室)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
机构 * Savitribai Phule Pune University (SPPU)(萨维特里·布尔大学(SPPU))
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments 10 pages, 12 figures. Code for MATS released at https://github.com/thubZ09/mats-spatial-reasoning
机构 * University of Science and Technology of China(中国科学技术大学) ; University of Palermo(巴勒莫大学) ; iFLYTEK Research(iFLYTEK研究院)
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.MM
Comments 13 pages, 8 figures
机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) ; School of Cyber Science and Engineering, Zhengzhou University(郑州大学网络科学与工程学院) ; School of Software, Northwestern Polytechnical University(西北工业大学软件学院) ; Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) ; Inspur Group(Inspur集团) ; Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS
Comments Submit to icassp 2026
机构 * Central South University of Forestry and Technology(林业科技大学) ; State University of New York(纽约州立大学)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL
Comments 35 pages, 10 figures, 8 tables
机构 * Shanghai Jiao Tong University(上海交通大学) ; East China Normal University(华东师范大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM
机构 * Indiana University(印第安纳大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
Comments 4 pages, 1 figure, and 1 table
机构 * Center for Computational & Data Sciences, Independent University, Bangladesh(计算与数据科学中心,独立大学,孟加拉国) ; Amazon GenAI(亚马逊生成人工智能) ; Qatar Computing Research Institute(卡塔尔计算研究所) ; University of Virginia(弗吉尼亚大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS
Comments Accepted at EMNLP 2025
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) ; Beijing AISHELL Technology Co., Ltd.(北京AISHELL科技有限公司) ; AI Center, OPPO(OPPO人工智能中心)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Code is available at https://github.com/dvlab-research/MGM-Omni
机构 * Xiamen University(厦门大学) ; University of Science and Technology Beijing(北京科技大学) ; National University of Singapore(新加坡国立大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS
机构 * Xinjiang Multimodal Intelligent Processing and Information Security Engineering Technology Research Center(新疆多模态智能处理与信息安全工程技术研究中心) ; School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; School of Electrical Engineering and Automation, Tianjin University of Technology(天津理工大学电气工程与自动化学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI
Comments Main paper (15 pages). Accepted for publication by ICONIP( International Conference on Neural Information Processing) 2025
机构 * Tsinghua University(清华大学) ; University of Cambridge(剑桥大学) ; ByteDance(字节跳动)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
Comments Accepted for publication in the Proceedings of EMNLP 2025 (Main Conference)
机构 * Johannes Kepler University Linz(约翰·凯撒大学林茨分校) ; National University of Computer and Emerging Sciences(国家计算机与新兴科学大学) ; University of Michigan(密歇根大学) ; Fortemedia Singapore(Fortemedia新加坡分公司) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; University of Engineering and Technology Taxila(塔希尔工程与技术大学) ; Human-centered AI Group(以人为本的人工智能小组)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV
Comments 4 pages, ICASSP'26, SP Grand Challenge'26
机构 * Kyutai
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
机构 * Renmin University of China(中国人民大学)
专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ACMMM 2024 poster
机构 * Korea University(韩国大学) ; Meta GenAI(Meta 生成人工智能) ; KAIST(韩国科学技术院)
专题命中 视频多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV
Comments ICCV 2025 Highlight