SportR: A Benchmark for Multimodal Large Language Model Reasoning in Sports
SportR:多模态大语言模型在体育中的推理基准
Haotian Xia, Haonan Ge, Junbo Zou, Hyun Woo Choi, Xuebin Zhang, Danny Suradja, Botao Rui, Ethan Tran, Wendy Jin, Zhen Ye, Xiyang Lin, Christopher Lai, Shengjie Zhang, Junwen Miao, Shichao Chen, Rhys Tracy, Vicente Ordonez, Weining Shen, Hanjie Chen
机构
*
Department of Computer Science, Rice University(Rice大学计算机科学系)
;
Ken Kennedy Institute, Rice University(Rice大学肯尼迪研究所)
;
Department of Statistics, University of California, Irvine(伊利诺伊大学欧文分校统计系)
;
College of Sciences, Georgia Institute of Technology(佐治亚理工学院科学学院)
;
Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系)
;
Department of Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系)
专题命中
视觉推理
:multimodal large language model(title);grounding(abstract);分类 cs.CV
机构
*
Tsinghua University(清华大学)
;
Peking University(北京大学)
;
Fudan University(复旦大学)
;
Microsoft Research Asia(微软亚洲研究院)
;
Hong Kong University of Science and Technology(香港科技大学)
;
Zhejiang University(浙江大学)
CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing
CityLens:评估大型视觉-语言模型用于城市社会经济感知
Tianhui Liu, Hetian Pang, Xin Zhang, Tianjian Ouyang, Zhiyuan Zhang, Jie Feng, Yong Li, Pan Hui
机构
*
Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心)
;
Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)
;
School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院)
Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction-Reasoning Synergy
Vid-LLM:一种基于视频的紧凑型3D多模态大语言模型,具有重建-推理协同效应
Haijier Chen, Bo Xu, Shoujian Zhang, Haoze Liu, Jiaxuan Lin, Jingrong Wang
机构
*
School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院)
;
Hubei Luojia Laboratory(湖北珞珈实验室)
;
School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院)
专题命中
视觉推理
:grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine
MedGPT-oss: 为生物医学训练一个通用的视觉-语言模型
Kai Zhang, Zhengqing Yuan, Cheng Peng, Songlin Zhao, Mengxian Lyu, Ziyi Chen, Yanfang Ye, Wei Liu, Ying Zhang, Kaleb E Smith, Lifang He, Lichao Sun, Yonghui Wu
机构
*
Department of Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系)
;
Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系)
;
Department of Health Outcomes & Biomedical Informatics, University of Florida(佛罗里达大学健康结果与生物医学信息学系)
;
Department of Radiation Oncology, Mayo Clinic(梅奥诊所放射肿瘤科)
;
Research Computing, University of Florida(佛罗里达大学研究计算中心)
;
AI Technology Center, NVIDIA(NVIDIA人工智能技术中心)
机构
*
University of Toronto, Canada(多伦多大学)
;
Vector Institute, Canada(向量研究所)
;
KITE Research Institute, University Health Network, Canada(KITE研究机构)
;
York University, Canada(约克大学)
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所)
;
Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构
*
School of Data Science, Fudan University(复旦大学数据科学学院)
;
Shanghai Innovation Institute(上海创新研究院)
;
Eastern Institute of Technology(技术东院)
;
Imperial College London(伦敦帝国理工学院)
;
University of Surrey(萨里大学)
MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning
MMR-Life: 组合真实场景以进行多模态多图像推理
Jiachun Li, Shaoping Huang, Zhuoran Jin, Chenlong Zhang, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室)
;
School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波校区计算机科学学院)
;
Institute of Biomedical Engineering, Ningbo institute of materials technology and engineering, Chinese Academy of Sciences(中国科学院宁波材料技术与工程研究所生物医学工程研究所)
;
School of Electrical & Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)
Zhibin Lan, Liqiang Niu, Fandong Meng, Jie Zhou, Jinsong Su
机构
*
School of Informatics, Xiamen University, China(厦门大学信息学院)
;
WeChat AI, Tencent Inc, China(腾讯公司微信AI部门)
;
Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室)
;
Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.AI、cs.LG