Chenggang Rong, Tao Han, Zhiyuan Zhao, Yaowu Fan, Jia Wan, Song Guo, Yuan Yuan, Junyu Gao
机构
*
Northwestern Polytechnical University(北华大学)
;
Hong Kong University of Science and Technology(香港科技大学)
;
Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所)
;
Sun Yat-sen University(中山大学)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中
视觉问答
:MLLM(title);multimodal large language model(abstract);分类 cs.CV
ConFoThinking: Consolidated Focused Attention Driven Thinking for Visual Question Answering
ConFoThinking:基于整合聚焦注意力的视觉问答思考
Zhaodong Wu, Haochen Xue, Qi Cao, Wenqi Mo, Yu Pei, Wenqi Xu, Jionglong Su, Yang Liu
机构
*
Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究所)
;
School of AI and Advanced Computing, Xi'an Jiaotong-Liverpool University, Suzhou, China(西安交通大学利物浦大学人工智能与高级计算学院)
机构
*
Shenzhen International Graduate School Tsinghua University Shenzhen China(深圳国际研究生院清华大学深圳中国)
;
Independent Researcher London United Kingdom(独立研究者伦敦英国)
;
Queen Mary University of London London United Kingdom(女王玛丽大学伦敦英国)
;
Imperial College London London United Kingdom(帝国理工学院伦敦英国)
;
University Of Surrey Guildford United Kingdom(Surrey大学Guildford英国)
OPGAgent: An Agent for Auditable Dental Panoramic X-ray Interpretation
OPGAgent: 一种用于可审计牙科全景X光解读的智能体
Zhaolin Yu, Litao Yang, Ben Babicka, Ming Hu, Jing Hao, Anthony Huang, James Huang, Yueming Jin, Jiasong Wu, Zongyuan Ge
机构
*
AIM for Health Lab
;
Faculty of Information Technology, Monash University(信息科技学院,莫纳什大学)
;
Monash University(莫纳什大学)
;
Curae Health
;
Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学)
;
National University of Singapore(新加坡国立大学)
;
Southeast University(东南大学)
专题命中
视觉问答
:vision language model(abstract);分类 cs.CV、cs.AI
SportR: A Benchmark for Multimodal Large Language Model Reasoning in Sports
SportR:多模态大语言模型在体育中的推理基准
Haotian Xia, Haonan Ge, Junbo Zou, Hyun Woo Choi, Xuebin Zhang, Danny Suradja, Botao Rui, Ethan Tran, Wendy Jin, Zhen Ye, Xiyang Lin, Christopher Lai, Shengjie Zhang, Junwen Miao, Shichao Chen, Rhys Tracy, Vicente Ordonez, Weining Shen, Hanjie Chen
机构
*
Department of Computer Science, Rice University(Rice大学计算机科学系)
;
Ken Kennedy Institute, Rice University(Rice大学肯尼迪研究所)
;
Department of Statistics, University of California, Irvine(伊利诺伊大学欧文分校统计系)
;
College of Sciences, Georgia Institute of Technology(佐治亚理工学院科学学院)
;
Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系)
;
Department of Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系)
专题命中
视觉推理
:multimodal large language model(title);grounding(abstract);分类 cs.CV
机构
*
Tsinghua University(清华大学)
;
Peking University(北京大学)
;
Fudan University(复旦大学)
;
Microsoft Research Asia(微软亚洲研究院)
;
Hong Kong University of Science and Technology(香港科技大学)
;
Zhejiang University(浙江大学)
CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing
CityLens:评估大型视觉-语言模型用于城市社会经济感知
Tianhui Liu, Hetian Pang, Xin Zhang, Tianjian Ouyang, Zhiyuan Zhang, Jie Feng, Yong Li, Pan Hui
机构
*
Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心)
;
Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)
;
School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院)
Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction-Reasoning Synergy
Vid-LLM:一种基于视频的紧凑型3D多模态大语言模型,具有重建-推理协同效应
Haijier Chen, Bo Xu, Shoujian Zhang, Haoze Liu, Jiaxuan Lin, Jingrong Wang
机构
*
School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院)
;
Hubei Luojia Laboratory(湖北珞珈实验室)
;
School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院)
专题命中
视觉推理
:grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine
MedGPT-oss: 为生物医学训练一个通用的视觉-语言模型
Kai Zhang, Zhengqing Yuan, Cheng Peng, Songlin Zhao, Mengxian Lyu, Ziyi Chen, Yanfang Ye, Wei Liu, Ying Zhang, Kaleb E Smith, Lifang He, Lichao Sun, Yonghui Wu
机构
*
Department of Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系)
;
Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系)
;
Department of Health Outcomes & Biomedical Informatics, University of Florida(佛罗里达大学健康结果与生物医学信息学系)
;
Department of Radiation Oncology, Mayo Clinic(梅奥诊所放射肿瘤科)
;
Research Computing, University of Florida(佛罗里达大学研究计算中心)
;
AI Technology Center, NVIDIA(NVIDIA人工智能技术中心)
机构
*
University of Toronto, Canada(多伦多大学)
;
Vector Institute, Canada(向量研究所)
;
KITE Research Institute, University Health Network, Canada(KITE研究机构)
;
York University, Canada(约克大学)