MMRQA: Signal-Enhanced Multimodal Large Language Models for MRI Quality Assessment
Fankai Jia, Daisong Gan, Zhe Zhang, Zhaochi Wen, Chenchen Dan, Dong Liang, Haifeng Wang
机构
*
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
ShanghaiTech University(上海理工大学)
;
Southern University of Science and Technology(南方科技大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV
机构
*
Fudan University(复旦大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
The University of Hong Kong(香港大学)
;
Shenzhen University(深圳大学)
;
University of Science and Technology of China(中国科学技术大学)
专题命中
视觉推理
:grounding(title);multimodal large language model(abstract);分类 cs.CV、cs.AI
Evaluating Compliance with Visualization Guidelines in Diagrams for Scientific Publications Using Large Vision Language Models
Johannes Rückert, Louise Bloch, Christoph M. Friedrich
机构
*
Department of Computer Science, University of Applied Sciences and Arts Dortmund(应用科学与艺术大学多特蒙德计算机科学系)
;
Institute for Medical Informatics, Biometry and Epidemiology (IMIBE)(医学信息学、生物统计与流行病学研究所)
;
Institute for Artificial Intelligence in Medicine (IKIM), University Hospital Essen(医学人工智能研究所,埃森大学医院)
专题命中
视觉推理
:vision language model(title,abstract);分类 cs.AI
AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
Kangan Qian, Sicong Jiang, Yang Zhong, Ziang Luo, Zilin Huang, Tianze Zhu, Kun Jiang, Mengmeng Yang, Zheng Fu, Jinyu Miao, Yining Shi, He Zhe Lim, Li Liu, Tianbao Zhou, Huang Yu, Yifei Hu, Guang Li, Guang Chen, Hao Ye, Lijun Sun, Diange Yang
机构
*
School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动学院)
;
McGill University(麦吉尔大学)
;
Automotive and Robotics, Xiaomi Corporation(小米公司汽车与机器人部门)
;
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
EarthMind: Leveraging Cross-Sensor Data for Advanced Earth Observation Interpretation with a Unified Multimodal LLM
Yan Shu, Bin Ren, Zhitong Xiong, Danda Pani Paudel, Luc Van Gool, Begüm Demir, Nicu Sebe, Paolo Rota
机构
*
University of Trento(特伦托大学)
;
BIFOLD and Technische Universität Berlin(BIFOLD和柏林技术大学)
;
Technical University of Munich(慕尼黑技术大学)
;
University of Pisa(比萨大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
SONAR: Semantic-Object Navigation with Aggregated Reasoning through a Cross-Modal Inference Paradigm
Yao Wang, Zhirui Sun, Wenzheng Chi, Baozhi Jia, Wenjun Xu, Jiankun Wang
机构
*
Shenzhen Key Laboratory of Robotics Perception and Intelligence(机器人感知与智能深圳重点实验室)
;
Department of Electronic and Electrical Engineering(电子与电气工程系)
;
Southern University of Science and Technology(南方科技大学)
;
Research Institute of Multiple Agents and Embodied Intelligence(多智能体与具身智能研究院)
;
Peng Cheng Laboratory(鹏城实验室)
;
Robotics and Microsystems Center(机器人与微系统中心)
;
School of Mechanical and Electric Engineering(机械与电子工程学院)
;
Soochow University(苏州大学)
;
Xiamen Key Laboratory of Visual Perception Technology and Application(视觉感知技术与应用厦门重点实验室)
;
Reconova Information Technology Co., Ltd.(Reconova信息技术有限公司)
Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs
Wenyu Zhang, Yingxu He, Geyu Lin, Zhuohan Liu, Shuo Sun, Bin Wang, Xunlong Zou, Jeremy H. M. Wong, Qiongqiong Wang, Hardik B. Sailor, Nancy F. Chen, Ai Ti Aw
机构
*
Institute for Infocomm Research (I 2 {}^{\text{2}} R), Agency for Science, Technology and Research (A*STAR)(信息与通信研究机构(I2R),科技研究局(A*STAR))
;
Centre for Frontier AI Research (CFAR), Agency for Science, Technology and Research (A*STAR)(前沿人工智能研究中心(CFAR),科技研究局(A*STAR))
机构
*
Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
;
Research Centre for Data Science & Artificial Intelligence(数据科学与人工智能研究中心)
;
Department of Computer and Data Sciences, Case Western Reserve University(凯斯西储大学计算机与数据科学系)
专题命中
视觉推理
:multimodal large language model(abstract)