Mind over Space: Can Multimodal Large Language Models Mentally Navigate?
心灵超越空间:多模态大语言模型能否进行心理导航?
Qihui Zhu, Shouwei Ruan, Xiao Yang, Hao Jiang, Yao Huang, Shiji Zhao, Hanwei Fan, Hang Su, Xingxing Wei
机构
*
Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)
;
Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学计算机科学与技术系)
;
School of Automation Science and Electrical Engineering , Beihang University(北京航空航天大学自动化科学与电气工程学院)
;
college of AI, Tsinghua University(清华大学人工智能学院)
;
Department of Computer Science and Technology , Tsinghua University(清华大学计算机科学与技术系)
专题命中
视觉推理
:multimodal large language model(title);分类 cs.AI
机构
*
Tsinghua University(清华大学)
;
SenseTime Research(商汤科技研究院)
;
Peking University(北京大学)
;
Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所)
De-rendering, Reasoning, and Repairing Charts with Vision-Language Models
图表去渲染、推理与修复:基于视觉-语言模型
Valentin Bonas, Martin Sinnona, Viviana Siless, Emmanuel Iarussi
机构
*
Universidad Torcuato Di Tella(托克托迪特拉大学)
;
Consejo Nacional de Investigaciones Científicas y Técnicas(国家科学与技术研究理事会)
;
Facultad de Ciencias Exactas y Naturales Universidad de Buenos Aires(布宜诺斯艾利斯大学科学与自然学院)
EAA: Automating materials characterization with vision language model agents
EAA: 用视觉语言模型代理自动化材料表征
Ming Du, Yanqi Luo, Srutarshi Banerjee, Michael Wojcik, Jelena Popovic, Mathew J. Cherukara
机构
*
Argonne National Laboratory(阿贡国家实验室)
;
Advanced Photon Source(先进光子源)
;
Data Science and Learning Division(数据科学与学习 division)
;
Department of Radiation Oncology(放射肿瘤学系)
;
Northwestern University(西北大学)
Recov-Vision: Linking Street View Imagery and Vision-Language Models for Post-Disaster Recovery
Recov-Vision:通过街道视图影像与视觉-语言模型实现灾害后恢复
Yiming Xiao, Archit Gupta, Miguel Esparza, Yu-Hsuan Ho, Antonia Sebastian, Hannah Weas, Rose Houck, Ali Mostafavi
机构
*
UrbanResilience.AI Lab(UrbanResilience.AI 实验室)
;
Zachry Department of Civil and Environmental Engineering(Zachry 土木与环境工程系)
;
Texas A&M University(德克萨斯A&M大学)
;
Department of Earth, Marine and Environmental Sciences(地球、海洋与环境科学系)
;
The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
Vision-Language Models for Automated 3D PET/CT Report Generation
用于自动化3D PET/CT报告生成的视觉-语言模型
Wenpei Jiao, Kun Shang, Hui Li, Ke Yan, Jiajin Zhang, Guangjie Yang, Lijuan Guo, Yan Wan, Xing Yang, Dakai Jin, Zhaoheng Xie
机构
*
Institute of Medical Technology and National Biomedical Imaging Center, Peking University(北京大学医学技术研究院和国家生物医学成像中心)
;
Peking University People’s Hospital(北京大学人民医院)
;
Peking University Third Hospital(北京大学第三医院)
;
DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)
;
The Affiliated Hospital of Qingdao University(青岛大学附属医院)
;
The First Affiliated Hospital of Henan Medical University(河南医科大学第一附属医院)
;
Jiujiang City Key Laboratory of Cell Therapy, Jiu Jiang NO.1 People’s Hospital(九江市细胞治疗重点实验室,九江市第一人民医院)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
Yang Liu, Ming Ma, Xiaomin Yu, Pengxiang Ding, Han Zhao, Mingyang Sun, Siteng Huang, Donglin Wang
机构
*
Westlake University(西湖大学)
;
Zhejiang University(浙江大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Shanghai Innovation Institute(上海创新研究院)
Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
Tan-Hanh Pham, Chris Ngo
机构
*
Harvard Medical School, Harvard University(哈佛医学院、哈佛大学)
;
Athinoula A. Martinos Center for Biomedical Imaging, Massachusetts General Hospital(阿提尼乌拉A.马丁努斯生物医学成像中心、麻省总医院)
;
Knovel Engineering Lab, Singapore(Knovel工程实验室、新加坡)
机构
*
Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(中国科学院)、计算技术研究所、中国)