Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation
区域感知多模态大语言模型:基于慢快标记化与伪掩码引导的3D CT报告生成
Sunggu Kyung, Jinyoung Seo, Hyunseok Lim, Dongyeong Kim, Hyungbin Park, Jimin Sung, Jihyun Kim, Wooyoung Jo, Yoojin Nam, Namkug Kim
机构
*
Department of Convergence Medicine, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院融合医学系)
;
University of Ulsan College of Medicine, Seoul, Republic of Korea(韩国首尔蔚山大学医学院)
;
Department of Radiology and Research Institute of Radiology, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院放射科与放射学研究所)
机构
*
Harbin Institute of Technology(哈尔滨工业大学)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院)
;
Nankai University(南开大学)
SDGIC: A Semantic Disambiguation-Guided Generative Image Compression Method for Ultra-Low Bitrates
SDGIC: 一种基于语义消歧的生成图像压缩方法,用于超低比特率
Kaile Wang, Lijun He, Haisheng Fu, Haixia Bi, Fan Li
机构
*
School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院)
;
Department of Electrical and Computer Engineering, Faculty of Applied Science, The University of British Columbia(不列颠哥伦比亚大学应用科学学院电气与计算机工程系)
Jingyu Xiao, Zhongyi Zhang, Yuxuan Wan, Yintong Huo, Yang Liu, Michael R. Lyu
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Huazhong University of Science and Technology(华中科技大学)
;
Singapore Management University(新加坡管理大学)
;
Nanyang Technological University(南洋理工大学)
Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning
位置重绑定缓存复用:交错多模态推理中无重放的视觉重访
Mengzhao Wang, Yanli Ji, Wangmeng Zuo, Peng Ye, Chongjun Tu
机构
*
Sun Yat-sen University(中山大学)
;
Shenzhen Loop Area Institute(深圳河套学院)
;
Harbin Institute of Technology (HIT)(哈尔滨工业大学)
;
Fudan University(复旦大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The Chinese University of Hong Kong(香港中文大学)