Unleashing MLLMs on the Edge: A Unified Framework for Cross-Modal ReID via Adaptive SVD Distillation
在边缘侧释放MLLMs:通过自适应SVD蒸馏实现跨模态重识别的统一框架
Hongbo Jiang, Jie Li, Xinqi Cai, Tianyu Xie, Yunhang Shen, Pingyang Dai, Liujuan Cao
机构
*
Tencent Youtu Lab, Shanghai, China(腾讯优图实验室,上海,中国)
;
Xiamen University, Media Analytics(厦门大学,媒体分析)
;
Computing Lab, Department of Artificial Intelligence, School of Informatics, Xiamen, China(计算实验室,人工智能系,信息学院,厦门,中国)
Comments15 pages, 2 figures, 2 tables. Introduces a multi-agent architecture for physics simulation code generation with perceptual self-reflection via vision-based validation. Includes qualitative evaluation across multiple physics domains
Any-to-Any Vision-Language Model for Multimodal X-ray Imaging and Radiological Report Generation
任意到任意的视觉-语言模型用于多模态X射线成像与放射学报告生成
Daniele Molino, Francesco di Feola, Linlin Shen, Paolo Soda, Valerio Guarrasi
机构
*
Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与介入部门,生物医学工程与放射物理,乌梅大学)
;
College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)