Enabling Disaggregated Multi-Stage MLLM Inference via GPU-Internal Scheduling and Resource Sharing
通过GPU内部调度和资源共享实现解耦的多阶段MLLM推理
机构 * Wuhan University(武汉大学)
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.LG
AI总结 通过GPU内部调度和资源共享实现解耦的多阶段MLLM推理,提升吞吐量和延迟性能