PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle
PixVL:通过统一掩码-文本一致性循环进行像素级多模态大语言模型的自监督训练
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract)
AI总结 PixVL作为自监督后训练框架,通过统一掩码-文本一致性循环及语义验证等策略,解决像素级MLLMs的优化干扰问题,同时提升区域理解与分割任务性能。