A Metric for MLLM Alignment in Large-scale Recommendation
机构 * Xiaohongshu Inc.(小红书公司)
专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract);分类 cs.LG
Comments Pre-print.Under Review
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Xiaohongshu Inc.(小红书公司)
专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract);分类 cs.LG
Comments Pre-print.Under Review
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Waseda University(早稻田大学) ; Peking University(北京大学)
专题命中 VLM训练与架构 :VLM(title);分类 cs.CV
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments Accepted to ICCV 2025
机构 * University of Electronic Science and Technology of China(电子科学与技术大学) ; Tongji University(同济大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Accepted to TPAMI
机构 * ByteDance(字节跳动)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI
Comments CVPR 2025; Code and models: https://github.com/ByteVisionLab/TokenFlow
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; Tsinghua Univerisity(清华大学) ; Peking University(北京大学) ; Chongqing University(重庆大学) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
专题命中 其他VLM :MLLM(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * Beijing University of Post and Telecommunication(北京邮电大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments 8 pages, 2 supplement pages, 3 figures, ECAI2025
机构 * Dali University(大理大学) ; Bandırma Onyedi Eylül University(班迪尔马第十七个九月大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.LG