Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start
Metis-SPECS: 通过基于偏好自我蒸馏的冷启动解耦多模态学习
Kun Chen, Peng Shi, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao, Lin Ma
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
;
Meituan(美团)
专题命中
视觉推理
:vision language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning
基于框架的思考:视觉上下文和测试时扩展如何增强视频推理
Chengzu Li, Zanyi Wang, Jiaang Li, Yi Xu, Han Zhou, Huanyu Zhang, Ruichuan An, Dengyang Jiang, Zhaochong An, Ivan Vulić, Serge Belongie, Anna Korhonen
机构
*
University of Cambridge(剑桥大学)
;
Pioneer Center for AI, University of Copenhagen(人工智能先锋中心,哥本哈根大学)
;
Hong Kong University of Science(香港科学大学)
;
University of California San Diego(加州大学圣地亚哥分校)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Peking University(北京大学)
KiVA: Kid-inspired Visual Analogies for Testing Large Multimodal Models
KiVA:儿童启发的视觉类比用于测试大多模态模型
Eunice Yiu, Maan Qraitem, Anisa Noor Majhi, Charlie Wong, Yutong Bai, Shiry Ginosar, Alison Gopnik, Kate Saenko
机构
*
University of California, Berkeley(加州大学伯克利分校)
;
Boston University(波士顿大学)
;
Google DeepMind(谷歌DeepMind)
;
Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)
机构
*
Zhejiang University(浙江大学)
;
Nanjing University of Science and Technology(南京理工大学)
;
Huzhou University(湖州大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结
SKG2DATA通过空间知识图引导多模态合成,提升多模态大语言模型的空间感知与推理能力。
CommentsIEEE/ACM Transactions on Audio, Speech and Language Processing
机构
*
Peking University(北京大学)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
Chinese University of Hong Kong(香港中文大学)
;
University of California, Santa Barbara(加州大学圣芭芭拉分校)