ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP
ReasonCLIP-58M: CLIP的视觉基础常识推理监督
Sicheng Zhang, Muzammal Naseer, Binzhu Xie, Naufal Suryanto, Shi Qiu, Jamal Bentahar, Naveed Akhtar, Mubarak Shah
机构
*
Khalifa University(卡利法大学)
;
University of Western Australia(西澳大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
University of Melbourne(墨尔本大学)
;
University of Central Florida(佛罗里达中央大学)
专题命中
VLM训练与架构
:LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality
跨模态掩码组合概念建模以增强视觉-语言组合性
Wei Li, Zhen Huang, Xinmei Tian
机构
*
MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部脑启发智能感知与认知重点实验室)
;
Independent Researcher(独立研究员)
专题命中
VLM训练与架构
:vision-language model(abstract);VLM(abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
CausalMoE: A Billion-Scale Multimodal Foundation Model for Granger Causal Discovery with Pattern-Routed Heterogeneous Experts
CausalMoE:基于模式路由异构专家的十亿规模多模态基础模型用于格兰杰因果发现
Bo Liu, Di Dai, Jingwei Liu, Jiarui Jin, Xiaocheng Fang, Guangkun Nie, Hongyan Li, Shenda Hong
机构
*
State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室)
;
National Institute of Health Data Science, and Institute for Artificial Intelligence, Peking University(北京大学健康医疗大数据国家研究院、人工智能研究院)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
弥合视觉令牌剪枝中的语义-动作鸿沟以实现高效VLA推理
Ziyan Liu, Yeqiu Chen, Hongyi Cai, Tao Lin, Shuo Yang, Zheng Liu, Bo Zhao
机构
*
School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)
;
University of Science and Technology of China(中国科学技术大学)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
BAAI(北京人工智能研究院)
机构
*
School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)
;
National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)
专题命中
VLM训练与架构
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.LG
机构
*
Peking University(北京大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Tsinghua University(清华大学)
;
Beihang University(北京航空航天大学)
;
Xiaohongshu Inc.(小红书公司)
机构
*
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Tencent(腾讯)
;
Tsinghua University(清华大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Beijing Film Academy(北京电影学院)
;
Stanford University(斯坦福大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Singapore Institute of Technology(新加坡理工学院)
Scaling-Aware Adapter for Structure-Grounded LLM Reasoning
Scaling-Aware Adapter for Structure-Grounded LLM Reasoning
Zihao Jing, Qiuhao Zeng, Ruiyi Fang, Yan Yi Li, Yan Sun, Boyu Wang, Pingzhao Hu
机构
*
Department of Computer Science, Western University, London, Canada(加拿大伦敦西方大学计算机科学系)
;
Department of Biochemistry, Western University, London, Canada(加拿大伦敦西方大学生物化学系)
机构
*
Harbin Institute of Technology, Shenzhen, China.(哈尔滨工业大学(深圳))
;
Peng Cheng Laboratory, China.(鹏城实验室)
;
Huazhong University of Science and Technology, China(华中科技大学)
专题命中
VLM训练与架构
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG
Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters
探究跨模态技能注入:场景、方法与超参数
Zhiyu Xu, Lean Wang, Yuanxin Liu, Lei Li, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun
机构
*
State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学)
;
WeChat AI, Tencent Inc., China(腾讯公司,中国)
;
The University of Hong Kong(香港大学)