Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement
交错思维中的模态隔离桥接:通过逐步强化监督模态转换
Tingyu Li, Le Zhou, Siyuan Li, Yujun Wu, Xinglong Xu, Jingxuan Wei, Conghui He, Cheng Tan
机构
*
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shanghai Jiaotong University(上海交通大学)
;
Zhejiang University(浙江大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
LEMUR 2: Unlocking Neural Network Diversity for AI
LEMUR 2:释放人工智能的神经网络多样性
Tolgay Atinc Uzun, Waleed Khalid, Saif U Din, Sai Revanth Mulukuledu, Akashdeep Singh, Chandini Vysyaraju, Raghuvir Duvvuri, Avi Goyal, Yashkumar Rajeshbhai Lukhi, Muhammad A. Hussain, Krunal Jesani, Usha Shrestha, Yash Mittal, Roman Kochnev, Pritam Kadam, Mohsin Ikram, Harsh R. Moradiya, Alice Arslanian, Dmitry Ignatov, Radu Timofte
Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality
跨模态掩码组合概念建模以增强视觉-语言组合性
Wei Li, Zhen Huang, Xinmei Tian
机构
*
MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部脑启发智能感知与认知重点实验室)
;
Independent Researcher(独立研究员)
机构
*
Shanghai Key Lab of Intelligent Information Processing, Fudan University(复旦大学上海智能信息处理重点实验室)
;
School of Computer Science, Fudan University(复旦大学计算机科学技术学院)
;
Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)
;
Youtu Lab, Tencent(腾讯优图实验室)
;
Meta AI
;
Shanghai AI Laboratory(上海人工智能实验室)
M*: A Modular, Extensible, Serving System for Multimodal Models
M*: 一个模块化、可扩展的多模态模型服务系统
Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang
机构
*
Stanford University(斯坦福大学)
;
University of Washington(华盛顿大学)
;
Carnegie Mellon University(卡内基梅隆大学)
Where a New Concept Must Enter: Entry Point Gates Cross-Task Usability in Unified Multimodal Models
新概念必须进入之处:统一多模态模型中的入口门跨任务可用性
Zongyang Qiu, Yihan Wu, Kaixuan Fan, Bo Li, Hui Xiong
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Columbia University(哥伦比亚大学)
;
CUHK(香港中文大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences
顺序很重要:LVLMs作为图像序列时间推理的评判者
Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli, Joao Magalhaes
机构
*
University of Bologna(博洛尼亚大学)
;
NOVA School of Science and Technology(NOVA科技学院)
;
NOVA Laboratory for Computer Science and Informatics(NOVA计算机科学与信息实验室)
机构
*
Shandong University(山东大学)
;
City University of Hong Kong(香港城市大学)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
Shandong Jianzhu University(山东建筑大学)
机构
*
South China University of Technology(华南理工大学)
;
Westlake University(西湖大学)
;
Johns Hopkins University(约翰·霍普金斯大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Shenzhen Loop Area Institute(深圳河套学院)
机构
*
Dalian University of Technology(大连理工大学)
;
University of Electronic Science and Technology of China(电子科技大学)
;
Zhejiang University(浙江大学)
;
WeChat, Tencent Inc.(腾讯微信)