Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference
Kuo Wang, Quanlong Zheng, Junlin Xie, Yanhao Zhang, Jinguo Luo, Haonan Lu, Liang Lin, Fan Zhou, Guanbin Li
机构
*
Sun Yat-sen University(中山大学)
;
Peng Cheng Laboratory(鹏城实验室)
;
OPPO AI Center(OPPO人工智能中心)
;
Research Institute(研究 institute)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Shenzhen Key Laboratory of Digital Living Network and Content Service(深圳数字生活网络与内容服务重点实验室)
;
Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
KeyMPs: One-Shot Vision-Language Guided Motion Generation by Sequencing DMPs for Occlusion-Rich Tasks
Edgar Anarossi, Yuhwan Kwon, Hirotaka Tahara, Shohei Tanaka, Keisuke Shirai, Masashi Hamaya, Cristian C. Beltran-Hernandez, Atsushi Hashimoto, Takamitsu Matsubara
机构
*
Division of Information Science, Graduate School of Science and Technology, Nara Institute of Science and Technology(信息科学系,科学技术研究生学校,科学技术研究所)
;
Department of Electrical and Electronic Engineering, Faculty of Engineering Science, Kansai University(电气电子工程系,工学科学大学)
;
Department of Electronics, Kobe City College of Technology(电子系,神户市立技术学院)
;
OMRON SINIC X Corporation(OMRON SINIC X公司)