Hong Liu, Dong Wei, Qiong Peng, Yawen Huang, Xian Wu, Yefeng Zheng, Liansheng Wang
机构
*
School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院)
;
National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康医学数据科学研究院)
;
Jarvis Research Center, Tencent YouTu Lab, Shenzhen, China(腾讯YouTu实验室 Jarvis研究部)
;
Medical Artificial Intelligence Laboratory, Westlake University, Hangzhou, China(西湖大学医学人工智能实验室)
Wild-Drive: Off-Road Scene Captioning and Path Planning via Robust Multi-modal Routing and Efficient Large Language Model
Wild-Drive: 通过鲁棒多模态路由和高效大语言模型实现越野场景描述与路径规划
Zihang Wang, Xu Li, Benwu Wang, Wenkai Zhu, Xieyuanli Chen, Dong Kong, Kailin Lyu, Yinan Du, Yiming Peng, Haoyang Che
机构
*
School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院)
;
Southeast University Nanjing Jiangbei New Area Innovation Research Institute(东南大学南京江滨新区创新研究院)
;
National Key Laboratory of Equipment State Sensing and Smart Support, National University of Defense Technology(国防科技大学装备状态感知与智能支撑国家重点实验室)
;
School of Transportation, Shandong University of Science and Technology(山东科技大学交通学院)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
Learning Multi-Modal Prototypes for Cross-Domain Few-Shot Object Detection
跨域少样本目标检测中的多模态原型学习
Wanqi Wang, Jingcai Guo, Yuxiang Cai, Zhi Chen
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
Zhejiang University(浙江大学)
;
The University of Southern Queensland(昆士兰大学)
cadrille: Multi-modal CAD Reconstruction with Reinforcement Learning
cadrille: 多模态CAD重建与强化学习
Maksim Kolodiazhnyi, Denis Tarasov, Dmitrii Zhemchuzhnikov, Alexander Nikulin, Ilya Zisman, Anna Vorontsova, Anton Konushin, Vladislav Kurenkov, Danila Rukhovich
机构
*
Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学)
;
AXXX
;
ETH Zurich(苏黎世联邦理工学院)
;
Innopolis University(因诺波利斯大学)
;
Institute of Mechanics, Armenia(亚美尼亚力学研究所)
Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition
基于多模态大语言模型的零样本人-物交互检测
Shiyu Xuan, Dongkai Wang, Zechao Li, Jinhui Tang
机构
*
School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)
;
School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics(西南财经大学计算机与人工智能学院)
;
Nanjing Forestry University(南京林业大学)
CommentsThe authors request withdrawal of this article. This version was submitted in error. Compared to the intended final version, it contains inaccuracies and fails to accurately reflect the authors' work and conclusions
Looping Back to Move Forward: Recursive Transformers for Efficient and Flexible Large Multimodal Models
循环回溯以前进:递归变换器用于高效灵活的大型多模态模型
Ruihan Xu, Yuting Gao, Lan Wang, Jianing Li, Weihao Chen, Qingpei Guo, Ming Yang, Shiliang Zhang
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)
;
AntGroup(蚂蚁集团)
专题命中
图文多模态
:multimodal(title,abstract);分类 cs.AI
AI总结
RecursiveVLM通过递归细化机制提升多模态模型效率,实现参数复用和性能提升。
CommentsThis is a primary contribution in the Recursive Vision-Language Models