Decoupling Endpoint and Semantic Transition Learning for Zero-Shot Composed Image Retrieval
解耦端点与语义转换学习以实现零样本复合图像检索
Mingyu Liu, Sihan Huang, Yijia Fan, Yinlin Yan, Quan Zhang, Jian-Fang Hu, Jianhuang Lai
机构
*
Sun Yat-sen University(中山大学)
;
Guangdong Province Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室)
;
Key Laboratory of Machine Intelligence and Advanced Computing(机器智能与先进计算重点实验室)
SHED: Style-Homogenized Embedding Alignment for Domain Generalization
SHED: 风格均质化嵌入对齐用于领域泛化
Kai Gan, Tong Wei
机构
*
School of Computer Science and Engineering, Southeast University, Nanjing 210096, China(1 东南大学计算机科学与工程学院,南京 210096,中国)
;
Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China(2 教育部计算机网络与信息集成重点实验室(东南大学),中国)
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
多模态语言模型需要多少视觉标记?通过F^3A进行视觉标记剪枝的扩展
YiJie Huang, Yiqun Zhang, Zhuoyue Jia, Xiaocui Yang, Junzhao Huang, Zihan Wang, Shi Feng, Daling Wang, Yifei Zhang, Yongkang Liu
机构
*
School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院,沈阳 110819,中国)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
School of Computer and Communication Engineering, Northeastern University, Qinhuangdao 066004, China(东北大学计算机与通信工程学院,秦皇岛 066004,中国)
机构
*
Bake AI
;
University of Washington(华盛顿大学)
;
University of California, Santa Barbara(加州大学圣巴巴拉分校)
;
Stanford University(斯坦福大学)
;
University of Notre Dame(诺丁汉大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
;
Western Washington University(西雅图华盛顿大学)
;
King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科技城)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室)
;
Tsinghua University(清华大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
Fudan University(复旦大学)
Structured Role-Aware Policy Optimization for Multimodal Reasoning
结构化角色感知策略优化用于多模态推理
Bingqing Jiang, Difan Zou
机构
*
School of Computing & Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)
;
School of Computing & Data Science and Institute of Data Science, The University of Hong Kong(计算与数据科学学院和数据科学研究所,香港大学)
机构
*
School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院)
;
School of Artificial Intelligence, Tianjin University(天津大学人工智能学院)
机构
*
Shanghai University of Engineering Science(上海工程技术大学)
;
Tencent YouTu Lab(腾讯优图实验室)
;
Clinical Research Unit, Zhongshan Hospital of Fudan University(复旦大学中山医院临床研究部)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.CV、cs.AI
DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation
DepthPilot:从可控性到可解释性在结肠镜视频生成中
Junhu Fu, Ke Chen, Weidong Guo, Shuyu Liang, Jie Xu, Chen Ma, Kehao Wang, Shengli Lin, Zeju Li, Yuanyuan Wang, Yi Guo, Shuo Li
机构
*
College of Biomedical Engineering, Fudan University, Shanghai 200433, China(复旦大学生物医学工程学院)
;
Key Laboratory of Medical Imaging Computing and Computer Assisted Intervention of Shanghai, Shanghai 200032, China(上海医学影像计算与计算机辅助干预重点实验室)
;
Endoscopy Research Institute, Zhongshan Hospital, Fudan University, Shanghai 200032, China(复旦大学中山医院内窥镜研究所)
;
Shanghai Collaborative Innovation Center of Endoscopy, Shanghai 200032, China(上海内窥镜协同创新中心)
;
Department of Biomedical Engineering, Case Western Reserve University, Cleveland, OH 44106, USA(凯斯西储大学生物医学工程系)
;
Department of Computer and Data Science, Case Western Reserve University, Cleveland, OH 44106, USA(凯斯西储大学计算机与数据科学系)
ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers
ViTaPEs: 视觉触觉位置编码用于多模态转换器中的跨模态对齐
Fotios Lygerakis, Ozan Özdenizci, Elmar Rückert
机构
*
Chair of Cyber-Physical Systems(感知系统教授席位)
;
Institute of Machine Learning and Neural Computation(机器学习与神经计算研究所)
;
Technical University of Leoben(莱比锡技术大学)
;
Graz University of Technology(格拉茨技术大学)