RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning
RSICCLLM:用于遥感图像变化描述的多模态大语言模型
Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu
机构
*
State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国)
;
Great Bay University, Dongguan, China(东莞Great Bay大学,中国)
;
Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院,中国)
;
Dongguan Key Laboratory for Intelligence and Information Technology, Dongguan, China(东莞智能与信息科技重点实验室,中国)
机构
*
College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)
;
Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳理工大学计算机科学与人工智能学院)
;
School of Artificial Intelligence, Nanchang University(南昌大学人工智能学院)
机构
*
School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)
;
School of Computer Science and Technology, Tiangong University(天津工大学计算机科学与技术学院)
;
Key Research Center for Surface Monitoring and Analysis of Relics, State Administration of Cultural Heritage(文物表面监测与分析关键研究中心,国家文物局)
机构
*
New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Kling Team, Kuaishou Technology(快手科技 Kling 团队)
;
Peking University(北京大学)
;
Nanjing University(南京大学)
VisGym: Diverse, Customizable, Scalable Environments for Multimodal Agents
VisGym: 多模态代理的多样化、可定制化、可扩展环境
Zirui Wang, Junyi Zhang, Jiaxin Ge, Long Lian, Letian Fu, Lisa Dunlap, Ken Goldberg, XuDong Wang, Ion Stoica, David M. Chan, Sewon Min, Joseph E. Gonzalez
Scaling Down to Scale Up: Towards Operationally-Efficient and Deployable Clinical Models via Cross-Modal Low-Rank Adaptation for Medical Vision-Language Models
缩小规模以扩大规模:通过跨模态低秩适应实现操作高效且可部署的临床模型
Thuraya Alzubaidi, Farhad R. Nezami, Muzammil Behzad
机构
*
King Fahd University of Petroleum(国王法赫德石油与矿物大学)
;
Institute for Medical Engineering(医学工程研究所)
;
Science, Massachusetts Institute of Technology, US(科学,麻省理工学院,美国)
;
Harvard Medical School, Harvard University, US(哈佛医学院,哈佛大学,美国)
;
SDAIA-KFUPM Joint Research Center for Artificial Intelligence, Saudi Arabia(SDAIA-KFUPM人工智能联合研究中心,沙特阿拉伯)
Bridging Visual Affective Gap: Borrowing Textual Knowledge by Learning from Noisy Image-Text Pairs
弥合视觉情感差距:通过学习噪声图像-文本对借用文本知识
Daiqing Wu, Dongbao Yang, Yu Zhou, Can Ma
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
TMCC, College of Computer Science, Nankai University(TMCC,南开大学计算机学院)
A multi-modal vision-language model for generalizable annotation-free pathology localization
Hao Yang, Hong-Yu Zhou, Jiarun Liu, Weijian Huang, Cheng Li, Zhihuan Li, Yuanxu Gao, Qiegen Liu, Yong Liang, Qi Yang, Song Wu, Tao Tan, Hairong Zheng, Kang Zhang, Shanshan Wang
机构
*
Paul C. Lauterbur Research Center for Biomedical Imaging(生物医学成像研究中心)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
;
Pengcheng Laboratory(鹏城实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Chinese Medicine Guangdong Laboratory(广东中医药实验室)
;
Beijing Chaoyang Hospital, Capital Medical University(首都医科大学北京朝阳医院)
T2ICount: Enhancing Cross-modal Understanding for Zero-Shot Counting
Yifei Qian, Zhongliang Guo, Bowen Deng, Chun Tong Lei, Shuai Zhao, Chun Pong Lau, Xiaopeng Hong, Michael P. Pound
机构
*
University of Nottingham(诺丁汉大学)
;
University of St Andrews(圣安德鲁大学)
;
City University of Hong Kong(香港城市大学)
;
Nanyang Technology University(南洋理工大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
Pedro R. A. S. Bassi, Mehmet Can Yavuz, Kang Wang, Xiaoxi Chen, Wenxuan Li, Sergio Decherchi, Andrea Cavalli, Yang Yang, Alan Yuille, Zongwei Zhou
机构
*
Johns Hopkins University(约翰霍普金斯大学)
;
University of Bologna(博洛尼亚大学)
;
Italian Institute of Technology(意大利理工学院)
;
University of California, San Francisco(加州大学旧金山分校)
;
Istanbul Medipol University(伊斯坦布尔Medipol大学)
;
University of Zurich(苏黎世大学)
;
ETH AI Center(ETH人工智能中心)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)
Aligning Information Capacity Between Vision and Language via Dense-to-Sparse Feature Distillation for Image-Text Matching
Yang Liu, Wentao Feng, Zhuoyao Liu, Shudong Huang, Jiancheng Lv
机构
*
College of Computer Science, Sichuan University(四川大学计算机学院)
;
Engineering Research Center of Machine Learning and Industry Intelligence(机器学习与工业智能工程研究中心)