Remodeling Semantic Relationships in Vision-Language Fine-Tuning
Xiangyang Wu, Liu Liu, Baosheng Yu, Jiayan Qiu, Zhenwei Shi
机构
*
Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
;
School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
;
Nanyang Technological University(南洋理工大学)
;
University of Leicester(莱斯特大学)
;
School of Astronautics, Beihang University(北京航空航天大学航天学院)
专题命中
图文多模态
:multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
A Comprehensive Survey on Multi-modal Conversational Emotion Recognition with Deep Learning
Yuntao Shou, Tao Meng, Wei Ai, Fangze Fu, Nan Yin, Keqin Li
机构
*
Central South University of Forestry and Technology(中部林业科技大学)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
State University of New York(纽约州立大学)
Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
Xiangyi Wei, Haotian Zhang, Xinyi Cao, Siyu Xie, Weifeng Ge, Yang Li, Changbo Wang
机构
*
School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院)
;
School of Data Science and Engineering, East China Normal University(东华师范大学数据科学与工程学院)
;
School of Software Engineering, East China Normal University(东华师范大学软件工程学院)
;
School of Computer Science, Fudan University(复旦大学计算机科学学院)
CommentsThis paper is being withdrawn because we have identified a significant error in the implementation of our self-supervised clustering approach. Specifically, our feature aggregation step inadvertently leaked temporal information across frames, which violates the core assumption of our training-free method. We sincerely apologize to the research community
VADB: A Large-Scale Video Aesthetic Database with Professional and Multi-Dimensional Annotations
Qianqian Qiao, DanDan Zheng, Yihang Bo, Bao Peng, Heng Huang, Longteng Jiang, Huaye Wang, Jingdong Chen, Jun Zhou, Xin Jin
机构
*
Nanjing University(南京大学)
;
Huazhong University of Science and Technology(华中科技大学)
;
Beijing Film Academy(北京电影学院)
;
University of Science and Technology of China(中国科学技术大学)
;
Beijing Electronic Science and Technology Institute(北京电子科技学院)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)
PepTriX: A Framework for Explainable Peptide Analysis through Protein Language Models
Vincent Schilling, Akshat Dubey, Georges Hattab
机构
*
Center for Artificial Intelligence in Public Health Research (ZKI-PH), Robert Koch Institute(人工智能与公共健康研究所以及罗伯特·科赫研究所)
;
Department of Mathematics and Computer Science, Free University of Berlin(数学与计算机科学系,柏林自由大学)
Abn-BLIP: Abnormality-aligned Bootstrapping Language-Image Pre-training for Pulmonary Embolism Diagnosis and Report Generation from CTPA
Zhusi Zhong, Yuli Wang, Lulu Bi, Zhuoqi Ma, Sun Ho Ahn, Christopher J. Mullin, Colin F. Greineder, Michael K. Atalay, Scott Collins, Grayson L. Baird, Cheng Ting Lin, Webster Stayman, Todd M. Kolb, Ihab Kamel, Harrison X. Bai, Zhicheng Jiao
机构
*
Department of Diagnostic Imaging, Brown University Health(布朗大学健康中心诊断影像科)
;
Warren Alpert Medical School of Brown University(布朗大学沃伦·阿尔珀特医学院)
;
Department of Biomedical Engineering, Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院生物医学工程系)
;
Department of Radiology and Radiological Sciences, Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院放射科)
;
Johns Hopkins University Division of Pulmonary and Critical Care Medicine(约翰霍普金斯大学肺科与重症医学科)
;
Department of Radiology, University of Colorado School of Medicine(科罗拉多大学医学院放射科)
GEA: Generation-Enhanced Alignment for Text-to-Image Person Retrieval
Hao Zou, Runqing Zhang, Xue Zhou, Jianxiao Zou
机构
*
School of Automation Engineering, University of Electronic Science and Technology of China(自动化工程学院,电子科学与技术大学)
;
Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳高级研究学院,电子科学与技术大学)