On VLMs for Diverse Tasks in Multimodal Meme Classification
Deepesh Gavit, Debajyoti Mazumder, Samiran Das, Jasabanta Patro
机构
*
Peng Wang and Shuai Bai and Sinan Tan and Shijie Wang and Zhihao Fan and Jinze Bai and Keqin Chen and Xuejing Liu and Jialin Wang and Wenbin Ge and Yang Fan and Kai Dang and Mengfei Du and Xuancheng Ren and Rui Men and Dayiheng Liu and Chang Zhou and Jingren Zhou and Junyang Lin(研究人员)
SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion
Ahmed Nassar, Andres Marafioti, Matteo Omenetti, Maksym Lysak, Nikolaos Livathinos, Christoph Auer, Lucas Morin, Rafael Teixeira de Lima, Yusik Kim, A. Said Gurbuz, Michele Dolfi, Miquel Farré, Peter W. J. Staar
Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment
回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉
Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang
机构
*
Xidian University(西安电子科技大学)
;
Tsinghua University(清华大学)
;
Shanghai Road Transport Development Center(上海市道路运输发展中心)
;
Hunan Institute of Advanced Technology(湖南先进技术研究院)
Intersectional Fairness in Vision-Language Models for Medical Image Disease Classification
视觉-语言模型在医学影像疾病分类中的交叉公平性
Yupeng Zhang, Adam G. Dunn, Usman Naseem, Jinman Kim
机构
*
Biomedical Data Analysis and Visualisation (BDAV) Lab, School of Computer Science(生物医学数据分析与可视化实验室,计算机科学学院)
;
Sydney School of Public Health(悉尼公共卫生学院)
;
School of Computing(计算学院)