CoTBox-TTT: Grounding Medical VQA with Visual Chain-of-Thought Boxes During Test-time Training
Jiahe Qian, Yuhao Shen, Zhangtianyi Chen, Juexiao Zhou, Peisong Wang
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港大学深圳研究院数据科学学院)
Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
Johannes Moll, Markus Graf, Tristan Lemke, Nicolas Lenhart, Daniel Truhn, Jean-Benoit Delbrouck, Jiazhen Pan, Daniel Rueckert, Lisa C. Adams, Keno K. Bressem
机构
*
Technical University of Munich (TUM)(慕尼黑技术大学)
;
TUM University Hospital(慕尼黑技术大学医院)
;
German Heart Center TUM University Hospital(慕尼黑技术大学医院德国心脏中心)
;
Department of Radiology(放射科)
;
Klinikum rechts der Isar TUM University Hospital(慕尼黑技术大学医院右岸诊所)
;
Uniklinik RWTH Aachen(亚琛工业大学医院)
;
HOPPR IL USA(HOPPR美国)
;
University of Oxford(牛津大学)
;
Imperial College London(伦敦帝国学院)
MOTOR: Multimodal Optimal Transport via Grounded Retrieval in Medical Visual Question Answering
Mai A. Shaaban, Tausifa Jan Saleem, Vijay Ram Papineni, Mohammad Yaqub
机构
*
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
Department of Mathematics and Computer Science, Faculty of Science, Alexandria University(亚历山大大学数学与计算机科学系)
;
Sheikh Shakhbout Medical City(谢赫·沙赫布OUT医疗城)
MEGC2025: Micro-Expression Grand Challenge on Spot Then Recognize and Visual Question Answering
Xinqi Fan, Jingting Li, John See, Moi Hoon Yap, Wen-Huang Cheng, Xiaobai Li, Xiaopeng Hong, Su-Jing Wang, Adrian K. Davision
机构
*
Department of Computing and Mathematics, Manchester Metropolitan University(计算与数学系,曼彻斯特 Metropolitan 大学)
;
State Key Laboratory of Cognitive Science and Mental Health, Institute of Psychology, Chinese Academy of Sciences(认知科学与心理健康国家重点实验室,心理学研究所,中国科学院)
;
Department of Psychology, University of the Chinese Academy of Sciences(心理学系,中国科学院大学)
;
National Taiwan University(台湾大学)
;
Zhejiang University(浙江大学)
;
University of Oulu(奥卢大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
专题命中
视觉问答
:visual question answering(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV
CommentsMicro-Expression Grand Challenge (MEGC) at ACM MM 2025
RSVLM-QA: A Benchmark Dataset for Remote Sensing Vision Language Model-based Question Answering
Xing Zi, Jinghao Xiao, Yunxiao Shi, Xian Tao, Jun Li, Ali Braytee, Mukesh Prasad
机构
*
School of Computer Science, University of Technology Sydney(技术悉尼大学计算机科学学院)
;
SEDE, University of Technology Sydney(技术悉尼大学SEDE)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中
视觉问答
:vision language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV
CommentsThis paper has been accepted to the proceedings of the 33rd ACM International Multimedia Conference (ACM Multimedia 2025)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
Zheng Liu, Hao Liang, Bozhou Li, Wentao Xiong, Chong Chen, Conghui He, Wentao Zhang, Bin Cui
机构
*
Peking University Beijing China
;
Huawei Technologies Ltd. Beijing China
;
Shanghai AI Laboratory Shanghai China
;
Peking University Center for Machine Learning Research Beijing China
;
Peking University School of Computer Science \& Key Lab of High Confidence Software Technologies (MOE) Beijing China
;
Peking University
;
Huawei Technologies Ltd.
;
Shanghai AI Laboratory
专题命中
视觉问答
:vision-language model(title,abstract);LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
Integrating Frequency-Domain Representations with Low-Rank Adaptation in Vision-Language Models
Md Azim Khan, Aryya Gangopadhyay, Jianwu Wang, Robert F. Erbacher
机构
*
University of Maryland Baltimore County (UMBC)(马里兰大学巴尔的摩县分校)
;
Center for Real-time Distributed Sensing and Autonomy (CARDS)(实时分布式感知与自主中心)
;
DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)
专题命中
视觉问答
:vision-language model(title);vision language model(abstract);VLM(abstract);visual question answering(abstract)
机构
*
School of computer science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)
;
South China Normal University(华南师范大学)
;
Northeastern University(东北大学)
;
Anhui University(安徽大学)
专题命中
视觉问答
:visual question answering(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV
机构
*
State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(北京邮电大学)
;
Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院)
;
School of Geographic Sciences, Hunan Normal University(湖南师范大学)
;
City University of Hong Kong(香港城市大学)
专题命中
视觉问答
:vision language model(title);vision-language model(abstract);VLM(abstract);visual question answering(abstract)