机构
*
Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
;
College of AI, Tsinghua University(清华大学人工智能学院)
;
Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)
;
School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院)
机构
*
School of Information Science and Technology, Beijing Foreign Studies University(信息科学与技术学院,北京外国语大学)
专题命中
视觉问答
:vision-language model(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments12 pages, 5 figures. Submitted to IEEE Transactions on Geoscience and Remote Sensing (TGRS). Code and dataset are available at https://github.com/hanlinwu/DeltaVLM
Human-centered Interactive Learning via MLLMs for Text-to-Image Person Re-identification
Yang Qin, Chao Chen, Zhihang Fu, Dezhong Peng, Xi Peng, Peng Hu
机构
*
College of Computer Science, Sichuan University(四川大学计算机学院)
;
National Key Laboratory of Fundamental Algorithms and Models for Engineering Simulation, Sichuan University(四川大学国家工程仿真基础算法与模型重点实验室)
;
Sichuan National Innovation New Vision UHD Video Technology Co., Ltd(四川国家创新新视觉超高清视频技术有限公司)
;
Tianfu Jincheng Laboratory(天府锦城实验室)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.LG
AstroLLaVA: towards the unification of astronomical data and natural language
Sharaf Zaman, Michael J. Smith, Pranav Khetarpal, Rishabh Chakrabarty, Michele Ginolfi, Marc Huertas-Company, Maja Jabłońska, Sandor Kruk, Matthieu Le Lain, Sergio José Rodríguez Méndez, Dimitrios Tanoglidis
机构
*
UniverseTBD
;
Indian Institute of Technology Delhi(印度理工学院德里分校)
;
Intelligent Internet Inc.(Intelligent Internet公司)
;
University of Florence(佛罗伦萨大学)
;
Instituto de Astrofísica de Canarias (IAC)(加那利群岛天体物理学研究所)
;
Observatoire de Paris(巴黎天文台)
;
PSL University(巴黎文理研究大学)
;
Université Paris-Cité(巴黎城市大学)
;
ANU RSAA(澳大利亚国立大学天体物理学与天体生物学研究学院)
;
European Space Agency(欧洲空间局)
;
IRISA(IRISA研究所)
;
Université Bretagne Sud(南布列塔尼大学)
;
ANU School of Computing(澳大利亚国立大学计算机学院)
专题命中
视觉问答
:vision language model(abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.LG
机构
*
Shenzhen University(深圳大学)
;
Tsinghua University(清华大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
City University of Hong Kong(香港城市大学)
;
Sun Yat-sen University(中山大学)
专题命中
视觉问答
:LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Seeing and Reasoning with Confidence: Supercharging Multimodal LLMs with an Uncertainty-Aware Agentic Framework
Zhuo Zhi, Chen Feng, Adam Daneshmend, Mine Orlu, Andreas Demosthenous, Lu Yin, Da Li, Ziquan Liu, Miguel R. D. Rodrigues
机构
*
University College London(伦敦大学学院)
;
National Health Service(英国国家医疗服务体系)
;
University of Surrey(萨里大学)
;
Samsung AI Centre(三星人工智能中心)
;
Queen Mary University of London(伦敦玛丽女王大学)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Wuhan AI Research(武汉人工智能研究院)
专题命中
视觉问答
:LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV