Grounding Multilingual Multimodal LLMs With Cultural Knowledge
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉问答 :grounding(title);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉问答 :grounding(title);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract)
机构 * Department of Civil & Environmental Engineering University of Utah(土木与环境工程系 犹他大学) ; Zachry Department of Civil and Environmental Engineering Texas A&M University(扎克里系 土木与环境工程系 德克萨斯农工大学) ; Department of Computer Science & Engineering Texas A&M University(计算机科学与工程系 德克萨斯农工大学)
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI
Comments 24 pages, 6 tables, 7 figures
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
机构 * Peking University(北京大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) ; Northwestern Polytechnical University(西北工业大学) ; Southeast University(东南大学)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI
机构 * Johns Hopkins University(约翰霍普金斯大学) ; University of California San Diego(加州大学圣地亚哥分校) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Michigan(密歇根大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉推理 :vision language model(title,abstract);分类 cs.AI
Comments Published at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment (BiAlign)
机构 * CMU(卡内基梅隆大学) ; WUSTL(华盛顿大学) ; UIUC(伊利诺伊大学香槟分校)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :vision language model(abstract);分类 cs.LG
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
机构 * Language & AGI Lab(语言与人工智能实验室)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
Comments 7 pages, 2 figures
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
机构 * Movian AI ; Posts & Telecommunications Inst. of Tech(电信技术研究所)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted at ICCVW'25 - OpenSUN3D: 5th Workshop on Open-World 3D Scene Understanding with Foundation Models
机构 * West Virginia University(西弗吉尼亚大学) ; University of Aberdeen(阿伯丁大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
Comments 3rd Workshop in Data Engineering in Medical Imaging (DEMI), MICCAI-2025 Workshop
机构 * University of Science, VNU-HCM(越南胡志明市科学大学) ; University of Information Technology, VNU-HCM(越南胡志明市信息技术大学) ; Vietnam National University(越南国家大学) ; University of Dayton(戴维森大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
机构 * College of Computer Science and Technology, Zhejiang University, China(浙江大学计算机科学与技术学院) ; College of Software Technology, Zhejiang University, China(浙江大学软件学院) ; School of Geological Engineering and Geomatics, Chang’an University, China(长安大学地质工程与测绘学院) ; College of Biosystems Engineering and Food Science, Zhejiang University, China(浙江大学生物系统工程与食品科学学院) ; Faculty of Computer and Information Sciences, Hosei University, Japan(立命馆大学计算机与信息科学系)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
机构 * Monash University(墨尔本大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
Comments Accepted to ACM ICMI 2025 Demos
机构 * Fan Yang
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :grounding(abstract)
Comments 6 pages, 5 figures, IEEE VIS Workshop on Visualization Education, Literacy, and Activities 2025, Vienna
专题命中 视觉定位与Grounding :grounding(abstract)
Comments 37 pages (double column format), 18 figures, and 4 appendices. References updated and version improved; accepted for publication in PRD
Journal ref Phys. Rev. D 112, 043510 2025
机构 * Huazhong University of Science and Technology(华中科技大学) ; Alibaba Group(阿里巴巴集团)
专题命中 文档图表理解 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments ICCV 2025
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Code at https://github.com/SunzeY/SEAgent
机构 * Hong Kong JC STEM Lab of Smart City and Department of Computer Science, City University of Hong Kong(香港JC STEM实验室及城市大学计算机科学系)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG
Comments 14 pages, 10 figures
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) ; State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动性国家重点实验室) ; College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院) ; School of Statistics and Data Science, Southwestern University of Finance and Economics(西南财经大学统计与数据科学学院) ; Meituan, China(美团(中国))
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(title);visual language model(abstract);分类 cs.CV
机构 * Shenzhen University(深圳大学) ; University of Nottingham Ningbo China(诺丁汉大学宁波分校) ; City University of Hong Kong(香港城市大学) ; Stanford University(斯坦福大学) ; Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title);分类 cs.CV
Comments ICCV 2025, 38 pages, 22 figures, 35 tables
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract)
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) ; Gaoling School of Artificial Intelligence, Renmin University of China(人工智能学院,中国人民大学) ; Kuaishou Technology Inc.(快手科技有限公司) ; Shanghai Key Laboratory of Multi. Info. Processing, East China Normal University(多信息处理重点实验室,华东师范大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
机构 * Tel Aviv University(特拉维夫大学) ; Google Research(谷歌研究)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Accepted to NAACL 2025
Journal ref Proceedings of the 2025 Conference of the North American Chapter of the Association for Computational Linguistics, Human Language Technologies, Long Papers, pp. 10497-10518
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments 24pages, 5 figures
机构 * Indian Institute of Science(印度科学研究院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV