Multi-Modal Semantic Parsing for the Interpretation of Tombstone Inscriptions
机构 * University of Groningen(格罗宁根大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
Comments ACMMM 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * University of Groningen(格罗宁根大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
Comments ACMMM 2025
机构 * Amazon AGI(亚马逊人工智能研究院) ; University of Trento(特伦托大学)
专题命中 文档图表理解 :grounding(abstract)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments The webpage is at https://dex-vla.github.io/. DexVLA is accepted by CoRL 2025
机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克洛科沃科学与技术研究所)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision language model(abstract)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
机构 * OPPO AI Center(OPPO人工智能中心) ; Tsinghua University(清华大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
Comments Accepted to ICCV 2025
机构 * IIIT Hyderabad
专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI
机构 * Center for Advanced Intelligence Project, RIKEN(先进智能项目中心,日本理化学研究所) ; Southeast University(东南大学) ; The University of Tokyo(东京大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)
Comments 39 pages, 4 figures, 33 tables; Accepted for publication at the Eighth AAAI/ACM Conference on AI, Ethics and Society (AIES 2025) (https://www.aies-conference.com/2025/)
专题命中 幻觉与鲁棒性 :vision language model(abstract);LLaVA(abstract);分类 cs.AI、cs.LG
Comments Paper accepted at ACM Transactions on Embedded Computing Systems
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Tsinghua University(清华大学) ; Hillbot
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments 43 pages, 31 figures, 13 tables
机构 * Beihang University(北航大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV
Comments 9 pages, 3 figures, 2 tables. Accepted at CV4A11y, ICCV 2025
专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV
机构 * Inner Mongolia University of Science & Technology(内蒙古科技大学) ; Federal University of Rio de Janeiro(里约热内卢联邦大学)
专题命中 幻觉与鲁棒性 :LLaVA(abstract);分类 cs.CV
机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-厄林根-纽伦堡大学) ; Ingolstadt University of Applied Sciences(因戈尔施塔特应用科学大学) ; Flensburg University of Applied Sciences(弗拉森堡应用科学大学) ; Julius-Maximilians-Universität Würzburg(朱利叶斯-马克斯-魏扎克大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract)
机构 * Southeast University(东南大学) ; Xi'an Jiaotong University(西安交通大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Comments Accepted by ACM MM 2025. First PTQ solution for Multimodal large language models applicable to 5 mainstream MLLMs
机构 * University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Comments Accepted to ICCV 2025
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI
Comments 28 pages, 6 figures, under review
机构 * CASIA(中国科学院自动化研究所) ; UCAS(中国科学院大学) ; CAIR, HKISI, CAS(中国科学院自动化研究所) ; Beihang University(北京航空航天大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG
机构 * Zhejiang University(浙江大学) ; Tencent(腾讯) ; Shenzhen University(深圳大学) ; Hefei University of Technology(合肥工业大学)
专题命中 其他VLM :multimodal large language model(title);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted at ACM MM 2025 Dataset Track
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICCV 2025. Project page: https://donaldssh.github.io/LoRA.rar
机构 * LIVIA ; ILLS ; Department of Systems Engineering, ÉTS Montreal(系统工程系,蒙特利尔ÉTS) ; ÉTS Montreal(蒙特利尔ÉTS)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
Comments ICCV2025
机构 * Zhipu AI(智谱AI) ; Tsinghua University(清华大学)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV