ByDeWay: Boost Your multimodal LLM with DEpth prompting in a Training-Free Way
机构 * Kalyani Government Engineering College(卡利尼政府工程学院) ; Intel Labs(英特尔实验室)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Kalyani Government Engineering College(卡利尼政府工程学院) ; Intel Labs(英特尔实验室)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
Comments EMNLP 2025
机构 * NC AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments 19 pages, 1 figure, 14 tables. Technical report for VARCO-VISION-2.0, a Korean-English bilingual VLM in 14B and 1.7B variants. Key features: multi-image understanding, OCR with text localization, improved Korean capabilities
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理实验室,计算机科学学院,复旦大学) ; The Chinese University of Hong Kong, Shatin, Hong Kong(香港中文大学,沙田,香港) ; The University of Hong Kong, Pokfulam, Hong Kong(香港大学,薄扶林,香港)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
Comments This work has been submitted to the IEEE for possible publication
机构 * University of Nevada Reno(内华达大学拉斯维加斯分校)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV