arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-16 至 2025-09-16 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 6 篇

2509.11961 2025-09-16 cs.CL 89%

Spec-LLaVA: Accelerating Vision-Language Models with Dynamic Tree-Based Speculative Decoding

Mingxiao Huo, Jiayi Zhang, Hewei Wang, Jinfeng Xu, Zheyu Chen, Huilin Tai, Yijun Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Nottingham(诺丁汉大学) The University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);VLM(abstract)

Comments 7pages, accepted by ICML TTODLer-FM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15688 2025-09-16 cs.CL cs.AI cs.LG 73%

Transformer-Based Multimodal Knowledge Graph Completion with Link-Aware Contexts

Haodi Ma, Dzmitry Kasinets, Daisy Zhe Wang

机构 * Department of Computer and Information Science and Engineering, University of Florida(计算机与信息科学与工程系,佛罗里达大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11071 2025-09-16 cs.CV cs.AI cs.CL 73%

The System Description of CPS Team for Track on Driving with Language of CVPR 2024 Autonomous Grand Challenge

Jinghan Peng, Jingwen Wang, Xing Yu, Dehui Du

机构 * East China Normal University(东华师范大学)

专题命中 VLM训练与架构 :vision language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11620 2025-09-16 cs.CL cs.CY 67%

AesBiasBench: Evaluating Bias and Alignment in Multimodal Language Models for Personalized Image Aesthetic Assessment

Kun Li, Lai-Man Po, Hongzheng Yang, Xuyuan Xu, Kangcheng Liu, Yuzhi Zhao

专题命中 VLM训练与架构 :InternVL(abstract);multimodal large language model(abstract)

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10765 2025-09-16 eess.IV 67%

Language-based Color ISP Tuning

Owen Mayer, Shohei Noguchi, Alexander Berestov, Jiro Takatori

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

Comments Accepted to Color and Imaging Conference (CIC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11766 2025-09-16 cs.RO 50%

Igniting VLMs toward the Embodied Space

Andy Zhai, Brae Liu, Bruno Fang, Chalse Cai, Ellie Ma, Ethan Yin, Hao Wang, Hugo Zhou, James Wang, Lights Shi, Lucy Liang, Make Wang, Qian Wang, Roy Gan, Ryan Yu, Shalfun Li, Starrick Liu, Sylas Chen, Vincent Chen, Zach Xu

机构 * X SQUARE ROBOT

专题命中 VLM训练与架构 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏