arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-19 至 2025-11-19 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 7 篇

2511.10701 2025-11-19 cs.CV cs.RO 79%

CARScenes: Semantic VLM Dataset for Safe Autonomous Driving

Yuankai He, Weisong Shi

机构 * st Yuankai He(第一作者) nd Weisong Shi(第二作者)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

Comments 8 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01293 2025-11-19 cs.CV cs.AI 79%

GMAT: Grounded Multi-Agent Clinical Description Generation for Text Encoder in Vision-Language MIL for Whole Slide Image Classification

Ngoc Bui Lam Quang, Nam Le Nguyen Binh, Thanh-Huy Nguyen, Le Thien Phuc Nguyen, Quan Nguyen, Ulas Bagci

机构 * AI VIETNAM(AI越南) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) PTIT Northwestern University(西北大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments Acccepted in MICCAI Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14760 2025-11-19 cs.CV 70%

UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning

Rui Tian, Mingfei Gao, Haiming Gang, Jiasen Lu, Zhe Gan, Yinfei Yang, Zuxuan Wu, Afshin Dehghan

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Apple(苹果公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23982 2025-11-19 cs.CV cs.RO 70%

StyleDrive: Towards Driving-Style Aware Benchmarking of End-To-End Autonomous Driving

Ruiyang Hao, Bowen Jing, Haibao Yu, Zaiqing Nie

机构 * AIR, Tsinghua University(空气动力学研究所,清华大学) King’s College London(伦敦国王学院) The University of Manchester(曼彻斯特大学) The University of Hong Kong(香港大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 25 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10683 2025-11-19 cs.RO cs.AI cs.CV 62%

MotIF: Motion Instruction Fine-tuning

Minyoung Hwang, Joey Hejna, Dorsa Sadigh, Yonatan Bisk

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14072 2025-11-19 cs.CV 57%

CORE: Compact Object-centric REpresentations as a New Paradigm for Token Merging in LVLMs

Jingyu Lei, Gaoang Wang, Der-Horng Lee

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14454 2025-11-19 cs.CV 57%

Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models

Xuyang Liu, Yiyu Wang, Junpeng Ma, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Fudan University(复旦大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏