arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-08 至 2025-08-08 共收录 38 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 7 篇

2508.04963 2025-08-08 cs.IR cs.LG 79%

A Metric for MLLM Alignment in Large-scale Recommendation

Yubin Zhang, Yanhua Huang, Haiming Xu, Mingliang Qi, Chang Wang, Jiarui Jin, Xiangyuan Ren, Xiaodan Wang, Ruiwen Xu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract);分类 cs.LG

Comments Pre-print.Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17963 2025-08-08 cs.CV 74%

M$^{2}$Chat: Empowering VLM for Multimodal LLM Interleaved Text-Image Generation

Xiaowei Chi, Junbo Qi, Rongyu Zhang, Shanghang Zhang, Qifeng Liu, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Waseda University(早稻田大学) Peking University(北京大学)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18651 2025-08-08 cs.CV cs.CL cs.LG 73%

Verbalized Representation Learning for Interpretable Few-Shot Generalization

Cheng-Fu Yang, Da Yin, Wenbo Hu, Heng Ji, Nanyun Peng, Bolei Zhou, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04987 2025-08-08 cs.CV 70%

Unified modality separation: A vision-language framework for unsupervised domain adaptation

Xinyao Li, Jingjing Li, Zhekai Du, Lei Zhu, Heng Tao Shen

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Tongji University(同济大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted to TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03069 2025-08-08 cs.CV cs.AI 62%

TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation

Liao Qu, Huichao Zhang, Yiheng Liu, Xu Wang, Yi Jiang, Yiming Gao, Hu Ye, Daniel K. Du, Zehuan Yuan, Xinglong Wu

机构 * ByteDance(字节跳动)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI

Comments CVPR 2025; Code and models: https://github.com/ByteVisionLab/TokenFlow

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 3 篇

2508.05580 2025-08-08 cs.CV 85%

Follow-Your-Instruction: A Comprehensive MLLM Agent for World Data Synthesis

Kunyu Feng, Yue Ma, Xinhua Zhang, Boshi Liu, Yikuang Yuluo, Yinhan Zhang, Runtao Liu, Hongyu Liu, Zhiyuan Qin, Shanhui Mo, Qifeng Chen, Zeyu Wang

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Tsinghua Univerisity(清华大学) Peking University(北京大学) Chongqing University(重庆大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 其他VLM :MLLM(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04998 2025-08-08 cs.CV 57%

Attribute Guidance With Inherent Pseudo-label For Occluded Person Re-identification

Rui Zhi, Zhen Yang, Haiyang Zhang

机构 * Beijing University of Post and Telecommunication(北京邮电大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 8 pages, 2 supplement pages, 3 figures, ECAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04732 2025-08-08 cs.LG cs.GR 57%

LumiGen: An LVLM-Enhanced Iterative Framework for Fine-Grained Text-to-Image Generation

Xiaoqi Dong, Xiangyu Zhou, Nicholas Evans, Yujia Lin

机构 * Dali University(大理大学) Bandırma Onyedi Eylül University(班迪尔马第十七个九月大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏