arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2409.06656 2025-07-22 eess.AS cs.CL cs.LG cs.SD 57%

Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems

Taejin Park, Ivan Medennikov, Kunal Dhawan, Weiqing Wang, He Huang, Nithin Rao Koluguri, Krishna C. Puvvada, Jagadeesh Balam, Boris Ginsburg

机构 * nvidia

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

Comments Published at ICML 2025

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13609 2025-07-21 cs.CV cs.CL 57%

CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks

Yanan Wang, Julio Vizcarra, Zhi Li, Hao Niu, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究公司)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10432 2025-07-17 cs.CV 57%

Text-Visual Semantic Constrained AI-Generated Image Quality Assessment

Qiang Li, Qingsen Yan, Haojian Huang, Peng Wu, Haokui Zhang, Yanning Zhang

机构 * Northwestern Polytechnical University(西北工业大学) The University of Hong Kong(香港大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments 9 pages, 5 figures, Accepted at ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01069 2025-07-15 cs.CV 57%

UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment

Hantao Zhou, Longxiang Tang, Rui Yang, Guanyi Qin, Yan Zhang, Yutao Li, Xiu Li, Runze Hu, Guangtao Zhai

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Media Analytics and Computing Lab, Department of Artificial Intelligence, School of Informatics, Xiamen University(媒体分析与计算实验室,人工智能系,厦门大学) School of Computer Science and Technology, Ocean University of China(计算机科学与技术学院,中国海洋大学) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(图像通信与信息处理研究所,上海交通大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09615 2025-07-15 cs.CV 57%

Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score

Eman Ali, Sathira Silva, Chetan Arora, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学) IIT Delhi(德里印度理工学院) Alexandria University(亚历山大大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08590 2025-07-14 cs.MM cs.CV 57%

Visual Semantic Description Generation with MLLMs for Image-Text Matching

Junyu Chen, Yihua Gao, Mingyong Li

机构 * Chongqing Normal University(重庆师范大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ICME2025 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07104 2025-07-14 cs.CV 57%

Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models

Tiezheng Zhang, Yitong Li, Yu-cheng Chou, Jieneng Chen, Alan Yuille, Chen Wei, Junfei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Tsinghua University(清华大学) Rice University(Rice 大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Project Page: https://lambert-x.github.io/Vision-Language-Vision/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06679 2025-07-10 cs.CV 57%

Text-promptable Object Counting via Quantity Awareness Enhancement

Miaojing Shi, Xiaowen Zhang, Zijie Yue, Yong Luo, Cairong Zhao, Li Li

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息学院) College of Computer Science, Wuhan University(武汉大学计算机学院) College of Computer Science, Tongji University(同济大学计算机学院) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20214 2025-07-09 cs.CV cs.MM 57%

UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation

Yanzhe Chen, Huasong Zhong, Yan Li, Zhenheng Yang

机构 * ByteDance(字节跳动)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04976 2025-07-08 cs.CV cs.CL 57%

Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models

Eunseop Yoon, Hee Suk Yoon, Mark A. Hasegawa-Johnson, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) University of Illinois at Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04664 2025-07-08 cs.CV 57%

VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs

Tao Zhang, Shiqing Wei, Shihao Chen, Wenling Yu, Muying Luo, Shunping Ji

机构 * School of Remote Sensing and Information Engineering(遥感与信息工程学院) College of Oceanography and Space Informatics(海洋学与空间信息学院) School of Surveying and Geoinformation Engineering(测绘与地理信息工程学院)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04635 2025-07-08 cs.CV 57%

MODA: MOdular Duplex Attention for Multimodal Perception, Cognition, and Emotion Understanding

Zhicheng Zhang, Wuyou Xia, Chenxi Zhao, Zhou Yan, Xiaoqiang Liu, Yongjie Zhu, Wenyu Qin, Pengfei Wan, Di Zhang, Jufeng Yang

机构 * VCIP \& TMCC \& DISSec, College of Computer Science, Nankai University Pengcheng Laboratory

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments ICML 2025 (Spotlight, Top 2.6%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04000 2025-07-08 cs.IR cs.AI 57%

Leveraging Multimodal Data and Side Users for Diffusion Cross-Domain Recommendation

Fan Zhang, Jinpeng Chen, Huan Li, Senzhang Wang, Yuan Cao, Kaimin Wei, JianXiang He, Feifei Kou, Jinqing Wang

机构 * School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(北京邮电大学计算机学院(国家级试点软件工程学院)) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Central South University(中南大学) National University of Singapore(新加坡国立大学) Jinan University(暨南大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03434 2025-07-08 cs.CV cs.MM 57%

Unlearning the Noisy Correspondence Makes CLIP More Robust

Haochen Han, Alex Jinpeng Wang, Peijun Ye, Fangming Liu

机构 * Peng Cheng Laboratory(鹏城实验室) Central South University(中南大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01938 2025-07-03 cs.CV 57%

CI-VID: A Coherent Interleaved Text-Video Dataset

Yiming Ju, Jijin Hu, Zhengxiong Luo, Haoge Deng, hanyu Zhao, Li Du, Chengwei Wu, Donglin Hao, Xinlong Wang, Tengfei Pan

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01492 2025-07-03 cs.CV 57%

AVC-DPO: Aligned Video Captioning via Direct Preference Optimization

Jiyang Tang, Hengyi Li, Yifan Du, Wayne Xin Zhao

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) College of Artificial Intelligence, Nankai University(南开大学人工智能学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01409 2025-07-03 cs.CV 57%

CaptionSmiths: Flexibly Controlling Language Pattern in Image Captioning

Kuniaki Saito, Donghyun Kim, Kwanyong Park, Atsushi Hashimoto, Yoshitaka Ushiku

机构 * University of Seoul(首尔大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted to ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01255 2025-07-03 cs.CV 57%

AIGVE-MACS: Unified Multi-Aspect Commenting and Scoring Model for AI-Generated Video Evaluation

Xiao Liu, Jiawei Zhang

机构 * IFM Lab, University of California, Davis(信息与媒体实验室,加州大学戴维斯分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Working in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22663 2025-07-02 cs.CV 57%

Training Free Stylized Abstraction

Aimon Rahman, Kartik Narayan, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Project Page: https://kartik-3004.github.io/TF-SA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05288 2025-07-02 cs.CV cs.CL 57%

Seeking and Updating with Live Visual Knowledge

Mingyang Fu, Yuyang Peng, Dongping Chen, Zetong Zhou, Benlin Liu, Yao Wan, Zhou Zhao, Philip S. Yu, Ranjay Krishna

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11346 2025-07-01 cs.CV 57%

Seedream 3.0 Technical Report

Yu Gao, Lixue Gong, Qiushan Guo, Xiaoxia Hou, Zhichao Lai, Fanshi Li, Liang Li, Xiaochen Lian, Chao Liao, Liyang Liu, Wei Liu, Yichun Shi, Shiqi Sun, Yu Tian, Zhi Tian, Peng Wang, Rui Wang, Xuanda Wang, Xun Wang, Ye Wang, Guofeng Wu, Jie Wu, Xin Xia, Xuefeng Xiao, Zhonghua Zhai, Xinyu Zhang, Qi Zhang, Yuwei Zhang, Shijia Zhao, Jianchao Yang, Weilin Huang

机构 * ByteDance(字节跳动)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Seedream 3.0 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21895 2025-06-30 cs.CV 57%

Exploring Task-Solving Paradigm for Generalized Cross-Domain Face Anti-Spoofing via Reinforcement Fine-Tuning

Fangling Jiang, Qi Li, Weining Wang, Gang Wang, Bing Liu, Zhenan Sun

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21272 2025-06-30 cs.GR cs.CV cs.MM 57%

FairyGen: Storied Cartoon Video from a Single Child-Drawn Character

Jiayi Zheng, Xiaodong Cun

机构 * GVC Lab, Great Bay University(Great Bay大学GVC实验室)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments Project Page: https://jayleejia.github.io/FairyGen/ ; Code: https://github.com/GVCLab/FairyGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21393 2025-06-27 cs.AI 57%

TableMoE: Neuro-Symbolic Routing for Structured Expert Reasoning in Multimodal Table Understanding

Junwen Zhang, Pu Chen, Yin Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

Comments 43 pages and 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21276 2025-06-27 cs.CV 57%

WordCon: Word-level Typography Control in Scene Text Rendering

Wenda Shi, Yiren Song, Zihan Rao, Dengming Zhang, Jiaming Liu, Xingxing Zou

机构 * The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05090 2025-06-27 cs.LG stat.ML 57%

HyperINF: Unleashing the HyperPower of the Schulz's Method for Data Influence Estimation

Xinyu Zhou, Simin Fan, Martin Jaggi

机构 * Machine Learning and Optimization Lab, EPFL(机器学习与优化实验室,EPFL)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20449 2025-06-26 cs.CV 57%

Med-Art: Diffusion Transformer for 2D Medical Text-to-Image Generation

Changlu Guo, Anders Nymark Christensen, Morten Rieger Hannemose

机构 * Department of Applied Mathematics and Computer Science(应用数学与计算机科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments The project is available at \url{https://medart-ai.github.io}

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10044 2025-06-25 cs.CV 57%

Aligning Anime Video Generation with Human Feedback

Bingwen Zhu, Yudong Jiang, Baohan Xu, Siqian Yang, Mingyu Yin, Yidi Wu, Huyang Sun, Zuxuan Wu

机构 * Fudan University(复旦大学) Bilibili Inc(哔哩哔哩公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 10 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14136 2025-06-18 cs.CV 57%

Interpreting Biomedical VLMs on High-Imbalance Out-of-Distributions: An Insight into BiomedCLIP on Radiology

Nafiz Sadman, Farhana Zulkernine, Benjamin Kwan

机构 * School of Computing(计算学院) Department of Diagnostic Radiology(诊断放射科) Queen's University(皇后大学) Kingston Health Sciences Centre(金斯顿健康科学中心)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

Comments GitHub: https://github.com/Nafiz95/BioVLM_Eval_CXR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00513 2025-06-17 cs.CV 57%

Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning

Hanxun Yu, Wentong Li, Song Wang, Junbo Chen, Jianke Zhu

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

Comments CVPR2025, Code Link: https://github.com/hanxunyu/Inst3D-LMM

详情

展开后加载摘要…

URL PDF HTML 收藏