arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2501.06031 2025-10-15 cs.CV 57%

Generate, Transduct, Adapt: Iterative Transduction with VLMs

Oindrila Saha, Logan Lawrence, Grant Van Horn, Subhransu Maji

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Code is released at https://github.com/cvl-umass/GTA-CLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02575 2025-10-15 cs.CL cs.CR cs.LG 57%

Cross-Modal Safety Alignment: Is textual unlearning all you need?

Trishna Chakraborty, Erfan Shayegani, Zikui Cai, Nael Abu-Ghazaleh, M. Salman Asif, Yue Dong, Amit K. Roy-Chowdhury, Chengyu Song

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

Comments Accepted by EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10633 2025-10-14 cs.AI 57%

Collaborative Text-to-Image Generation via Multi-Agent Reinforcement Learning and Semantic Fusion

Jiabao Shi, Minfeng Qi, Lefeng Zhang, Di Wang, Yingjie Zhao, Ziying Li, Yalong Xing, Ningran Li

机构 * Minzu University of China(民族大学) City University of Macau(澳门城市大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心(济南国家超级计算机中心),齐鲁工业大学(山东省科学院)) The University of Adelaide(阿德莱德大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10022 2025-10-14 cs.CV 57%

Q-Adapter: Visual Query Adapter for Extracting Textually-related Features in Video Captioning

Junan Chen, Trung Thanh Nguyen, Takahiro Komamizu, Ichiro Ide

机构 * Nagoya University(名古屋大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments ACM Multimedia Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09822 2025-10-14 cs.CV cs.CL 57%

Task-Aware Resolution Optimization for Visual Large Language Models

Weiqing Luo, Zhen Tan, Yifan Li, Xinyu Zhao, Kwonjoon Lee, Behzad Dariush, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学) Michigan State University(密歇根州立大学) Honda Research Institute USA(本田美国研究院)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments Accepted as a main conference paper at EMNLP 2025. 9 pages (main content), 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12067 2025-10-14 cs.CV 57%

A Comprehensive Survey on Knowledge Distillation

Amir M. Mansourian, Rozhan Ahmadi, Masoud Ghafouri, Amir Mohammad Babaei, Elaheh Badali Golezani, Zeynab Yasamani Ghamchi, Vida Ramezanian, Alireza Taherian, Kimia Dinashi, Amirali Miri, Shohreh Kasaei

机构 * Sharif University of Technology(谢里夫科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Published at TMLR (102 pages, 10 figures, 17 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21334 2025-10-13 cs.CV 57%

HoliTom: Holistic Token Merging for Fast Video Large Language Models

Kele Shao, Keda Tao, Can Qin, Haoxuan You, Yang Sui, Huan Wang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Salesforce AI Research(Salesforce AI研究院) Columbia University(哥伦比亚大学) Rice University(Rice大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments code link: https://github.com/cokeshao/HoliTom

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18369 2025-10-13 cs.CV 57%

RePIC: Reinforced Post-Training for Personalizing Multi-Modal Language Models

Yeongtak Oh, Dohyun Chung, Juhyeon Shin, Sangha Park, Johan Barthelemy, Jisoo Mok, Sungroh Yoon

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16460 2025-10-10 cs.CL cs.AI 57%

T-VEC: A Telecom-Specific Vectorization Model with Enhanced Semantic Understanding via Deep Triplet Loss Fine-Tuning

Vignesh Ethiraj, Ashwath David, Sidhanth Menon, Divya Vijay, Vidhyakshaya Kannan

机构 * NetoAI

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06679 2025-10-09 cs.CV 57%

DreamOmni2: Multimodal Instruction-based Editing and Generation

Bin Xia, Bohao Peng, Yuechen Zhang, Junjia Huang, Jiyang Liu, Jingyao Li, Haoru Tan, Sitong Wu, Chengyao Wang, Yitong Wang, Xinglong Wu, Bei Yu, Jiaya Jia

机构 * CUHK(香港中文大学) HKUST(香港科技大学) HKU(香港大学) ByteDance Inc(字节跳动公司)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19252 2025-10-08 cs.CV 57%

Inference-Time Text-to-Video Alignment with Diffusion Latent Beam Search

Yuta Oshima, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

Comments Accepted to NeurIPS2025. Website: https://sites.google.com/view/t2v-dlbs and Code: https://github.com/shim0114/T2V-Diffusion-Search

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22229 2025-10-07 cs.CV 57%

A Tale of Two Experts: Cooperative Learning for Source-Free Unsupervised Domain Adaptation

Jiaping Yu, Muli Yang, Jiapeng Ji, Jiexi Yan, Cheng Deng

机构 * School of Electronic Engineering(电子工程学院) Xidian University(西安电子科技大学) School of Computer Science(计算机科学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03591 2025-10-07 cs.CV 57%

Resolving Task Objective Conflicts in Unified Model via Task-Aware Mixture-of-Experts

Jiaxing Zhang, Hao Tang

机构 * Sichuan University(四川大学) Peking University(北京大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02778 2025-10-06 cs.CV 57%

AdaRD-key: Adaptive Relevance-Diversity Keyframe Sampling for Long-form Video understanding

Xian Zhang, Zexi Wu, Zinuo Li, Hongming Xu, Luqi Gong, Farid Boussaid, Naoufel Werghi, Mohammed Bennamoun

机构 * The University of Western Australia(西澳大学) Dalian University of Technology(大连理工大学) Khalifa University(卡利夫大学) Zhejiang Lab(浙江实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00320 2025-10-03 cs.CV 57%

TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models

Hao Zhang, Mengsi Lyu, Chenrui He, Yulong Ao, Yonghua Lin

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01051 2025-10-03 cs.CV 57%

Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization

Tao Zhang, Cheng Da, Kun Ding, Huan Yang, Kun Jin, Yan Li, Tingting Gao, Di Zhang, Shiming Xiang, Chunhong Pan

机构 * MAIS, CASIA(中国科学院自动化研究所MAIS实验室) Kuaishou Technology(快手科技) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00993 2025-10-02 cs.CV 57%

Visual Self-Refinement for Autoregressive Models

Jiamian Wang, Ziqi Zhou, Chaithanya Kumar Mummadi, Sohail Dianat, Majid Rabbani, Raghuveer Rao, Chen Qiu, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工大学) Bosch Research(博世研究) DEVCOM Army Research Laboratory(美国陆军研究实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00618 2025-10-02 cs.CV 57%

Robust Context-Aware Object Recognition

Klara Janouskova, Cristian Gavrus, Jiri Matas

机构 * Visual Recognition Group, Czech Technical University in Prague(捷克技术大学布拉格分校视觉识别组)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24200 2025-10-01 cs.CV 57%

UniVid: The Open-Source Unified Video Model

Jiabin Luo, Junhui Lin, Zeyu Zhang, Biao Wu, Meng Fang, Ling Chen, Hao Tang

机构 * Peking University(北京大学) AI Geeks Australian Artificial Intelligence Institute(澳大利亚人工智能研究所)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16257 2025-09-30 cs.CV 57%

Plug-and-Play 1.x-Bit KV Cache Quantization for Video Large Language Models

Keda Tao, Haoxuan You, Yang Sui, Can Qin, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Columbia University(哥伦比亚大学) Rice University(Rice大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23760 2025-09-30 cs.CV 57%

UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception

Xinyang Song, Libin Wang, Weining Wang, Shaozhen Liu, Dandan Zheng, Jingdong Chen, Qi Li, Zhenan Sun

机构 * Ant Group(蚂蚁集团)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22570 2025-09-29 cs.AI 57%

UniMIC: Token-Based Multimodal Interactive Coding for Human-AI Collaboration

Qi Mao, Tinghan Yang, Jiahao Li, Bin Li, Libiao Jin, Yan Lu

机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室) Communication University of China(中国传媒大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21287 2025-09-26 cs.CL cs.AI 57%

DisCoCLIP: A Distributional Compositional Tensor Network Encoder for Vision-Language Understanding

Kin Ian Lo, Hala Hawashin, Mina Abbaszadeh, Tilen Limback-Stokin, Hadi Wazni, Mehrnoosh Sadrzadeh

机构 * University College London(伦敦大学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12148 2025-09-26 cs.CV 57%

HermesFlow: Seamlessly Closing the Gap in Multimodal Understanding and Generation

Ling Yang, Xinchen Zhang, Ye Tian, Chenming Shang, Minghao Xu, Wentao Zhang, Bin Cui

机构 * Peking University(北京大学) Tsinghua University(清华大学) Mila - Québec AI Institute(魁北克人工智能研究所)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments NeurIPS 2025. Code: https://github.com/Gen-Verse/HermesFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19018 2025-09-24 cs.LG 57%

OmniBridge: Unified Multimodal Understanding, Generation, and Retrieval via Latent Space Alignment

Teng Xiao, Zuchao Li, Lefei Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18778 2025-09-24 cs.RO cs.AI 57%

VGGT-DP: Generalizable Robot Control via Vision Foundation Models

Shijia Ge, Yinxin Zhang, Shuzhao Xie, Weixiang Zhang, Mingcai Zhou, Zhi Wang

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

Comments submitted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04130 2025-09-24 cs.CV 57%

STORM: Token-Efficient Long Video Understanding for Multimodal LLMs

Jindong Jiang, Xiuyu Li, Zhijian Liu, Muyang Li, Guo Chen, Zhiqi Li, De-An Huang, Guilin Liu, Zhiding Yu, Kurt Keutzer, Sungjin Ahn, Jan Kautz, Hongxu Yin, Yao Lu, Song Han, Wonmin Byeon

机构 * NVIDIA(英伟达) Rutgers University(罗格斯大学) UC Berkeley(加州大学伯克利分校) MIT(麻省理工学院) Nanjing University(南京大学) KAIST(韩国科学技术院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17065 2025-09-23 cs.CV 57%

CardiacCLIP: Video-based CLIP Adaptation for LVEF Prediction in a Few-shot Manner

Yao Du, Jiarong Guo, Xiaomeng Li

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16768 2025-09-23 cs.CV 57%

MMPart: Harnessing Multi-Modal Large Language Models for Part-Aware 3D Generation

Omid Bonakdar, Nasser Mozayani

机构 * School of Computer engineering, Iran university of Science and Technology(计算机工程学院,伊朗科学技术大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15277 2025-09-22 cs.MM cs.LG 57%

Copycat vs. Original: Multi-modal Pretraining and Variable Importance in Box-office Prediction

Qin Chao, Eunsoo Kim, Boyang Li

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) Business School, University of Seoul, Republic of Korea(商学学院,首尔大学,韩国) Alibaba Group and the Alibaba-NTU Joint Research Institute, Singapore(阿里巴巴集团及阿里巴巴-南洋理工大学联合研究机构,新加坡)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏